cs.AI Arbeiten | Gist.Science

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

Die Arbeit stellt ImageEdit-R1 vor, ein Multi-Agenten-Framework, das durch den Einsatz von Reinforcement Learning die Koordination spezialisierter Vision-Language- und Generative-Agenten optimiert, um komplexe Bildbearbeitungsaufgaben präziser und kontextbewusster zu lösen als bestehende monolithische oder manuell gestaltete Ansätze.

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui2026-03-10💻 cs

In-Context Reinforcement Learning for Tool Use in Large Language Models

Die Arbeit stellt In-Context Reinforcement Learning (ICRL) vor, einen reinen Reinforcement-Learning-Ansatz, der durch den Einsatz und die schrittweise Reduzierung von Few-Shot-Beispielen während des Rollouts das teure Supervised Fine-Tuning überflüssig macht und Large Language Models effizient zum Erlernen des Werkzeuggebrauchs befähigt.

Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi, Cihang Xie, Michael Qizhe Shieh2026-03-10💻 cs

DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation

Das Paper stellt DSH-Bench vor, ein umfassendes Benchmark mit hierarchischer Taxonomie, Schwierigkeits- und Szenarioanalyse sowie einem neuen Konsistenzmaß, das die Evaluierung und Weiterentwicklung von subjektgetriebenen Text-zu-Bild-Modellen durch detaillierte Diagnosen und eine höhere Übereinstimmung mit menschlichen Bewertungen verbessert.

Zhenyu Hu, Qing Wang, Te Cao, Luo Liao, Longfei Lu, Liqun Liu, Shuang Li, Hang Chen, Mengge Xue, Yuan Chen, Chao Deng, Peng Shu, Huan Yu, Jie Jiang2026-03-10💻 cs

DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning

Die Arbeit stellt das DC-W2S-Framework vor, das durch die Kombination von Selbst- und Nachbarschaftskonsens schwache, verrauschte Überwachungssignale filtert, um zuverlässige Prozess-Belohnungsmodelle für biologische Schlussfolgerungen ohne exhaustive Expertenannotation zu trainieren.

Chi-Min Chan, Ehsan Hajiramezanali, Xiner Li, Edward De Brouwer, Carl Edwards, Wei Xue, Sirui Han, Yike Guo, Gabriele Scalia2026-03-10🤖 cs.LG

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

Die Arbeit stellt das UIS-Digger-Framework und den UIS-QA-Benchmark vor, um die bisher vernachlässigte Herausforderung der Suche nach unindexierten Informationen zu adressieren und zeigt, dass ein optimiertes Multi-Agenten-System selbst mit kleineren Modellen leistungsfähiger ist als aktuelle State-of-the-Art-LLMs.

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang2026-03-10💻 cs

SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action

Der Artikel stellt SaiVLA-0 vor, ein rechnerbewusstes Vision-Language-Action-Modell, das durch eine neurowissenschaftlich inspirierte Dreiteilung aus Cerebrum, Pons und Cerebellum sowie eine foveierte Blicksteuerung effizientere und stabilere Robotersteuerung ermöglicht.

Xiang Shi, Wenlong Huang, Menglin Zou, Xinhai Sun2026-03-10🤖 cs.LG

Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows

Der Artikel stellt FoleyFlow vor, ein neues Modell zur koordinierten Video-zu-Audio-Generierung, das durch einen Maskierungsansatz zur semantischen und rhythmischen Ausrichtung sowie einen dynamischen bedingten Fluss für eine zeitlich präzise Synchronisation übertrifft bestehende Methoden.

Shentong Mo, Yibing Song2026-03-10🤖 cs.LG

DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding

Die Arbeit stellt DARC vor, eine retraining-freie Inferenzmethode, die durch risikobewusste, distributionell robuste Decodierung die Abstimmung von Sprachmodellen auf heterogene menschliche Präferenzen verbessert, indem sie Diskrepanzen und Tail-Risiken reduziert, ohne die durchschnittliche Qualität zu beeinträchtigen.

Mingxi Zou, Jiaxiang Chen, Junfan Li, Langzhang Liang, Qifan Wang, Xu Yinghui, Zenglin Xu2026-03-10🤖 cs.LG

Gradually Excavating External Knowledge for Implicit Complex Question Answering

Diese Arbeit stellt einen schrittweisen Rahmen zur aktiven Gewinnung externen Wissens vor, der es großen Sprachmodellen ermöglicht, komplexe implizite Fragen im offenen Bereich durch iteratives Abfragen und logisches Schließen zu beantworten und dabei auf dem StrategyQA-Datensatz einen neuen State-of-the-Art für Modelle der ~10-Milliarden-Parameter-Klasse zu erreichen.

Chang Liu, Xiaoguang Li, Lifeng Shang, Xin Jiang, Qun Liu, Edmund Y. Lam, Ngai Wong2026-03-10💬 cs.CL

An explainable hybrid deep learning-enabled intelligent fault detection and diagnosis approach for automotive software systems validation

Diese Arbeit stellt einen hybriden, erklärbaren Deep-Learning-Ansatz vor, der auf 1D-CNN- und GRU-Modellen sowie Explainable-AI-Techniken basiert, um die Zuverlässigkeit und Nachvollziehbarkeit der Fehlererkennung und -diagnose in der Validierung von Automobilsoftwaresystemen zu verbessern.

Mohammad Abboush, Ehab Ghannoum, Andreas Rausch2026-03-10💻 cs

Evidence-Driven Reasoning for Industrial Maintenance Using Heterogeneous Data

Das Paper stellt den „Condition Insight Agent" vor, ein eingesetztes Entscheidungsunterstützungssystem, das durch die Integration heterogener Wartungsdaten, die Einschränkung von LLM-Reasoning auf deterministische Evidenz und eine regelbasierte Verifizierungsschleife zuverlässige, evidenzbasierte Erklärungen und Handlungsempfehlungen für die industrielle Instandhaltung liefert.

Fearghal O'Donncha, Nianjun Zhou, Natalia Martinez, James T Rayfield, Fenno F. Heath III, Abigail Langbridge, Roman Vaculin2026-03-10💻 cs

Evolution Strategy-Based Calibration for Low-Bit Quantization of Speech Models

Das Papier stellt ESC vor, eine kalibrierungsmethode auf Basis von Evolutionsstrategien, die die spezifischen Herausforderungen von Audio-Aktivierungen bei der Low-Bit-Quantisierung adressiert und erstmals nahezu verlustfreie INT4-Quantisierung sowie volle INT8-Leistung für Sprachmodelle ermöglicht.

Lucas Rakotoarivony2026-03-10💻 cs

Is continuous CoT better suited for multi-lingual reasoning?

Die Studie zeigt, dass das kontinuierliche Chain-of-Thought-Verfahren (CODI) im Vergleich zur herkömmlichen Feinabstimmung nicht nur eine bis zu 50-fache Kompression der Denkspuren ermöglicht, sondern auch durch seine sprachinvarianten latenten Repräsentationen insbesondere bei ressourcenarmen Sprachen und Zero-Shot-Szenarien deutlich robustere multilinguale Schlussfolgerungen erzielt.

Ali Hamza Bashir, Behzad Shomali, Markus Frey, Mehdi Ali, Rafet Sifa, David Berghaus2026-03-10🤖 cs.LG

Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models

Diese Studie zeigt, dass die versteckten Zustände end-to-end Full-Duplex-Sprachmodelle wie SALM-Duplex und Moshi erhebliche Privatsphärenrisiken für die Sprecheridentität bergen, und demonstriert, dass vorgeschlagene Streaming-Anonymisierungsmethoden diese Lecks signifikant reduzieren können, ohne dabei die Antwortlatenz oder die Sprachqualität zu beeinträchtigen.

Nikita Kuzmin, Tao Zhong, Jiajun Deng, Yingke Zhu, Tristan Tsoi, Tianxiang Cao, Simon Lui, Kong Aik Lee, Eng Siong Chng2026-03-10💻 cs

TildeOpen LLM: Leveraging Curriculum Learning to Achieve Equitable Language Representation

Die Arbeit stellt TildeOpen LLM vor, ein 30-Milliarden-Parameter-Modell, das durch Curriculum-Learning und gezielte Datenkuratierung die Leistung für 34 europäische Sprachen, insbesondere für baltische, finno-ugrische und slawische Sprachen, verbessert und dabei eine deutlich gerechtere sprachliche Repräsentation bei begrenzten Rechenressourcen erreicht.

Toms Bergmanis, Martins Kronis, Ingus J\=anis Pretkalninš, D\=avis Nicmanis, Jelizaveta Jelinska, Roberts Rozis, Rinalds V\=iksna, M\=arcis Pinnis2026-03-10💬 cs.CL

MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data

Die Arbeit stellt MM-TS vor, eine Methode für das kontrastive Lernen mit langschwanzigen Daten, die durch dynamische Temperatur- und Margin-Schedules in multimodalen Settings die Leistung verbessert und den InfoNCE-Loss mit dem Max-Margin-Ansatz vereint.

Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva2026-03-10💻 cs

Distributional Regression with Tabular Foundation Models: Evaluating Probabilistic Predictions via Proper Scoring Rules

Die Arbeit kritisiert, dass aktuelle Benchmarks für tabellarische Basis-Modelle wie TabPFN nur Punktschätzer bewerten, und fordert die Einführung von angemessenen Bewertungskennzahlen für probabilistische Regression, insbesondere den Continuous Ranked Probability Score (CRPS), um die Unsicherheit von Vorhersagen zu erfassen und die Modelle entsprechend anzupassen.

Jonas Landsgesell, Pascal Knoll2026-03-10🤖 cs.LG

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

Diese Studie stellt zwei neue Fusionsstrategien vor, die eine registrationsbewusste Bildverarbeitung und eine Zuverlässigkeits-gesteuerte Aufmerksamkeitsfusion nutzen, um die Erkennung von unbemannten Luftfahrzeugen (UAVs) durch die Integration heterogener thermischer und visueller Sensordaten signifikant zu verbessern.

Ishrat Jahan, Molla E Majid, M Murugappan, Muhammad E. H. Chowdhury, N. B. Prakash, Saad Bin Abul Kashem, Balamurugan Balusamy, Amith Khandakar2026-03-10💻 cs

Revisiting Gradient Staleness: Evaluating Distance Metrics for Asynchronous Federated Learning Aggregation

Diese Arbeit untersucht alternative Distanzmetriken zur Messung von Gradientenveraltetheit im asynchronen Federated Learning und zeigt, dass deren Integration in den Aggregationsprozess die Konvergenzgeschwindigkeit, Modellleistung und Trainingsstabilität unter heterogenen Bedingungen und nicht-IID-Daten verbessert.

Patrick Wilhelm, Odej Kao2026-03-10🤖 cs.LG

SplitAgent: A Privacy-Preserving Distributed Architecture for Enterprise-Cloud Agent Collaboration

Die Arbeit stellt SplitAgent vor, eine neuartige verteilte Architektur, die durch kontextbewusste dynamische Bereinigung und differenzielle Privatsphäre eine datenschutzkonforme Zusammenarbeit zwischen Unternehmens- und Cloud-Agenten ermöglicht, ohne die Aufgabenleistung zu beeinträchtigen.

Jianshu She2026-03-10💻 cs

← Zurück Weiter →