💻 computer science

CTC: The Composite Task Challenge for Cooperative Multi-Agent Reinforcement Learning

Dieses Paper stellt die Composite Tasks Challenge (CTC) vor, eine neue Benchmark-Suite, die darauf ausgelegt ist, die Arbeitsteilung und Kooperation in Multi-Agenten-Reinforcement-Learning streng zu evaluieren, wobei aufgezeigt wird, dass aktuelle State-of-the-Art-Methoden daran scheitern, diese Aufgaben zu lösen, während gleichzeitig demonstriert wird, dass ein lösbares, aber anspruchsvolles Testfeld essenziell für den Fortschritt des Feldes ist.

Yurui Li, Yuxuan Chen, Xiaoli Yang, Shijian Li, Gang Pan2026-06-25
💻 computer science

SousCoder: Cross-Application Confusion Detection for Proactive Developer Assistance

SousCoder ist ein lokal-basierter, proaktiver Entwickler-Assistent, der applikationsübergreifende Verhaltenssignale in VS Code, Chrome und dem Terminal überwacht, um Entwicklerverwirrung zu erkennen und mit kontextbezogenen Vorschlägen zu intervenieren, wobei er in Feld-Evaluierungen eine geringe Latenz sowie hohe Relevanz erreicht und vorangegangene Arbeiten durch persistentes Gedächtnis und Multi-Source-Wahrnehmung erweitert.

Vrund Thakkar2026-06-25
💻 computer science

Validating Large Language Model Extraction of Actuarial Variables from Unstructured Claims Documents

Diese Studie evaluiert eine Pipeline aus großen Sprachmodellen zur Extraktion von 14 versicherungsmathematischen Variablen aus Arbeitnehmerentschädigungsansprüchen, wobei eine moderate Gesamteinigkeit mit menschlichen Prüfern (quadratisches gewichtetes Kappa von 0,53) sowie eine signifikante Variabilität über die Dimensionen hinweg festgestellt wurde, was die Notwendigkeit einer Kalibrierung und einer phasenweisen Bereitstellung vor der formellen Validierung unterstreicht.

Robert Lieberthal, Vietbao Phan, Jawand Singh, Elizabeth Sottung, Richard Tran2026-06-25
💻 computer science

Comparative Analysis of Machine Learning Models for Predicting Grid Stability Using Tabular and Transformer Architectures

Diese Studie zeigt, dass ein Transformer-basiertes Deep-Learning-Modell klassische Algorithmen des maschinellen Lernens bei der Vorhersage der Stabilität elektrischer Netze übertrifft und dabei eine hohe Genauigkeit sowohl bei binären Klassifikations- als auch bei Regressionsaufgaben erzielt, während es gleichzeitig globale Nachhaltigkeitsziele für resiliente Smart Grids unterstützt.

ARUNKUMAR E, Lakshmi Priya M2026-06-25
💻 computer science

Contrast-Induced Class Overlap as a Fairness Bottleneck in Dermatological AI: Evidence from HAM10000

Diese Studie identifiziert, dass ein geringerer Läsions-Hintergrund-Kontrast auf dunklerer Haut eine strukturelle Klassenüberlappung erzeugt, die KI-gestützte dermatologische Modelle dazu veranlasst, Malignität systematisch überzuprädisponieren und übermäßige Überweisungen für dunkelhäutige Patienten zu generieren, was einen Fairness-Engpass darstellt, der selbst nach Korrektur konfundierender Klassendistributionen bestehen bleibt und am besten durch per-Ton-Klassen-Balancierung anstatt durch Ton-Konditionierung gemildert wird.

Aaron Ajit2026-06-25
💻 computer science

How Class Imbalance Treatments Distort SHAP Attribution Fidelity: A Monte Carlo Investigation of Ranking and Magnitude Errors

Durch eine umfassende Monte-Carlo-Untersuchung zeigt diese Arbeit auf, dass die Stichprobengröße beim Training zwar der primäre Treiber für die Treue der SHAP-Attribution ist, gängige Behandlungen zur Klassengleichgewichtung jedoch häufig die Merkmalsrankings und -magnituden verzerren, was die Autoren dazu veranlasst, zugunsten von Klassengewichtung statt Rebalancing zu raten, wenn die SHAP-Interpretierbarkeit eine Priorität darstellt.

Rıdvan Kara2026-06-25
💻 computer science

CLHA: Cross-Layer Hessian Aggregation for Quantizing Weight-Shared Mixture-of-Experts Transformers

Dieses Paper führt CLHA ein, eine über Schichten hinweg aggregierende Hessian-Methode für die Post-Training-Quantisierung von gewichtsteilenden Mixture-of-Experts-Transformern, die den gesamten Rekonstruktionsfehler minimiert, indem sie Hessian-Statistiken über geteilte Schichten hinweg kombiniert, dabei bestehende pro Schicht erfolgende Kalibrierungsansätze signifikant übertrifft und gleichzeitig kritische Implementierungsfallen bei der Hessian-Schätzung adressiert.

Kunal Dhanda2026-06-25
💻 computer science

AAL: In-Band Source Annotations for Just-In-Time Context Injection in Autonomous Agentic Workflows

Dieses Paper stellt die Agentic Annotation Language (AAL) vor, ein neuartiges In-Band-Annotationssystem, das eine Just-In-Time-Kontextinjektion für autonome Agenten ermöglicht und im Vergleich zu herkömmlichen globalen Regeldateien den Tokenverbrauch sowie die Kontextkontamination signifikant reduziert, während es gleichzeitig eine hohe Compliance mit domänenspezifischen Constraints aufrechterhält.

Jorge O Varona2026-06-25
💻 computer science

Cross-Dataset Generalization in Urdu Fake News Detection: An Empirical Study with XLM-RoBERTa and a Length Confound Analysis

Diese Arbeit präsentiert die erste Cross-Dataset-Generalisierungsstudie für die Erkennung von Fake News in Urdu und zeigt auf, dass ein auf dem Ax-to-Grind-Datensatz trainiertes Modell beim Einsatz auf den Notri-Fact-Datensatz katastrophal versagt, was auf einen systematischen Längen-Confounder im Trainingsdatensatz zurückzuführen ist, der Shortcut-Learning induziert, wodurch kritische Mängel in der aktuellen Datensatzkonstruktion und Evaluierungspraxis für ressourcenarme NLP-Verfahren verdeutlicht werden.

Muhammad Abdullah Haroon2026-06-25