How Well Do Multimodal Models Reason on ECG Signals?

Cet article présente un cadre reproductible pour évaluer le raisonnement des modèles multimodaux sur les signaux ECG en décomposant l'analyse en perception (vérification par code des structures temporelles) et déduction (alignement logique avec des critères cliniques structurés), permettant ainsi une évaluation scalable de la validité des traces de raisonnement.

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg2026-03-10🤖 cs.LG

Leveraging Model Soups to Classify Intangible Cultural Heritage Images from the Mekong Delta

Cet article propose un cadre robuste combinant l'architecture hybride CoAtNet et la technique de « model soups » pour améliorer la classification des images du patrimoine culturel immatériel du delta du Mékong, atteignant des performances de pointe en réduisant la variance grâce à un ensemencement intelligent de checkpoints géométriquement diversifiés.

Quoc-Khang Tran, Minh-Thien Nguyen, Nguyen-Khang Pham2026-03-10🤖 cs.LG

Embedding interpretable 1\ell_1-regression into neural networks for uncovering temporal structure in cell imaging

Ce papier propose d'intégrer un modèle de régression vectorielle autorégressive interprétable et régularisé en 1\ell_1 au sein d'un autoencodeur convolutif pour extraire la dynamique temporelle sparse des données d'imagerie calcique, tout en séparant les informations spatiales statiques et en permettant la visualisation des régions spatiales contributives.

Fabian Kabus, Maren Hackenberg, Julia Hindel, Thibault Cholvin, Antje Kilias, Thomas Brox, Abhinav Valada, Marlene Bartos, Harald Binder2026-03-10🤖 cs.LG

CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning

Ce papier propose CGL, un cadre d'apprentissage continu pour les agents d'interface graphique qui combine l'ajustement fin supervisé et l'apprentissage par renforcement via un mécanisme d'ajustement dynamique et une chirurgie des gradients pour surmonter l'oubli catastrophique lors de l'adaptation aux mises à jour fréquentes des applications.

Zhenquan Yao, Zitong Huang, Yihan Zeng, Jianhua Han, Hang Xu, Chun-Mei Feng, Jianwei Ma, Wangmeng Zuo2026-03-10🤖 cs.LG

Information Routing in Atomistic Foundation Models: How Task Alignment and Equivariance Shape Linear Disentanglement

Cette étude introduit la décomposition de sonde compositionnelle (CPD) pour démontrer que l'alignement de la tâche d'entraînement, plutôt que l'architecture du modèle, détermine la séparation linéaire des informations géométriques et compositionnelles dans les modèles de fondation atomistiques, tout en révélant un routage de l'information par symétrie au sein des représentations MACE.

Joshua Steier2026-03-10🤖 cs.LG

XInsight: Integrative Stage-Consistent Psychological Counseling Support Agents for Digital Well-Being

Ce papier présente XInsight, un cadre multi-agents inspiré par le counseling qui structure le soutien psychologique selon le paradigme « Exploration-Insight-Action » pour améliorer l'interprétabilité, la continuité et l'efficacité des applications de bien-être numérique, validé par une nouvelle plateforme d'évaluation appelée XInsight-Bench.

Fei Wang, Jiangnan Yang, Junjie Chen, Yuxin Liu, Kun Li, Yanyan Wei, Dan Guo, Meng Wang2026-03-10🤖 cs.LG

How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective

Cette étude révèle que les « attention sinks » sur le premier token émergent précocement lors de l'entraînement grâce à un mécanisme spécifique appelé « P0 Sink Circuit », qui permet d'identifier la position zéro sans information sémantique et pourrait servir d'indicateur de convergence du pré-entraînement.

Runyu Peng, Ruixiao Li, Mingshu Chen, Yunhua Zhou, Qipeng Guo, Xipeng Qiu2026-03-10🤖 cs.LG

Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale

En utilisant des grammaires contextuelles probabilistes pour générer des corpus synthétiques, cette étude démontre que les structures hiérarchiques inhérentes au processus de génération des données constituent le facteur unificateur expliquant l'émergence de phénomènes mécanistes apparemment distincts dans les modèles de langage.

Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych2026-03-10🤖 cs.LG

Hierarchical Embedding Fusion for Retrieval-Augmented Code Generation

Le papier présente HEF (Hierarchical Embedding Fusion), une approche en deux étapes qui compresse les dépôts de code en une hiérarchie de vecteurs denses pour remplacer les longs contextes de récupération par des pseudo-jetons, permettant ainsi une génération de code assistée par récupération à faible latence avec une précision comparable aux méthodes existantes.

Nikita Sorokin, Ivan Sedykh, Valentin Malykh2026-03-10🤖 cs.LG