cs.AI articoli | Gist.Science

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

Il paper presenta AutoViVQA, un dataset su larga scala per il Visual Question Answering in vietnamita costruito automaticamente, e ne esamina l'efficacia utilizzando architetture basate su transformer e confrontando diverse metriche di valutazione automatica in contesti multilingue.

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le2026-03-11🤖 cs.AI

ESAinsTOD: A Unified End-to-End Schema-Aware Instruction-Tuning Framework for Task-Oriented Dialog Modeling

Il paper presenta ESAinsTOD, un framework unificato end-to-end per il dialogo orientato al compito che, attraverso l'addestramento su istruzioni e meccanismi di allineamento allo schema, supera i modelli esistenti offrendo prestazioni superiori, maggiore robustezza al rumore e capacità di generalizzazione in scenari a risorse limitate.

Dechuan Teng, Chunlin Lu, Libo Qin, Wanxiang Che2026-03-11🤖 cs.AI

ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning

Il paper introduce ActiveUltraFeedback, una pipeline di apprendimento attivo modulare che riduce significativamente i costi di annotazione dei dati di preferenza per l'allineamento dei modelli linguistici, ottenendo prestazioni superiori o paragonabili a quelle dei metodi statici con solo un sesto dei dati necessari.

Davit Melikidze, Marian Schneider, Jessica Lam, Martin Wertich, Ido Hakimi, Barna Pásztor, Andreas Krause2026-03-11🤖 cs.AI

Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning

Il paper propone Mousse, un nuovo ottimizzatore che combina la stabilità spettrale di Muon con l'adattabilità geometrica di Shampoo tramite una precondizionamento consapevole della curvatura, ottenendo una riduzione del 12% dei passi di addestramento per modelli linguistici senza sovraccarichi computazionali significativi.

Yechen Zhang, Shuhao Xing, Junhao Huang, Kai Lv, Yunhua Zhou, Xipeng Qiu, Qipeng Guo, Kai Chen2026-03-11🤖 cs.AI

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

Il paper introduce OOD-MMSafe, un benchmark e un framework di ottimizzazione chiamato CASPO, per superare la "cecità causale" dei modelli MLLM spostando l'allineamento alla sicurezza dalla semplice rilevazione delle intenzioni malevole alla previsione delle conseguenze nascoste.

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma2026-03-11🤖 cs.AI

MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

Il paper introduce MUGEN, un benchmark completo che rivela le carenze dei modelli audio-linguistici nella comprensione di più audio simultanei e dimostra che strategie di inferenza senza addestramento, come la permutazione degli input e il ragionamento a catena, possono migliorare significativamente le prestazioni.

Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo, Ping-Le Tsai, Yen-Ting Piao, Hung-Wei Chen, Ting-Lin Hsiao, Yun-Man Hsu, Ke-Han Lu, Hung-yi Lee2026-03-11🤖 cs.AI

Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFT

Il paper propone CVS, un metodo di selezione dei dati privo di addestramento che utilizza un VLLM congelato per identificare campioni che richiedono un ragionamento congiunto visione-linguaggio, migliorando le prestazioni dei modelli multimodali con meno dati e costi computazionali ridotti.

Peng Sun, Huawen Shen, Yi Ban, Tianfan Fu, Yanbo Wang, Yuqiang Li2026-03-11🤖 cs.AI

AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents

Il paper presenta AutoAgent, un framework multi-agente auto-evolutivo che integra cognizione dinamica, orchestrazione elastica della memoria e decisioni contestuali in tempo reale per superare i limiti degli agenti autonomi statici in ambienti non stazionari.

Xiaoxing Wang, Ning Liao, Shikun Wei, Chen Tang, Feiyu Xiong2026-03-11🤖 cs.AI

RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation

Il paper presenta RbtAct, un approccio che utilizza le risposte degli autori (rebuttal) come supervisione implicita per addestrare modelli linguistici a generare feedback di revisione scientifica più concreti e azionabili, supportato da un nuovo dataset e da un compito di generazione mirata.

Sihong Wu, Yiling Ma, Yilun Zhao, Tiansheng Hu, Owen Jiang, Manasi Patwardhan, Arman Cohan2026-03-11🤖 cs.AI

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

Il paper introduce EXPLORE-Bench, un nuovo benchmark basato su video in prima persona per valutare la capacità dei modelli linguistici multimodali di prevedere le conseguenze fisiche a lungo termine di azioni sequenziali in scenari egocentrici, evidenziando un significativo divario rispetto alle prestazioni umane e l'efficacia parziale del ragionamento passo-passo nel colmarlo.

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha2026-03-11🤖 cs.AI

Ego: Embedding-Guided Personalization of Vision-Language Models

Il paper propone un metodo efficiente per la personalizzazione dei modelli visione-linguaggio che, sfruttando i meccanismi di attenzione interna per estrarre token visivi come memoria concettuale, supera i limiti di scalabilità e complessità delle approcci esistenti senza richiedere fasi di addestramento aggiuntive.

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi2026-03-11🤖 cs.AI

World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models

Il paper presenta World2Mind, un toolkit di intelligenza spaziale senza addestramento che, ispirandosi alla mappatura cognitiva biologica, costruisce mappe spaziali strutturate e un albero allocentrico per potenziare il ragionamento spaziale allocentrico nei modelli fondazionali, permettendo persino a modelli puramente testuali di raggiungere prestazioni vicine a quelle dei modelli multimodali avanzati.

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Hang Su, Yubin Wang2026-03-11🤖 cs.AI

First Estimation of Model Parameters for Neutrino-Induced Nucleon Knockout Using Simulation-Based Inference

Questo studio dimostra che l'inferenza basata sulla simulazione (SBI) è uno strumento efficace per la stima dei parametri dei modelli di interazione neutrino-nucleone, ottenendo un migliore adattamento ai dati sperimentali rispetto alle configurazioni precedentemente sintonizzate e mostrando la capacità di approssimare anche simulazioni con modelli fisici diversi.

Karla Tame-Narvaez, Steven Gardiner, Aleksandra Ciprijanovic, Giuseppe Cerati2026-03-11⚛️ hep-ph

Quantifying the Necessity of Chain of Thought through Opaque Serial Depth

Questo paper introduce il concetto di "profondità seriale opaca" per quantificare la capacità dei modelli linguistici di eseguire ragionamenti complessi senza passaggi intermedi interpretabili, fornendo limiti superiori calcolati per modelli come Gemma 3 e un metodo automatizzato per analizzare diverse architetture neurali.

Jonah Brown-Cohen, David Lindner, Rohin Shah2026-03-11🤖 cs.AI

A Hybrid Quantum-Classical Framework for Financial Volatility Forecasting Based on Quantum Circuit Born Machines

Questo articolo propone un nuovo framework ibrido quantistico-classico che combina una rete LSTM con una Quantum Circuit Born Machine per migliorare l'accuratezza delle previsioni di volatilità finanziaria, dimostrando risultati superiori rispetto ai modelli classici puri su dati reali del mercato cinese.

Yixiong Chen2026-03-11⚛️ quant-ph

Exploiting Label-Aware Channel Scoring for Adaptive Channel Pruning in Split Learning

Il paper propone ACP-SL, uno schema di apprendimento diviso che riduce l'overhead di comunicazione comprimendo i dati intermedi tramite una potatura adattiva dei canali basata su un punteggio di importanza consapevole dell'etichetta, ottenendo al contempo una maggiore accuratezza e un numero inferiore di round di addestramento rispetto alle soluzioni esistenti.

Jialei Tan, Zheng Lin, Xiangming Cai, Ruoxi Zhu, Zihan Fang, Pingping Chen, Wei Ni2026-03-11🤖 cs.AI

MITRA: An AI Assistant for Knowledge Retrieval in Physics Collaborations

Il paper presenta MITRA, un assistente AI basato su Retrieval-Augmented Generation (RAG) ospitato on-premise per le collaborazioni scientifiche come CMS, che utilizza un'architettura a due livelli e tecniche di estrazione avanzate per recuperare in modo sicuro ed efficiente informazioni da vasti corpus di documentazione interna.

Abhishikth Mallampalli, Sridhara Dasu2026-03-11🤖 cs.AI

Correction of Transformer-Based Models with Smoothing Pseudo-Projector

Il paper propone il "pseudo-proiettore", una modifica leggera ispirata al paradigma multigriglia che corregge le rappresentazioni nascoste dei modelli basati su transformer riducendo la sensibilità al rumore e migliorando la dinamica di addestramento e la robustezza senza alterare l'architettura di base.

Vitaly Bulgakov2026-03-11🤖 cs.AI

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

Il paper introduce MA-EgoQA, un nuovo benchmark e un modello di base chiamato EgoMAS progettati per valutare e migliorare la capacità dei sistemi di intelligenza artificiale di comprendere e rispondere a domande basate su flussi video egocentrici simultanei provenienti da più agenti incarnati.

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang2026-03-11🤖 cs.AI

SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases

Questo articolo presenta SCENEBench, una nuova suite di benchmark progettata per valutare la comprensione audio dei modelli linguistici audio di grandi dimensioni (LALM) al di là del riconoscimento vocale, concentrandosi su scenari reali legati all'accessibilità e al monitoraggio industriale come la comprensione dei suoni ambientali, la localizzazione del rumore e il riconoscimento delle caratteristiche vocali.

Laya Iyer, Angelina Wang, Sanmi Koyejo2026-03-11🤖 cs.AI

← Precedente Successivo →