🤖 AI

SentinelBench: A Benchmark for Long-Running Monitoring Agents

यह शोध पत्र SentinelBench प्रस्तुत करता है, जो 10 सिंथेटिक वेब वातावरणों में 100 कार्यों से युक्त एक ओपन-सोर्स बेंचमार्क है जिसे समय के साथ विकसित होने वाली स्थितियों की कुशलतापूर्वक निगरानी करने और बाहरी घटनाओं पर प्रतिक्रिया देने की एआई एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे निरंतर कार्रवाई के बजाय निरंतर ध्यान (sustained attention) को प्राथमिकता देने वाले लंबे समय तक चलने वाले निगरानी कार्यों के लिए प्रदर्शन बेसलाइन स्थापित की जा सके।

Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin, Hussein Mozzanar, Gagan Bansal, Maya Murad, Rafah Hosn, Saleem (…)2026-06-05
💻 computer science

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

यह क्रॉस-आर्किटेक्चर मैकेनिस्टिक अध्ययन यह प्रदर्शित करता है कि टास्क सर्किट की पहचान करने के लिए एक एकीकृत "स्क्रीन-एंड-अबलेट" प्रोटोकॉल विभिन्न 1B-क्लास लैंग्वेज मॉडल्स में असंगत कॉज़ल दावे प्रस्तुत करता है, जो यह प्रकट करता है कि समान व्यवहार संबंधी क्षमताएं विशिष्ट अटेंशन-पैटर्न संरचनाओं के माध्यम से कार्यान्वित होती हैं और यह प्रस्तावित करता है कि MoE मॉडल्स विशेष रूप से कंपोज्ड टास्क के लिए एक मौलिक प्रीवियस-टोकन पोजीशनल सबस्ट्रेट पर निर्भर करते हैं।

Yongzhong Xu2026-06-05
🤖 AI

Synthetic Contrastive Reasoning for Multi-Table Q&A

यह शोध पत्र मल्टी-टेबल प्रश्न उत्तर (multi-table question answering) के लिए एक सिंथेटिक कंट्रास्टिव रीजनिंग-ट्रेस डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि इन प्रेफरेंस पेयर्स (preference pairs) पर कंट्रास्टिव प्रेफरेंस ऑप्टिमाइज़ेशन (CPO) के साथ ओपन-वेट LLMs को फाइन-ट्यून करना, कंपोजिशनल रीजनिंग और स्कीमा लिंकिंग को बढ़ाकर मानक सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में काफी बेहतर प्रदर्शन करता है।

Ankit Pratap Singh, Xin Su, Phillip Howard2026-06-05
🤖 AI

Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

यह शोध पत्र प्रकट करता है कि जबकि LLM जज तटस्थ पुनर्मूल्यांकन के तहत स्थिर प्रतीत होते हैं, उनके निर्णय लक्षित निर्णय-पश्चात अंतःक्रिया (post-decision interaction) के माध्यम से उलट दिए जाने के प्रति अत्यधिक संवेदनशील होते हैं, एक ऐसी भेद्यता जो बेंचमार्क विश्वसनीयता को कमजोर करती है और मूल्यांकन सुदृढ़ता स्कोर (ERS) जैसे नए सुदृढ़ता मेट्रिक्स की आवश्यकता को अनिवार्य बनाती है।

Srimonti Dutta, Akshata Kishore Moharir2026-06-05
💻 computer science

Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents

17 अनुभवी डेवलपर्स के साथ साक्षात्कार के माध्यम से, यह शोध पत्र स्वायत्त सॉफ़्टवेयर एजेंटों के साथ सहयोग करते समय डेवलपर्स द्वारा नियोजित प्रोएक्टिव (proactive) और रिएक्टिव (reactive) रूपों के निरीक्षण कार्य, संबद्ध चुनौतियों और व्यावहारिक ह्यूरिस्टिक्स (heuristics) का अनुभवजन्य रूप से लक्षण वर्णन करता है, जिससे सैद्धांतिक ढांचों और वास्तविक दुनिया के अभ्यास के बीच के अंतर को पाटा जा सके।

Shipi Dhanorkar, Samir Passi, Mihaela Vorvoreanu2026-06-05
💻 computer science

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

VASO एक नवीन ढांचा है जो औपचारिक सत्यापन (formal verification) के माध्यम से LLM-जनित रोबोट कौशल अनुबंधों के स्व-विकास को सक्षम बनाता है, जो फाउंडेशन मॉडल के भार (weights) को संशोधित किए बिना, काउंटरएग्ज़ाम्पल्स (counterexamples) का उपयोग करके टेम्पोरल सुरक्षा विशिष्टताओं (temporal safety specifications) के विरुद्ध पुन: प्रयोज्य कौशलों को पुनरावृत्ति से परिष्कृत करता है, जिससे न्यूनतम अनुकूलन नमूनों (optimization samples) के साथ भौतिक एजेंटों पर उच्च अनुपालन प्राप्त होता है।

Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu2026-06-05
💻 computer science

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

यह शोध पत्र प्रदर्शित करता है कि "एब्लिटरेशन" (abliteration), जो कि रिफ्यूज़ल दिशाओं को ऑर्थोगोनली प्रोजेक्ट करने वाली एक लो-रैंक वेट एडिटिंग तकनीक है, सुरक्षा-संरेखित कोड एलएलएम (LLM) की असुरक्षित कोड उत्पन्न करने से मना करने की प्रवृत्ति को उनकी वास्तविक पीढ़ी क्षमताओं से प्रभावी रूप से अलग कर सकता है, जिससे सिंटैक्टिक वैधता से समझौता किए बिना भेद्यता पहचान अनुसंधान के लिए लेबल किए गए असुरक्षित कोड का स्केलेबल उत्पादन सक्षम हो जाता है।

Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo2026-06-05
🤖 AI

LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization

LeanMarathon एक विकसित होते ब्लूप्रिंट और एक दो-चरणीय ऑर्केस्ट्रेटर पर केंद्रित एक मल्टी-एजेंट सिस्टम पेश करता है ताकि लंबी अवधि की ऑटोफॉर्मलाइजेशन विफलताओं को दूर किया जा सके, जिसने एरडोस समस्याओं पर चार हालिया शोध पत्रों के सात प्रमेयों को बिना किसी त्रुटि के सफलतापूर्वक औपचारिक रूप दिया है।

Yuanhe Zhang, Yuekai Sun, Taiji Suzuki, Jason D. Lee, Fanghui Liu2026-06-05
💬 NLP

ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

यह शोध पत्र ReasoningFlow को प्रस्तुत करता है, जो जटिल, गैर-रेखीय लार्ज रीजनिंग मॉडल (LRM) ट्रेसेस को उनके विमर्श संरचनाओं (discourse structures) का विश्लेषण करने के लिए सूक्ष्म-स्तरीय निर्देशित अचक्रीय ग्राफ़ (directed acyclic graphs) में परिवर्तित करता है, जिससे यह पता चलता है कि LRMs विभिन्न मॉडलों में संरचनात्मक रूप से समान रीजनिंग पैटर्न प्रदर्शित करते हैं और अधिकांश त्रुटिपूर्ण चरण अंतिम उत्तरों को प्रभावित नहीं करते हैं।

Jinu Lee, Shivam Agarwal, Amruta Parulekar, Siddarth Madala, Dilek Hakkani-Tur, Julia Hockenmaier2026-06-05
💻 computer science

Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation

यह शोध पत्र प्रकट करता है कि जहाँ बड़े भाषा मॉडल (large language models) मनगढ़ंत आँकड़ों का पता लगाने की पृथक क्षमता रखते हैं, वहीं वे बहु-स्रोत संश्लेषण (multi-source synthesis) के दौरान इस विवेक को लागू करने में विफल रहते हैं, और इसके बजाय एक "कार्यप्रणाली-पंजीकरण" (methodology-register) संकेत पर निर्भर रहते हैं जो विश्लेषणात्मक शैली वाले किंतु संख्यात्मक रूप से अमान्य दावों को समान महत्व प्रदान करता है, जिससे एक व्यवस्थित ज्ञान संबंधी अंध बिंदु (epistemic blind spot) निर्मित होता है जहाँ शैलीगत विश्वसनीयता तथ्यात्मक सत्यापन पर हावी हो जाती है।

Rohan N. Pradhan, Steve Goley2026-06-05