🤖 AI

CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

यह शोध पत्र CIAware-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें चार कार्य डोमेन शामिल हैं ताकि यह मूल्यांकन किया जा सके कि सीमावर्ती (फ्रंटियर) लार्ज लैंग्वेज मॉडल्स अपने निष्पादन प्रक्षेपवक्र (एग्जीक्यूशन ट्रेजेक्टरीज़) में नियंत्रण हस्तक्षेपों का पता लगाने में किस हद तक सक्षम हैं, जिससे यह पता चलता है कि ऐसी जागरूकता मॉडलों और परिदृश्यों के बीच काफी भिन्न होती है न कि एक स्थिर गुण है।

Joachim Schaeffer, Thomas Jiralerspong, Alexander Panfilov, Guillaume Lajoie, Jonas Geiping, Yoshua Bengio, Roland S. Zi (…)2026-06-10
💬 NLP

T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains

यह शोधपत्र T1-Bench प्रस्तुत करता है, जो एक उच्च-सटीक (high-fidelity) बेंचमार्क है जिसे जटिल, बहु-चरणीय और इंटरलीव्ड परिदृश्यों के माध्यम से मौजूदा बेंचमार्क की सीमाओं को संबोधित करते हुए, निरंतर तर्क और समन्वय की आवश्यकता वाले 25 विविध वास्तविक दुनिया के डोमेन में एजेंटिक प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Genta Indra Winata, Amartya Chakraborty, Yuzhen Lin, Swasthi P Rao, Shikhhar Siingh, Houhan Lu, Nadia Bathaee, Sriharsha (…)2026-06-10
💬 NLP

Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में स्पष्ट व्यक्तित्व अनुकूलन (personality conditioning) के लिए एक व्यवस्थित ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि व्यक्तित्व प्रेरण (personality induction) इमेज कैप्शनिंग को बेहतर बनाता है, यह तर्क संबंधी कार्यों (reasoning tasks) को बाधित कर सकता है और मल्टी-ट्रे़ट संरचना तथा गतिशील स्विचिंग के दौरान जटिल संतुलन और अवशिष्ट प्रभाव प्रदर्शित करता है, जिससे मजबूत, अनुकूलित प्रेरण विधियों की आवश्यकता पर बल मिलता है।

Peiqi Jia (Xi'an Jiaotong University), Haonan Jia (Beihang University), Ziqi Miao (Beihang University), Linkang Du (Xi'a (…)2026-06-10
🤖 machine learning

Unifying Local Communications and Local Updates for LLM Pretraining

यह शोध पत्र GASLoC को प्रस्तुत करता है, जो एक नवीन विकेंद्रीकृत प्री-ट्रेनिंग एल्गोरिदम है जो बैंडविड्थ और विषमता (heterogeneity) की बाधाओं को दूर करने के लिए स्थानीय अपडेट को स्पार्स, गॉसिप-आधारित पीयर कम्युनिकेशन के साथ एकीकृत करता है, जिससे होमोजेनियस और हेट्रोजेनियस दोनों नेटवर्क सेटिंग्स में DiLoCo जैसे अत्याधुनिक दृष्टिकोणों के साथ प्रतिस्पर्धी या उससे बेहतर प्रदर्शन प्राप्त होता है।

Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon2026-06-10
🤖 AI

Designed by Journalists, but Is It for Readers? Rethinking AI Disclosures and Transparency in News

यह शोध पत्र तर्क देता है कि समाचार कक्षों में वर्तमान एआई प्रकटीकरण प्रथाएं पत्रकारिता संबंधी इरादों और उपयोगकर्ता की आवश्यकताओं के बीच विच्छेद के कारण पाठक का विश्वास बनाने में विफल रहती हैं, और यह प्रस्तावित करता है कि एचसीआई (HCI) समुदाय को इंटरैक्टिव, आनुपातिक और संदर्भ-जागरूक समाधानों के माध्यम से उपयोगकर्ता एजेंसी को प्राथमिकता देने के लिए पारदर्शिता तंत्र को पुनर्गठित करना चाहिए।

Pooja Prajod2026-06-10
💬 NLP

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो इंटरैक्शन को ट्री-स्ट्रक्चर्ड नोड्स के रूप में मॉडल करके और रिवॉर्ड कंट्रास्ट एवं पॉलिसी लर्निंग दक्षता को बढ़ाने के लिए मिश्रित टर्मिनल रिवार्ड्स के साथ प्रॉम्प्ट रूट्स और इंटरमीडिएट प्रीफिक्स दोनों को गतिशील रूप से लक्षित करके मल्टी-टर्न एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) में रोलआउट बजट आवंटन को अनुकूलित करता है।

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, X (…)2026-06-10
🤖 AI

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

यह शोध पत्र मोंटे कार्लो पास सर्च (MCPS) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो उच्च-सटीक बुंडेसलिगा ट्रैकिंग डेटा का उपयोग करके फुटबॉल पास के वितरण-जागरूक एट्रिब्यूशन और रैंकिंग को सक्षम करने के लिए एक 3D बॉल-कंडीशन्ड वर्ल्ड मॉडल और एक वैल्यू मॉडल का लाभ उठाकर पास निष्पादन वेरिएंट्स और उनके काउंटरफैक्चुअल परिणामों का अनुकरण करता है।

Andrew Kang, Priya Narasimhan2026-06-10
🤖 AI

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

यह शोध पत्र ABC-Bench प्रस्तुत करता है, जो LLMs में एजेंटिक जैव-सुरक्षा क्षमताओं का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान एजेंट रोबोटिक DNA असेंबली और संश्लेषण बचाव जैसे दोहरे उपयोग वाले कार्यों में औसत मानव विशेषज्ञों से बेहतर प्रदर्शन करते हैं, जिसमें वेट-लैब सत्यापन यह पुष्टि करता है कि वे जैविक प्रोटोकॉल को सफलतापूर्वक निष्पादित करने की क्षमता रखते हैं।

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe2026-06-10
📊 statistics

Flaws in the LLM Automation Narrative

यह शोध पत्र एक नवीन कोडिंग बेंचमार्क के माध्यम से यह प्रदर्शित करते हुए इस विमर्श को चुनौती देता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) मानव विशेषज्ञ प्रदर्शन के बराबर हैं, जिसमें यह दिखाया गया है कि मानव औसत सटीकता और निरंतरता दोनों में फ्रंटियर LLMs से बेहतर प्रदर्शन करते हैं, साथ ही यह केवल मानक बेंचमार्क पर निर्भर रहने के बजाय त्रुटि की मात्रा और प्रतिक्रिया की भिन्नता का मूल्यांकन करने की महत्वपूर्ण आवश्यकता पर भी प्रकाश डालता है।

George Perrett, Javae Elliott, Jennifer Hill, Marc Scott2026-06-10
🤖 AI

Piper: A Programmable Distributed Training System

पाइपर (Piper) एक प्रोग्रामेबल डिस्ट्रीब्यूटेड ट्रेनिंग सिस्टम है जो एक यूनिफाइड इंटरमीडिएट रिप्रेजेंटेशन के माध्यम से हाई-लेवल पैरेललिज्म स्ट्रैटेजीज़ को लो-लेवल रनटाइम इम्प्लीमेंटेशन्स से अलग करता है, जिससे ज़ीरो (ZeRO) और डीपसीक-V3 (DeepSeek-V3) की डुअलपाइप (DualPipe) जैसी विविध रणनीतियों का लचीला संयोजन सक्षम होता है और साथ ही प्रदर्शन समानता बनाए रखते हुए दक्षता में सुधार होता है।

Megan Frisella, Shubham Tiwari, Andy Ruan, Yi Pan, Parker Gustafson, Mat Jacob, Gilbert Bernstein, Stephanie Wang2026-06-10