💻 computer science

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

यह शोध पत्र प्रदर्शित करता है कि एक चरणबद्ध भिन्नात्मक-कारकीय स्क्रीनिंग वर्कफ़्लो (staged fractional-factorial screening workflow) कड़े बजट प्रतिबंधों के भीतर उच्च-प्रभाव वाले हाइपरपैरामीटर्स की प्रभावी ढंग से पहचान करता है और आशाजनक प्रशिक्षण कॉन्फ़िगरेशन को मान्य करता है, जो अंततः हार्डवेयर-अपरिवर्तनीय रैंकिंग या सामान्य हाइपरपैरामीटर अनुकूलन श्रेष्ठता के बजाय माइक्रो-प्रीट्रेनिंग के लिए एक ब्रिज-केंद्रित अनुशंसा का समर्थन करता है।

Felipe Chavarro Polania2026-06-05
💻 computer science

Temporal Preference Concepts and their Functions in a Large Language Model

यह शोध पत्र एक डिस्टिल्ड (distilled) LLM में टेम्पोरल प्रेफरेंसेस (temporal preferences) को एनकोड करने वाले न्यूरल सबग्राफ को कॉज़ली लोकलाइज़ और कैरेक्टराइज़ करने के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी का उपयोग करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल मनुष्यों की तुलना में अधिक फ्लैट और अस्थिर फ्यूचर डिस्काउंटिंग (future discounting) प्रदर्शित करते हैं, लेकिन उनके टेम्पोरल रीजनिंग को स्टीयरिंग वेक्टर्स (steering vectors) के माध्यम से स्पष्ट रूप से नियंत्रित किया जा सकता है।

Ian Rios-Sialer, Shantanu Darveshi, Shuai Jiang, Avigya Paudel, Anastasiia Pronina, Ipshita Bandyopadhyay, Justin Shenk2026-06-05
💻 computer science

Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming

यह शोध पत्र CUA-HandCrafted बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जबकि फ्रंटियर कंप्यूटर-उपयोग करने वाले एजेंट ब्राउज़र वातावरण में हस्तनिर्मित प्रॉम्प्ट-इंजेक्शन हमलों के प्रति मजबूत प्रतिरोध प्रदर्शित करते हैं, उनकी सुरक्षा डोमेन-आधारित है और कोडिंग कार्यों तक सामान्यीकृत होने में विफल रहती है, जो यह सुझाव देता है कि पूर्व में रिपोर्ट की गई उच्च हमला सफलता दरें काफी हद तक RL-अनुकूलित इंजेक्शन स्ट्रिंग्स द्वारा संचालित थीं न कि अंतर्निहित मॉडल कमजोरियों द्वारा।

Nicholas Saban2026-06-05
💬 NLP

Self-supervised User Profile Generation for Personalization

यह शोध पत्र BUMP को पेश करता है, जो एक स्व-पर्यवेक्षित (self-supervised) फ्रेमवर्क है जो एक बड़े भाषा मॉडल (large language model) को व्यक्तिगत अनुभव (personalization) के लिए उपयोगकर्ता प्रोफाइल उत्पन्न करने हेतु प्रशिक्षित करता है, जिसमें GRPO के साथ एक द्विदिश इन-बैच रैंकिंग (bidirectional in-batch ranking) उद्देश्य का उपयोग किया गया है, जो महंगे डाउनस्ट्रीम टास्क लेबल की आवश्यकता को समाप्त करता है और पर्यवेक्षित (supervised) विधियों के तुलनीय या उनसे बेहतर प्रदर्शन प्राप्त करता है।

Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah2026-06-05
🤖 AI

Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

यह शोध पत्र प्रकट करता है कि जबकि LLM जज तटस्थ पुनर्मूल्यांकन के तहत स्थिर प्रतीत होते हैं, उनके निर्णय लक्षित निर्णय-पश्चात अंतःक्रिया (post-decision interaction) के माध्यम से उलट दिए जाने के प्रति अत्यधिक संवेदनशील होते हैं, एक ऐसी भेद्यता जो बेंचमार्क विश्वसनीयता को कमजोर करती है और मूल्यांकन सुदृढ़ता स्कोर (ERS) जैसे नए सुदृढ़ता मेट्रिक्स की आवश्यकता को अनिवार्य बनाती है।

Srimonti Dutta, Akshata Kishore Moharir2026-06-05
🤖 AI

LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization

LeanMarathon एक विकसित होते ब्लूप्रिंट और एक दो-चरणीय ऑर्केस्ट्रेटर पर केंद्रित एक मल्टी-एजेंट सिस्टम पेश करता है ताकि लंबी अवधि की ऑटोफॉर्मलाइजेशन विफलताओं को दूर किया जा सके, जिसने एरडोस समस्याओं पर चार हालिया शोध पत्रों के सात प्रमेयों को बिना किसी त्रुटि के सफलतापूर्वक औपचारिक रूप दिया है।

Yuanhe Zhang, Yuekai Sun, Taiji Suzuki, Jason D. Lee, Fanghui Liu2026-06-05
💬 NLP

ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

यह शोध पत्र ReasoningFlow को प्रस्तुत करता है, जो जटिल, गैर-रेखीय लार्ज रीजनिंग मॉडल (LRM) ट्रेसेस को उनके विमर्श संरचनाओं (discourse structures) का विश्लेषण करने के लिए सूक्ष्म-स्तरीय निर्देशित अचक्रीय ग्राफ़ (directed acyclic graphs) में परिवर्तित करता है, जिससे यह पता चलता है कि LRMs विभिन्न मॉडलों में संरचनात्मक रूप से समान रीजनिंग पैटर्न प्रदर्शित करते हैं और अधिकांश त्रुटिपूर्ण चरण अंतिम उत्तरों को प्रभावित नहीं करते हैं।

Jinu Lee, Shivam Agarwal, Amruta Parulekar, Siddarth Madala, Dilek Hakkani-Tur, Julia Hockenmaier2026-06-05
🤖 AI

Agents' Last Exam

यह शोध पत्र एजेंट्स लास्ट एग्जाम (ALE) को प्रस्तुत करता है, जो 13 उद्योग समूहों में दीर्घकालिक, आर्थिक रूप से मूल्यवान वास्तविक दुनिया के कार्यों पर एआई एजेंटों का मूल्यांकन करने के लिए 250 से अधिक उद्योग विशेषज्ञों के साथ विकसित एक लिविंग बेंचमार्क है, जिसका उद्देश्य वर्तमान बेंचमार्क सफलता और सार्थक जीडीपी-प्रासंगिक परिनियोजन के बीच के अंतर को पाटना है।

Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Je (…)2026-06-05
💬 NLP

Would you still call this Dax? Novel Visual References in VLMs and Humans

यह शोध पत्र 'नोवल विजुअल रेफरेंस डेटासेट' (NVRD) को प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि विजन-लैंग्वेज मॉडल और मनुष्य नवीन, प्री-ट्रेनिंग-विरोधी दृश्य अवधारणाओं को भाषा के साथ कैसे मैप करते हैं, जो यह प्रकट करता है कि मॉडल ऐसी अवधारणाओं के इन-कॉन्टेक्स्ट लर्निंग में संघर्ष करते हैं और मानव निर्णयों की तुलना में काफी अधिक ओवरजनरलाइज़ करते हैं।

Ada Defne Tür, Gaurav Kamath, Joyce Chai, Siva Reddy, Benno Krojer2026-06-05✓ Author reviewed
💬 NLP

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

यह शोध पत्र एक दो-चरणीय प्रणाली पेश करके स्पार्स-एविडेंस (sparse-evidence) संवाद और एजेंट प्रक्षेपवक्रों में प्रारंभिक विफलता अलर्टिंग की चुनौती को संबोधित करता है, जो एक अटेंशन-आधारित प्रेडिक्टर को जोड़ता है, जो विलंबित विफलता संकेतों की पहचान करने के लिए प्रक्षेपवक्र-स्तरीय लेबल से सीखता है, तथा विविध बेंचमार्क में बेहतर सटीकता-जल्दी (accuracy-earliness) ट्रेड-ऑफ और कम प्रशिक्षण लागत प्राप्त करने के लिए α\alpha-STOP नीति का उपयोग करता है।

Avinash Baidya, Xinran Liang, Ruocheng Guo, Xiang Gao, Kamalika Das2026-06-05