🤖 machine learning

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

यह शोध पत्र PPT-Eval प्रस्तुत करता है, जो कंप्यूटर-उपयोग एजेंटों के मूल्यांकन के लिए डिज़ाइन किए गए 120 पावरपॉइंट कार्यों का एक बेंचमार्क है, जिसमें एक नवीन रूब्रिक-आधारित ढांचा शामिल है जो आंशिक प्रगति को कैप्चर करता है और मानव निर्णय के साथ दृढ़ता से सह-संबंधित है ताकि यह प्रकट किया जा सके कि वर्तमान फ्रंटियर मॉडल अभी भी जटिल प्रेजेंटेशन संपादन में संघर्ष कर रहे हैं।

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi R (…)2026-07-01
🤖 AI

One Retrieval to Cover Them All: Co-occurrence-Aware Knowledge Base Reorganization for Session-Level RAG

यह शोध पत्र एक सह-उपस्थिति-जागरूक (co-occurrence-aware) ज्ञान आधार पुनर्गठन पद्धति का प्रस्ताव करता है जो संबंधित दस्तावेजों को क्लस्टर करने और क्वेरी उम्मीदवारों के विस्तार के माध्यम से एंटरप्राइज RAG सिस्टम के लिए सत्र-स्तरीय (session-level) पुनर्प्राप्ति कवरेज और दक्षता में महत्वपूर्ण सुधार करता है, और यह तर्क देता है कि एकल-क्वेरी रिकॉल के स्थान पर सत्र-स्तरीय कवरेज को प्राथमिक मूल्यांकन मीट्रिक के रूप में अपनाया जाना चाहिए।

Shivam Ratnakar, Yixuan Zhu, Cecilia Cheng, Chaya Vijayakumar2026-07-01
🤖 machine learning

ComplianceGate: Classifier-Gated Multi-Tier LLM Routing for Inference in Regulated Industries

यह शोध पत्र ComplianceGate का प्रस्ताव करता है, जो एक क्लासिफायर-गेटेड मल्टी-टियर रूटिंग आर्किटेक्चर है जो विनियमित उद्योगों में डेटा रेजिडेंसी और लागत दक्षता को लागू करता है, जो किसी भी इन्फरेंस (inference) से पहले जटिलता और PII के लिए प्रश्नों की प्री-स्क्रीनिंग करके उन्हें उपयुक्त आकार के मॉडलों और अनुपालन वाले भौगोलिक स्थानोंों में गतिशील रूप से रूट करता है।

Abhishek Dey2026-07-01
🤖 AI

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH विजन-लैंग्वेज-एक्शन एजेंटों के लिए एक एकीकृत ढांचा है जो वर्तमान सिंगल-फ्रेम आर्किटेक्चर की सीमाओं को दूर करने के लिए ड्यूल-स्केल टेम्पोरल मेमोरी हब्स, म्यूचुअल-इन्फॉर्मेशन-ऑप्टिमाइज्ड लेटेंट रीजनिंग टोकन और एक पैरेलल वेक्टर-वाइज एक्शन डिकोडिंग स्कीम को एकीकृत करके प्रदर्शन और दक्षता को बढ़ाता है।

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen2026-07-01
🤖 machine learning

AETDICE: Unified Framework and Offline Optimization for Nonlinear Multi-Objective RL

यह शोध पत्र AETDICE को प्रस्तुत करता है, जो एक एकीकृत ढांचा और ऑफलाइन RL एल्गोरिदम है जो स्थिर डेटासेट का उपयोग करके नॉनलीनियर मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग के लिए सुलभ सैंपल-आधारित अनुकूलन को सक्षम करने हेतु स्केलेराइज्ड एक्सपेक्टेड रिटर्न (SER) और एक्सपेक्टेड स्केलेराइज्ड रिटर्न (ESR) प्रतिमानों के बीच के अंतर को पाटता है।

Woosung Kim, Youngjun Suh, Jinho Lee, Jongmin Lee, Byung-Jun Lee2026-07-01
🤖 AI

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

यह शोध पत्र HealthAgentBench को प्रस्तुत करता है, जो विविध नैदानिक वर्कफ़्लो और माध्यमों में 54 यथार्थवादी, बहु-चरणीय स्वास्थ्य देखभाल कार्यों वाला एक व्यापक बेंचमार्क सुइट है, जो यह प्रकट करता है कि सबसे उन्नत फ्रंटियर एआई एजेंट भी वर्तमान में जटिल, एंड-टू-एंड चिकित्सा वातावरण में उच्च सफलता दर प्राप्त करने के लिए संघर्ष करते हैं।

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan (…)2026-07-01
🤖 AI

AI-Assisted Discovery of Convex Relaxations via Dual Agents

यह शोधपत्र गैर-उत्तल अनुकूलन समस्याओं (nonconvex optimization problems) के लिए बेहतर उत्तल विश्रामों (convex relaxations) की खोज करने और उन्हें कड़ाई से प्रमाणित करने के लिए दोहरे एजेंटों का उपयोग करने वाले एक एआई-सहायता प्राप्त ढांचे को प्रस्तुत करता है, जो प्रथम ऑटोकोरिलेशन असमानता (autocorrelation inequality) और एर्डोस न्यूनतम-ओवरलैप स्थिरांक (Erdős minimum-overlap constant) के निचले स्तरों को सफलतापूर्वक सुदृढ़ करता है।

Sungyoon Kim, Mert Pilanci2026-07-01
🤖 machine learning

Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation

यह शोध पत्र "बेयसियन इन-कॉन्टेक्स्ट एक्सपेरिमेंटर्स" (Bayesian in-context experimenters) प्रस्तुत करता है, जो एक ट्रांसफार्मर-आधारित ढांचा है जो एक बेयसियन पोस्टीरियर नेमन टीचर (Bayesian posterior Neyman teacher) की नकल करना सीखकर औसत उपचार प्रभावों (Average Treatment Effects - ATE) के लिए इष्टतम अनुक्रमिक विचरण अनुमान और आवंटन प्रक्रिया को एमोर्टाइज़ (amortize) करता है, जिससे सुपरवाइज्ड प्रीट्रेनिंग के माध्यम से स्मूथनेस-एडेप्टिव (smoothness-adaptive), ओरेकल-एफिशिएंट (oracle-efficient) अनुमान प्राप्त होता है।

Jiachun Li, David Simchi-Levi2026-07-01
💬 NLP

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

यह शोध पत्र MoralAltDataset को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जब द्विआधारी दुविधाओं (binary dilemmas) से परे विकल्प प्रस्तुत किए जाते हैं, तो मनुष्य और बड़े भाषा मॉडल (LLMs) दोनों ही अपने पसंदीदा समझौता विकल्पों की ओर अपने नैतिक निर्णयों को महत्वपूर्ण रूप से स्थानांतरित करते हैं, और साथ ही यह भी दिखाता है कि LLMs उच्च गुणवत्ता वाले, संरचनात्मक रूप से सुदृढ़ नैतिक विकल्प उत्पन्न कर सकते हैं जो अक्सर मानव-लिखित विकल्पों से बेहतर होते हैं।

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park2026-07-01
🤖 AI

Information-Aided DVL Calibration

यह शोध पत्र एक सूचना-सहायता प्राप्त अंशांकन (IAC) विधि प्रस्तावित करता है जो GNSS-सक्षम वातावरण में पारंपरिक कलमन फ़िल्टर-आधारित अंशांकन में सुधार करके और GNSS संकेतों की अनुपलब्धता के दौरान प्रभावी स्व-अंशांकन को सक्षम करके स्वायत्त अंतर्जलीय वाहनों (AUVs) के लिए डॉप्लर वेलोसिटी लॉग (DVL) मापों की सटीकता को बढ़ाता है।

Zeev Yampolsky, Itzik Klein2026-07-01