🤖 AI

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

यह शोध पत्र इमेजिंग-101 (Imaging-101) प्रस्तुत करता है, जो छह वैज्ञानिक डोमेन में 57 विशेषज्ञ-सत्यापित कम्प्यूटेशनल इमेजिंग कार्यों का एक बेंचमार्क है जिसे LLM कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल एल्गोरिदम चयन और भौतिक परंपराओं (physical convention) के प्रबंधन जैसे डोमेन-विशिष्ट चुनौतियों के साथ संघर्ष करते हैं, जिससे विश्वसनीय वैज्ञानिक खोज को सक्षम करने के लिए विशिष्ट, कौशल-संवर्धित एजेंटों की आवश्यकता पर बल मिलता है।

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tia (…)2026-07-14
💬 NLP

Abstractiveness Metrics for Evaluating Text Summarization: A Refined Formulation with Empirical Validation

यह शोध पत्र टेक्स्ट सारांशों में अमूर्तता (abstraction) की डिग्री को मापने के लिए संदर्भ अमूर्तता (Reference Abstraction), सारांश अमूर्तता (Summary Abstraction) और अमूर्तता अनुपात (Abstraction Ratio) को सिद्धांतगत ह्यूरिस्टिक मेट्रिक्स के रूप में प्रस्तुत करता है, जो XSUM डेटासेट पर अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि ये माप निष्कर्षणत्मक (extractive) और अमूर्तकारी (abstractive) मॉडलों के बीच प्रभावी ढंग से अंतर करते हैं और संभावित मतिभ्रम (hallucinations) की पहचान करते हैं।

Praveenkumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala2026-07-14
🤖 AI

Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

यह शोध पत्र डिस्ट्रिब्यूटेड एजेंट सिस्टम (DAS) को प्रस्तुत करता है, जो एक डिवाइस-एज-क्लाउड फ्रेमवर्क है जो विश्वसनीयता को सिस्टम-स्तरीय दोष सहिष्णुता (फॉल्ट टॉलरेंस) के रूप में पुनर्परिभाषित करके और संचयी त्रुटि प्रसार को कम करने के लिए सेमी-फॉर्मल संचार प्रोटोकॉल के साथ फॉल्ट-टॉलरेंट अलाइनमेंट को संयोजित करने वाले दो-स्तरीय आर्किटेक्चर को लागू करके औद्योगिक परिदृश्यों में विषम एम्बॉडीड एजेंटों के बीच विश्वसनीय सहयोग सुनिश्चित करता है।

Kai Yu, Lu Chen, Hanqi Li2026-07-14
🤖 AI

Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games

यह शोध पत्र छिपी हुई जानकारी वाले सोशल डिटेक्शन गेम्स में एलएलएम (LLM) एजेंटों के मूल्यांकन के लिए एक ऑडिट करने योग्य ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि हालांकि सक्रिय विश्वास रखरखाव (active belief maintenance) वेयरवोल्फ (Werewolf) में अच्छी टीम की जीत की दर में महत्वपूर्ण सुधार करता है, लेकिन अंतर्निहित तंत्र अनसुलझा बना हुआ है क्योंकि इसमें प्रत्यक्ष क्रिया-विश्वास निरंतरता कम है और जब विश्वास केवल वेयरवोल्फ तक सीमित होते हैं तो अप्रत्याशित लाभ मिलते हैं।

Yuan Gao, Jiangyi Yang, Yao Zhao, Yichi Zhang2026-07-14
🤖 AI

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

यह शोध पत्र 3D-DefectBench का परिचय देता है, जो एक व्यापक बेंचमार्क और फैक्टोरियल अध्ययन है जो यह प्रदर्शित करता है कि स्वचालित 3D दोष पहचान (defect detection) की विश्वसनीयता केवल अंतर्निहित विजन-लैंग्वेज मॉडल पर नहीं, बल्कि संपूर्ण मूल्यांकन पाइपलाइन—जिसमें कैमरा प्रोटोकॉल और प्रॉम्प्ट स्कीमा शामिल हैं—पर निर्भर करती है, साथ ही एक लागत प्रभावी छह-व्यू RGB सेटअप की पहचान करता है और वर्तमान AI जजों एवं मानव लेबलर्स के बीच प्रदर्शन के अंतर को रेखांकित करता है।

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen (…)2026-07-14
🤖 AI

Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

यह शोधपत्र GRADE को प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट सिस्टम है जो एजेंट चयन, तर्क की गहराई और संचार को गतिशील रूप से अनुकूलित करने के लिए सीखे गए गेटिंग मैकेनिज्म और एक नवीन क्रिटिक-मुक्त प्रशिक्षण एल्गोरिदम का उपयोग करता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम सक्रिय कंप्यूट के साथ जटिल बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Sudipto Ghosh, Tanmoy Chakraborty2026-07-14
🤖 AI

How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

100 पेशेवरों के एक मिश्रित-पद्धति अध्ययन के माध्यम से, यह शोध पत्र प्रकट करता है कि सॉफ्टवेयर इंजीनियरिंग एजेंटों का निर्माण कोडिंग से हटकर आवश्यकताओं और समन्वय जैसी गैर-कोडिंग गतिविधियों की ओर विकास संबंधी बाधाओं को स्थानांतरित कर देता है, जिससे एक मूल्यांकन-संचालित वर्कफ़्लो को बढ़ावा मिलता है जो एक सात-चरणीय प्रक्रिया और अविश्वसनीय मूल्यांकन संकेतों एवं बोध ऋण (comprehension debt) जैसी चुनौतियों द्वारा अभिलक्षित है।

Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo2026-07-14
🤖 AI

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

यह शोध पत्र एक मॉड्यूलर, विस्तार योग्य मूल्यांकन ढांचे को प्रस्तुत करता है जिसे चिंतनशील सिद्धांतों के माध्यम से लार्ज लैंग्वेज मॉडल संरेखण (alignment) का व्यवस्थित रूप से आकलन करने और उसे बढ़ाने के लिए डिज़ाइन किया गया है, जो प्रारंभ में मानसिक स्वास्थ्य अनुप्रयोगों को लक्षित करता है जबकि सुदृढ़ मानव-एआई पारिस्थित प्रणालियों के अंतःविषय अनुसंधान के लिए एक डोमेन-अज्ञेय दृष्टिकोण प्रदान करता है।

Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao2026-07-14
🤖 AI

First-Order Modal Logic in HOL: Deep and Shallow Embeddings with Automated Faithfulness (Extended Preprint)

यह शोध पत्र तीन विशिष्ट एम्बेडिंग्स प्रदान करके, क्वांटिफायर के लिए आवश्यक प्रतिस्थापन तंत्र विकसित करके, और पूर्ण डोमेन पर डीप वैलिडिटी को मिनिमल-शैलो व्याख्याओं के साथ सुसंगत बनाने के लिए डाउनवर्ड लोवेनहाइम-स्कोलेम प्रमेय को मैकेनाइज करके, इसाबेल/एचओएल (Isabelle/HOL) के भीतर प्रपोजिशनल से फर्स्ट-ऑर्डर मोडल लॉजिक तक डीप-एंड-शैलो एम्बेडिंग कार्यप्रणाली का विस्तार करता है।

Christoph Benzmüller, Daniel Kirchner2026-07-14
🤖 AI

SETA: Scaling Environments for Terminal Agents

यह शोध पत्र SETA को पेश करता है, जो सत्यापन योग्य टर्मिनल वातावरण उत्पन्न करने के लिए एक स्केलेबल फ्रेमवर्क है जो अपने प्रकार का सबसे बड़ा ओपन-सोर्स डेटासेट (SETA-Env) बनाता है, जिससे Qwen3-8B जैसे RL-प्रशिक्षित मॉडल टर्मिनल एजेंट बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम होते हैं।

Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Don (…)2026-07-14