💬 NLP

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

यह शोध पत्र "एडजुडिकेटेड कैप्शनिंग" (Adjudicated Captioning) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त, मल्टी-एजेंट इन्फरेंस फ्रेमवर्क है जो फ्रोजन रिट्रीवल एनकोडर और क्रॉस-अटेंशन वेरिफायर को सेल्फ-सुपरवाइज्ड, कंसेंसस-डिस्टिल्ड रेंकर के साथ एकीकृत करके स्ट्रिक्ट ज़ीरो-शॉट इमेज कैप्शनिंग को बेहतर बनाता है, ताकि अंतर्निहित कैप्शनर को पुन: प्रशिक्षित किए बिना COCO और Flickr30k पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh2026-08-03
🤖 machine learning

Procedural Fairness in Multi-Agent Bandits

यह शोध पत्र मल्टी-एजेंट मल्टी-आर्म्ड बैंडिट्स में 'समान आवाज़' के रूप में प्रक्रियात्मक निष्पक्षता (प्रोसीजरल फेयरनेस) को प्रतिनिधित्व पर आधारित एक कोर-स्टेबल नैश वेलफेयर उद्देश्य को औपचारिक रूप देकर प्रस्तुत करता है, यह प्रदर्शित करते हुए कि परिणाम-आधारित निष्पक्षता मेट्रिक्स अक्सर इस सिद्धांत का त्याग करते हैं जबकि प्रक्रियात्मक रूप से निष्पक्ष नीतियां पारंपरिक उद्देश्यों पर न्यूनतम लागत डालती हैं, जिससे निष्पक्षता ढांचों में प्रक्रियात्मक वैधता को प्राथमिकता देने का तर्क दिया जाता है।

Joshua Caiata, Carter Blair, Kate Larson2026-07-31
💻 computer science

Auditing Emergent LLM-Agent Collaboration through Cooperation-Obligation Coupling

यह शोधपत्र iCORE को प्रस्तुत करता है, जो एक एकीकृत ऑडिटिंग फ्रेमवर्क है जो उभरते हुए LLM-एजेंट सिस्टम में कार्य की सुदृढ़ता (work soundness) और एजेंट-असाइनमेंट स्थिरता को प्रमाणित करने के लिए सहयोग ग्राफ (cooperation graphs), दायित्व ग्राफ (obligation graphs) और एक ऑडिट मैप को एकीकृत करता है, जिससे अधूरे कार्य और गलत आवंटित जिम्मेदारियों का पता लगाकर और उन्हें सुधारकर प्रक्षेपवक्र (trajectory) और टर्मिनल प्रदर्शन में महत्वपूर्ण सुधार किया जाता है।

Zuyuan Zhang, Hanqing Yang, Carlee Joe-Wong, Tian Lan2026-07-31
💻 computer science

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

यह शोध पत्र कौशल-संवर्धित भाषा एजेंटों (skill-augmented language agents) में एक व्यापक "रीज़निंग बैकरूम" (Reasoning Backroom) को उजागर करने के लिए BACKTRACE फ्रेमवर्क और BACKROOMBench प्रस्तुत करता है, जो यह प्रकट करता है कि अवलोकन योग्य कौशल एट्रिब्यूशन (skill attributions) और टेक्स्ट ट्रेसेस (text traces), वास्तविक कारण संबंधी निर्भरता (causal reliance) के अविश्वसनीय संकेतक हैं, जिसे केवल व्यवस्थित प्रतितथ्यात्मक हस्तक्षेपों (counterfactual interventions) के माध्यम से ही सटीक रूप से मापा जा सकता है।

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-07-31
💬 NLP

Belief Coevolution in a Social Network of Generalist and Specialist Large Language Models

यह शोध पत्र यह प्रदर्शित करने के लिए CoevolveSim फ्रेमवर्क प्रस्तुत करता है कि जबकि सामाजिक भूमिकाओं और नेटवर्क संरचनाओं का जनसंख्या-स्तर के आम सहमति पर सीमित प्रभाव पड़ता है, विशेषज्ञ लार्ज लैंग्वेज मॉडल्स (LLMs) का समावेश विश्वास परिवर्तनों को महत्वपूर्ण रूप से बढ़ाता है और विषम प्रभाव पैदा करता है, जो यह संकेत देता है कि यथार्थवादी मल्टी-एजेंट सिमुलेशन के लिए केवल पर्सोना प्रॉम्प्टिंग के बजाय मॉडल विविधता की आवश्यकता है।

Germans Savcisens, Samantha Dies, Courtney Maynard, Tina Eliassi-Rad2026-07-31
🤖 machine learning

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

यह शोध पत्र नैश इक्विलिब्रियम एंट्रॉपी (Nash equilibrium entropy) और रिस्पॉन्स सेंसिटिविटी (response sensitivity) पर आधारित एक हल्का व्यवहार संबंधी एम्बेडिंग (behavioural embedding) प्रस्तावित करता है, जो सफलतापूर्वक यह भविष्यवाणी करता है कि विशिष्ट नॉर्म-फॉर्म गेम्स (normal-form games) पर फाइन-ट्यूनिंग करने से बड़े भाषा मॉडलों (large language models) में रणनीतिक क्षमताएं अनदेखे गेम्स में कैसे स्थानांतरित होती हैं, और यह उन मौजूदा स्ट्रक्चरल एम्बेडिंग्स से बेहतर प्रदर्शन करता है जो केवल गेम की पहचान को याद रखते हैं।

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson2026-07-31
💻 computer science

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

यह शोधपत्र फंक्शन-एविडेंस-वैलिडेशन (FEV) फ्रेमवर्क प्रस्तुत करता है ताकि एजेंटिक बायोइन्फॉर्मेटिक्स सिस्टम के मूल्यांकन को अंतिम-आउटपुट सटीकता से हटाकर उनके संपूर्ण वर्कफ्लो ट्राजेक्टरीज की वैज्ञानिक विश्वसनीयता और ऑडिटेबिलिटी की ओर स्थानांतरित किया जा सके, जो यह प्रकट करता है कि योजना बनाने और निष्पादन करने की वर्तमान क्षमताएं प्रोवेनेंस, वैलिडेशन और एम्पिरिकल टेस्टिंग की क्षमताओं से आगे निकल गई हैं।

Phuc Pham, Truong-Son Hy2026-07-31
💻 computer science

Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness

यह शोध पत्र प्रूफ़एजेंट इंडेक्स (PAI) को प्रस्तुत करता है, जो एक गवर्नेंस रेडिनेस फ्रेमवर्क है जो एआई एजेंट परिनियोजन निर्णयों को केवल क्षमता प्रदर्शन पर निर्भरता से हटाकर मूल्यांकन, संदर्भ, अनुपालन और शासन के एक ऑडिट योग्य, चार-आयामी मूल्यांकन की ओर ले जाता है, जिसे विनियमित डोमेन में उत्पादन तत्परता को केवल कार्यात्मक क्षमता से अलग करने के लिए मान्य किया गया है।

Fouad Bousetouane2026-07-31
💻 computer science

Argonaut: Interactive Visual Exploration for Distributed Optimization

यह शोध पत्र 'Argonaut' को प्रस्तुत करता है, जो एक हल्का, कंटेनराइज्ड डैशबोर्ड है जो विकेंद्रीकृत परिवेशों में मल्टी-एजेंट डिस्क्रीट-चॉइस ऑप्टिमाइज़ेशन की संपूर्ण खोज प्रक्रिया के इंटरैक्टिव और विजुअल अन्वेषण को सक्षम बनाता है, जिससे एक पारंपरिक रूप से ब्लैक-बॉक्स गणना को हज़ारों एजेंटों और लाखों समाधानों को संभालने में सक्षम एक 'ह्यूमन-इन-द-लूप' सिस्टम में बदल दिया जाता है।

Srijoni Majumdar, Chuhao Qin, Evangelos Pournaras2026-07-31
💻 computer science

AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration

AgentRadio एक एसिंक्रोनस मैसेज-पासिंग लेयर पेश करता है जो एजेंटों को निष्पादन के दौरान अपने साथियों की खोजों के प्रति निष्क्रिय जागरूकता बनाए रखने की अनुमति देकर दीर्घ-क्षितिज बहु-एजेंट कोड समझ (long-horizon multi-agent code comprehension) को सक्षम बनाता है, जिससे निरंतर मध्य-मार्ग समन्वय (mid-course coordination) के माध्यम से SWE-Atlas QnA बेंचमार्क पर 62.1% सफलता दर प्राप्त होती है—जो सिंगल-एजेंट बेसलाइन और नए मॉडलों दोनों से काफी बेहतर प्रदर्शन करती है।

Xinxing Ren, Qianbo Zang, Ziyan Wang, Caelum Forder, Suman Deb, Peter Carroll, Zekun Guo2026-07-31