💻 computer science

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

यह शोध पत्र TraceElephant को पेश करता है, जो LLM-आधारित मल्टी-एजेंट सिस्टम में विफलता एट्रिब्यूशन (failure attribution) के लिए एक नया बेंचमार्क है जो वास्तविक दुनिया के डिबगिंग परिदृश्यों को बेहतर ढंग से दर्शाने के लिए पूर्ण निष्पादन ट्रेसेस (full execution traces) का उपयोग करता है और यह प्रदर्शित करता है कि पूर्ण अवलोकन क्षमता (complete observability) एट्रिब्यूशन सटीकता में महत्वपूर्ण रूप से सुधार करती है।

Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang2026-04-27
🤖 machine learning

Principled Evaluation with Human Labels: One Rater at a Time and Rater Equivalence

यह शोध पत्र यह तर्क देता है कि जब मानवीय निर्णय वस्तुनिष्ठता या समभाव की कमी रखते हैं, तो बहुमत के मतों का उपयोग करने की तुलना में व्यक्तिगत रेटर्स के विरुद्ध स्कोरिंग क्लासिफायर करना और परिणामों का औसत निकालना अधिक सिद्धांतवादी है, और एक क्लासिफायर के प्रदर्शन से मेल खाने के लिए आवश्यक रेटर्स की न्यूनतम संख्या निर्धारित करने के लिए "रेटर इक्विवेलेंस" (रेटर तुल्यता) को एक मीट्रिक के रूप में प्रस्तुत करता है।

Paul Resnick, Yuqing Kong, Grant Schoenebeck, Tim Weninger2026-04-24
💻 computer science

Speculative Actions: A Lossless Framework for Faster Agentic Systems

यह शोध पत्र "स्पेक्युलेटिव एक्शन्स" (Speculative Actions) का परिचय देता है, जो एक लॉसलेस फ्रेमवर्क है जो तेज़ मॉडलों का उपयोग करके संभावित भविष्य के कार्यों का पूर्वानुमान लगाकर और उन्हें समानांतर (parallelize) करके एजेंटिक सिस्टम्स को तेज़ बनाता है, जिससे विविध डोमेन में 20% तक लेटेंसी में कमी आती है और स्पेक्यूलेशन की चौड़ाई और दक्षता के बीच ट्रेडऑफ़ को अनुकूलित करने के लिए एक औपचारिक लागत-लेटेंसी विश्लेषण प्रदान करता है।

Naimeng Ye, Arnav Ahuja, Georgios Liargkovas, Yunan Lu, Kostis Kaffes, Tianyi Peng2026-04-24
💻 computer science

Caesar: Deep Agentic Web Exploration for Creative Answer Synthesis

सीज़र (Caesar) एक नवीन एजेंटिक एलएलएम (LLM) आर्किटेक्चर है जो साहचर्य तर्क (associative reasoning) के लिए नॉलेज ग्राफ का लाभ उठाता है और निष्क्रिय सूचना पुनर्प्राप्ति से नवीन अंतर्दृष्टि के रचनात्मक संश्लेषण की ओर संक्रमण करने के लिए एक प्रतिकूल परिशोधन लूप (adversarial refinement loop) का उपयोग करता है, जो मूल और सुसंगत उत्तर उत्पन्न करने में मौजूदा एजेंटों से काफी बेहतर प्रदर्शन करता है।

Jason Liang, Elliot Meyerson, Risto Miikkulainen2026-04-24
💬 NLP

Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

यह शोध पत्र PolyChartQA प्रस्तुत करता है, जो बहु-चार्ट छवियों और प्रश्न-उत्तर युग्मों का एक मध्यम-स्तरीय डेटासेट है, जिसे जटिल, बहु-चार्ट विज़ुअलाइज़ेशन से अंतर्दृष्टि प्राप्त करने में मल्टीमॉडल लैंग्वेज मॉडल्स के प्रदर्शन को बेंचमार्क और मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Azher Ahmed Efat, Seok Hwan Song, Wallapak Tavanapong2026-04-24
💬 NLP

AI-Gram: When Visual Agents Interact in a Social Network

यह शोध पत्र AI-Gram का परिचय देता है, जो एक लाइव प्लेटफॉर्म है जहाँ LLM-संचालित एजेंट छवियों के माध्यम से परस्पर क्रिया करते हैं, जिससे यह पता चलता है कि जबकि ये एजेंट स्वतः ही समृद्ध दृश्य संचार संरचनाएँ बनाते हैं, वे साथ ही व्यक्तिगत सौंदर्य संप्रभुता बनाए रखते हैं और शैलीगत अभिसरण का विरोध करते हैं।

Andrew Shin2026-04-24
💻 computer science

Architectures for Robust Self-Organizing Energy Systems under Information and Control Constraints

यह शोध पत्र एजेंट-आधारित साइबर-फिजिकल एनर्जी सिस्टम्स में ऑब्जर्वर्स और कंट्रोलर्स के लिए आर्किटेक्चर वेरिएंट्स का प्रस्ताव और मूल्यांकन करता है जो गोपनीयता, नियमों और डेटा विनिमय आवश्यकताओं द्वारा लगाए गए महत्वपूर्ण सूचना पहुंच और क्रिया सीमाओं का पालन करते हुए मजबूत, नियंत्रित स्व-संगठन को सक्षम करते हैं।

Emilie Frost, Astrid Nieße2026-04-24
🔬 physics

Agentic AI-Enabled Framework for Thermal Comfort and Building Energy Assessment in Tropical Urban Neighborhoods

यह शोधपत्र एक एजेंटिक एआई फ्रेमवर्क प्रस्तावित करता है जो उष्णकटिबंधीय शहरी वातावरण में तीव्र, क्लोज्ड-लूप रीजनिंग और एक्शन के माध्यम से थर्मल कम्फर्ट और बिल्डिंग एनर्जी परफॉर्मेंस का स्वायत्त रूप से मूल्यांकन और अनुकूलन करने के लिए लार्ज लैंग्वेज मॉडल्स को लाइटवेट फिजिक्स-आधारित मॉडल्स के साथ एकीकृत करता है।

Po-Yen Lai, Xinyu Yang, Derrick Low, Huizhe Liu, Jian Cheng Wong2026-04-24
💬 NLP

Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems

यह शोध पत्र DiffMAS प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो लेटेंट कम्युनिकेशन (latent communication) को एक सीखने योग्य घटक मानकर मल्टी-एजेंट सिस्टम को अनुकूलित करता है, जिससे टेक्स्ट-आधारित और पूर्ववर्ती लेटेंट दृष्टिकोणों की तुलना में विविध बेंचमार्क पर तर्क संबंधी सटीकता और स्थिरता में महत्वपूर्ण सुधार होता है।

Ye Yu, Heming Liu, Haibo Jin, Xiaopeng Yuan, Peng Kuang, Haohan Wang2026-04-24
🤖 machine learning

Probably Approximately Consensus: On the Learning Theory of Finding Common Ground

यह शोध पत्र एक PAC-लर्निंग फ्रेमवर्क प्रस्तावित करता है जो उच्च-आयामी डेटा से प्राप्त एक-आयामी मत (ओपिनियन) स्पेस में सर्वसम्मति को एक इष्टतम अंतराल के रूप में मॉडल करता है, जो एक कुशल एम्पिरिकल रिस्क मिनिमाइजेशन एल्गोरिदम और चयनात्मक उपयोगकर्ता पूछताछ के माध्यम से मुद्दों की प्रसांगिकता (सेलिएंस) को ध्यान में रखते हुए मुद्दों पर अपेक्षित सहमति को अधिकतम करता है।

Carter Blair, Ben Armstrong, Shiri Alouf-Heffetz, Nimrod Talmon, Davide Grossi2026-04-24