💬 NLP

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

यह शोध पत्र मल्टी-एजेंट डिबेट सिस्टम में आंतरिक आत्मविश्वास संकेतों (लॉग-प्रोबेबिलिटीज), बाहरी एलएलएम-एज़-जज (LLM-as-judge) मूल्यांकनों और अंतिम कार्य सटीकता के बीच संबंध की जांच करता है, जिससे यह पता चलता है कि आत्मविश्वास मेट्रिक्स "ऑडिटर" (Auditor) एजेंट की तुलना में "कंस्ट्रक्टर" (Constructor) एजेंट के लिए तर्क की गुणवत्ता और विफलता का पता लगाने के साथ काफी अधिक मजबूती से संरेखित होते हैं।

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer2026-06-10
💬 NLP

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

यह शोधपत्र MIRAGE को प्रस्तुत करता है, जो एक वास्तविक समय की निगरानी प्रणाली है जो मॉडल के रेसिडुअल स्ट्रीम (residual stream) में एक साझा, निम्न-आयामी एन्कोडिंग उप-स्थान (low-dimensional encoding subspace) की पहचान करके LLM एजेंट डेटा एक्सफिल्ट्रेशन का पता लगाती है, और सतही विशेषताओं के बजाय अंतर्निहित गणना को पढ़कर आउटपुट-ओनली विधियों की तुलना में काफी अधिक पहचान सटीकता प्राप्त करती है।

Pratibha Revankar, Kargi Chauhan, Jihye Kim, Sadiba Nusrat Nur, Vincent Siu, Chenguang Wang2026-06-10✓ Author reviewed
💬 NLP

Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

यह शोध पत्र यह प्रदर्शित करता है कि लॉग-प्रायिकता (log-probabilities) से प्राप्त प्रारंभिक-टोकन आत्मविश्वास (early-token confidence), पूर्ण-अनुक्रम मेट्रिक्स (full-sequence metrics) से बेहतर प्रदर्शन करते हुए, मल्टी-एजेंट एलएलएम (LLM) बहसों में तर्क की गुणवत्ता के एक सुदृढ़ और हल्के भविष्यवक्ता के रूप में कार्य करता है और सहायक एवं विरोधी एजेंट भूमिकाओं के बीच विशिष्ट विश्वसनीयता पैटर्न को प्रकट करता है।

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer2026-06-10
💬 NLP

Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents

यह शोध पत्र यह प्रदर्शित करता है कि प्रोडक्शन मल्टी-टर्न एजेंटों में LLM-as-judge सिस्टम संरचनात्मक ब्लाइंड स्पॉट्स (blind spots) से ग्रस्त होते हैं जो उन्हें अधिकांश महत्वपूर्ण स्टेट-ट्रैकिंग और व्यवहार संबंधी दोषों को पहचानने से रोकते हैं, जिससे यह स्पष्ट होता है कि स्वचालित जजिंग केवल एक रिग्रेशन फ्लोर (regression floor) के रूप में कार्य करती है न कि मानव समीक्षा के एक विश्वसनीय विकल्प के रूप में।

Sawyer Zhang, Alexander Wang, Sophie Lei2026-06-10
💬 NLP

The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring

यह शोध पत्र यह प्रदर्शित करता है कि एक क्वांटाइज्ड LLaMA-3.1-8B मॉडल को उनके स्वाभाविक क्रम में डिस्कोर्स तत्वों पर अनुक्रमिक रूप से फाइन-ट्यून करना, स्वतंत्र और रैंडमाइज्ड प्रशिक्षण दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे बेहतर ऑटोमेटेड एसे रिस्कोरिंग कोहेरेंस प्राप्त होती है और बड़े 70B बेसलाइन के समकक्ष प्रदर्शन मिलता है, जबकि यह एक अधिक लागत प्रभावी समाधान भी प्रदान करता है।

Ali Keramati, Mark Warschauer2026-06-10
⚛️ high-energy experiments

Agentic Hybrid RAG for Evidence-Grounded Muon Collider Analysis

यह शोध पत्र "एजेंटिक हाइब्रिड RAG" प्रस्तुत करता है, जो एक ढांचा है जो मयून कोलाइडर अनुसंधान के लिए साक्ष्य-आधारित वैज्ञानिक प्रश्न उत्तर को बढ़ाने के लिए हाइब्रिड रिट्रीवल को एजेंटिक रीजनिंग के साथ जोड़ता है, जिसे एक नए डोमेन-विशिष्ट बेंचमार्क और मौजूदा बेसलाइनों पर बेहतर प्रदर्शन द्वारा प्रमाणित किया गया है।

Ruobing Jiang, Dawei Fu, Cheng Jiang, Tianyi Yang, Zijian Wang, Youpeng Wu, Yong Ban, Yajun Mao, Qiang Li2026-06-10
💬 NLP

Selection, Not Salience: The Shape and Limits of Personalization in Social Highlighting

यह शोध पत्र प्रदर्शित करता है कि सोशल हाइलाइटिंग में वैयक्तिकरण (पर्सनलाइजेशन) मुख्य रूप से दस्तावेज़ चयन के स्तर पर मामूली, विषय-संचालित लाभ प्रदान करता है, जबकि यह साधारण लीड बेसलाइन या अपरिवेशिक (इम्पर्सनल) मॉडलों द्वारा प्राप्त की जाने वाली उपलब्धि से आगे वाक्य-स्तरीय सलिअन्स (महत्ता) रैंकिंग में सुधार करने में विफल रहता है।

Kazuki Nakayashiki, Keisuke Watanabe2026-06-10
💬 NLP

Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries

यह शोध पत्र आइंस्टीनएरेना (EinsteinArena) का परिचय देता है, जो एक विकेंद्रीकृत मंच है जहाँ स्वायत्त एआई एजेंट सार्वजनिक संवाद और विचारों के आदान-प्रदान के माध्यम से गणित की खुली समस्याओं को सहयोगात्मक रूप से हल करते हैं, और सफलतापूर्वक 12 नए अत्याधुनिक परिणाम उत्पन्न करते हैं, जिनमें 11-आयामी किसिंग नंबर समस्या (11-dimensional kissing number problem) के लिए एक बेहतर सीमा भी शामिल है।

Federico Bianchi, Yongchan Kwon, Aneesh Pappu, James Zou2026-06-10
💬 NLP

WebChallenger: A Reliable and Efficient Generalist Web Agent

WebChallenger एक सामान्यज्ञ वेब एजेंट फ्रेमवर्क है जो PageMem और तीन वास्तुशिल्प तंत्रों को पेश करके, जो चयनात्मक ध्यान, निरंतर स्मृति और प्रक्रियात्मक प्रवाह में मानव संज्ञानात्मक लाभों की नकल करते हैं, कई बेंचमार्क पर लागत प्रभावी, ऑफ-द-शेल्फ मॉडलों का उपयोग करके अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jayoo Hwang, Xiaowen Zhang, Vedant Padwal2026-06-10✓ Author reviewed
💬 NLP

Which LoRA? An Empirical Study on the Effectiveness of LoRA Techniques During Multilingual Instruction Tuning

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि बहुभाषी निर्देश ट्यूनिंग (multilingual instruction tuning) में बुनियादी LoRA अधिक जटिल वेरिएंट्स के समान प्रदर्शन करता है, क्योंकि न तो कोई क्रॉस-लिंगुअल ट्रांसफर और ज्ञान प्रतिधारण (knowledge retention) को संतुलित करने में महत्वपूर्ण लाभ प्रदान करता है, और न ही वे लेयर-वाइज भाषा प्रतिनिधित्व (layer-wise language representations) को पर्याप्त रूप से बदलते हैं।

Thamali Wijewardhana, Napoleon H. Reyes, Surangika Ranathunga2026-06-10