🤖 AI

Multi-Agent LLMs Fail to Explore Each Other

यह शोध पत्र एक मौलिक सीमा की पहचान करता है जहाँ आधुनिक LLM एजेंट मल्टी-एजेंट परिवेश में एक-दूसरे को प्रभावी ढंग से एक्सप्लोर करने में विफल रहते हैं, जिससे उप-इष्टतम समन्वय होता है, और संरचित पीयर चयन (peer selection) को स्पष्ट रूप से बढ़ावा देने के लिए मल्टी-एजेंट कॉन्टेक्स्टुअल एक्सप्लोरेशन (MACE) फ्रेमवर्क का प्रस्ताव करता है, जिससे एक्सप्लोरेशन व्यवहार और कार्य प्रदर्शन में महत्वपूर्ण सुधार होता है।

Hyeong Kyu Choi, Jiatong Li, Wendi Li, Xin Eric Wang, Sharon Li2026-07-14
🤖 AI

Valid \ne Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

यह शोध पत्र वैध लेकिन अक्षम तर्क (reasoning) के संबंध में मौजूदा चेन-ऑफ-थॉट इवैल्यूएटर्स में एक महत्वपूर्ण ब्लाइंड स्पॉट की पहचान करता है, और कई बेंचमार्क्स में सटीकता बनाए रखते हुए टोकन खपत को महत्वपूर्ण रूप से कम करने के लिए प्रशिक्षण-मुक्त CAID मेट्रिक और PACE कंप्रेशन रणनीति पेश करता है।

Daeyeop Lee, Hwanjo Yu2026-07-14
💬 NLP

Enhancing LLMs through human feedback: a journey towards self-improvement

यह शोध पत्र एक नवीन ह्यूमन-इन-द-लूप कार्यप्रणाली प्रस्तावित करता है जो निरंतर उपयोगकर्ता फीडबैक के माध्यम से एक प्राथमिक RAG सिस्टम के प्रदर्शन को पुनरावृत्ति से परिष्कृत करने के लिए एक सहायक फीडबैक RAG सिस्टम को एकीकृत करता है, जो LLM-एज़-अ-जज मूल्यांकन के माध्यम से विविध बेंचमार्क में सटीकता और प्रासंगिकता में महत्वपूर्ण सुधार प्रदर्शित करता है।

Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon2026-07-14
🤖 AI

Towards Predictive, Aligned, and Scalable Robot Learning

यह शोध पत्र Lumo-2 को प्रस्तुत करता है, जो एक हल्का लेटेंट वर्ल्ड-एक्शन मॉडल है, जो लेटेंट स्पेस को व्यवस्थित करने और क्रिया (actions), विज़न और भाषा के बीच क्रॉस-मोडल निरंतरता सुनिश्चित करने के लिए एक मल्टी-स्टेज प्री-अलाइनमेंट रणनीति का उपयोग करके जटिल वास्तविक दुनिया के कार्यों पर बेहतर प्रेडिक्टिव रीजनिंग और कंट्रोल प्रदर्शन प्राप्त करता है।

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang2026-07-14
🤖 AI

Efficient Test-Time Optimization for Multi-Agent Proof Autoformalization

यह शोध पत्र ToMap का परिचय देता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो प्रूफ डिकम्पोज़िशन (प्रमाण अपघटन) चरण को महत्वपूर्ण बाधा के रूप में पहचानकर और औपचारिक सत्यापन (फॉर्मल वेरिफिकेशन) एवं सिमेंटिक रूब्रिक्स का उपयोग करके इसे पुनरावृत्ति से परिष्कृत करके टेस्ट-टाइम कंप्यूट को अनुकूलित करता है, जिससे ProofFlowBench पर फुल-प्रूफ ऑटोफॉर्मलाइजेशन की सटीकता और दक्षता में महत्वपूर्ण सुधार प्राप्त होता है।

Tian-Shuo Liu, Shiyuan Zhang, Zijie Geng, Haoyu Liu, Runjie Xu, Pengyuan Wang, Lei Yuan, Yang Yu2026-07-14
🤖 AI

Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors

यह शोध पत्र तर्क देता है कि सेंटर्ड टोकन लॉग-प्रोबेबिलिटी (centered token log-probability), अपने अंतर्निहित मार्टिंगेल गुणों (martingale properties) और आत्मविश्वासी पुनरावृत्ति के दौरान मौन रहने के कारण, क्वांटाइज्ड रीजनिंग मॉडल्स की निगरानी के लिए एक अप्रभावी अवलोकन योग्य (observable) है, और इसके बजाय एक प्रशिक्षण-मुक्त, कैलिब्रेटेड e-CUSUM डिकोडर का प्रस्ताव देता है जो टोकन अनिश्चितता को वर्बेटम पुनरावृत्ति संकेतों (verbatim repetition signals) के साथ जोड़कर विफल होने वाले ट्रेसेस (failing traces) का सफलतापूर्वक पता लगाता है।

El Hassane Ettifouri (Novelis Research, Paris, France), Ayoub Belfatmi (Novelis Research, Paris, France), Mahaman Sanous (…)2026-07-14
🤖 AI

Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation

यह शोध पत्र एक न्यूरो-सिम्बोलिक जनरेट-वेरिफाई-रिपेयर हार्नेस पेश करता है जो बड़े भाषा मॉडलों द्वारा उत्पन्न बारह-स्वर (twelve-tone) संगीत की निरंतरता और कथित गुणवत्ता में महत्वपूर्ण सुधार करता है, जो उन्हें एक सिम्बोलिक सत्यापन लूप में लपेटकर ऐसा करता है जो स्पष्ट रूप से अपभ्रंश (degenerate) आउटपुट उत्पन्न करने से बचता है।

Congren Dai, Danni Zhao, Enyang Liu, Michael Ching Yam, Zhancheng Guo, Siyi Gu, Wentao Yang, Bo Dai, Xiaobing Li, Maoson (…)2026-07-14
🤖 AI

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR एक स्वचालित फ्रेमवर्क है जो सर्किट स्कीमैटिक्स को एक निष्पादन योग्य इंटरमीडिएट रिप्रेजेंटेशन में बदलने के लिए विजन लैंग्वेज मॉडल्स का लाभ उठाता है और सटीक सिम्बोलिक एक्सप्रेशंस उत्पन्न करने के लिए एक सिम्बोलिक सॉल्वर एजेंट का उपयोग करता है, जो सटीकता और दक्षता दोनों में मौजूदा एंड-टू-एंड और विशिष्ट विधियों से काफी बेहतर प्रदर्शन करता है।

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu2026-07-14
🤖 AI

Fail-Aware and Explainable Test Oracle Prediction

यह शोध पत्र FOCAL को प्रस्तुत करता है, जो एक कोड LLM-आधारित विभेदक भविष्यवक्ता (discriminative oracle predictor) है जो उन्नत विफलता पहचान और कथन-स्तरीय स्पष्टीकरणों के साथ सीधे टेस्ट पास/फेल परिणामों का पूर्वानुमान लगाता है, जो अनदेखे प्रोजेक्ट्स के लिए मौजूदा टेस्ट जनरेशन तकनीकों के एक सुदृढ़ पूरक के रूप में कार्य करता है।

Yue Zhao, Binish Tanveer, Jelena Zdravkovic2026-07-14
🤖 AI

Longitudinal Multi-View Breast Cancer Risk Prediction

यह शोध पत्र LMV-Net प्रस्तुत करता है, जो एक डीप लर्निंग मॉडल है जो एक स्पष्ट रूप से संरेखित अनुदैर्ध्य ढांचे के भीतर शारीरिक रूप से पूरक CC और MLO दृश्यों का संयुक्त रूप से विश्लेषण करके स्तन कैंसर के जोखिम की भविष्यवाणी में सुधार करता है, और विभिन्न रोगी उपसमूहों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Solveig Thrun, Zijun Sun, Suaiba A. Salahuddin, Kristoffer Wickstrøm, Elisabeth Wetzer, Stine Hansen, Robert Jenssen, Mi (…)2026-07-14