🤖 AI

Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs

यह शोध पत्र एमोर्टाइज्ड सीक्वेंशियल इंफॉर्मेशन गैदरिंग (ASIG) को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग विधि है जो LLM नीतियों में बेयसियन एक्सपेरिमेंटल डिज़ाइन को एकीकृत करती है ताकि 20 प्रश्न (20 Questions) और मेडिकल डायग्नोसिस जैसे कार्यों में अनुक्रमिक सूचना एकत्र करने की दक्षता और सफलता दर में उल्लेखनीय सुधार किया जा सके और साथ ही इन्फरेंस लागत को भारी रूप से कम किया जा सके।

Jakob Hartmann, James Harvey, Jhonathan Navott, Erik Y. Wang, Luckeciano C. Melo, Flaviu Cipcigan, Cheng Zhang, Alessand (…)2026-07-07
🤖 AI

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

यह शोध पत्र HiMe को प्रस्तुत करता है, जो एक पदानुक्रमित एम्बोडीड मेमोरी फ्रेमवर्क (hierarchical embodied memory framework) है जो वास्तविक समय के निष्पादन (real-time execution), वर्किंग मेमोरी और रणनीतिक योजना को अलग करके तथा आत्म-सुधार के लिए गतिशील ज्ञान प्रबंधन को सक्षम करके लंबी अवधि के रोबोटिक कार्यों में फ्रीक्वेंसी-कॉम्पिटेंस विरोधाभास (frequency-competence paradox) को हल करता है।

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu2026-07-07
🤖 AI

Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

यह शोध पत्र बेस्ट-ऑफ-बेटर-NN (BoBN) को प्रस्तुत करता है, जो एक इन-कॉन्टेक्स्ट लर्निंग फ्रेमवर्क है जो उच्च-पुरस्कार वाले उदाहरणों को रिट्रीव और रीस्टाइल करके मॉडल के सैंपलिंग डिस्ट्रीब्यूशन को बेहतर प्रतिक्रियाओं की ओर स्थानांतरित करके इन्फरेंस-टाइम अलाइनमेंट में सुधार करता है, जिससे पारंपरिक बेस्ट-ऑफ-NN विधियों की तुलना में कम जनरेटेड उम्मीदवारों के साथ उत्कृष्ट प्रदर्शन प्राप्त होता है।

Eric Lei, Hsiang Hsu, Chun-Fu Chen2026-07-07
💬 NLP

CaresAI at SMM4H-HeaRD 2026: Predicting TNM Staging

यह शोध पत्र SMM4H-HeaRD 2026 चुनौती के लिए CaresAI प्रणाली प्रस्तुत करता है, जो TNM स्टेजिंग की भविष्यवाणी करने के लिए TCGA पैथोलॉजी रिपोर्टों पर विभिन्न मशीन लर्निंग और डीप लर्निंग मॉडलों का उपयोग करता है, जो प्रशिक्षण के दौरान मजबूत प्रदर्शन प्राप्त करता है लेकिन परीक्षण सेटों पर मूल्यांकन के दौरान महत्वपूर्ण सामान्यीकरण चुनौतियों और वर्ग असंतुलन के प्रति संवेदनशीलता को प्रकट करता है।

Joseph Itopa Abubakar, Jorge Jarme, Favour Igwezeke, Mary Adewunmi2026-07-07
🤖 AI

Demonstrating Generalization Failures via Mixtures of Conditional Policies

यह शोध पत्र सशर्त नीतियों (conditional policies) के मिश्रण पर प्रशिक्षण देकर, विशिष्ट सामान्यीकरण विफलताओं (generalization failures) को प्रदर्शित करने वाले नियंत्रणीय "मॉडल जीवों" (model organisms) के निर्माण के लिए एक विधि प्रस्तावित करता है, जिससे यह अस्तित्व प्रमाण (existence proofs) प्राप्त होते हैं कि प्रशिक्षण की सफलता सामान्यीकरण की गारंटी नहीं देती है और संरेखण स्ट्रेस-टेस्टिंग (alignment stress-testing) के लिए उपकरण भी उपलब्ध होते हैं।

Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells2026-07-07
🤖 AI

Towards Diverse and Comprehensive Benchmarks for Mutual Information Estimation

यह शोध पत्र म्यूचुअल इंफॉर्मेशन अनुमानकों (mutual information estimators) का मूल्यांकन करने के लिए विविध सिंथेटिक और वास्तविक दुनिया के परीक्षणों के साथ एक व्यापक, कोपुला-सैद्धांतिक (copula-theoretic) बेंचमार्किंग ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि कोई भी एकल विधि सार्वभौमिक रूप से दूसरों से बेहतर प्रदर्शन नहीं करती है और गैर-पैरामीट्रिक, विभेदक (discriminative) तथा जनरेटिव श्रेणियों में विशिष्ट सीमाओं को उजागर करती है।

Alberto Foresti, Ivan Butakov, Alexander Tolmachev, Giulio Franzese, Alexey Frolov, Pietro Michiardi2026-07-07
💬 NLP

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

यह शोध पत्र प्रदर्शित करता है कि फ्रंटियर LLMs अपने हिडन स्टेट्स (hidden states) के भीतर कंटेंट-फ्री फिलर टोकन्स पर संरचित, सुपाठ्य बहु-चरणीय तर्क (multi-step reasoning) करते हैं, जो यह प्रकट करता है कि अनसुपरवाइज्ड डिकोडिंग के माध्यम से रेसिडुअल स्ट्रीम (residual stream) की निगरानी तब भी की जा सकती है जब सतह के टोकन्स कोई दृश्यमान चेन-ऑफ-थॉट (chain-of-thought) प्रदान नहीं करते हैं।

Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks2026-07-07
💬 NLP

Aligning Language Models with Selective Prediction

यह शोध पत्र 'रिनफोर्समेंट लर्निंग फॉर सिलेक्शन रिवॉर्ड' (RLSR) का प्रस्ताव करता है, जो एक नवीन पोस्ट-ट्रेनिंग अलाइनमेंट फ्रेमवर्क है जो रिस्क-कवरेज कर्व के नीचे के क्षेत्र (AURC) को सीधे लक्षित करके बड़े भाषा मॉडलों को चयनात्मक भविष्यवाणी (selective prediction) के लिए अनुकूलित करता है, जिससे रिस्क-कवरेज ट्रेड-ऑफ में महत्वपूर्ण सुधार होता है और उच्च-जोखिम वाले निर्णय लेने की स्थितियों में विश्वसनीयता बढ़ती है।

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun2026-07-07
🤖 AI

Applying Answer Set Programming with Fuzzy Membership Functions: a Case Study

यह शोध पत्र उत्तर सेट प्रोग्रामिंग (Answer Set Programming) का एक नवीन फजी-लॉजिक-आधारित विस्तार प्रस्तुत करता है जो अस्पष्ट भाषाई अवधारणाओं को संभालने के लिए लचीले सदस्यता फलनों (membership functions) के माध्यम से विशेषज्ञ ज्ञान के साथ मशीन लर्निंग आउटपुट को एकीकृत करके संख्यात्मक डेटा और गुणात्मक तर्क के बीच सेतु बनाता है।

Luca Ferragina, Ilenia Galati, Lorena Gullone, Francesco Scarcello2026-07-07
🤖 AI

How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs

यह शोध पत्र ऑरेकल-सहायता प्राप्त गणनाओं के लिए 'डबली-एफिशिएंट सिंगल-प्रूवर इंटरैक्टिव प्रूफ' पेश करके एआई सुरक्षा सत्यापन के लिए एक स्केलेबल दृष्टिकोण का प्रस्ताव करता है, जिससे यह सिद्ध होता है कि दो एआई मॉडलों के बीच प्रतिस्पर्धी बहस की अक्सर अवास्तविक धारणाओं पर निर्भर किए बिना विश्वसनीय संरेखण सत्यापन संभव है।

Liyan Chen, Yael Tauman Kalai, Zoe Xi2026-07-07