🤖 AI

A Scalable Entity-Based Framework for Auditing Bias in LLMs

यह शोध पत्र एलएलएम (LLM) पूर्वाग्रह के ऑडिटिंग के लिए एक स्केलेबल, एंटिटी-आधारित ढांचे को प्रस्तुत करता है जो अब तक के सबसे बड़े अध्ययन (1.9 बिलियन डेटा पॉइंट्स) को संचालित करने के लिए सिंथेटिक डेटा का लाभ उठाता है, जो राजनीतिक और भौगोलिक पक्षपात जैसे व्यवस्थित विचलनों को प्रकट करता है जो इंस्ट्रक्शन ट्यूनिंग के बावजूद बने रहते हैं और मॉडल के बढ़ते स्केल द्वारा और अधिक बढ़ जाते हैं।

Akram Elbouanani, Aboubacar Tuo, Adrian Popescu2026-05-12
🤖 AI

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

यह शोधपत्र यह प्रदर्शित करता है कि मानसिक स्वास्थ्य एआई सुरक्षा परीक्षण में, विशेषज्ञ मानवीय फीडबैक यादृच्छिक त्रुटि के बजाय व्यवस्थित और सिद्धांतपूर्ण असहमति प्रदर्शित करता है, जो एक वैध ग्राउंड ट्रुथ (आधारभूत सत्य) की धारणा को चुनौती देता है और यह सुझाव देता है कि सुरक्षा-महत्वपूर्ण एआई मूल्यांकन को सर्वसम्मति-आधारित एकत्रीकरण से हटकर उन तरीकों की ओर स्थानांतरित होना चाहिए जो विविध व्यावसायिक दृष्टिकोणों को संरक्षित करते हैं।

Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max (…)2026-05-12
🤖 machine learning

The Geometric Reasoner: Manifold-Informed Latent Foresight Search for Long-Context Reasoning

द ज्योमेट्रिक रीज़नर (TGR) एक ट्रेनिंग-फ्री फ्रेमवर्क है जो चंक-वाइज KV कैश रिसेट्स के साथ मैनिफोल्ड-इन्फॉर्म्ड लेटेंट फोरसाइट सर्च को निष्पादित करके सख्त मेमोरी बाधाओं के तहत लॉन्ग-कॉन्टेक्स्ट रीजनिंग को बढ़ाता है, जिससे गणित और कोड बेंचमार्क पर नगण्य कम्प्यूटेशनल ओवरहेड के साथ प्रक्षेपवक्र कवरेज (ट्रैजेक्टरी कवरेज) में महत्वपूर्ण सुधार प्राप्त होता है।

Ren Zhuang, Ben Wang, Shuifa Sun2026-05-12
🤖 AI

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

यह शोध पत्र DiGiT-TC प्रस्तुत करता है, जो एक नवीन डेटा जनरेशन विधि है जो उपयोगकर्ता अनुरोधों के भीतर टूल कॉल्स को अंतर्निहित रूप से दर्शाकर स्टेटलेस निष्पादन वातावरण (stateless execution environments) के लिए जटिल मल्टी-टर्न टूल कॉलिंग वार्तालापों को संश्लेषित करती है, जिससे स्टेटफुल सत्यापन (stateful validation) पर निर्भर किए बिना छोटे भाषा मॉडलों की प्रभावी ट्यूनिंग सक्षम होती है।

Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumarave (…)2026-05-12
🤖 machine learning

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

यह शोध पत्र सरल, स्केलेबल तकनीकों को प्रस्तुत करता है जो यह प्रदर्शित करती हैं कि इम्पलिसिट प्लानिंग (implicit planning)—एक ऐसी प्रक्रिया जहाँ भाषा मॉडल तुकबंदी या उत्तर जैसे भविष्य के लक्ष्यों की ओर मध्यवर्ती टोकन को निर्देशित करते हैं—एक सार्वभौमिक क्षमता है जो 1B पैरामीटर्स जितने छोटे मॉडलों में भी मौजूद है, जो एआई सुरक्षा और नियंत्रण के लिए नई अंतर्दृष्टि प्रदान करती है।

Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda2026-05-12
🤖 machine learning

Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning

यह शोध पत्र "फेलियर-प्रिफिक्स कंडीशनिंग" (failure-prefix conditioning) का प्रस्ताव करता है, जो दुर्लभ गलत प्रक्षेप पथों (trajectories) के प्रिफिक्स पर कंडीशन करके संतृप्त समस्याओं (saturated problems) पर रीजनिंग मॉडल के प्रशिक्षण को बढ़ाता है ताकि अन्वेषण को विफलता-प्रवण अवस्थाओं की ओर स्थानांतरित किया जा सके, जिससे महंगी नई डेटा संग्रह की आवश्यकता के बिना मूल्यवान शिक्षण संकेतों को अनलॉक किया जा सके।

Minwu Kim, Safal Shrestha, Anubhav Shrestha, Keith Ross2026-05-12
🤖 machine learning

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

यह अध्ययन प्रदर्शित करता है कि भाषाई रूप से प्रेरित पाठ्यक्रम LLM प्रीट्रेनिंग में मुख्य रूप से साझा लेटेंट लर्निंग चरणों की अवधि को बदलकर छोटे मॉडलों में प्रशिक्षण स्थिरता को बढ़ाते हैं और ग्रेडिएंट शोर को कम करते हैं, न कि नए चरण बनाकर, जबकि बड़े मॉडल पैमानों पर ये लाभ कम हो जाते हैं।

Mohamed Elgaar, Hadi Amiri2026-05-12
📊 statistics

Why Adam Works Better with β1=β2\beta_1 = \beta_2: The Missing Gradient Scale Invariance Principle

यह शोध पत्र यह प्रकट करता है कि एडम (Adam) ऑप्टिमाइज़र में β1=β2\beta_1 = \beta_2 निर्धारित करना इष्टतम है क्योंकि यह विशिष्ट रूप से प्रथम-क्रम ग्रेडिएंट स्केल इनवेरिएंस (first-order gradient scale invariance) सुनिश्चित करता है, जो एक ऐसी संरचनात्मक विशेषता है जो विविध कार्यों में प्रशिक्षण स्थिरता और प्रदर्शन में अनुभवजन्य रूप से देखे गए सुधारों की व्याख्या करती है।

Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí2026-05-12
🤖 AI

Supervised Mixture-of-Experts for Surgical Grasping and Retraction

यह शोध पत्र एक सुपरवाइज्ड मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर प्रस्तुत करता है जो केवल स्टीरियो एंडोस्कोपिक छवियों और 150 से कम प्रदर्शनों (demonstrations) का उपयोग करके हल्केवेट इमिटेशन लर्निंग पॉलिसियों को लचीले ऊतकों (deformable tissue) पर मजबूत और डेटा-कुशल सर्जिकल ग्रैस्पिंग और रिट्रैक्शन प्राप्त करने में सक्षम बनाता है, जो इन-डिस्ट्रीब्यूशन और चुनौतीपूर्ण आउट-ऑफ-डिस्ट्रीब्यूशन परिदृश्यों दोनों में मानक मॉडलों से काफी बेहतर प्रदर्शन करता है और एक्स विवो (ex vivo) तथा प्रारंभिक इन विवो (in vivo) पोर्सिन सर्जरी में सफल ज़ीरो-शॉट ट्रांसफर प्रदर्शित करता है।

Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagn (…)2026-05-12
🤖 AI

Emergence of Physical Intelligence via Controllable Information Production

यह शोध पत्र कंट्रोलेबल इंफॉर्मेशन प्रोडक्शन (CIP) प्रस्तुत करता है, जो डायनेमिकल सिस्टम्स और ऑप्टिमल कंट्रोल पर आधारित एक नवीन इंट्रिन्सिक मोटिवेशन फ्रेमवर्क है जो फिजिकल इंटेलिजेंस को इंफॉर्मेशन प्रोडक्शन के साथ एकीकृत करता है, जिससे एजेंटों को सिस्टम को कंट्रोलेबल केओस (controllable chaos) के किनारे की ओर ले जाकर ह्यूमनॉइड सेल्फ-राइटिंग जैसे जटिल कार्यों में महारत हासिल करने में सक्षम बनाया जा सके।

Tristan Shah, Stas Tiomkin2026-05-12