🤖 machine learning

Message Passing Enables Efficient Reasoning

यह शोध पत्र मैसेज पासिंग लैंग्वेज मॉडल्स (MPLMs) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो हल्के प्रिमिटिव्स के माध्यम से प्रत्यक्ष इंटर-थ्रेड संचार सक्षम करके LLM तर्क दक्षता को बढ़ाता है, जिससे संदर्भ अतिरेक कम होता है और आशाजनक न दिखने वाली शाखाओं को समय से पहले समाप्त करने की अनुमति मिलती है ताकि सुडोकू और 3-SAT जैसे जटिल कार्यों पर पारंपरिक अनुक्रमिक और फोर्क-जॉइन दृष्टिकोणों से बेहतर प्रदर्शन किया जा सके।

Xuecheng Liu, Daman Arora, Gokul Swamy, Andrea Zanette2026-07-02
💻 computer science

AGC-Bench: Measuring Artificial General Creativity

यह शोध पत्र AGC-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और मूल्यांकन ढांचा है जो कृत्रिम सामान्य रचनात्मकता (artificial general creativity) का एक एकीकृत मापन स्थापित करता है, जो सामान्य बुद्धिमत्ता से भिन्न एक एकल रचनात्मक कारक को प्रकट करता है और यह प्रदर्शित करता है कि शीर्ष मानव रचनाकार अभी भी वर्तमान अत्याधुनिक LLMs से बेहतर प्रदर्शन करते हैं।

Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. Di (…)2026-07-02
🤖 AI

Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity

यह शोध पत्र "एडवर्सरियल प्रैगमैटिक्स" (adversarial pragmatics) प्रस्तुत करता है, जो एक भाषाई रूप से आधारित बेंचमार्क और एनोटेशन प्रोटोकॉल है जिसे क्षमता की सीमाओं, नीतिगत अस्पष्टता और निर्देश संघर्षों के बीच अंतर करने के माध्यम से एआई सुरक्षा (AI safety) का कठोरता से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें मॉडल व्यवहार और मूल्यांकनकर्ता निर्णयों में विफलताओं के निदान के लिए एक नियंत्रित वर्गीकरण, विशेषज्ञ मूल्यांकन मेट्रिक्स और एक सीड डेटासेट शामिल है।

Brett Reynolds2026-07-02
⚡ electrical engineering

Disentangling Speaker and Language Effects in Cross-Lingual Speaker Verification for Iberian Languages

यह शोध पत्र क्रॉस-लिंगुअल स्पीकर वेरिफिकेशन में स्पीकर और भाषा के प्रभावों को अलग करने के लिए पांच इबेरियन भाषाओं के लिए एक द्विभाषी समान-वक्ता मूल्यांकन सेट प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि स्पीकर की परिवर्तनशीलता प्रदर्शन में गिरावट में योगदान देती है, भाषा का बेमेल होना ही क्रॉस-लिंगुअल हानि का प्राथमिक कारण बना हुआ है।

Pol Buitrago, Javier Hernando2026-07-02
🤖 machine learning

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

यह शोध पत्र एक एडवरसेरियल जनरेटर-डिस्क्रिमिनेटर फ्रेमवर्क प्रस्तावित करता है जो विविधता पतन (diversity collapse) और रिवॉर्ड हैकिंग (reward hacking) जैसे सामान्य RLVR विफलता मोड को कम करने के लिए मानव प्रदर्शनों से प्राप्त एक सीखे हुए संकेत के साथ सत्यापन योग्य पुरस्कारों को बढ़ाता है, जिससे कार्य सटीकता और शैली एवं संरचना जैसे गैर-सत्यापन योग्य मानव-समान गुणों दोनों को सफलतापूर्वक अनुकूलित किया जा सके।

Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas2026-07-02
🤖 machine learning

Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation

यह शोध पत्र "डिस्टिल टू डिटेक्ट" (D2D) को प्रस्तुत करता है, जो एक नवीन विधि है जो वितरण संबंधी बदलावों (distributional shifts) को एक KV-कैश एडेप्टर में डिस्टिल करके बड़े भाषा मॉडलों (large language models) में छिपे हुए, गुप्त पूर्वाग्रहों को प्रवर्धित और प्रकट करती है, जिससे उस मौलिक पहचान विषमता (detection asymmetry) पर विजय प्राप्त होती है जहाँ अज्ञात पूर्वाग्रह विषय मानक निरीक्षण के लिए अदृश्य बने रहते हैं।

Shayan Talaei, Abhinav Chinta, Devvrit Khatri, Amin Karbasi, Azalia Mirhoseini, Amin Saberi2026-07-02
🤖 AI

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

यह शोध पत्र 'थियोरिया' (Theoria) का परिचय देता है, जो एक ऐसा सत्यापन आर्किटेक्चर है जो समाधानों को स्पष्ट औचित्यों के साथ ऑडिट योग्य, टाइप किए गए स्टेट ट्रांज़िशन (state transitions) में पुनर्गठित करके एआई उत्तरों की विश्वसनीयता को बढ़ाता है, जिससे यह छिपे हुए आधारों और काल्पनिक उद्धरणों का पता लगाने में समग्र एलएलएम (LLM) जजों से बेहतर प्रदर्शन करता है और विशेषज्ञ-स्तरीय समस्याओं पर उच्च सटीकता बनाए रखता है।

Ben Slivinski, Michael Saldivar2026-07-02
🤖 AI

Measuring the Gap Between Human and LLM Research Ideas

यह शोध पत्र एक बड़े पैमाने के मूल्यांकन ढांचे और एक द्वि-अक्षीय वर्गीकरण को प्रस्तुत करता है जो यह प्रदर्शित करता है कि हालांकि वर्तमान LLM तर्कसंगत अनुसंधान विचार उत्पन्न कर सकते हैं, लेकिन उनका आउटपुट वितरण मानव शोधकर्ताओं की व्यापक और अधिक विविध अनुसंधान रुचि की तुलना में व्यवस्थित रूप से संकीर्ण है और ब्रिज-जैसे अवसरों तथा संश्लेषण विधियों पर अधिक केंद्रित है।

Ziyu Chen, Yilun Zhao, Arman Cohan2026-07-02
💬 NLP

Learning by Surprise: Adaptive Mitigation of Model Collapse in Large Language Models

यह शोध पत्र एआई-जनित सामग्री पर प्रशिक्षण के कारण होने वाली मॉडल कोलैप्स (model collapse) की घटना की जांच करता है, परप्लेक्सिटी (perplexity) को क्षय के एक प्रमुख चालक के रूप में पहचानता है, और एक स्केलेबल, मॉडल-अंतर्निहित फ़िल्टरिंग रणनीति प्रस्तावित करता है जो मानव-लिखित डेटा तक पहुंच की आवश्यकता के बिना प्रभावी ढंग से कोलैप्स को कम करने के लिए उच्च-आश्चर्य (high-surprise) वाले दस्तावेज़ों को प्राथमिकता देता है।

Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo2026-07-01
💬 NLP

SubData: Bridging Heterogeneous Datasets to Enable Theory-Driven Evaluation of Political and Demographic Perspectives in LLMs

यह शोध पत्र SubData प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी और सिद्धांत-आधारित ढांचा है जिसे विषम डेटासेट को मानकीकृत करने के लिए डिज़ाइन किया गया है ताकि यह मूल्यांकन किया जा सके कि विभिन्न रूप से संरेखित लार्ज लैंग्वेज मॉडल्स विशिष्ट जनसांख्यिकी को लक्षित करने वाली सामग्री को कितनी भिन्नता से वर्गीकृत करते हैं, जिससे इस प्रकार विभिन्न अध्ययनों में परिप्रेक्ष्य संरेखण के आकलन में आने वाली विसंगतियों को दूर किया जा सके।

Pietro Bernardelle, Leon Fröhling, Stefano Civelli, Gianluca Demartini2026-07-01