💬 NLP

Post-training makes large language models less human-like

यह शोध पत्र Psych-201 डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि पोस्ट-ट्रेनिंग प्रक्रियाएं, जो बड़े भाषा मॉडलों को उपयोगिता के लिए अनुकूलित करती हैं, निरंतर मानव व्यवहार का सटीक रूप से अनुकरण करने की उनकी क्षमता को कम करती हैं, एक ऐसी समस्या जो नई मॉडल पीढ़ियों में बनी रहती है और बदतर होती जाती है और जिसे पर्सोना-इंडक्शन तकनीकों द्वारा हल नहीं किया जा सकता है।

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W (…)2026-05-11
🤖 AI

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

यह शोध पत्र LC-MAPF प्रस्तुत करता है, जो एक सामान्यीकरण योग्य प्री-ट्रेंड मॉडल है जो कुशल फीचर शेयरिंग के लिए एक स्केलेबल, सीखने योग्य मल्टी-राउंड कम्युनिकेशन मॉड्यूल को शामिल करके विकेंद्रीकृत मल्टी-एजेंट पाथफाइंडिंग को बढ़ाता है, जो स्केलेबिलिटी से समझौता किए बिना विविध परिदृश्यों में मौजूदा लर्निंग-आधारित सॉल्वर्स से बेहतर प्रदर्शन करता है।

Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik2026-05-11
💬 NLP

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN एक ब्लैकबोर्ड-प्रेरित, मल्टी-एजेंट फ्रेमवर्क है जो इन-स्टेप ऑडिटिंग के साथ एक एडवर्सरियल स्केप्टिक-रिसर्चर-जज लूप में भूमिकाओं को अलग करके LLM रीजनिंग की गुणवत्ता और एपिस्टेमिक ट्रस्ट को बढ़ाता है, जो विविध बेंचमार्क और बैकबोन मॉडल्स पर मोनोलिथिक और कंसेंसस-आधारित बेसलाइन्स से बेहतर प्रदर्शन करता है।

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng2026-05-11
📊 statistics

Reliable Chain-of-Thought via Prefix Consistency

यह शोध पत्र "प्रिफिक्स कंसिस्टेंसी" (prefix consistency) को प्रस्तुत करता है, जो एक टेस्ट-टाइम विश्वसनीयता सिग्नल है जो ट्रंकेशन (truncation) और पुनरुत्पादन (regeneration) के बाद उम्मीदवारों के उत्तरों की पुनरुत्पादकता के आधार पर उन्हें भारित करके चेन-ऑफ-थॉट (Chain-of-Thought) तर्किंग की दक्षता में सुधार करता है, जिससे लॉग-प्रोबेबिलिटीज़ (log-probabilities) या सेल्फ-रेटिंग प्रॉम्प्ट्स की आवश्यकता के बिना काफी कम जनरेट किए गए टोकन के साथ मानक मेजॉरिटी वोटिंग सटीकता प्राप्त की जा सकती है।

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama2026-05-11
🤖 machine learning

Stochastic Transition-Map Distillation for Fast Probabilistic Inference

यह शोध पत्र स्टोकेस्टिक ट्रांज़िशन-मैप डिस्टिलेशन (STMD) को प्रस्तुत करता है, जो एक टीचर-मुक्त ढांचा है जो सैंपलिंग SDE के पूर्ण ट्रांज़िशन मैप को एक कंडीशनल मीन फ्लो मॉडल में डिस्टिल करके डिफ्यूजन मॉडल इन्फरेंस को त्वरित करता है, जिससे बिना किसी प्री-ट्रेन्ड टीचर या जटिल अनुकूलन की आवश्यकता के कुशल एक- या कुछ-चरणों वाले स्टोकेस्टिक सैंपलिंग को सक्षम बनाया जा सके।

George Rapakoulias, Peter Garud, Lingjiong Zhu, Panagiotis Tsiotras2026-05-11
🔢 mathematics

Direction-Preserving Number Representations

यह शोध पत्र वेक्टर दिशा प्रतिनिधित्व के लिए निम्न-परिशुद्धता वाले स्केलर वर्णमाला (scalar alphabets) का विश्लेषण और अनुकूलन करने हेतु एक ज्यामितीय ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि टूज़ कॉम्प्लीमेंट (two's complement) और फ्लोटिंग-पॉइंट जैसे मानक प्रारूप उप-इष्टतम हैं, जबकि यह भी प्रमाणित करता है कि NVIDIA का NVFP4 E2M1 प्रारूप चार-बिट परिशुद्धता के लिए सैद्धांतिक रूप से इष्टतम विन्यास के निकटतम है।

Bardia Zadeh, George A. Constantinides2026-05-11
🤖 machine learning

Quotient Semivalues for False-Name-Resistant Data Attribution

यह शोधपत्र कोटिएंट सेमीवैल्यूज़ (quotient semivalues) तंत्र प्रस्तुत करता है, जो मशीन लर्निंग डेटा एट्रिब्यूशन में साक्ष्य-आधारित क्लस्टरों में डेटा योगदान को एकत्रित करता है ताकि फॉल्स-नेम-प्रूफनेस (false-name-proofness) प्राप्त की जा सके, जिससे योगदानकर्ताओं को पहचान विभाजन या दोहराव के माध्यम से अपने पुरस्कारों को कृत्रिम रूप से बढ़ाने से रोका जा सके और साथ ही अपूर्ण प्रोवेनेंस (imperfect provenance) के तहत हेरफेर लाभ और निष्पक्षता हानि पर सैद्धांतिक सीमाएँ प्रदान की जा सकें।

Florian A. D. Burnat, Brittany I. Davidson2026-05-11
📊 statistics

Debiased Counterfactual Generation via Flow Matching from Observations

यह शोधपत्र ऑब्जर्वेशनल (observational) और काउंटरफैक्चुअल (counterfactual) डेटा के बीच सांख्यिकीय संबंध का लाभ उठाकर फ्लो मैचिंग (flow matching) के माध्यम से एक डीकॉन्फाउंडिंग फ्लो (deconfounding flow) सीखने हेतु काउंटरफैक्चुअल वितरणों का अनुमान लगाने के लिए एक नवीन विधि प्रस्तावित करता है, जिसके परिणामस्वरूप एक सेमीपैरामेट्रिक रूप से कुशल एस्टिमेटर (semiparametrically efficient estimator) प्राप्त होता है जो उच्च-आयामी सेटिंग्स में मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Hugh Dance, Johnny Xi, Peter Orbanz, Benjamin Bloem-Reddy2026-05-11
🤖 machine learning

Differentially Private Auditing Under Strategic Response

यह शोध पत्र विभेदक रूप से निजी (डिफरेंशियल प्राइवेट) एआई ऑडिटिंग के लिए एक रणनीतिक ढांचे का प्रस्ताव करता है जो एक ऑडिटर और एक प्रतिक्रियाशील डेवलपर के बीच की अंतःक्रिया को स्टैकेलबर्ग गेम (स्टैकेलबर्ग गेम) के रूप में मॉडल करता है, जिससे एक इष्टतम आवंटन नीति प्राप्त होती है जो डेवलपर के रणनीतिक शमन प्रयासों को ध्यान में रखते हुए कल्याण-भारित अल्प-पता लगाने (अंडर-डिटेक्शन) को कम करती है।

Florian A. D. Burnat2026-05-11
🤖 machine learning

Structured Coupling for Flow Matching

यह शोध पत्र स्ट्रक्चर्ड कपलिंग फॉर फ्लो मैचिंग (SCFM) का प्रस्ताव करता है, जो एक सहकारी ढांचा है जो क्लस्टरिंग और डिसेंटैंगलमेंट जैसे कार्यों के लिए व्याख्या योग्य लेटेंट संरचनाओं के अनसुपरवाइज्ड लर्निंग को सक्षम करने हेतु स्ट्रक्चर्ड लेटेंट वेरिएबल मॉडलिंग को फ्लो मैचिंग के साथ एकीकृत करता है, बिना जनरेटिव सैंपल की गुणवत्ता से समझौता किए।

Xavier Sumba, Carles Balsells-Rodas, Yingzhen Li2026-05-11