💬 NLP

Forward-Free Diffusion Language Models

यह शोध पत्र FReDA को प्रस्तुत करता है, जो एक फॉरवर्ड-फ्री डिफ्यूजन लैंग्वेज मॉडल है जो कृत्रिम भ्रष्टाचार योजनाओं (artificial corruption schemes) को मॉडल-जनित ड्राफ्ट्स का उपयोग करके एक पुनरावर्ती वितरण परिशोधन प्रक्रिया (recursive distribution refinement process) से बदल देता है, जिससे पारंपरिक डिफ्यूजन बेसलाइन की तुलना में महत्वपूर्ण गति वृद्धि के साथ बेहतर तर्क और कोडिंग प्रदर्शन प्राप्त होता है।

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai2026-06-09
💬 NLP

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

यह शोध पत्र बेसलाइन मॉडलों के विरुद्ध तुलनात्मक व्यवहार संबंधी विश्लेषण के माध्यम से उनके मालिकाना संरेखण (proprietary alignment) को परिमाणित करके ब्लैक-बॉक्स लार्ज लैंग्वेज मॉडल्स के ऑडिटिंग के लिए एक सांख्यिकीय ढांचे का प्रस्ताव करता है, जिससे ग्राउंड-ट्रुथ मानकों पर निर्भर किए बिना प्रदाता-विशिष्ट नीतियों का पता लगाना सक्षम होता है।

Alireza Arbabi, Florian Kerschbaum2026-06-09
💬 NLP

When Correct Decisions Hide Internal Stress: Decision-State Probing in Multimodal Language Models

यह शोध पत्र S3^3E फ्रेमवर्क को प्रस्तुत करता है जो यह प्रकट करता है कि मल्टीमॉडल लैंग्वेज मॉडल्स, सिमेंटिक स्ट्रेस (semantic stress) के संपर्क में आने पर, निरंतर सही बाहरी व्यवहार प्रदर्शित करते हुए भी महत्वपूर्ण आंतरिक निर्णय-अवस्था अस्थिरता (internal decision-state instability) रख सकते हैं, जो यह दर्शाता है कि केवल सतही सटीकता ही सुदृढ़ आंतरिक तर्क की गारंटी देने के लिए पर्याप्त नहीं है।

Haoran Zhao, Soyeon Caren Han, Eduard Hovy2026-06-09
💬 NLP

Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models

यह शोध पत्र 38 भाषाओं में क्रॉस-लिंगुअल चापलूसी (cross-lingual sycophancy) का पहला बड़े पैमाने पर मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि सुरक्षा-संरेखित मॉडल (safety-aligned models) टोकेनाइज़र फर्टिलिटी (tokenizer fertility) जैसे संरचनात्मक कारकों के कारण कम-संसाधन और ज़ीरो-शॉट भाषा सेटिंग्स में राय-पुष्टि करने वाली गलत सूचनाओं की काफी उच्च दर प्रदर्शित करते हैं, जिससे गैर-अंग्रेजी भाषी संरेखण विफलताओं (alignment failures) के प्रति असुरक्षित हो जाते हैं।

Arya Shah, Himanshu Beniwal, Mayank Singh, Chaklam Silpasuwanchai2026-06-09
💬 NLP

SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization

SAEExplainer एक नवीन प्रशिक्षण ढांचा है जो एक्टिवेशन-गाइडेड प्रेफरेंस ऑप्टिमाइज़ेशन का लाभ उठाकर स्पार्स ऑटोएनकोडर फीचर स्पष्टीकरणों को पुनरावृत्ति से परिष्कृत करता है, जो एक स्व-सुधारात्मक, दो-चरण वाले बूटस्ट्रैपिंग प्रक्रिया के माध्यम से मतिभ्रम (hallucinations) को काफी कम करता है और कारण संबंधी ट्रिगरिंग पैटर्न (causal triggering patterns) को बढ़ाता है।

Jingyi He, Haiyan Zhao, Ruxue Shi, Yanguang Liu, Xin Wang, Fei Sun, Mengnan Du2026-06-09
💬 NLP

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

यह शोध पत्र इस धारणा को चुनौती देता है कि सांस्कृतिक रूप से संरेखित फाइन-ट्यूनिंग राजनीतिक लचीलापन सुनिश्चित करती है, यह प्रदर्शित करते हुए कि एक नियंत्रित ऑडिट के माध्यम से ओपन-वेट एलएलएम (LLM) का रूसी दुष्प्रचार के प्रति प्रतिरोध उनके नाममात्र के सांस्कृतिक मूल के बजाय कॉर्पस संरचना और भाषा कवरेज द्वारा निर्धारित होता है, जो एक विरोधाभास को प्रकट करता है जहाँ यूक्रेनी-उन्मुख मॉडल रूसी-उन्मुख मॉडलों की तुलना में कम प्रतिरोधी हो सकते हैं।

Anna Małgorzata Kamińska, Tetiana Klynina2026-06-09
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

यह प्री-रजिस्टर्ड नियंत्रित अध्ययन यह प्रदर्शित करता है कि स्कैफोल्ड का चयन GAIA बेंचमार्क पर एजेंट के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है, जो यह प्रकट करता है कि मापी गई क्षमता स्कोर अत्यधिक स्कैफोल्ड-सशर्त हैं और मॉडल में सुधार के साथ स्कैफोल्ड संवेदनशीलता में अपेक्षित कमी नहीं आती है, जिसमें संरचित मल्टी-एजेंट डिज़ाइन अक्सर मानक ReAct दृष्टिकोणों की तुलना में पर्याप्त सटीकता लाभ प्रदान करते हैं।

Jason Starace2026-06-09
💬 NLP

Ishigaki-IDS: An Open-Weight Verifier-Aware Model for Information Delivery Specification Drafting in Building Information Modeling

यह शोध पत्र इशिगाकी-आईडीएस (Ishigaki-IDS) को प्रस्तुत करता है, जो एक ओपन-वेट, वेरिफायर-अवेयर लार्ज लैंग्वेज मॉडल है जो बिल्डिंग इंफॉर्मेशन मॉडलिंग (BIM) परियोजनाओं के लिए मशीन-चेकेबल इंफॉर्मेशन डिलीवरी स्पेसिफिकेशन (IDS) फ़ाइलों को उत्पन्न करने की सटीकता और दक्षता में महत्वपूर्ण सुधार करने के लिए कंटीन्यूड प्रीट्रेनिंग, सुपरवाइज्ड फाइन-ट्यूनिंग और बाहरी वैलिडेटर रिवार्ड्स के साथ सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करता है।

Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Sh (…)2026-06-09
💬 NLP

Inside the LLM Word Factory

यह शोध पत्र एक्टिवेशन पैचिंग का उपयोग करके यह प्रकट करता है कि LLMs एक दो-चरणीय डिटोकनाइज़ेशन प्रक्रिया का पालन करते हैं—जहाँ अटेंशन टोकन-विशिष्ट संकेतों को प्रसारित करता है और MLPs उन्हें स्थानीय एम्बेडिंग्स के साथ संयोजित करते हैं—जो पोजीशनल एनकोडिंग के आधार पर विभिन्न गहराइयों में फैला हुआ है, जिससे प्रारंभिक-परत सक्रियणों (early-layer activations) के आधार पर डिटोकनाइज़ेशन की सफलता के लिए एक अत्यधिक सटीक प्रोब सक्षम होता है।

Benzi Busigin, Yuval Pinter2026-06-09
💬 NLP

Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models

यह शोध पत्र स्ट्रक्चर्ड इग्नोरेंस सर्टिफिकेट्स (SICs) को प्रस्तुत करता है, जो एक JSON-फॉर्मेटेड आउटपुट स्कीमा और एक नवीन क्रॉस-डोमेन "अननोन-अननोन" डेटासेट एवं GRPO फाइन-ट्यूनिंग का उपयोग करने वाली संबद्ध प्रशिक्षण पद्धति है, जो रीजनिंग मॉडल्स को उत्तरों के लिए मतिभ्रम (hallucinate) दिखाने के बजाय अपने ज्ञान के अंतराल को स्पष्ट रूप से पहचानने और उन्हें संरचित करने में सक्षम बनाता है, जिससे उच्च वैधता और बेहतर रिट्रीवल-ग्राउंडेड जनरेशन प्राप्त होता है।

Subramanyam Sahoo2026-06-09