💬 NLP

SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation

यह शोध पत्र SHIFT प्रस्तुत करता है, जो एक हल्का ढांचा (lightweight framework) है जो एक सीखने योग्य गेट मॉड्यूल (learnable gate module) का उपयोग करके आंतरिक सक्रियणों (internal activations) को अनुकूल रूप से नियंत्रित करता है, जिससे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) में ज्ञान के संघर्षों को कम किया जा सके और मॉडल की सामान्य क्षमताओं से समझौता किए बिना रिट्रीव किए गए संदर्भ और पैरामीट्रिक ज्ञान के बीच के संघर्षों को हल किया जा सके।

Ruochang Li, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun2026-06-29
💬 NLP

A Study of Temporal Fusion Strategies for Named Entity Recognition in Historical Texts

यह शोध पत्र इस बात की जांच करता है कि ऐतिहासिक ग्रंथों के लिए ट्रांसफॉर्मर-आधारित नाम वाली इकाई पहचान (Named Entity Recognition) मॉडलों में टेम्पोरल मेटाडेटा को प्रभावी ढंग से कैसे एकीकृत किया जाए, जिसमें यह पाया गया कि अर्ली फ्यूजन या अन्य हल्के तंत्रों की तुलना में लेट फ्यूजन रणनीतियां फ्रांसीसी और जर्मन डेटासेट में अधिक मजबूत और टेम्पोरल रूप से सामान्यीकरण योग्य प्रदर्शन प्रदान करती हैं।

Emanuela Boros2026-06-29
💬 NLP

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

यह शोध पत्र "ट्रायैडिक वेयरवोल्फ" (Triadic Werewolf) गेम का परिचय देता है, जो एक मल्टी-हॉप थ्योरी-ऑफ-माइंड बेंचमार्क है जिसमें उलटे प्रोत्साहन वाला एक 'जेस्टर' (Jester) गुट शामिल है जो यह प्रकट करता है कि कैसे वर्तमान लार्ज लैंग्वेज मॉडल्स जटिल तीन-तरफा रणनीतिक तर्क करने में संघर्ष करते हैं, और अक्सर स्व-शिक्षण तंत्रों के बावजूद वास्तविक संदेह और इरादतन धोखे के बीच अंतर करने में विफल रहते हैं।

Avni Mittal2026-06-29
💬 NLP

VASAE: Naming SAE Dictionary Directions with Vocabulary-Aligned Anchoring

यह शोध पत्र VASAE प्रस्तुत करता है, जो एक ऐसी विधि है जो वोकैबुलरी-अलाइन्ड एंकरिंग (vocabulary-aligned anchoring) के साथ स्पार्स ऑटोएनकोडर्स को प्रशिक्षित करती है ताकि प्रशिक्षण के दौरान फीचर्स को उनके अंतर्निहित टोकन नाम दिए जा सकें, जिससे ट्रांसफॉर्मर मॉडल्स के शैलो (shallow) और मिडिल लेयर्स में पुनर्निर्माण की गुणवत्ता से समझौता किए बिना उच्च संरेखण दर प्राप्त होती है।

Kairui Zhang, Ziwen Yu, Zahraa S. Abdallah, Martha Lewis2026-06-29
⚡ electrical engineering

DG^VoiC: Speaker Clustering for Fraud Investigation under Real Call-Centre Conditions

यह शोध पत्र DG^VoiC को प्रस्तुत करता है, जो एक वॉइस क्लस्टरिंग फ्रेमवर्क है जो ग्राहक इंटरैक्शन के दौरान दोहराए जाने वाले वक्ताओं की पहचान करने के लिए गुमनाम रियल कॉल-सेंटर ऑडियो का लाभ उठाता है, जिससे वक्ता की निरंतरता को सत्यापित करके बीमा धोखाधड़ी की जांच को बढ़ाने के लिए उच्च क्लस्टरिंग सटीकता (100% होमोजेनिटी तक) प्राप्त होती है।

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly2026-06-29
💬 NLP

MultiHashFormer: Hash-based Generative Language Models

मल्टीहैशफॉर्मर (MultiHashFormer) एक नवीन हैश-आधारित ऑटोरेग्रेसिव फ्रेमवर्क पेश करता है जो टोकन को हैश आईडी के अद्वितीय अनुक्रमों के रूप में निरूपित करता है ताकि स्थिर शब्दावली फुटप्रिंट के साथ पैरामीटर-कुशल भाषा मॉडलिंग सक्षम हो सके, जो कई पैमानों और बहुभाषी परिदृश्यों में मानक ट्रांसफॉर्मर्स की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras2026-06-29
💬 NLP

Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability

यह शोध पत्र लो-प्रिसिजन फ्लैश अटेंशन और MoE राउटर जैसे महत्वपूर्ण मॉड्यूल की कार्यात्मक भूमिकाओं से व्युत्पन्न तंत्र-संचालित मॉनिटर्स (mechanism-driven monitors) का प्रस्ताव करता है, ताकि लॉस डाइवर्जेंस (loss divergence) होने से हजारों स्टेप्स पहले प्रशिक्षण अस्थिरता का पता लगाया जा सके, जिससे लार्ज लैंग्वेज मॉडल प्रशिक्षण में होने वाली महंगी विफलताओं को रोका जा सके।

Ruixuan Huang, Yipei Wang, Wenyi Fang, Hantao Huang, Yifan Huang, Ansheng You, Zhenxing Zhang, Shuai Wang, Fan Wu, Yang (…)2026-06-29
💬 NLP

From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) और वर्ल्ड मॉडल्स के बीच के द्विआधारी अंतर को चुनौती देता है, यह तर्क देते हुए कि LLMs, वर्ल्ड मॉडल्स का एक डिजेनरेट विशेष मामला (degenerate special case) हैं, और टोकन प्रेडिक्शन से लेकर लेटेंट-स्पेस सिमुलेशन तक की आर्किटेक्चर की एक निरंतर स्पेक्ट्रम का प्रस्ताव देते हुए, एक्शन-लेबल वाले वातावरणों में स्केल करने और निरंतर-स्टेट प्रेडिक्शन के लिए ट्रांसफॉर्मर आर्किटेक्चर को अनुकूलित करने में महत्वपूर्ण अनुसंधान चुनौतियों पर प्रकाश डालते हैं।

Paul Dubois2026-06-29
💬 NLP

Techniques for supercharging academic writing with generative AI

यह शोध पत्र एक मानव-एआई सहयोगात्मक ढांचे और व्यावहारिक रणनीतियों को प्रस्तुत करता है जो विद्वत्तापूर्ण कठोरता बनाए रखते हुए शैक्षणिक लेखन की गुणवत्ता, दक्षता और समावेशिता को बढ़ाने के लिए जनरेटिव एआई (generative AI) का लाभ उठाने पर केंद्रित है।

Zhicheng Lin2026-06-26