💬 NLP

Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention

यह शोध पत्र FLAS को प्रस्तुत करता है, जो एक फ्लो-आधारित एक्टिवेशन स्टीयरिंग विधि है जो मॉडल एक्टिवेशन को ट्रांसपोर्ट करने के लिए एक सामान्य, कॉन्सेप्ट-कंडीशन्ड वेलोसिटी फील्ड को सीखता है, जिससे यह पूर्ववर्ती दृष्टिकोणों की प्रतिबंधात्मक धारणाओं को दूर करते हुए AxBench पर मौजूदा स्टीयरिंग तकनीकों और इन-कॉन्टेक्स्ट प्रॉम्प्टिंग दोनों से बेहतर प्रदर्शन करता है।

Zehao Jin, Ruixuan Deng, Junran Wang, Xinjie Shen, Chao Zhang2026-05-08
💬 NLP

Logic-Regularized Verifier Elicits Reasoning from LLMs

यह शोध पत्र LOVER को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised) वेरीफायर है जो बिना किसी महंगी सुपरवाइज्ड डेटा के, ऑफ-द-शेल्फ (off-the-shelf) LLMs से मजबूत तर्क प्राप्त करने के लिए रीजनिंग पाथ्स पर तार्किक बाधाओं का लाभ उठाता है, और सुपरवाइज्ड बेसलाइन्स के समान प्रदर्शन प्राप्त करता है।

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li2026-05-08
💬 NLP

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

यह शोध पत्र TextPro-SLM का प्रस्ताव करता है, जो एक स्पीच लार्ज लैंग्वेज मॉडल है जो एक एकीकृत एनकोडर के माध्यम से बोले गए इनपुट को प्रोसेस करके मोडैलिटी गैप को कम करता है जो टेक्स्ट टोकन को प्रोसोडी एम्बेडिंग्स के साथ संरेखित करता है, जिससे यह मॉडल केवल 1,000 घंटों के प्रशिक्षण डेटा का उपयोग करके मजबूत पैरालिंग्विस्टिक समझ के साथ एक प्रोसोडी-अवेयर टेक्स्ट LLM के रूप में कार्य करने में सक्षम होता है।

Wenqian Cui, Xiao-Hui Li, Daxin Tan, Qiyong Zheng, Irwin King2026-05-08
🤖 machine learning

Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing

यह शोध पत्र नियर-पॉलिसी डिस्टिलेशन (NPD) का प्रस्ताव करता है, जो एक एसिंक्रोनस फ्रेमवर्क है जो जनरेशन को ट्रेनिंग से अलग करके और पॉलिसी विलंब (policy delay) को कम करने के लिए Δ\Delta-IFD फ़िल्टरिंग का उपयोग करके ऑन-पॉलिसी नॉलेज डिस्टिलेशन को तेज़ करता है, जिससे मानक SFT और बड़े मॉडलों की तुलना में 8.1 गुना गति और बेहतर प्रदर्शन प्राप्त होता है।

Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen2026-05-08
💬 NLP

MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

यह शोधपत्र MobileEgo Anywhere को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो निरंतर अवस्था ट्रैकिंग (persistent state tracking) के साथ बड़े पैमाने पर, एक घंटे लंबे ईगोसेंट्रिक डेटासेट के संग्रह को लोकतांत्रिक बनाने के लिए सामान्य स्मार्टफोन का लाभ उठाता है, जिससे विजन लैंग्वेज एक्शन मॉडल्स को आगे बढ़ाने के लिए आवश्यक दीर्घ-क्षितिज (long-horizon) डेटा की कमी को दूर किया जा सके।

Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathor, Pratyush Patnaik, Shubhanshu Khatana2026-05-08
💬 NLP

Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits

यह शोध पत्र PCNET को प्रस्तुत करता है, जो एक संभाव्य सर्किट-आधारित विधि है जो LLM के रेसिडुअल स्ट्रीम (residual stream) में ज्यामितीय विसंगतियों (geometric anomalies) के रूप में मतिभ्रम (hallucinations) का पता लगाती है ताकि PC-LDCD के माध्यम से गतिशील, लक्षित हस्तक्षेप को सक्षम किया जा सके, जिससे मॉडल वेट संशोधनों या बाहरी सत्यापनकर्ताओं की आवश्यकता के बिना, सही जनरेशन की अखंडता को बनाए रखते हुए मतिभ्रम को काफी हद तक कम किया जा सके।

Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca2026-05-08
💬 NLP

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent एक स्व-सुधारित एजेंटिक फ्रेमवर्क है जो उपचार योजना को बेहतर बनाने के लिए वन-शॉट (one-shot) LLM जनरेशन को एक पुनरावृत्त जनरेट-जज-रिफाइन (generate-judge-refine) पाइपलाइन से बदल देता है, जिसमें एक विशेषीकृत TheraJudge मॉड्यूल का उपयोग किया जाता है ताकि विशेषज्ञ मूल्यांकन में मानव चिकित्सकों से भी बेहतर सटीकता, पूर्णता और सुरक्षा प्राप्त की जा सके।

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu2026-05-08
💬 NLP

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

यह शोध पत्र सेफ्टी बॉटलनेक रेगुलराइजेशन (SBR) का प्रस्ताव करता है, जो एक नवीन रक्षा तंत्र है जो अनएम्बेडिंग लेयर को सुरक्षा-संरेखित मॉडलों के साथ स्थिर करता है, जिससे ज्यामितीय बॉटलनेक्स का लाभ उठाकर हानिकारक फाइन-ट्यूनिंग हमलों को प्रभावी रूप से निष्प्रभावी किया जाता है और बेंइन टास्क प्रदर्शन से समझौता किए बिना सुरक्षा बनाए रखी जाती है।

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao2026-05-08
💬 NLP

PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue

PersonaKit एक ओपन-सोर्स, लो-लेटेंसी वेब प्लेटफॉर्म है जो शोधकर्ताओं को सहज JSON कॉन्फ़िगरेशन और स्वचालित A/B टेस्टिंग के माध्यम से फुल-डुप्लेक्स स्पोकन डायलॉग सिस्टम्स में विविध, पर्सोना-विशिष्ट टर्न-टेकिंग रणनीतियों को तेजी से प्रोटोटाइप करने और मूल्यांकन करने में सक्षम बनाता है।

Hyunbae Jeon, Jinho D. Choi2026-05-08
💬 NLP

More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs

यह अध्ययन HPSG औपचारिकता और विविधता मेट्रिक्स का उपयोग करते हुए मानव-लिखित समाचार पाठ के विरुद्ध LLMs की दो पीढ़ियों की तुलना करता है, जिससे यह पता चलता है कि जहाँ मानव लेखन स्थिर बना हुआ है, वहीं नए निर्देश-ट्यून किए गए मॉडल महत्वपूर्ण रूप से कम वाक्यात्मक और शाब्दिक विविधता प्रदर्शित करते हैं, जो बेहतर सुसंगतता के बावजूद अभिव्यक्ति की संभावित संकुचित सीमा का सुझाव देता है।

Adrián Gude, Roi Santos-Ríos, Francis Bond, Dan Flickinger, Carlos Gómez-Rodríguez, Olga Zamaraeva2026-05-08