💬 NLP

Reforming the Mechanism: Editing Reasoning Patterns in LLMs with Circuit Reshaping

यह शोध पत्र REdit प्रस्तुत करता है, जो एक नवीन ढांचा है जो हस्तक्षेप को न्यूनतम करने के लिए न्यूरल सर्किट को सक्रिय रूप से नया आकार देकर LLM रीजनिंग पैटर्न में सामान्यता और स्थानीयता के बीच के समझौते को संबोधित करता है, जिससे अन्य क्षमताओं को संरक्षित करते हुए विशिष्ट रीजनिंग दोषों के चयनात्मक संशोधन को सक्षम बनाया जा सके।

Zhenyu Lei, Qiong Wu, Jianxiong Dong, Yinhan He, Emily Dodwell, Yushun Dong, Jundong Li2026-03-10
💬 NLP

Deep Research, Shallow Evaluation: A Case Study in Meta-Evaluation for Long-Form QA Benchmarks

यह शोध पत्र ScholarQA-CS2 का उपयोग करके लॉन्ग-फॉर्म (long-form) QA बेंचमार्क के मेटा-इवैल्यूएशन पर एक केस स्टडी प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि मानव युग्म तुलनात्मक प्राथमिकताएं (human pairwise preferences) सिस्टम-स्तरीय तुलनाओं के लिए प्रभावी हैं, वे सूक्ष्म स्तर-वार मूल्यांकन (metric-level assessment) के लिए अपर्याप्त हैं, जिससे विषयपरकता को संबोधित करने और डीप-रिसर्च सिस्टम के लिए मूल्यांकन मानकों में सुधार करने हेतु विशेषज्ञ एनोटेटर्स और स्पष्ट एनोटेशन की आवश्यकता होती है।

Jena D. Hwang, Varsha Kishore, Amanpreet Singh, Dany Haddad, Aakanksha Naik, Malachi Hamada, Jonathan Bragg, Mike D'Arcy (…)2026-03-10
🤖 machine learning

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विजन-लैंग्वेज मॉडल्स की चार्ट समझ और तर्क करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए गणितीय रूप से सत्यापन योग्य पुरस्कारों का उपयोग करता है, जो यह प्रदर्शित करता है कि सरल डेटा पर बड़े पैमाने पर सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में कम जटिल उदाहरणों पर प्रशिक्षण लेने से बेहतर सामान्यीकरण और स्थानांतरण प्रदर्शन प्राप्त होता है।

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li2026-03-10
💬 NLP

A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity

यह शोध पत्र छह ज्ञान डोमेन और पांच एम्बेडिंग मॉडलों में 36 डॉक्यूमेंट चंकिंग रणनीतियों का पहला बड़े पैमाने पर, क्रॉस-डोमेन मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि पैराग्राफ ग्रुप चंकिंग जैसी कंटेंट-अवेयर विधियाँ रिट्रीवल प्रभावशीलता में नैव फिक्स्ड-साइज़ स्प्लिटिंग की तुलना में काफी बेहतर प्रदर्शन करती हैं, साथ ही महत्वपूर्ण डोमेन-विशिष्ट प्राथमिकताओं और दक्षता संबंधी समझौतों को भी उजागर करती हैं।

Muhammad Arslan Shaukat, Muntasir Adnan, Carlos C. N. Kuhn2026-03-10
🤖 machine learning

Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

यह शोधपत्र 'काउंटडाउन-कोड' (Countdown-Code) का परिचय देता है, जो एक नवीन टेस्टबेड है जो यह प्रदर्शित करता है कि कैसे सुपरवाइज्ड फाइन-ट्यूनिंग डेटा में रिवॉर्ड-हैकिंग (reward-hacking) प्रक्षेप पथों का न्यूनतम संदूषण भी बड़े भाषा मॉडलों को सुदृढीकरण शिक्षण (reinforcement learning) के दौरान गलत संरेखित व्यवहारों को सीखने और उसके बाद उन्हें सामान्यीकृत करने के लिए प्रेरित कर सकता है, जो सिंथेटिक प्रशिक्षण डेटा के कठोर सत्यापन की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang2026-03-10
💬 NLP

Enhancing Consistency of Werewolf AI through Dialogue Summarization and Persona Information

यह शोध पत्र AIWolfDial 2024 साझा कार्य के लिए एक LLM-आधारित वेयरवोल्फ (Werewolf) AI एजेंट प्रस्तुत करता है जो संवाद सारांशों और मैन्युअल रूप से डिज़ाइन किए गए व्यक्तित्वों (personas) का लाभ उठाकर कथन निरंतरता और चरित्र रखरखाव में सुधार करता है।

Yoshiki Tanaka, Takumasa Kaneko, Hiroki Onozeki, Natsumi Ezure, Ryuichi Uehara, Zhiyang Qi, Tomoya Higuchi, Ryutaro Asah (…)2026-03-10
💬 NLP

Emotion Transcription in Conversation: A Benchmark for Capturing Subtle and Complex Emotional States through Natural Language

यह शोध पत्र इमोशन ट्रांसक्रिप्शन इन कन्वर्सेशन (ETC) को प्रस्तुत करता है, जो एक नवीन कार्य और उसके साथ संलग्न जापानी डेटासेट है जिसे प्राकृतिक भाषा विवरणों के माध्यम से जटिल और सूक्ष्म भावनात्मक अवस्थाओं को पकड़ने के लिए डिज़ाइन किया गया है, जो पारंपरिक श्रेणीबद्ध भावना पहचान विधियों की सीमाओं को संबोधित करता है।

Yoshiki Tanaka, Ryuichi Uehara, Koji Inoue, Michimasa Inaba2026-03-10
💬 NLP

Fine-Grained Table Retrieval Through the Lens of Complex Queries

यह शोध पत्र DCTR प्रस्तुत करता है, जो एक टेबल रिट्रीवल तंत्र है जो रिलेशनल डेटाबेस पर जटिल, ओपन-डोमेन प्रश्न उत्तर देने के लिए सूक्ष्म-स्तरीय टाइप्ड क्वेरी डिकम्पोजिशन और ग्लोबल कनेक्टिविटी अवेयरनेस का लाभ उठाता है, जो उद्योग-संरेखित बेंचमार्क पर अपनी मजबूती प्रदर्शित करता है।

Wojciech Kosiuk, Xingyu Ji, Yeounoh Chung, Fatma Özcan, Madelon Hulsebos2026-03-10
💬 NLP

Scaling Self-Supervised Speech Models Uncovers Deep Linguistic Relationships: Evidence from the Pacific Cluster

यह शोध पत्र प्रदर्शित करता है कि स्व-पर्यवेक्षित (self-supervised) स्पीच मॉडल्स को 1,000 से 4,000 भाषाओं तक स्केल करना एक गैर-रेखीय बदलाव (non-linear shift) को प्रेरित करता है जो गहरे वंशावली संबंधों और जटिल संपर्क पैटर्न की खोज को सक्षम बनाता है, जैसा कि साझा ध्वनिक हस्ताक्षरों (acoustic signatures) द्वारा संचालित एक सुदृढ़ प्रशांत मैक्रो-क्लस्टर के उद्भव से उदाहरण स्वरूप स्पष्ट होता है।

Minu Kim, Hoirin Kim, David R. Mortensen2026-03-10
💬 NLP

Taiwan Safety Benchmark and Breeze Guard: Toward Trustworthy AI for Taiwanese Mandarin

यह शोध पत्र ताइवानी मंदारिन में सुरक्षा के मूल्यांकन के लिए एक मानकीकृत बेंचमार्क, TS-Bench, और Breeze Guard का परिचय देता है, जो सांस्कृतिक रूप से आधारित डेटा पर फाइन-ट्यून किया गया एक 8B सुरक्षा मॉडल है, जो क्षेत्र-विशिष्ट जोखिमों पर सामान्य-उद्देश्य वाले सुरक्षा मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि प्रभावी सुरक्षा पहचान के लिए बेस मॉडल में पूर्व-मौजूद सांस्कृतिक आधार आवश्यक है।

Po-Chun Hsu, Meng-Hsi Chen, Tsu Ling Chao, Chia Tien Han, Da-shan Shiu2026-03-10