💬 NLP

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

यह शोध पत्र MedVAL को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित डिस्टिलेशन (self-supervised distillation) विधि और बेंचमार्क है जो भाषा मॉडलों को चिकित्सक-लेबल वाले डेटा या संदर्भ आउटपुट की आवश्यकता के बिना, विशेषज्ञ-स्तर के प्रदर्शन के साथ चिकित्सा पाठ की तथ्यात्मक सटीकता को सत्यापित करने में सक्षम बनाता है।

Asad Aali, Vasiliki Bikia, Maya Varma, Nicole Chiou, Sophie Ostmeier, Arnav Singhvi, Magdalini Paschali, Ashwin Kumar, A (…)2026-02-10
💬 NLP

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

STITCH स्पोकन लैंग्वेज मॉडल्स के लिए एक नवीन जनरेशन विधि है जो अनस्पोकन रीजनिंग चंक्स (unspoken reasoning chunks) को स्पोकन रिस्पांस चंक्स (spoken response chunks) के साथ इंटरलीव करके लेटेंसी को कम करती है, जिससे मॉडल उपयोगकर्ता को ऑडियो प्ले करते समय ही साथ-साथ "सोच" सकता है।

Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-y (…)2026-02-10
💬 NLP

R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning

R-Stitch एक प्रशिक्षण-मुक्त हाइब्रिड डिकोडिंग फ्रेमवर्क है जो टोकन-स्तरीय एंट्रॉपी का उपयोग करके चेन-ऑफ-थॉट रीजनिंग को त्वरित करता है, जिससे कम अनिश्चितता वाले टोकन को एक छोटे लैंग्वेज मॉडल को गतिशील रूप से सौंप दिया जाता है और जटिल, उच्च-एंट्रॉपी वाले टोकन के लिए बड़े लैंग्वेज मॉडल को सुरक्षित रखा जाता है, जिससे न्यूनतम सटीकता हानि के साथ प्रति-टोकन जटिलता और कुल प्रक्षेपवक्र लंबाई दोनों को कम किया जाता है।

Zhuokun Chen, Zeren Chen, Jiahao He, Lu Sheng, Mingkui Tan, Jianfei Cai, Bohan Zhuang2026-02-10
💬 NLP

LegalΔΔ: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain

LegalΔ\Delta एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो DeepSeek-R1 से ज्ञान आसवन (knowledge distillation) और एक बहुआयामी पुरस्कार तंत्र का उपयोग करके, प्रत्यक्ष उत्तरों और चेन-ऑफ-थॉट तर्क के बीच सूचना लाभ को अधिकतम करके, LLMs में कानूनी तर्क की सटीकता और व्याख्यात्मकता को बढ़ाता है।

Xin Dai, Buqiang Xu, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Xiaoyuan Yi, Shuo Wang, Ge Yu2026-02-10
💬 NLP

DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis

यह शोध पत्र DeepScholar-bench को प्रस्तुत करता है, जो एक लाइव बेंचमार्क और स्वचालित मूल्यांकन ढांचा है जिसे हाल के ArXiv शोध पत्रों से जानकारी प्राप्त करने और उन्हें संश्लेषित करके उद्धृत, दीर्घ-रूप रिपोर्ट तैयार करने के माध्यम से जनरेटिव रिसर्च सिंथेसिस करने की एआई प्रणालियों की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है।

Liana Patel, Negar Arabzadeh, Harshit Gupta, Ankita Sundar, Ion Stoica, Matei Zaharia, Carlos Guestrin2026-02-10
💬 NLP

Cognitive Linguistic Identity Fusion Score (CLIFS): A Scalable Cognition-Informed Approach to Quantifying Identity Fusion from Text

यह शोध पत्र कॉग्निटिव लिंग्विस्टिक आइडेंटिटी फ्यूजन स्कोर (CLIFS) को प्रस्तुत करता है, जो एक नवीन, स्वचालित मीट्रिक है जो पाठ विश्लेषण के माध्यम से बाहरी संस्थाओं के साथ स्वयं के मनोवैज्ञानिक विलय को मापने के लिए संज्ञानात्मक भाषाविज्ञान और लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, तथा पारंपरिक विधियों और मौजूदा स्वचालित दृष्टिकोणों की तुलना में बेहतर सटीकता और स्केलेबिलिटी प्रदर्शित करता है।

Devin R. Wright, Jisun An, Yong-Yeol Ahn2026-02-10
💬 NLP

OpenGVL -- Benchmarking Visual Temporal Progress for Data Curation

OpenGVL एक नया बेंचमार्क है जिसे टेम्पोरल टास्क प्रोग्रेस (temporal task progress) की भविष्यवाणी करने के लिए विजन-लैंग्वेज मॉडल्स का मूल्यांकन और उपयोग करने के लिए डिज़ाइन किया गया है, जो रोबोटिक्स में ऑटोमेटेड डेटा क्यूरेशन के लिए एक टूल प्रदान करता है और ओपन-सोर्स और क्लोज्ड-सोर्स मॉडल्स के बीच एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Paweł Budzianowski, Emilia Wiśnios, Michał Tyrolski, Gracjan Góral, Igor Kulakov, Viktor Petrenko, Krzysztof Walas2026-02-10
💬 NLP

Copy-Paste to Mitigate Large Language Model Hallucinations

यह शोध पत्र **CopyPasteLLM** का प्रस्ताव करता है, जो एक ऐसी विधि है जो उच्च-कॉपीइंग रिस्पॉन्स प्रेफरेंस ट्रेनिंग और विशिष्ट प्रॉम्प्टिंग का उपयोग करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) में होने वाले मतिभ्रम (hallucinations) को कम करती है, ताकि मॉडल्स को आंतरिक पैरामीट्रिक ज्ञान के बजाय प्रदान किए गए संदर्भ पर अधिक निर्भर रहने के लिए प्रोत्साहित किया जा सके।

Yongchao Long, Xian Wu, Yingying Zhang, Xianbin Wen, Yuxi Zhou, Shenda Hong2026-02-10
💻 computer science

Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer

यह शोध पत्र लूथ (Luth) को प्रस्तुत करता है, जो फ्रांसीसी-विशिष्ट स्मॉल लैंग्वेज मॉडल्स (SLMs) का एक परिवार है, जो लक्षित पोस्ट-ट्रेनिंग और रणनीतिक मॉडल मर्जिंग के माध्यम से अंग्रेजी क्षमताओं को बनाए रखते हुए फ्रांसीसी बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, और प्रभावी रूप से गैर-अंग्रेजी SLMs में प्रदर्शन के अंतर को संबोधित करता है।

Maxence Lasbordes, Sinoué Gad2026-02-10
💬 NLP

What Layers When: Learning to Skip Compute in LLMs with Residual Gates

GateSkip एक स्थिर, फाइन-ट्यून करने योग्य गेटिंग मैकेनिज्म है जो डिकोडर-ओनली लैंग्वेज मॉडल्स में टोकन-वाइज लेयर स्किपिंग को सक्षम बनाता है, जिससे सटीकता में न्यूनतम कमी के साथ इन्फरेंस के दौरान महत्वपूर्ण कंप्यूटेशनल बचत संभव होती है।

Filipe Laitenberger, Dawid Kopiczko, Cees G. M. Snoek, Yuki M. Asano2026-02-10