💬 NLP

Capabilities of Claude Fable 5 on Biomedical Challenge Problems

यह शोध पत्र प्रकट करता है कि जबकि एंथ्रोपिक का क्लॉड फेबल 5 (Claude Fable 5) सक्रिय रूप से संलग्न होने पर बायोमेडिकल बेंचमार्क पर शीर्ष स्तर की सटीकता प्राप्त करता है, इसकी व्यावहारिक उपयोगिता प्रश्नों के एक महत्वपूर्ण हिस्से को अस्वीकार करने की एक अनूठी और व्यापक प्रवृत्ति द्वारा गंभीर रूप से बाधित होती है—एक ऐसा पैटर्न जो इसके पूर्ववर्तियों और GPT-5 दोनों में अनुपस्थित है।

Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika2026-07-14
💬 NLP

Can a Language Model Learn Facts Continually in Its Weights?

यह शोध पत्र यह प्रदर्शित करता है कि जबकि व्यापक प्रशिक्षण डेटा भाषा मॉडलों को नग्न कथनों की तुलना में अपने भार (weights) में नए तथ्यों को अधिक प्रभावी ढंग से संग्रहीत करने में सक्षम बनाता है, निरंतर भार-आधारित सीखना अपरिहार्य रूप से विनाशकारी विस्मृति (catastrophic forgetting) और हस्तक्षेप का कारण बनता है, जिससे संदर्भ (context) क्रमिक अपडेट के माध्यम से ज्ञान को संरक्षित करने और संयोजित करने के लिए एकमात्र विश्वसनीय माध्यम बन जाता है।

Charles O'Neill2026-07-14
💬 NLP

When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR

यह पूर्व-पंजीकृत कारण संबंधी अध्ययन (causal study) प्रदर्शित करता है कि कोड रिवॉर्ड सूट्स में प्राकृतिक 'फॉल्स पॉजिटिव' (false positives) व्यवस्थित रूप से RLVR प्रदर्शन मेट्रिक्स को बढ़ा देते हैं क्योंकि वे केवल सूट आर्टिफैक्ट्स के बजाय वास्तव में त्रुटिपूर्ण कोड को पुरस्कृत करते हैं, एक ऐसी घटना जिसे सस्ते स्टैटिक ऑडिट के माध्यम से पहचाना जा सकता है लेकिन जिसे सुधारने पर क्षमता में न्यूनतम लाभ प्राप्त होता है।

Chuyifei Zhang2026-07-14
💬 NLP

Dimensionality in Satisfaction Ratings

यह शोध पत्र यह प्रदर्शित करता है कि ग्राहक संतुष्टि को विशिष्ट अक्षों (जैसे एजेंट का प्रदर्शन और परिणाम) में विभाजित करने के लिए एक लार्ज लैंग्वेज मॉडल का उपयोग करना, पारंपरिक सर्वेक्षण-आधारित मेट्रिक्स की तुलना में ग्राहक अनुभव की अधिक सूक्ष्म और व्यापक समझ प्रदान करता है, जो केवल स्व-चयनित सर्वेक्षण उत्तरदाताओं के बजाय सभी सहायता वार्तालापों का विश्लेषण करने पर काफी कम संतुष्टि स्तरों को प्रकट करता है।

Andrew Hong, Jason Potteiger2026-07-14
💬 NLP

Domain-Aware Scaling Laws Uncover Data Synergy

यह शोध पत्र विविध ओपन-वेट (open-weight) एलएलएम (LLM) के अवलोकन संबंधी डेटा का लाभ उठाकर, यह अनुमान लगाने के लिए कि विभिन्न डोमेन संयोजन कैसे परस्पर क्रिया करते हैं, भाषा मॉडल प्रीट्रेनिंग में "डेटा सिनर्जी" (data synergy) को औपचारिक रूप देता है और परिमाणित करता है, जो यह प्रदर्शित करता है कि उनका प्रस्तावित ढांचा डोमेन-अज्ञेयवादी स्केलिंग लॉज़ (domain-agnostic scaling laws) से बेहतर प्रदर्शन करता है और इष्टतम बनाम प्रति-इष्टतम (optimal versus anti-optimal) डेटा मिश्रण के आधार पर मॉडल प्रदर्शन रैंकिंग की सटीक भविष्यवाणी करता है।

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis2026-07-14
💬 NLP

ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers

यह शोधपत्र ResearchQA का परिचय देता है, जो 6,211 प्रश्न-उत्तर युग्मों का एक नया बेंचमार्क है जिसे वैज्ञानिक शोध पत्रों के लिए उद्धरण-आधारित (citation-grounded) उत्तर प्रदान करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि उद्धरण-आधारित मेट्रिक्स, LLM-आधारित मूल्यांकनकर्ताओं की तुलना में मॉडल प्रदर्शन के बीच बेहतर अंतर स्पष्ट करते हैं और साथ ही यह भी दिखाते हैं कि ओपन-वेट मॉडल काफी कम विलंबता (latency) के साथ तुलनीय सटीकता प्राप्त कर सकते हैं।

Saba Imran, Debanjum Singh Solanky2026-07-14
💬 NLP

AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

AgentCheck एक ओपन-सोर्स वेब वर्कबेंच है जो डेवलपर्स को वास्तविक टूल रिस्पॉन्स में विभिन्न दोषों (faults) को इंजेक्ट करके और एक नियंत्रित रिप्ले मैकेनिज्म के माध्यम से सुधारों की प्रभावशीलता को सत्यापित करके, टूल का उपयोग करने वाले LLM एजेंट्स में विफलताओं को पुनरुत्पादित करने, हस्तक्षेप करने और उन्हें कम करने में सक्षम बनाता है।

Aritra Mazumder, Nusrat jahan Lia2026-07-14
💬 NLP

Generative Chinese Statute Retrieval

यह शोध पत्र GCSR को प्रस्तुत करता है, जो एक जनरेटिव फ्रेमवर्क है जो बहु-स्तरीय संरचित दस्तावेज़ आईडी और बहु-कार्य प्रशिक्षण का उपयोग करके चीनी वैधानिक पुनर्प्राप्ति (statute retrieval) को एक अनुक्रम निर्माण कार्य (sequence generation task) के रूप में पुनर्गठित करता है ताकि बोलचाल की क्वेरी और औपचारिक वैधानिक भाषा के बीच के अंतर को प्रभावी ढंग से पाटा जा सके, जो मौजूदा पुनर्प्राप्ति बेसलाइनों से बेहतर प्रदर्शन करता है।

Yiteng Tu, Zitao Su, Weihang Su, Xuanyi Chen, Yueyue Wu, Yiqun Liu, Min Zhang, Qingyao Ai2026-07-14
⚡ electrical engineering

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

यह शोध पत्र वीडियो साक्षात्कारों में द्वंद्व (ambivalence) और हिचकिचाहट (hesitancy) को पहचानने के लिए एक ऐसी प्रणाली प्रस्तुत करता है जो ASR-मिटाए गए समय संबंधी विशेषताओं (ASR-erased time features) और प्रभाव-विशिष्ट मल्टीमॉडल फ्यूजन (affect-specialized multimodal fusion) का लाभ उठाती है, जो यह प्रदर्शित करता है कि सरल AP-वेटेड एन्सेम्बलिंग (AP-weighted ensembling) के साथ ईमानदार अंशांकन (honest calibration), ABAW 2026 BAH चैलेंज पर जटिल आर्किटेक्चर और ओवरफिटेड सत्यापन रणनीतियों से बेहतर प्रदर्शन करता है।

Vikas Kumar, Aditya Mishra, Haroon R. Lone2026-07-14
💬 NLP

Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

यह शोध पत्र यूनिफाइड ग्रेडिएंट प्रोजेक्शन (UGP) का प्रस्ताव करता है, जो एक निरंतर सीखने (continual learning) की विधि है जो बहुभाषी कम-संसाधन वाले ASR में प्रमुख-भाषा पूर्वाग्रह और कैटास्ट्रोफिक फॉरगेटिंग को कम करने के लिए भाषा-संतुलित संदर्भ ग्रेडिएंट्स का उपयोग करके पैरामीटर अपडेट को सीमित करती है, जिससे Whisper-large-v3 जैसे मॉडलों पर लगभग शून्य फॉरगेटिंग प्राप्त होती है।

Ziang Ren, Guodong Lin, Yuchen Ai, Kaize Tan, Wei-Qiang Zhang2026-07-14