🤖 AI

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

यह शोध पत्र RealICU का परिचय देता है, जो एक पश्चदृष्टि-एनोटेटेड (hindsight-annotated) बेंचमार्क है जो चिकित्सक-समीक्षित ग्राउंड ट्रुथ का उपयोग करके लंबे-संदर्भ वाले ICU डेटा पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे यह पता चलता है कि बेहतर मेमोरी आर्किटेक्चर के बावजूद वर्तमान मॉडल रिकॉल-सुरक्षा ट्रेडऑफ और एंकरिंग बायस (anchoring biases) के साथ संघर्ष करते हैं।

Chengzhi Shen (Cherise), Weixiang Shen (Cherise), Tobias Susetzky (Cherise), Chen (Cherise), Chen (Cherise), Jun Li, Y (…)2026-05-14
💬 NLP

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

यह शोध पत्र रिवॉर्ड-डिकोरिलेटेड पॉलिसी ऑप्टिमाइज़ेशन (RDPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो मल्टी-रिवॉर्ड सुदृढीकरण शिक्षण (reinforcement learning) में एडवांटेज एस्टीमेशन को स्थिर करने के लिए मैग्नीट्यूड-अवेयर क्वांटाइल नॉर्मलाइजेशन और महालानोबिस व्हाइटनिंग का उपयोग करती है, जिससे तर्क (reasoning) या कोडिंग क्षमताओं से समझौता किए बिना इंस्ट्रक्शन फॉलोइंग, लेखन और मजबूती (robustness) पर मॉडल के प्रदर्शन में सुधार होता है।

Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai2026-05-14
💬 NLP

Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation

यह शोध पत्र स्ट्रॉन्ग-टू-वीक ऑन-पॉलिसी डिस्टिलेशन (strong-to-weak on-policy distillation) में "लोकल टीचबिलिटी कोलैप्स" (local teachability collapse) की पहचान करता है, जहाँ बाद के ट्राजेक्टरी सेगमेंट्स में भेदभावपूर्ण शिक्षक फीडबैक की कमी के कारण समान पर्यवेक्षण विफल हो जाता है, और एक ट्राजेक्टरी-विशिष्ट रिलीज़ नियम प्रस्तावित करता है जो निरंतर विभिन्न बेंचमार्क पर मानक विधियों से बेहतर प्रदर्शन करने के लिए डाउनवर्ड चेंज पॉइंट (downward change point) का पता चलते ही सघन पर्यवेक्षण को काट देता है।

Kaiyuan Liu, Ziyuan Zhuang, Yang Bai, Bing Wang, Rongxiang Weng, Jieping Ye2026-05-14
💬 NLP

Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training

यह शोध पत्र यह प्रदर्शित करता है कि लो-रैंक प्री-ट्रेनिंग विधियाँ, फुल-रैंक ट्रेनिंग के समान वैलिडेशन परप्लेक्सिटी प्राप्त करने के बावजूद, ज्यामितीय और स्पेक्ट्रल रूप से भिन्न समाधानों पर अभिसरित होती हैं जिनके आंतरिक प्रतिनिधित्व और डाउनस्ट्रीम प्रदर्शन भिन्न होते हैं, जो केवल परप्लेक्सिटी से परे एक व्यापक मूल्यांकन ढांचे की आवश्यकता को रेखांकित करता है।

Namrata Shivagunde, Vijeta Deshpande, Sherin Muckatira, Anna Rumshisky2026-05-14
💬 NLP

Fine-tuning with Hierarchical Prompting for Robust Propaganda Classification Across Annotation Schemas

यह शोध पत्र एक नया इरादा-केंद्रित (intent-focused) प्रचार वर्गीकरण और पदानुक्रमित प्रॉम्प्टिंग (Hierarchical Prompting - HiPP) विधि प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इस दृष्टिकोण के साथ भाषा मॉडलों को फाइन-ट्यून करने से विभिन्न एनोटेशन स्कीमा, विशेष रूप से अस्पष्ट और कम-सहमति वाले डेटासेट में मजबूती और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Lukas Stähelin, Veronika Solopova, Max Upravitelev, David Kaplan, Ariana Sahitaj, Premtim Sahitaj, Charlott Jakob, Sebas (…)2026-05-14
💬 NLP

Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety

यह शोध पत्र यह प्रदर्शित करता है कि विशेषज्ञ-निर्मित शैक्षिक डेटा पर फाइन-ट्यून किए जाने पर, कॉम्पैक्ट 8B-पैरामीटर वाले LLMs, नियंत्रित कठिनाई और सुरक्षा के साथ बच्चों की अंग्रेजी पढ़ने की कहानियाँ उत्पन्न कर सकते हैं जो कठिनाई मेट्रिक्स पर GPT-4o और Llama 3.3 70B जैसे ज़ीरो-शॉट बड़े मॉडलों से बेहतर प्रदर्शन करते हैं, जबकि व्यापक शैक्षिक उपयोग के लिए लागत प्रभावी बने रहते हैं।

Qian Shen (University of Florida, Gainesville, USA), Fanghua Cao (University of Florida, Gainesville, USA), Min Yao (Uni (…)2026-05-14
💬 NLP

Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching

25M पैरामीटर्स से कम के एक सूक्ष्म-पैमाने वाले प्रीट्रेनिंग रिजीम में, मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल सक्रिय पैरामीटर्स के मामले में मिलान करने वाले डेंस बेसलाइन्स से बेहतर प्रदर्शन करते हैं, लेकिन कुल पैरामीटर क्षमता के मामले में मिलान करने पर वे उन्हें पछाड़ने में विफल रहते हैं।

Abdalrahman Wael2026-05-14
💬 NLP

Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry

यह शोध पत्र एक स्टेप-लेवल मतिभ्रम (hallucination) डिटेक्शन फ्रेमवर्क प्रस्तावित करता है जो एक कंट्रास्टिव PCA-आधारित शिक्षक और एक डिस्टिल्ड BiLSTM छात्र का उपयोग करके तर्क संबंधी त्रुटियों को हिडन-स्टेट ट्रांसपोर्ट ज्योमेट्री में स्थानीय विचलन के रूप में पहचानता है, जो सिंगल-पास इन्फरेंस के दौरान पहली त्रुटि को स्थानीयकृत करने में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है।

Tyler Alvarez, Ali Baheri2026-05-14
💬 NLP

An LLM-Based System for Argument Reconstruction

यह शोध पत्र एक एंड-टू-एंड लार्ज लैंग्वेज मॉडल सिस्टम प्रस्तुत करता है जो प्राकृतिक भाषा के टेक्स्ट से तर्कों को एब्स्ट्रैक्ट डायरेक्टेड एसाइक्लिक ग्राफ्स में पुनर्गठित करता है, और मैन्युअल एवं मात्रात्मक मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि यह प्रभावी रूप से तर्कपूर्ण संरचनाओं को पुनः प्राप्त कर सकता है और बेंचमार्क डेटासेट्स पर उचित प्रदर्शन प्राप्त कर सकता है।

Paulo Pirozelli, Victor Hugo Nascimento Rocha, Fabio G. Cozman, Douglas Aldred2026-05-14
💬 NLP

Good Agentic Friends Do Not Just Give Verbal Advice: They Can Update Your Weights

यह शोध पत्र TFlow को पेश करता है, जो एक मल्टी-एजेंट LLM फ्रेमवर्क है जो पारंपरिक टेक्स्ट-आधारित संचार को प्रेषक एजेंटों के हिडन स्टेट्स (hidden states) से प्राप्त क्षणिक, लो-रैंक वेट परटर्बेशन्स (low-rank weight perturbations) से बदल देता है, जिससे प्रतिस्पर्धी सटीकता बनाए रखते हुए टोकन लागत और इन्फरेंस लेटेंसी में काफी कमी आती है।

Wenrui Bao, Huan Wang, Jian Wang, Zhangyang Wang, Kai Wang, Yuzhang Shang2026-05-14