🤖 machine learning

Training Language Agents to Learn from Experience

यह शोध पत्र इन-कॉन्टेक्स्ट ट्रेनिंग (ICT) फ्रेमवर्क और एक सुदृढीकरण लर्निंग-आधारित पाइपलाइन पेश करता है जो भाषा एजेंटों को पिछले इंटरैक्शन से अनुभव को पुन: प्रयोज्य सिस्टम प्रॉम्प्ट्स में संकुचित करने में सक्षम बनाता है, जिससे वे मानवीय पर्यवेक्षण के बिना क्रॉस-टास्क आत्म-सुधार और अनदेखे वातावरणों में सामान्यीकरण प्राप्त करते हैं।

Yuval Shalev, Zifeng Ding, Mateja Jamnik2026-05-21
🤖 machine learning

Reinforcing Human Behavior Simulation via Verbal Feedback

यह शोध पत्र DITTO प्रस्तुत करता है, जो मानव व्यवहार को बेहतर ढंग से सिम्युलेट करने के लिए मौखिक फीडबैक के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से प्रशिक्षित एक मॉडल है, साथ ही SOUL बेंचमार्क सुइट भी प्रस्तुत करता है, जो बेस मॉडलों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है और कई मानव-समान सिमुलेशन कार्यों पर GPT-5.4 से आगे निकल जाता है।

Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang (…)2026-05-21
⚡ electrical engineering

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA एक बड़े पैमाने का, इमेज-ग्राउंडेड बेंचमार्क है जिसमें 12 डेटासेट और पांच क्लिनिकल डोमेन के 3D ब्रेन MRI वॉल्यूम से व्युत्पन्न लगभग 57,000 प्रश्न-उत्तर जोड़े शामिल हैं, जिसे सख्त इमेज-ग्राउंडिंग प्रोटोकॉल और विशेषज्ञ सत्यापन के माध्यम से टेक्स्ट-ओनली शॉर्टकट को समाप्त करते हुए 3D मेडिकल विजुअल रीजनिंग का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Mohammad H. Abbasi (Stanford University), Favour Nerrise (Stanford University), Shaurnav Ghosh (Stanford University), Ri (…)2026-05-21
💬 NLP

What Do Biomedical NER and Entity Linking Benchmarks Measure? A Corpus-Centric Diagnostic Framework

यह शोध पत्र एक कॉर्पस-केंद्रित नैदानिक ढांचे (डायग्नोस्टिक फ्रेमवर्क) को प्रस्तुत करता है जो बेंचमार्क गुणों के पांच प्रमुख परिवारों का विश्लेषण करता है ताकि बायोमेडिकल एनईआर (NER) और ईएल (EL) कॉर्पोरा के बीच मूल्यांकन संकेतों और सामान्यीकरण संबंधी मांगों में पर्याप्त अंतर को प्रकट किया जा सके, और यह तर्क देता है कि सतही सांख्यिकी यह चरित्रित करने के लिए अपर्याप्त है कि ये बेंचमार्क वास्तव में क्या मापते हैं।

Robert Leaman, Rezarta Islamaj, Zhiyong Lu2026-05-21
💬 NLP

Multi-agent Collaboration with State Management

यह शोधपत्र STORM को प्रस्तुत करता है, जो एक स्टेट-ओरिएंटेड (state-oriented) प्रबंधन ढांचा है जो कोडिंग बेंचमार्क पर पारंपरिक वर्कस्पेस आइसोलेशन बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हुए और साझा कोडबेस के सुसंगत दृश्यों को सुनिश्चित करते हुए, राइट टाइम (write time) पर कोड संघर्षों का पता लगाने और उन्हें हल करने के लिए मल्टी-एजेंट इंटरैक्शन को मध्यस्थता प्रदान करता है।

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong2026-05-21
💬 NLP

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

यह शोध पत्र 6,000 से अधिक वेब-तैनात चिकित्सा लार्ज लैंग्वेज मॉडल्स के बड़े पैमाने पर मूल्यांकन को प्रस्तुत करता है, जो भविष्य के सुरक्षा सुधारों को निर्देशित करने के लिए नए मूल्यांकन ढांचे और एक डेटासेट को पेश करते हुए मतिभ्रम (hallucinations), नीति उल्लंघन और गोपनीयता अंतराल के महत्वपूर्ण जोखिमों को प्रकट करता है।

Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood2026-05-21
💬 NLP

Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies

यह शोध पत्र इस धारणा को चुनौती देता है कि स्व-प्रशिक्षण (self-training) केवल भाषा को सपाट बनाता है, बल्कि यह प्रदर्शित करता है कि इसके बजाय यह एक विषम पतन (asymmetric collapse) के माध्यम से इसे पुनर्गठित करता है जहाँ गहरे वाक्य संरचनात्मक लक्षण क्षय होते हैं जबकि सतही संकेतक प्रवर्धित होते हैं, एक ऐसी घटना जिसे संरचनात्मक गहराई परिकल्पना (Structural Depth Hypothesis) के रूप में औपचारिक रूप दिया गया है।

Ming Liu2026-05-21
💬 NLP

HRM-Text: Efficient Pretraining Beyond Scaling

यह शोध पत्र HRM-Text को प्रस्तुत करता है, जो एक 1B-पैरामीटर वाला मॉडल है जो एक पदानुक्रमित आवर्ती (hierarchical recurrent) आर्किटेक्चर, विशिष्ट प्रशिक्षण तकनीकों और केवल निर्देश-आधारित प्रीट्रेनिंग को जोड़कर काफी बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है ताकि मौलिक भाषा मॉडल अनुसंधान के लिए कंप्यूट और डेटा की आवश्यकताओं को नाटकीय रूप से कम किया जा सके।

Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori2026-05-21
💬 NLP

Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents

यह शोध पत्र Auto-Dreamer को प्रस्तुत करता है, जो पूरक शिक्षण प्रणाली सिद्धांत (complementary learning systems theory) से प्रेरित एक सीखा हुआ ऑफलाइन मेमोरी कंसोलिडेटर (memory consolidator) है, जो तेज़ ऑनलाइन अनुभव प्राप्ति को धीमी क्रॉस-सेशन कंसोलिडेशन से अलग करता है, जिससे भाषा एजेंटों को आवर्ती पैटर्न को एब्स्ट्रैक्ट करने और रेडंडेंसी को कम करने में सक्षम बनाया जा सके ताकि कई वातावरणों में काफी छोटे सक्रिय मेमोरी बैंक के साथ बेहतर प्रदर्शन प्राप्त किया जा सके।

Chongrui Ye, Yuxiang Liu, Yu Wang, Haofei Yu, Yining Zhao, Ge Liu, Julian McAuley, Jiaxuan You2026-05-21
💬 NLP

Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task

फ्लोरिडा विश्वविद्यालय के गेटर्स ने स्पेनिश मध्यवर्ती कैप्शनिंग के लिए Qwen2.5-VL को Gemini 2.5 Flash के साथ रिट्रीवल-ऑगमेंटेड मेनी-शॉट प्रॉम्प्टिंग के साथ संयोजित करने वाले एक दो-चरणीय पाइपलाइन का उपयोग करके स्वदेशी भाषाओं के लिए सांस्कृतिक छवि कैप्शनिंग पर AmericasNLP 2026 साझा कार्य (shared task) जीता, जिससे ब्राइब्री, गुआरानी और ओरिज़ाबा नहुआटल में बेसलाइन की तुलना में 120% से अधिक प्रदर्शन सुधार प्राप्त हुआ।

Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Daisy Zhe Wang, Christan Grant2026-05-21