💬 NLP

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

यह शोधपत्र RIMS का प्रस्ताव करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन में छोटे पैमाने के भाषा मॉडलों के लिए एक तीन-चरणीय प्राथमिकता अनुकूलन ढांचा है, जो कई प्राथमिकता युग्मों का प्रभावी ढंग से लाभ उठाने के लिए स्व-निर्मित सिंथेटिक डेटा और एक डिफरेंशिएबल सॉफ्ट एग्रीगेशन तंत्र का उपयोग करता है, जिससे शोर वाले रिट्रीवल स्थितियों में अत्याधुनिक बेसलाइनों से बेहतर प्रदर्शन किया जा सके।

Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang2026-07-21
💬 NLP

Can Multimodal Large Language Models Understand OCT?

यह शोध पत्र OCT-Bench प्रस्तुत करता है, जो धारणा (perception), संज्ञान (cognition) और तर्क (reasoning) के आयामों में 10,000 से अधिक सूक्ष्म-स्तरीय प्रश्नों वाला एक व्यापक बेंचमार्क है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है, और यह प्रकट करता है कि वर्तमान मॉडल—चिकित्सा-अनुकूलित और बड़े पैमाने के वेरिएंट्स सहित—नैदानिक रूप से आधारित OCT इमेज समझ करने की अपनी क्षमता में काफी सीमित हैं।

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song2026-07-21
💬 NLP

OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research

ओपनलैंग्वेजमॉडल (OLM) एक ओपन-सोर्स पायटॉर्च (PyTorch) लाइब्रेरी है जिसे शिक्षा और अनुसंधान के बीच के अंतर को पाटने के लिए डिज़ाइन किया गया है, जो पारदर्शी, कंपोजेबल छोटे भाषा मॉडलों के निर्माण को सक्षम बनाता है जो विविध हार्डवेयर कॉन्फ़िगरेशन में टीचिंग नोटबुक से लेकर स्केलेबल प्रीट्रेनिंग रन तक निर्बाध रूप से संक्रमण कर सकते हैं।

Tavish Mankash, Vardhaman Kalloli, Keshava Prasad, Deepan Muthirayan2026-07-21
💬 NLP

SpecLA: Efficient Speculative Decoding for Linear-Attention Models

यह शोध पत्र SpecLA प्रस्तुत करता है, जो विशेष रूप से स्टेटफुल लीनियर-अटेंशन मॉडल्स के लिए डिज़ाइन किया गया एक कुशल स्पेक्युलेटिव डिकोडिंग रनटाइम है, जो मानक ऑटोरिग्रेसिव डिकोडिंग की तुलना में 1.70x तक एंड-टू-एंड स्पीडअप प्राप्त करने के लिए टोपोलॉजी-अवेयर वेरिफिकेशन, कॉम्पैक्ट स्टेट रिकवरी और टार्गेट-अलाइन्ड ड्राफ्टर का उपयोग करता है।

Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian2026-07-21
💬 NLP

Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs

यह शोध पत्र यह प्रदर्शित करता है कि LLMs में अंकगणितीय गणना प्रतीकात्मक (symbolic), प्राकृतिक भाषा और कोड प्रारूपों के बीच "अनुमानित न्यूरॉन्स" (heuristic neurons) के एक साझा, रूप-अपरिवर्तनीय सेट पर निर्भर करती है, जो यह प्रकट करता है कि विभिन्न प्रारूपों में विफलताएं अलग-अलग आंतरिक सर्किटों के बजाय सक्रियण अवस्थाओं (activation states) से उत्पन्न होती हैं।

Sharath Naganna, Tanvir Ahmed Sijan, Uddipta Kalita2026-07-21
🤖 AI

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

DS@GT टीम ने एक हाइब्रिड मल्टी-एजेंट सिस्टम विकसित करके eRisk 2026 कन्वर्सेशनल डिप्रेशन स्क्रीनिंग चैलेंज में शीर्ष-3 रैंकिंग हासिल की, जो एक संरचित एल्गोरिद्मिक ढांचे को एक ओपन-सोर्स Gemma 27B मॉडल के साथ जोड़ता है ताकि सटीकता और लागत-दक्षता दोनों में अधिक महंगी प्रोप्रायटरी बेसलाइन से बेहतर प्रदर्शन किया जा सके।

Victor Gong, David Guecha2026-07-21
💬 NLP

Diagnosing Correctness Probes under Self-Judgement Confounding

यह शोध पत्र प्रदर्शित करता है कि भाषा मॉडलों में हिडन-स्टेट रीडआउट्स अक्सर वस्तुनिष्ठ शुद्धता के बजाय मॉडल के आत्म-निर्णय (self-judgement) को कैप्चर करते हैं, जैसा कि वास्तविक शुद्धता से जुड़े दिशाओं की तुलना में आत्म-निर्णय से जुड़ी दिशाओं की बेहतर क्रॉस-डोमेन हस्तांतरणीयता (cross-domain transferability) से सिद्ध होता है।

Yi-Long Lu2026-07-21
💬 NLP

Group Entropy-Controlled Policy Optimization

यह शोध पत्र ग्रुप एंट्रॉपी-कंट्रोल्ड पॉलिसी ऑप्टिमाइज़ेशन (GEPO) प्रस्तुत करता है, जो GRPO का एक हल्का विस्तार है जो समूह-स्तरीय एंट्रॉपी अनुमानों का उपयोग करके एसिमेट्रिक एडवांटेज शेपिंग करने के माध्यम से विषम (heterogeneous) RL कार्यों में वैश्विक एंट्रॉपी विनियमन की सीमाओं को संबोधित करता है, जिससे बेहतर क्रॉस-टास्क प्रदर्शन प्राप्त करने के लिए अन्वेषण (exploration) और दोहन (exploitation) को संतुलित किया जा सके।

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen2026-07-21
💬 NLP

Training Continuous Chain of Thought Models: A Tale of Two Regimes

यह शोध पत्र C-MTP को प्रस्तुत करता है, जो निरंतर चेन-ऑफ-थॉट (Chain-of-Thought) मॉडलों को प्रशिक्षित करने के लिए एक तेज़ प्रत्यक्ष पर्यवेक्षण विधि है, जो पूर्ववर्ती प्रत्यक्ष दृष्टिकोणों से बेहतर प्रदर्शन करता है और लघु तर्क श्रृंखलाओं (reasoning traces) पर धीमी अप्रत्यक्ष विधियों के बराबर प्रदर्शन करता है, जबकि यह भी प्रकट करता है कि वर्तमान निरंतर CoT तकनीकें लंबी तर्क श्रृंखलाओं वाले जटिल कार्यों पर लागू होने पर काफी संघर्ष करती हैं।

Varun Yerram, He He, Eunsol Choi2026-07-21
💬 NLP

Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

यह अध्ययन प्रदर्शित करता है कि एक ह्यूमन-इन-द-लूप एआई एजेंट नैदानिक विद्वानों (क्लिनिकल स्कॉलर्स) के लिए ट्रांसलेशनल इम्पैक्ट सारांशों को एकत्र करने और ड्राफ्ट करने को प्रभावी ढंग से स्वचालित कर सकता है, जिससे उच्च सटीकता बनाए रखते हुए और अक्सर नियमित प्रक्रियाओं द्वारा छूट जाने वाले गैर-विद्वत्तापूर्ण साक्ष्यों को कैप्चर करते हुए, प्रति विद्वान रिपोर्टिंग कार्यभार को अनुमानित 15 घंटों से घटाकर 14 मिनट कर दिया गया है।

Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren Ramakrishnan Sureshbabu, Krishna Riteshkumar Patel, Rebecca (…)2026-07-21