💬 NLP

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

यह शोध पत्र तर्क देता है कि मेडिकल विजन-लैंग्वेज मॉडल्स को पूर्ण स्वायत्तता के बजाय कैलिब्रेटेड ट्राइएज (calibrated triage) के लिए तैनात किया जाना चाहिए, यह प्रदर्शित करते हुए कि जबकि मानक कॉन्फिडेंस मेट्रिक्स खराब मार्गदर्शक हैं, विशिष्ट एस्टिमेटर्स आत्मविश्वासपूर्ण गलत उत्तरों को काफी कम कर सकते हैं ताकि मामलों के केवल एक उपसमुच्चय (विशेष रूप से रेडियोलॉजी में) के सुरक्षित स्वचालित प्रबंधन को सक्षम बनाया जा सके और शेष मामलों को चिकित्सकों के पास भेजा जा सके।

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi2026-06-16
💬 NLP

Interactor: Agentic RL oriented Iterative Creation for Ad Description Generation in Sponsored Search

यह शोध पत्र Interactor को प्रस्तुत करता है, जो एक एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो जनरेटिव रिवॉर्ड मॉडल्स के साथ मल्टी-टर्न इंटरैक्शन के माध्यम से प्रायोजित खोज (sponsored search) में विज्ञापन विवरणों को पुनरावृत्ति से परिष्कृत करता है, जिससे ज्ञान की समृद्धि और लैंडिंग पेज की निरंतरता में महत्वपूर्ण सुधार होता है और सफल ऑनलाइन परिनियोजन (deployment) प्राप्त होता है।

Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu2026-06-16
💬 NLP

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

यह सर्वेक्षण कोड की भूमिका के आधार पर कार्यों को वर्गीकृत करने वाले एक वर्गीकरण (taxonomy) को स्थापित करके और चार प्रमुख डोमेन में विधियों को व्यवस्थित करके उभरते हुए मल्टीमॉडल कोड इंटेलिजेंस के क्षेत्र को परिभाषित करता है, जो अंततः इस क्षेत्र को एकल-आउटपुट अनुकरण से साक्ष्य-आधारित निष्पादन योग्य प्रणालियों की ओर ले जाने के लिए चार सत्यापन-केंद्रित दिशाओं का प्रस्ताव करता है।

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, L (…)2026-06-16
💬 NLP

FinBalance: A Multi-Document Accounting Reconciliation Benchmark

यह शोध पत्र FinBalance को प्रस्तुत करता है, जो विविध उद्योगों और कठिनाई स्तरों के स्रोत दस्तावेजों से निर्मित एक मल्टी-डॉक्यूमेंट अकाउंटिंग रिकॉन्सिलिएशन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स स्रोत सामग्रियों को सुसंगत बैलेंस शीट्स में सटीक रूप से मिलान करने में संघर्ष करते हैं, और अक्सर उनके द्वारा रिपोर्ट किए गए वित्तीय विवरणों और उनके अपने द्वारा जनरेट की गई प्रविष्टियों से प्राप्त विवरणों के बीच महत्वपूर्ण अंतर प्रदर्शित करते हैं।

Sasank Tumpati, Devansh Agarwal, Ayush Kedia, Arjun Neekhra, Murari Mandal, Krishna Garg, Yash Sinha, Suman Gupta, Dhruv (…)2026-06-16
💬 NLP

PreLort: Prefix-Nested LoRA for Federated Fine-Tuning under Rank Heterogeneity

PreLort, सेगमेंट-वाइज एग्रीगेशन (segment-wise aggregation) और मल्टी-ट्रंकेशन ट्रेनिंग (multi-truncation training) के साथ एक प्रीफिक्स-नेस्टेड लोरा (prefix-nested LoRA) फॉर्मूलेशन पेश करके रैंक विषमता (rank heterogeneity) के तहत फेडरेटेड फाइन-ट्यूनिंग की चुनौतियों का समाधान करता है, जो यह सुनिश्चित करता है कि कम-रैंक वाले क्लाइंट्स उच्च-रैंक वाले क्लाइंट्स के समृद्ध प्रतिनिधित्व (richer representations) से लाभान्वित हों और मौजूदा तरीकों की तुलना में बेहतर सटीकता और दक्षता प्राप्त करें।

Muhammad Waseem, Nurbek Tastan, Andrej Jovanovic, Nicholas D. Lane, Nils Lukas, Karthik Nandakumar, Samuel Horvath2026-06-16
💬 NLP

Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning

यह शोध पत्र BASE को प्रस्तुत करता है, जो एक बेस-एंड-एडिट पाइपलाइन है जो एक विशेष रीराइटर मॉडल (LEASCRIBE) का लाभ उठाकर एक एकल संभावित उत्तर को औपचारिक रूप देता है और इन-प्लेस एडिटिंग के माध्यम से शेष K-1 औपचारिक कथनों को कुशलतापूर्वक व्युत्पन्न करता है, जिससे लीन-आधारित गणितीय तर्क में उत्तर चयन सटीकता में सुधार करते हुए कम्प्यूटेशनल लागतों को काफी कम किया जाता है।

Ji Feng, Zhouxing Shi2026-06-16
💬 NLP

Entity Labels Are Not Entity Signals: A Framework for Observable Relevance in Document Re-Ranking

यह शोध पत्र तर्क देता है कि एंटिटी-अवेयर रिट्रीवल सिस्टम को वैचारिक एंटिटी प्रासंगिकता (विषयगत जुड़ाव) पर निर्भर रहने के बजाय अवलोकनीय एंटिटी प्रासंगिकता (विभेदक शक्ति) की ओर स्थानांतरित होना चाहिए, जो यह प्रदर्शित करता है कि उत्तरार्द्ध प्रासंगिक और गैर-प्रासंगिक दस्तावेजों के बीच बेहतर अंतर करके दस्तावेज़ पुन: रैंकिंग प्रदर्शन में महत्वपूर्ण सुधार करता है।

Utshab Kumar Ghosh, Shubham Chatterjee2026-06-16
💬 NLP

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

यह शोध पत्र GRACE-DS को प्रस्तुत करता है, जो कि LLM-संचालित AutoML एजेंटों के लिए एक गार्ड की गई, रिवॉर्ड-गाइडेड मूल्यांकन प्रणाली है, जो प्रदर्शन, सुरक्षा और प्रोटोकॉल अनुपालन का कठोरता से आकलन करने के लिए छिपे हुए वैलिडेटर्स के साथ यथार्थवादी डेटा साइंस वर्कफ़्लो का अनुकरण करती है।

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasya Palienko2026-06-16
💬 NLP

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

यह शोध पत्र तर्क देता है कि मशीन व्याख्या प्रणालियों को पाठ्य निष्ठा मेट्रिक्स से आगे बढ़कर व्याख्या अध्ययनों से प्राप्त एजेंसी, ग्राउंडिंग और अनुभव की डिज़ाइन प्राथमिकताओं को अपनाते हुए "सटीकता के भ्रम" को संबोधित करना चाहिए, जिससे वर्तमान तकनीक और प्रमाणिक मानव-मध्यस्थ संचार के बीच उपयोगिता अंतराल को पाटा जा सके।

Claudio Fantinuoli2026-06-16
💬 NLP

Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

यह शोध पत्र "Who Flips" नामक एक नए मूल्यांकन प्रोटोकॉल को प्रस्तुत करता है जो बड़े भाषा मॉडलों (large language models) में महत्वपूर्ण उत्तर अस्थिरता को प्रकट करता है, यह दर्शाते हुए कि अग्रणी मॉडल भी अक्सर विश्वसनीय प्रति-तर्कों द्वारा चुनौती दिए जाने पर सही उत्तरों को छोड़ देते हैं, जिसमें फ्लिप दर (flip rate) तर्क के स्रोत, लंबाई और आत्म-श्रेय (self-attribution) के आधार पर व्यापक रूप से भिन्न होती है।

Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli, Jana Diesner2026-06-16