💬 NLP

On the Effect of Uncertainty on Layer-wise Inference Dynamics

यह शोध पत्र कई मॉडलों और डेटासेटों में ट्यून्ड लेंस (Tuned Lens) विश्लेषण का उपयोग करके यह प्रदर्शित करता है कि निश्चित और अनिश्चित भविष्यवाणियों की परत-वार अनुमान संबंधी गतिशीलता (layer-wise inference dynamics) काफी हद तक संरेखित है, जो सरल अनिश्चितता पहचान विधियों की व्यवहार्यता को चुनौती देता है और यह सुझाव देता है कि अधिक सक्षम मॉडल अनिश्चितता को अलग तरह से संसाधित कर सकते हैं।

Sunwoo Kim, Haneul Yoo, Alice Oh2026-06-29
💬 NLP

Training-free Truthfulness Detection via Sparse MLP Value Vectors

यह शोध पत्र TruthV को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) विधि है जो MLP वैल्यू वेक्टर्स के एक विरल उपसमुच्चय (sparse subset) से संकेतों को एकत्रित करके LLM की सत्यनिष्ठा का पता लगाती है, और बिना किसी अतिरिक्त पैरामीटर या क्लासिफायर प्रशिक्षण के विभिन्न मॉडल स्केल्स और बेंचमार्क में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करती है।

Runheng Liu, Heyan Huang, Xingchen Xiao, Yanghao Zhou, Zhijing Wu2026-06-29
💬 NLP

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

यह शोध पत्र "चयनात्मक त्याग" (selective quitting) को LLM एजेंटों के लिए एक अत्यधिक प्रभावी, तत्काल तैनात करने योग्य सुरक्षा तंत्र के रूप में प्रस्तावित और मान्य करता है, यह प्रदर्शित करते हुए कि कम-आत्मविश्वास वाली स्थितियों से हटने के स्पष्ट निर्देश, बहु-चरण परिदृश्यों में उपयोगिता पर नगण्य प्रभाव के साथ सुरक्षा में महत्वपूर्ण सुधार करते हैं।

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut2026-06-29
💬 NLP

Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs

यह शोध पत्र एक स्वयंसिद्ध ढांचे (axiomatic framework) को प्रस्तुत करता जिसमें एलएलएम (LLM) में लेटेंट थॉट रिप्रेजेंटेशन (latent thought representations) का डाउनस्ट्रीम सटीकता से स्वतंत्र रूप से मूल्यांकन करने के लिए चार कार्यात्मक मेट्रिक्स शामिल हैं, जो यह प्रकट करता है कि वर्तमान मॉडल इन स्वयंसिद्धों को संतुष्ट करने में संरचनात्मक रूप से विफल रहते हैं क्योंकि वे इनपुट एम्बेडिंग्स के परे न्यूनतम जानकारी को एनकोड करते हैं और एक ही कार्य के भीतर विशिष्ट प्रश्नों के बीच अंतर करने की क्षमता का अभाव रखते हैं।

Fahd Seddik, Fatemeh Fard2026-06-29
💬 NLP

Position: The Term "Machine Unlearning" Is Overused in LLMs

यह स्थिति पत्र तर्क देता है कि "मशीन अनलर्निंग" (machine unlearning) शब्द का वर्तमान में LLM अनुसंधान में रिफ्यूज़ल (refusal) या सप्रेशन (suppression) जैसे विविध कार्यों का वर्णन करने के लिए अत्यधिक उपयोग किया जा रहा है, और भ्रामक मूल्यांकन को रोकने तथा विभिन्न उद्देश्यों के लिए उपयुक्त शब्दावली सुनिश्चित करने हेतु इस शब्द को विशेष रूप से डेटासेट-परिभाषित विलोपन (dataset-defined deletion) और रिट्रेनिंग-तुल्यता गारंटी (retraining-equivalence guarantees) के लिए आरक्षित करने का आह्वान करता है।

Sangyeon Yoon, Yeachan Jun, Albert No2026-06-29
💬 NLP

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

यह शोध पत्र स्वचालित प्रस्तुति कोचिंग प्रणालियों का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो मौजूदा उपकरणों को उच्चारण, स्वर-लहरी (प्रोसोडी) और विषय-वस्तु डोमेन में मैप करने के लिए एक पांच-आयामी कार्य वर्गीकरण (टैक्सोनॉमी) पेश करता है, साथ ही डेटा की कमी और लहजे की निष्पक्षता जैसी प्रमुख तकनीकी विधियों और महत्वपूर्ण खुली चुनौतियों की पहचान करता है।

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg2026-06-29
🤖 AI

CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models

यह शोध पत्र CalBrief प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क और ढांचा है जो यह प्रकट करता है कि जबकि संरचित संगठन LLMs में साक्ष्य तर्क (evidence reasoning) में सुधार करता है, स्पष्ट शक्ति-अंशांकन (strength-calibration) नीतियां अक्सर अत्यधिक रूढ़िवादिता की ओर ले जाती हैं, जिसका मुख्य कारण मॉडल की साक्ष्य शक्ति को आंकने की अंतर्निहित अक्षमता के बजाय विस्तारित लेबल स्पेस है।

Yu Fu, Yongqi Kang, Yong Zhao2026-06-29
💬 NLP

Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving

यह शोध पत्र एक दो-चरणीय कैस्केड फ्रेमवर्क प्रस्तावित करता है जो लागत प्रभावी मॉडल रूटिंग के लिए क्वेरीज़ को क्लस्टर करता है और कम गुणवत्ता वाले आउटपुट को मजबूत मॉडलों तक बढ़ाता है, जिससे बिना किसी मैनुअल पुनर्गठन के, अनुमानित सटीकता (inference costs) को काफी कम करते हुए लगभग इष्टतम सटीकता प्राप्त होती है।

Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana, Ammar Abbas, Solmaz Panahi, David Lynch, Zhuangzhuang Nie (…)2026-06-29
💬 NLP

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

यह शोध पत्र LLM एजेंटों में एक विशिष्ट "मेमोरी-अपडेट गैप" (स्मृति-अद्यतन अंतराल) की पहचान करता है जहाँ मॉडल के पैमाने की परवाह किए बिना, जैसे-जैसे बातचीत की लंबाई बढ़ती है, तथ्य-प्रतिस्थापन (fact-supersession) कार्यों पर प्रदर्शन काफी कम हो जाता है, और यह प्रदर्शित करता है कि 'सुपरसीड' (Supersede) नामक एक नए पेश किए गए प्रशिक्षण वातावरण में सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से इस अंतराल को प्रभावी ढंग से कम किया जा सकता है।

Vedant Patel2026-06-29
💬 NLP

Aloe-Vision: Robust Vision-Language Models for Healthcare

यह शोध पत्र एलो-विज़न (Aloe-Vision) का परिचय देता है, जो एक उच्च-गुणवत्ता वाले, फ़िल्टर्ड मल्टीमॉडल डेटासेट पर प्रशिक्षित एक सुदृढ़ मेडिकल लार्ज विज़न-लैंग्वेज मॉडल (7B और 72B) का ओपन-सोर्स परिवार है, जिसके साथ विश्वसनीय मूल्यांकन के लिए केयरक्यूए-विज़न (CareQA-Vision) बेंचमार्क भी दिया गया है, ताकि स्वास्थ्य सेवा एआई में डेटा की कमी, पुनरुत्पादकता और सुरक्षा संबंधी चिंताओं को दूर किया जा सके।

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-G (…)2026-06-29