🤖 machine learning

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

यह शोध पत्र यह प्रदर्शित करता है कि LLM एजेंट फीडबैक लूप में मूल्यांकनकर्ता के निर्णयों पर प्रायिकता अंशांकन (probability calibration) लागू करना प्रभावी रूप से मूल्यांकनकर्ता प्राथमिकता युग्मन (evaluator preference coupling) को कम करता है, जो मानक बाइनरी फीडबैक विधियों की तुलना में युग्मन गुणांक और वितरण विचलन (distributional divergence) दोनों को महत्वपूर्ण रूप से कम करता है।

Zewen Liu2026-07-01
💬 NLP

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

यह शोध पत्र विज़ुअल सिमेंटिक एंट्रॉपी (VSE) का प्रस्ताव करता है, जो एक नवीन अनिश्चितता अनुमान पद्धति है जो टेक्स्ट क्वेरीज़ को स्थिर रखते हुए केवल इमेज इनपुट्स को बाधित करके विज़ुअल अस्पष्टता को अलग करती है, जिससे मौजूदा एंट्रॉपी-आधारित दृष्टिकोणों की सीमाओं को दूर किया जा सके जो अत्यधिक आत्मविश्वासी विज़ुअल एम्बेडिंग्स द्वारा विकृत या टेक्स्टुअल विविधताओं द्वारा प्रभावित होते हैं।

Ta Duc Huy, Trang Nguyen, Townim Chowdhury, Ankit Yadav, Minh-Son To, Zhibin Liao, Johan W. Verjans, Vu Minh Hieu Phan2026-07-01
💬 NLP

Linguistic Bias Mitigation for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck

यह शोधपत्र एक भाषाई-अपरिवर्तनीय (linguistic-invariant) स्पूफिंग डिटेक्शन फ्रेमवर्क प्रस्तावित करता है जो भाषाई पूर्वाग्रह को कम करने के लिए ग्रेडिएंट रिवर्सल और एक वेरिएशनल इंफॉर्मेशन बॉटलनेक के साथ टीचर-स्टूडेंट एडवर्सरियल लर्निंग दृष्टिकोण को जोड़ता है, जिससे नौ डेटासेट्स में बेसलाइन्स की तुलना में इक्वल एरर रेट (Equal Error Rate) में 36.2% की सापेक्ष कमी प्राप्त होती है।

Anh-Tuan Dao, Driss Matrouf, Mickael Rouvier, Nicholas Evans2026-07-01
💬 NLP

Clinically Structured Rank-Gated LoRA for Cross-Benchmark Medical Question Answering

यह शोध पत्र BiRG-LoRA का प्रस्ताव करता है, जो एक पैरामीटर-कुशल, इनपुट-कंडीशन्ड रैंक-गेटेड LoRA विधि है जो क्लिनिकल प्रायर्स और सिमेंटिक साक्ष्य के आधार पर स्पार्स रैंक एटम्स को गतिशील रूप से चुनती है, और मौजूदा बेसलाइन्स की तुलना में कम प्रशिक्षण योग्य पैरामीटर्स के साथ चार मेडिकल बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करती है।

Yining Huang2026-07-01
🤖 AI

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

यह शोध पत्र CDR-Bench प्रस्तुत करता है, जो संयोजी (compositional), क्रम-संवेदनशील डेटा परिशोधन कार्यों पर LLMs के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल प्रक्रियात्मक विश्वसनीयता की कमी के कारण जटिल, बहु-चरणीय रेसिपीज़ को निष्ठापूर्वक निष्पादित करने में लगातार विफल रहते हैं।

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li2026-07-01
💬 NLP

Team MKC at CLPsych 2026: Capturing and Characterizing Mental Health Changes through Social Media Timeline Dynamics

यह शोध पत्र CLPsych 2026 साझा कार्य (shared task) के लिए टीम MKC के LLM-आधारित पाइपलाइन को प्रस्तुत करता है, जो क्रमिक रूप से व्यवस्थित सोशल मीडिया पोस्ट का विश्लेषण करके पोस्ट-स्तरीय मानसिक स्वास्थ्य मूल्यांकन और उपयोगकर्ता-स्तरीय टेम्पोरल मॉडलिंग को संयुक्त रूप से करने के लिए एक एकीकृत ढांचा प्रदान करता है।

Kyomin Hwang, Hyeonjin Kim, Hyunho Lee, Nojun Kwak2026-07-01
🤖 machine learning

Fork-Think with Confidence

यह शोध पत्र "फोर्क-थिंक विद कॉन्फिडेंस" (Fork-think with confidence) को पेश करता है, जो एक नवीन तर्क प्रतिमान (reasoning paradigm) है जो कई पथों को सैंपल करने से पहले मॉडल के आत्मविश्वास के आधार पर उच्च-मूल्य वाले फोर्किंग बिंदुओं की पहचान करता है, जिससे पारंपरिक समानांतर विचार विधियों की तुलना में प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए टोकन खपत और रनटाइम को काफी कम कर दिया जाता है।

Zena Al-Khalili, Rafi Hakim, Dietrich Klakow, Ji-Ung Lee2026-07-01
💬 NLP

Building an ASR Solution for Training and Assessing Children's Reading

यह शोध पत्र बम्बारा में बच्चों के पठन का आकलन करने के लिए एक ओपन-सोर्स, एंड-टू-एंड सिस्टम प्रस्तुत करता है, जिसमें एक नया सार्वजनिक बेंचमार्क और एक फाइन-ट्यून्ड सोलोनी (Soloni) एएसआर (ASR) मॉडल शामिल है जो क्वार्ट्ज़नेट (QuartzNet) की तुलना में वर्ड एरर रेट (WER) और कैरेक्टर एरर रेट (CER) को काफी कम करता है, साथ ही फील्ड डेटा संग्रह और कक्षा परीक्षणों के माध्यम से समाधान को प्रमाणित करता है।

Yacouba Diarra, Nouhoum Souleymane Coulibaly, Mamadou Dembele, Aymane Dembele, Michael Leventhal2026-07-01
💬 NLP

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

यह शोध पत्र FinPersona-Bench को प्रस्तुत करता है, जो एक सिमुलेशन बेंचमार्क है जो यह प्रकट करता है कि कैसे स्वायत्त वित्तीय एजेंट समय के साथ मैंडेट सेलिएंस डिके (Mandate Salience Decay) से ग्रस्त होते हैं, यह प्रदर्शित करते हुए कि जबकि आवधिक मैंडेट री-ग्राउंडिंग (periodic mandate re-grounding) रूढ़िवादी एजेंटों को स्थिर कर सकती है, यह बाजार की स्थितियों के आधार पर आक्रामक एजेंटों के व्यवहार को अनजाने में बदतर बना सकती है।

Muhammad Usman Safder (Steve), Ayesha Gull (Steve), Rania Elbadry (Steve), Fan Zhang (Steve), Yankai Chen (Steve), Xueqi (…)2026-07-01
💬 NLP

Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition

यह शोध पत्र एक टोन-कंडीशन्ड करिकुलम लर्निंग फ्रेमवर्क प्रस्तुत करता है जो हाइब्रिड डिफिकल्टी स्कोरिंग, टोनल स्टैटिस्टिक्स और स्टेज्ड ट्रेनिंग का लाभ उठाकर छह दक्षिणी बांटू भाषाओं के लिए लो-रिसोर्स स्पीच रिकग्निशन में महत्वपूर्ण सुधार करता है, साथ ही यह भी प्रदर्शित करता है कि इष्टतम मॉडल चयन (W2V-BERT बनाम Whisper) विशिष्ट भाषा परिवार पर निर्भर करता है।

Kesego Mokgosi, Vukosi Marivate, Sitwala Mundia, Unarine Netshifhefhe, Tsholofelo Hope Mogale, Thapelo Sindane2026-07-01