💬 NLP

G2G^2-Reader: Dual Evolving Graphs for Multimodal Document QA

G2G^2-Reader एक ड्यूल-ग्राफ सिस्टम पेश करके मल्टीमॉडल लॉन्ग-डॉक्यूमेंट QA में रिट्रीवल-ऑगमेंटेड जनरेशन की भंगुरता को संबोधित करता है, जो मूल दस्तावेज़ संरचना को संरक्षित करने के लिए एक कंटेंट ग्राफ को विकसित करता है और पुनरावृत्ति साक्ष्य संग्रह को निर्देशित करने के लिए एक प्लानिंग ग्राफ को विकसित करता है, जिससे VisDoMBench पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng (…)2026-01-30
💬 NLP

GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization

यह शोध पत्र GeoNorm को प्रस्तुत करता है, जो एक नवीन सामान्यीकरण (normalization) विधि है जो लेयर आउटपुट्स को लेयर-वार क्षय (layer-wise decay) वाले मैनिफोल्ड पर जियोडेसिक अपडेट के रूप में व्याख्या करके Pre-Norm और Post-Norm दृष्टिकोणों को एकीकृत करती है, जिससे नगण्य कम्प्यूटेशनल ओवरहेड के साथ ट्रांसफॉर्मर मॉडल में निरंतर प्रदर्शन सुधार प्राप्त होता है।

Chuanyang Zheng, Jiankai Sun, Yihang Gao, Chi Wang, Yuehao Wang, Jing Xiong, Liliang Ren, Bo Peng, Qingmei Wang, Xiaoran (…)2026-01-30
💬 NLP

The crime of being poor

यह शोध पत्र आठ अंग्रेजी भाषी देशों में गरीबी को अपराध के साथ गलत तरीके से जोड़ने वाले सामाजिक पूर्वाग्रह को मापने और विश्लेषण करने के लिए ट्विटर डेटा पर नेचुरल लैंग्वेज प्रोसेसिंग का उपयोग करता है, जो यह प्रकट करता है कि यह धारणा वास्तविक अपराध दर के बजाय सांस्कृतिक कारकों द्वारा संचालित है और यह सुझाव देता है कि प्रभावी गरीबी उन्मूलन नीति के लिए इस सामूहिक पूर्वाग्रह को संबोधित करना आवश्यक है।

Georgina Curto, Svetlana Kiritchenko, Isar Nejadgholi, Kathleen C. Fraser2026-01-29
💬 NLP

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

यह शोधपत्र CTC-DRO प्रस्तुत करता है, जो एक सुदृढ़ अनुकूलन विधि है जो बहुभाषी वाक् पहचान में भाषाई विषमताओं को प्रभावी ढंग से कम करने के लिए इनपुट लेंथ-मैच्ड बैचिंग के साथ स्मूथ्ड ग्रुप वेट अपडेट्स को जोड़ती है, जो ML-SUPERB 2.0 बेंचमार्क पर मानक ग्रुप DRO और बेसलाइन मॉडलों की तुलना में काफी बेहतर प्रदर्शन करती है।

Martijn Bartelds, Ananjan Nandi, Moussa Koulako Bala Doumbouya, Dan Jurafsky, Tatsunori Hashimoto, Karen Livescu2026-01-29
💬 NLP

Reducing Hallucinations in Language Model-based SPARQL Query Generation Using Post-Generation Memory Retrieval

यह शोध पत्र PGMR का प्रस्ताव करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो बड़े भाषा मॉडलों (LLMs) द्वारा प्राकृतिक भाषा प्लेसहोल्डर्स के साथ मध्यवर्ती क्वेरीज़ उत्पन्न कराने और तत्पश्चात उन्हें एक सुदृढ़, गैर-पैरामीट्रिक मेमोरी रिट्रीवल मॉड्यूल द्वारा हल करने के माध्यम से SPARQL क्वेरी जनरेशन में मतिभ्रम (hallucinations) को कम करता है, जिससे विभिन्न डेटासेट्स और वितरण बदलावों (distribution shifts) में क्वेरी की शुद्धता और सुरक्षा में उल्लेखनीय सुधार होता है।

Aditya Sharma, Christopher J. Pal, Amal Zouaq2026-01-29
💬 NLP

Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers

यह शोध पत्र UQLM को प्रस्तुत करता है, जो एक बहुमुखी पायथन टूलकिट और ट्यूनेबल एन्सेम्बल फ्रेमवर्क है जो बड़े भाषा मॉडलों (LLMs) में मतिभ्रम (hallucinations) का पता लगाने के लिए मानकीकृत कॉन्फिडेंस स्कोर प्रदान करने हेतु ब्लैक-बॉक्स, व्हाइट-बॉक्स और LLM-as-a-Judge अनिश्चितता मात्रा निर्धारण तकनीकों को एकीकृत करता है, जो विभिन्न बेंचमार्क पर मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Dylan Bouchard, Mohit Singh Chauhan2026-01-29
💬 NLP

Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies

यह शोध पत्र इशिहारा टेस्ट का उपयोग करके लार्ज-स्केल विजन-लैंग्वेज मॉडल्स (LVLMs) का मूल्यांकन करता है और पाता है कि, रंग दृष्टि दोषों के बारे में तथ्यात्मक ज्ञान रखने के बावजूद, ये मॉडल प्रभावित व्यक्तियों के परिवर्तित संवेदी अनुभवों का अनुकरण करने में विफल रहते हैं, बल्कि सामान्य रंग धारणा पर ही निर्भर रहते हैं, जो समावेशी सुलभता का समर्थन करने की उनकी क्षमता में एक महत्वपूर्ण अंतर को रेखांकित करता है।

Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe2026-01-29
💬 NLP

Multimodal Conversation Structure Understanding

यह शोध पत्र TV-MMPC डेटासेट और संवादात्मक संरचना की समझ पर मल्टीमॉडल LLMs का मूल्यांकन करने के लिए कार्यों के एक समूह को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि मॉडल ह्यूरिस्टिक्स (heuristics) से बेहतर प्रदर्शन करते हैं, वे गुमनाम पहचानों के साथ संघर्ष करते हैं, साथ ही TVQA का एक समाजशास्त्रीय भाषाई विश्लेषण यह दर्शाता है कि महिला पात्रों को असमान रूप से एड्रेसियों (addressees) या सह-प्रतिभागियों के रूप में कास्ट किया जाता है, जिससे संवादात्मक रजिस्टर सामाजिक संपर्क की ओर स्थानांतरित हो जाता है।

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman2026-01-29
💬 NLP

In-context Language Learning for Endangered Languages in Speech Recognition

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल इन-कॉन्टेक्स्ट लर्निंग के माध्यम से स्पीच रिकग्निशन के लिए अनदेखी लुप्तप्राय भाषाओं को प्रभावी ढंग से सीख सकते हैं, जहाँ प्रासंगिक टेक्स्ट नमूनों वाले संभाव्यता-आधारित तरीके पारंपरिक निर्देश-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करते हैं और मूल क्षमताओं से समझौता किए बिना समर्पित मॉडलों के तुलनीय प्रदर्शन प्राप्त करते हैं।

Zhaolin Li, Jan Niehues2026-01-29