💬 NLP

Validating LLMs in social science: Epistemic threats and emerging norms

यह शोध पत्र बड़े भाषा मॉडल (LLMs) को मापन उपकरणों के रूप में उपयोग करते हुए सामाजिक विज्ञान अनुसंधान में सत्यापन प्रथाओं का व्यवस्थित रूप से विश्लेषण करता है, जो यह प्रकट करता है कि जबकि LLM-जनित डेटा अनुभवजन्य विश्लेषणों के लिए केंद्रीय है, वर्तमान सत्यापन विधियाँ असंगत और सीमित हैं, जिससे लेखक अधिक सुदृढ़ सत्यापन के लिए उभरते मानदंडों और रणनीतियों का प्रस्ताव करते हैं।

Meera Desai, Dallas Card, Abigail Z. Jacobs2026-07-10
💬 NLP

fog: Expressing Motion and Emotion through Function Composition of AI-Generated Code

यह शोध पत्र "fog" प्रस्तुत करता है, जो एक फंक्शन कंपोजिशन फ्रेमवर्क है जो AI-जनित कोड और एक इंटरैक्टिव एनिमेशन एडिटर का लाभ उठाता है ताकि उपयोगकर्ताओं को अभिव्यंजक, हाइडर-सिमेल-शैली की गति और भावना बनाने में सक्षम बनाया जा सके, जिसे धारणा संबंधी अध्ययनों के माध्यम से मान्य किया गया है जिन्होंने 68% अर्थपूर्ण पहचान सटीकता और बेहतर उपयोगकर्ता नियंत्रण प्रदर्शित किया।

Vivian Liu, Lydia Chilton2026-07-10
💬 NLP

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

यह शोध पत्र कई आयामों में मानव रेटर्स के साथ जेमिनी 2.5 फ्लैश (Gemini 2.5 Flash) की मजबूत सहमति प्रदर्शित करके फुल-डुप्लेक्स वॉयस एजेंटों के लिए एक ऑडियो जज के रूप में इसकी विश्वसनीयता को अनुभवजन्य रूप से मान्य करता है, जो इसे एक प्रतिस्थापन या पूरक रेटर के रूप में तैनाती के लिए एक लागत प्रभावी आधार स्थापित करता है और साथ ही यह चेतावनी देता है कि जेमिनी परिवार के भीतर मॉडल का प्रदर्शन भिन्न होता है और इसके लिए विशिष्ट पुन: सत्यापन की आवश्यकता होती है।

A. Sayyad, J. Emmons, S. Jones, T. Lin, H. Krishnan2026-07-10
💬 NLP

From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs

यह शोध पत्र LLMs में शैक्षिक नियंत्रण का मूल्यांकन करने के लिए एक ब्लूम-संरेखित (Bloom-aligned) ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि Qwen3-Next जैसे मॉडल प्रोग्रामिंग कार्यों की संज्ञानात्मक मांग (cognitive demand) को विश्वसनीय रूप से बढ़ाने में सक्षम हैं, वे इसे कम करने में संघर्ष करते हैं, जो यह दर्शाता है कि मजबूत निष्पादन प्रदर्शन विशिष्ट शिक्षण उद्देश्यों के लिए कार्यों को अनुकूलित करने की क्षमता की गारंटी नहीं देता है।

Yi Zhang, Julia Rayz2026-07-10
💬 NLP

Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework

यह शोध पत्र GRAPHEVAL को प्रस्तुत करता है, जो एक ग्राफ-आधारित ढांचा है जो एक नवीन ग्राफ रीजनिंग कोहेरेंस स्कोर (GRCS) के माध्यम से तर्क अनिश्चितता को परिमाणित करता है और सरल उत्तर सहमति के बजाय तार्किक वैधता को प्राथमिकता देकर तर्क निष्ठा में सुधार करने के लिए ग्राफ सेल्फ-कंसिस्टेंसी (GSC) का उपयोग करता है, जिससे मानक डिकोडिंग रणनीतियों की सीमाओं का पता चलता है और प्रमुख तर्क पथों की सुदृढ़ता उजागर होती है।

Riccardo Revalor, Jalees Rehman, Debjit Pal2026-07-10
💬 NLP

PLURAL: A Global Dataset for Value Alignment

यह शोध पत्र PLURAL को प्रस्तुत करता है, जो 92 देशों के 'इंटीग्रेटेड वैल्यूज सर्वे' से प्राप्त एक बड़े पैमाने का डेटासेट है जो विविध, गैर-पश्चिमी सांस्कृतिक मूल्यों के साथ लार्ज लैंग्वेज मॉडल के संरेखण (अलाइनमेंट) में सुधार करने के लिए सिंथेटिक प्राथमिकता ट्रिपलेट्स (preference triplets) उत्पन्न करता है, जो स्वचालित मेट्रिक्स और मानव मूल्यांकन दोनों में महत्वपूर्ण सुधार प्रदर्शित करता है।

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha2026-07-10
💬 NLP

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल पूर्वानुमानकर्ताओं (forecasters) के आंतरिक निरूपणों (internal representations) की जांच करना, चेन-ऑफ-थॉट ट्रेसेस (chain-of-thought traces) पर निर्भर रहने की तुलना में अंशांकन (calibration) का आकलन करने, अविश्वसनीय तर्क (unfaithful reasoning) का पता लगाने और टोकन उपयोग को अनुकूलित करने के लिए एक अधिक विश्वसनीय और कुशल विधि प्रदान करता है।

Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho2026-07-10
💬 NLP

Holographic Neural PCFG for Unsupervised Parsing

यह शोध पत्र होलोग्राफिक न्यूरल PCFG (Hol-PCFG) को प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड पार्सिंग मॉडल है जो स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए ब्लैक-बॉक्स न्यूरल नेटवर्क को टॉरस-प्रतिबंधित एम्बेडिंग्स पर व्याख्यात्मक, बीजगणितीय संबंध मॉडलिंग से प्रतिस्थापित करता है, जिसमें नियम-स्कोरिंग मापदंडों में 99.94% की कमी और जापानी भाषा को सीधे वर्णों से पार्स करने की क्षमता है।

Ryosuke Yamaki, Daichi Mochihashi, Nobutaka Shimada, Tadahiro Taniguchi2026-07-10
💬 NLP

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

CausalDS एक व्यापक बेंचमार्क है जिसे सिंथेटिक स्ट्रक्चरल कॉज़ल मॉडल्स, यथार्थवादी प्राकृतिक-भाषा नैरेटिव्स और पर्ल के कॉज़ालिटी के तीन रोंग्स (rungs) के माध्यम से मल्टी-स्टेप कोडिंग कार्यों को एकीकृत करके डेटा-साइंस एजेंटों की कारण संबंधी तर्क क्षमता (causal reasoning capabilities) का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि यह स्पष्ट रूप से टूल उपयोग, अनिश्चितता परिमाणीकरण (uncertainty quantification), और अनुचित उत्तरों से बचने की क्षमता का आकलन करता है।

Andrej Leban, Yuekai Sun2026-07-10
💬 NLP

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

ICDAR 2026 में HIPE-OCRepair-2026 प्रतियोगिता ने बहुभाषी ऐतिहासिक दस्तावेजों के लिए LLM-सहायता प्राप्त OCR पोस्ट-करेक्शन की प्रभावशीलता का मूल्यांकन किया, जिससे यह पता चला कि जबकि आधुनिक प्रणालियाँ पाठ की गुणवत्ता में महत्वपूर्ण सुधार करती हैं, वे कम-शोर वाले इनपुट पर ओवर-करेक्शन (अति-सुधार) की चुनौतियों का सामना करती हैं और उन्हें ऐसे मूल्यांकन ढांचों की आवश्यकता है जो सख्त राजनयिक सटीकता के बजाय पुनर्प्राप्ति उपयोगिता (रिट्रीवल यूटिलिटी) को प्राथमिकता देते हैं।

Maud Ehrmann, Emanuela Boros, Juri Opitz, Andrianos Michail, Florian Wagner, Simon Clematide2026-07-10