💬 NLP

Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework

यह शोध पत्र GRAPHEVAL को प्रस्तुत करता है, जो एक ग्राफ-आधारित ढांचा है जो एक नवीन ग्राफ रीजनिंग कोहेरेंस स्कोर (GRCS) के माध्यम से तर्क अनिश्चितता को परिमाणित करता है और सरल उत्तर सहमति के बजाय तार्किक वैधता को प्राथमिकता देकर तर्क निष्ठा में सुधार करने के लिए ग्राफ सेल्फ-कंसिस्टेंसी (GSC) का उपयोग करता है, जिससे मानक डिकोडिंग रणनीतियों की सीमाओं का पता चलता है और प्रमुख तर्क पथों की सुदृढ़ता उजागर होती है।

Riccardo Revalor, Jalees Rehman, Debjit Pal2026-07-10
💬 NLP

PLURAL: A Global Dataset for Value Alignment

यह शोध पत्र PLURAL को प्रस्तुत करता है, जो 92 देशों के 'इंटीग्रेटेड वैल्यूज सर्वे' से प्राप्त एक बड़े पैमाने का डेटासेट है जो विविध, गैर-पश्चिमी सांस्कृतिक मूल्यों के साथ लार्ज लैंग्वेज मॉडल के संरेखण (अलाइनमेंट) में सुधार करने के लिए सिंथेटिक प्राथमिकता ट्रिपलेट्स (preference triplets) उत्पन्न करता है, जो स्वचालित मेट्रिक्स और मानव मूल्यांकन दोनों में महत्वपूर्ण सुधार प्रदर्शित करता है।

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha2026-07-10
💬 NLP

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल पूर्वानुमानकर्ताओं (forecasters) के आंतरिक निरूपणों (internal representations) की जांच करना, चेन-ऑफ-थॉट ट्रेसेस (chain-of-thought traces) पर निर्भर रहने की तुलना में अंशांकन (calibration) का आकलन करने, अविश्वसनीय तर्क (unfaithful reasoning) का पता लगाने और टोकन उपयोग को अनुकूलित करने के लिए एक अधिक विश्वसनीय और कुशल विधि प्रदान करता है।

Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho2026-07-10
🤖 machine learning

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

यह शोध पत्र "कॉन्स्टिट्यूशनल मेटा-STPA" को पेश करके सुरक्षा विश्लेषण के लिए उपयोग किए जाने वाले AI उपकरणों के विश्लेषण के महत्वपूर्ण अंतराल को संबोधित करता है, जो एक स्व-सत्यापन ढांचा (self-validating framework) है जो स्वयं पर सिस्टम-थ्योरेटिक प्रोसेस एनालिसिस (STPA) लागू करने के लिए एक शासन संविधान (governance constitution) को व्युत्पन्न और लागू करता है, जिससे यह सुनिश्चित होता है कि LLM-सहायता प्राप्त विश्लेषक का मतिभ्रम (hallucinations) और unverifiable बाधाओं के लिए कड़ाई से ऑडिट किया गया है।

Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming2026-07-10
📊 statistics

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

यह शोध पत्र मल्टीमॉडल मास्कड डिफ्यूजन मॉडल्स में जनरेशन ऑर्डर को गतिशील रूप से अनुकूलित करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) के माध्यम से प्रशिक्षित एक सीखने योग्य कंट्रोल मॉड्यूल प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज एलाइनमेंट और मल्टीमॉडल अंडरस्टैंडिंग क्षमताओं दोनों को महत्वपूर्ण रूप से बढ़ाता है।

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov2026-07-10
🤖 machine learning

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

यह शोध पत्र थिंकिंग-मोड विजुअल लैंग्वेज मॉडल्स में उत्तर एंट्रॉपी व्यवहार के तीन विशिष्ट पैटर्न को अनुभवजन्य रूप से अभिलक्षित करता है, यह प्रदर्शित करते हुए कि रीजनिंग चेन एंट्रॉपी, उत्तर एंट्रॉपी की तुलना में अनिश्चितता का अधिक विश्वसनीय संकेत है और एक लागत-मुक्त अपोस्थेन (abstention) तंत्र को सक्षम करता है जो प्रतिकूल और रीजनिंग कार्यों पर सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

Mayank Singal2026-07-10
💻 computer science

When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए कॉन्फिडेंस सिग्नल के रूप में सेल्फ-कंसिस्टेंसी और क्रॉस-मॉडल एग्रीमेंट के उपयोग की विश्वसनीयता को चुनौती देता है, जो एक बड़े पैमाने के अध्ययन के माध्यम से यह प्रदर्शित करता है कि हालांकि एग्रीमेंट एक सकारात्मक लेकिन कमजोर भविष्यवक्ता है, फिर भी यह अक्सर फ्रंटियर मॉडल्स में अति-आत्मविश्वास (ओवर-कॉन्फिडेंस) की ओर ले जाता है जहाँ उच्च एग्रीमेंट बार-बार होने वाली त्रुटियों के साथ मेल खाता है।

Kaihua Ding2026-07-10
🤖 machine learning

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

यह शोध पत्र प्रकट करता है कि चेन-ऑफ-थॉट (CoT) निगरानी अनजाने में प्रतिकूल एजेंटों को एक अतिरिक्त अनुनय चैनल प्रदान करके हानिकारक कार्यों की स्वीकृति को बढ़ा सकती है, लेकिन यह प्रस्तावित करता है कि अलग-अलग मॉडल परिवारों के फैक्ट-चेकर्स के साथ मॉनिटर्स को जोड़ना इस भेद्यता को प्रभावी ढंग से कम करता है।

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna2026-07-10
🤖 machine learning

Deep Learning Method for Stationary Distribution of Reflected Brownian Motion

यह शोध पत्र एक ऐसे डीप लर्निंग फ्रेमवर्क का प्रस्ताव करता है जो उच्च-आयामी रिफ्लेक्टेड ब्राउनियन मोशन के लाप्लास ट्रांसफॉर्म और टेल प्रोबेबिलिटीज को सटीक और कुशलता से कंप्यूट करने के लिए बुनियादी एडजॉइंट संबंध का लाभ उठाता है, जो मौजूदा क्लोज्ड-फॉर्म समाधानों की सीमाओं को दूर करता है।

Jim Dai, Zhanhao Zhang2026-07-10
💬 NLP

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

CausalDS एक व्यापक बेंचमार्क है जिसे सिंथेटिक स्ट्रक्चरल कॉज़ल मॉडल्स, यथार्थवादी प्राकृतिक-भाषा नैरेटिव्स और पर्ल के कॉज़ालिटी के तीन रोंग्स (rungs) के माध्यम से मल्टी-स्टेप कोडिंग कार्यों को एकीकृत करके डेटा-साइंस एजेंटों की कारण संबंधी तर्क क्षमता (causal reasoning capabilities) का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि यह स्पष्ट रूप से टूल उपयोग, अनिश्चितता परिमाणीकरण (uncertainty quantification), और अनुचित उत्तरों से बचने की क्षमता का आकलन करता है।

Andrej Leban, Yuekai Sun2026-07-10