💬 NLP

Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation

यह शोधपत्र TreeTracer को प्रस्तुत करता है, जो एक विज़ुअल एनालिटिक्स टूल है जो हिस्टेरिकैलिटी (hierarchical) संकी (Sankey) आरेखों में स्टोकेस्टिक LLM जनरेशन को एकत्रित करता है ताकि उन छिपे हुए प्रतिनिधित्व संबंधी और वाक्यात्मक पूर्वाग्रहों—जैसे कि सर्वनाम दमन (pronoun suppression) और संवादात्मक हाशिए पर डालना (conversational marginalization)—को उजागर किया जा सके, जिन्हें अक्सर मानक एकल-आउटपुट ऑडिटिंग विधियों द्वारा अनदेखा कर दिया जाता है।

Matteo Pelossi, Rita Sevastjanova, Thilo Spinner, Mennatallah El-Assady2026-06-19
💬 NLP

Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में क्रॉस-लिंगुअल ट्रांसफर मुख्य रूप से टास्क-फॉर्मेट अलाइनमेंट द्वारा संचालित होता है न कि भाषाई संबद्धता द्वारा, क्योंकि मॉडल अपने बेसलाइन प्रदर्शन या चेन-ऑफ-थॉट रीजनिंग के उपयोग की परवाह किए बिना भाषा परिवारों में समान सुधार प्रदर्शित करते हैं।

Ahmed Haj Ahmed, Ruochen Zhang, Alvin Grissom II2026-06-19
💬 NLP

How LLMs Fail and Generalize in RTL Coding for Hardware Design?

यह शोध पत्र एक संज्ञानात्मक सिद्धांत-आधारित त्रुटि वर्गीकरण प्रस्तुत करता है जो यह प्रदर्शित करता है कि हार्डवेयर डिज़ाइन में एलएलएम (LLMs) RTL कोडिंग कार्यों पर एक सख्त प्रदर्शन सीमा का सामना करते हैं, जहाँ संरेखण तकनीकें केवल सिंटैक्स में सुधार करती हैं जबकि गहरे कार्यात्मक दोष प्रीट्रेनिंग ज्ञान द्वारा सीमित रहते हैं और टेस्ट-टाइम स्केलिंग द्वारा भी हल नहीं किए जा सकते।

Guan-Ting Liu, Chao-Han Huck Yang, Chenhui Deng, Zhongzhi Yu, Brucek Khailany, Yu-Chiang Frank Wang2026-06-19
💬 NLP

Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

यह शोध पत्र कॉज़ल एट्रिब्यूशन प्रूनिंग (CAP) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो सरल परिमाण या सक्रियण मेट्रिक्स के बजाय अटेंशन हेड्स के कॉज़ल प्रभाव के आधार पर वेट्स की पहचान और प्रूनिंग करके मध्यम स्पर्सिटी स्तरों पर लार्ज लैंग्वेज मॉडल के रीजनिंग प्रदर्शन को बनाए रखती है।

Amogh Sheth, Biruk Assefa, Yi Wen Huang, Andrew Lin, Yuhao Ge2026-06-19
💬 NLP

Detecting Hallucinations for Large Language Model-based Knowledge Graph Reasoning

यह शोध पत्र LUCID को प्रस्तुत करता है, जो लार्ज लैंग्वेज मॉडल-आधारित नॉलेज ग्राफ रीजनिंग के लिए एक नवीन हैलुसिनेशन डिटेक्शन विधि है, जो ग्राफ न्यूरल नेटवर्क के माध्यम से LLM अटेंशन स्कोर, सिमेंटिक समानता और स्ट्रक्चरल ग्राफ सूचना का संयुक्त रूप से लाभ उठाकर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xinyan Zhu, Yaoqi Liu, Yue Gao, Huadong Ma, Cheng Yang, Chuan Shi2026-06-19
💬 NLP

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

यह शोध पत्र तर्क देता है कि मोबाइल एजेंटों को ग्राफिकल यूजर इंटरफेस (GUI) के साथ कमांड-लाइन इंटरफेस (CLI) का लाभ उठाना चाहिए, जो व्यापक बेंचमार्क के माध्यम से यह प्रदर्शित करता है कि CLI-आधारित एजेंट मानक और रोजमर्रा के कार्यों में दक्षता और सफलता दर के मामले में GUI बेसलाइन से काफी बेहतर प्रदर्शन करते हैं, साथ ही भविष्य के सुधारों के लिए पर्याप्त अप्रयुक्त क्षमता को भी उजागर करते हैं।

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang2026-06-19
🤖 machine learning

Thermodynamic Signatures of Reasoning: Free-Energy and Spectral-Form-Factor Diagnostics for Hallucination Detection in Large Language Models

यह शोध पत्र फ्री-एनर्जी सिग्नेचर (Fes) को प्रस्तुत करता है, जो एक नवीन स्पेक्ट्रल डिस्क्रिप्टर है जो अटेंशन-व्युत्पन्न ग्राफ लैपलेसियन्स को हैमिल्टोनियन्स के रूप में मानता है ताकि थर्मोडायनामिक और रैंडम-मैट्रिक्स-थ्योरी मेट्रिक्स निकाले जा सकें, जिससे एक ट्रेनिंग-मुक्त हैलुसिनेशन डिटेक्टर सक्षम होता है जो मौजूदा स्पेक्ट्रल बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है और यह भी प्रकट करता है कि हैलुसिनेशन, सही तर्क के विग्नर-डायसन पैटर्न से भिन्न, पॉइसन-जैसे स्पेक्ट्रल सांख्यिकी प्रदर्शित करते हैं।

Salim Khazem2026-06-19
💬 NLP

Characterizing Narrative Content in Web-scale LLM Pretraining Data

यह शोध पत्र एक नवीन ढांचे और डेटासेट, NarraDolma को प्रस्तुत करता है, जो वेब-स्केल एलएलएम (LLM) प्रीट्रेनिंग डेटा की सूक्ष्म-स्तरीय नैरेटिव संरचना को स्पष्ट करता है, यह प्रकट करते हुए कि नैरेटिव गुण मापने योग्य रूप से मौजूद हैं लेकिन वर्तमान क्यूरेशन प्रथाओं द्वारा अनदेखा किए जाने वाले तरीकों से स्रोतों और विषयों में असमान रूप से वितरित हैं।

Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak2026-06-19
🤖 AI

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

यह शोध पत्र DeXposure-Claw को प्रस्तुत करता है, जो एक एजेंटिक सिस्टम है जो ऑडिट योग्य, नियामक-अनुरूप DeFi जोखिम पर्यवेक्षण टिकट उत्पन्न करने के लिए एक ग्राफ टाइम-सीरीज फाउंडेशन मॉडल को नियत मॉनिटर्स और कॉन्फिडेंस गेट्स के साथ एकीकृत करता है, जबकि DeXposure-Bench मूल्यांकन ढांचे के माध्यम से झूली सूचनाओं (फॉल्स अलार्म) को न्यूनतम करता है।

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He2026-06-19
💬 NLP

Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

यह शोध पत्र अब तक के LLM-as-a-Judge मॉडलों के सबसे बड़े व्यवस्थित मूल्यांकन को प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ ये जज उच्च विश्वसनीयता प्रदर्शित करते हैं, वहीं वे महत्वपूर्ण वैधता संबंधी समस्याओं से ग्रस्त हैं जिनमें सार्वभौमिक संयोग-अतिरंजित सहमति (universal chance-overstated agreement), बेंचमार्क-निर्भर रैंकिंग अस्थिरता, और निरंतरता एवं गंभीर स्थिति पूर्वाग्रह (position bias) का विरोधाभासी सह-अस्तित्व शामिल है, जो अंततः एक प्रस्तावित न्यूनतम व्यवहार्य सत्यापन प्रोटोकॉल (Minimum Viable Validation Protocol) की ओर ले जाता है।

Justin D. Norman, Michael U. Rivera, D. Alex Hughes2026-06-19