💬 NLP

Detecting Differences Is Not Understanding Structure: Large Language Models Fail at Graph Isomorphism

यह शोध पत्र प्रकट करता है कि ग्राफ आइसोमोर्फिज्म (graph isomorphism) का पता लगाने में लार्ज लैंग्वेज मॉडल्स की स्पष्ट सफलता भ्रामक है, क्योंकि वे नोड लेबल के क्रम परिवर्तन वाले समान ग्राफों को पहचानने में विफल रहते हैं, जो यह दर्शाता है कि वे वास्तविक संरचनात्मक तर्क के बजाय सतही पैटर्न पर निर्भर करते हैं।

Kumar Thushalika, Sukumar Kishanthan, Asela Hevapathige2026-06-09
💬 NLP

Self-Harness: Harnesses That Improve Themselves

यह शोध पत्र Self-Harness को प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जहाँ LLM-आधारित एजेंट मानवीय हस्तक्षेप के बिना प्रदर्शन में उल्लेखनीय सुधार करने के लिए पुनरावृत्ति के माध्यम से अपने स्वयं के विफलता पैटर्न की पहचान करते हैं और स्वायत्त रूप से मॉडल-विशिष्ट हारनेस संशोधनों को उत्पन्न, मान्य और कार्यान्वित करते हैं।

Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu2026-06-09
💬 NLP

Emergence of Context Characteristics Sensitivity in Large Language Models

यह शोध पत्र इस बात की जांच करता है कि कैसे सुपरवाइज्ड फाइन-ट्यूनिंग, डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन और रीइन्फोर्समेंट लर्निंग चरणों के माध्यम से संदर्भ विशेषताओं (context characteristics) के प्रति बड़े भाषा मॉडलों की संवेदनशीलता विकसित होती है, जो यह प्रकट करता है कि ये प्राथमिकताएं प्रत्येक चरण में सक्रिय रूप से पुनर्गठित की जाती हैं और मजबूत संदर्भ उपयोग के लिए संतुलित निर्देश फाइन-ट्यूनिंग डेटासेट के महत्वपूर्ण महत्व को रेखांकित करती हैं।

Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein2026-06-09
💬 NLP

Code Is More Than Text: Uncertainty Estimation for Code Generation

यह शोध पत्र कोड जनरेशन के लिए एक नवीन तीन-अक्षीय अनिश्चितता अनुमान ढांचा प्रस्तावित करता है जो टोकन नाजुकता (token fragility), इरादा-कोड अंतराल (intent-code gaps) और निष्पादन क्षमता (executability) जैसे कोड-विशिष्ट गुणों का लाभ उठाता है ताकि अविश्वसनीय आउटपुट का पता लगाने में प्राकृतिक भाषा-व्युत्पन्न बेसलाइन से काफी बेहतर प्रदर्शन किया जा सके।

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu2026-06-09
🤖 AI

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

यह शोधपत्र TABVERSE को प्रस्तुत करता है, जो एक नियंत्रित मल्टीमॉडल बेंचमार्क है जो मॉडल प्रदर्शन पर तालिका प्रतिनिधित्व प्रारूपों (जैसे कि HTML, Markdown, LaTeX और चित्र) के प्रभाव को अलग करता है, जिससे यह पता चलता है कि संरचित टेक्स्ट आमतौर पर चित्रों से बेहतर प्रदर्शन करता है लेकिन प्रतिनिधित्व का चयन विभिन्न कार्यों और मॉडलों में परिणामों को महत्वपूर्ण रूप से प्रभावित करता है।

Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov2026-06-09
💬 NLP

Clinically Grounded Privacy Evaluation of Medical LMs

यह शोध पत्र चिकित्सा भाषा मॉडल की गोपनीयता का मूल्यांकन करने के लिए एक नैदानिक रूप से आधारित ढांचा प्रस्तुत करता है जो यथार्थवादी खतरा मॉडलों के तहत वर्बेटिम (शब्दशः) स्मृतिधारण और संवेदनशील निदान रिसाव के महत्वपूर्ण जोखिमों को प्रकट करता है, जबकि यह भी प्रदर्शित करता है कि टेम्पलेटेड दस्तावेज़ीकरण सटीक-मिलान प्रकटीकरण के अति-अनुमान का कारण बन सकता है।

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghas (…)2026-06-09
💬 NLP

Automated IEP Generation from Traditional Chinese Parent-Teacher Interviews via Corpus-Grounded Feature Diffusion

यह शोध पत्र एक गोपनीयता-संरक्षण करने वाले, कम-संसाधन वाले पाइपलाइन का प्रस्ताव करता है जो स्वचालित पारंपरिक चीनी व्यक्तिगत शिक्षा कार्यक्रम (IEP) निर्माण के लिए कॉर्पस-ग्राउंडेड फीचर डिफ्यूजन का लाभ उठाते हुए एक स्थानीय ब्रीज़-7B मॉडल को फाइन-ट्यून करता है, जो ज़ीरो-शॉट ग्लोबल बेसलाइन्स की तुलना में बेहतर प्रदर्शन और कम विलंबता प्राप्त करता है और विशेष रूप से यह पाता है कि इस विशिष्ट भाषाई संदर्भ में स्कीमा-प्रतिबंधित डिकोडिंग प्रतिकूल है।

Kuanlin Chen, Cheng-En Ou2026-06-09
💬 NLP

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

यह शोध पत्र AGENTSERVESIM को प्रस्तुत करता है, जो एक हार्डवेयर-जागरूक सिम्युलेटर है जो मल्टी-टर्न LLM एजेंट सर्विंग डायनेमिक्स—जिसमें प्रोग्राम ऑर्केस्ट्रेशन, टूल-प्रेरित अंतराल (tool-induced gaps), और KV-कैश रेजिडेंसी शामिल है—को सटीक रूप से मॉडल करता है ताकि व्यापक वास्तविक-सिस्टम डिप्लॉयमेंट की आवश्यकता के बिना कमोडिटी CPUs पर सर्विंग नीतियों के स्केलेबल और लागत प्रभावी मूल्यांकन को सक्षम किया जा सके।

Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou2026-06-09
💬 NLP

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

यह शोध पत्र स्वायत्त ड्राइविंग (ऑटोनॉमस ड्राइविंग) के लिए एक नया बेंचमार्क प्रस्तुत करता है जो मल्टी-व्यू मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की किसी उत्तर का समर्थन करने वाले विशिष्ट कैमरा व्यू को सही ढंग से पहचानने की क्षमता का मूल्यांकन करता है, जिससे उन ग्राउंडिंग विफलताओं को उजागर किया जा सके जिन्हें पारंपरिक केवल-उत्तर वाले मूल्यांकन छोड़ देते हैं।

Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki2026-06-09
💬 NLP

End-to-End Context Compression at Scale

यह शोधपत्र लेटेंट कॉन्टेक्स्ट लैंग्वेज मॉडल्स (LCLMs) को प्रस्तुत करता है, जो विशाल डेटासेट पर प्रशिक्षित एनकोडर-डिकोडर कंप्रेसर का एक परिवार है, जो मॉडल की उच्च गुणवत्ता बनाए रखते हुए मेमोरी उपयोग और संपीड़न समय को कम करके लॉन्ग-कॉन्टेक्स्ट इन्फरेंस के लिए सटीकता-दक्षता सीमा (accuracy-efficiency frontier) में महत्वपूर्ण सुधार करता है।

Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya (…)2026-06-09