📊 statistics

Conformal Certification of Reasoning Trace Prefixes

यह शोध पत्र CROP को प्रस्तुत करता है, जो एक कॉन्फॉर्मल कैलिब्रेशन विधि है जो भाषा मॉडलों में वैध तर्क प्रीफिक्स (reasoning prefixes) की लंबाई के लिए सांख्यिकीय गारंटी प्रदान करती है, जिससे सही मध्यवर्ती चरणों को सुरक्षित रूप से बनाए रखने और त्रुटिपूर्ण सफिक्स (suffixes) को मरम्मत के लिए रूट करने में सक्षम बनाया जा सके।

Matt Y. Cheung, Ashok Veeraraghavan, Hanjie Chen, Guha Balakrishnan2026-05-29
💻 computer science

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

DirectorBench एक व्यक्तिगत मल्टी-एजेंट डायग्नोस्टिक बेंचमार्क पेश करता है जो पांच आयामों और कई उपयोगकर्ता प्रोफाइलों के माध्यम से लॉन्ग-फॉर्म वीडियो जनरेशन का मूल्यांकन करता है ताकि विशिष्ट वर्कफ़्लो विफलताओं को स्थानीयकृत किया जा सके और पारंपरिक समग्र स्कोरिंग विधियों की तुलना में मानव निर्णय के साथ अधिक निकटता से संरेखित किया जा सके।

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma2026-05-29
💻 computer science

SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

यह शोध पत्र SEAL को प्रस्तुत करता है, जो एक स्व-सुधारित मूल्यांकन प्रोटोकॉल है जो सीडेड एलिमिनेशन (seeded elimination) और एडेप्टिव चेकलिस्ट (adaptive checklists) के साथ एक LLM-as-a-Meta-Judge का उपयोग करता है ताकि पूर्ण पेयरवाइज जजिंग (pairwise judging) की तुलना में उच्च सटीकता और काफी कम विलंबता (latency) के साथ लेटेंट रैंकिंग सिग्नल्स (latent ranking signals) निकालकर सैचुरेटेड बेंचमार्क्स (saturated benchmarks) को पुनर्जीवित किया जा सके।

Jiamin Chen, Yidi Wu, Qiexiang Wang, Qianben Chen, Yuchen Li, Yansen Zhang, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma2026-05-29
💻 computer science

Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking

यह शोध पत्र HEALTHDIAL को प्रस्तुत करता है, जो एक बड़े पैमाने का बहुभाषी और बहु-समानांतर स्पोकन डायलॉग डेटासेट है जिसमें अरबी, चीनी, अंग्रेजी और स्पेनिश में 6,000 WHO-आधारित सूचना-खोजने वाली बातचीत शामिल हैं, जिसे रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम के विकास और मूल्यांकन में सहायता करने के लिए डिज़ाइन किया गया है और साथ ही विभिन्न भाषाओं के बीच मौजूदा प्रदर्शन असमानताओं को उजागर किया गया है।

Songbo Hu, Yinhong Liu, Ej Zhou, Evgeniia Razumovskaia, Xiaobin Wang, Alexander Fraser, Ivan Vulić, Anna Korhonen2026-05-29
💻 computer science

CCS: Clinical Consensus Selection for Radiology Report Generation

यह शोध पत्र क्लिनिकल कंसेंसस सिलेक्शन (CCS) का प्रस्ताव करता है, जो एक डिकोडर-अज्ञेयवादी इन्फरेंस-टाइम फ्रेमवर्क है जो कई उम्मीदवारों को सैंपल करके और उच्चतम क्लिनिकल कंसेंसस वाले का चयन करके रेडियोलॉजी रिपोर्ट जनरेशन में सुधार करता है, जो मानक सिंगल-पाथ डिकोडिंग और जेनेरिक बेस्ट-ऑफ-एन बेसलाइन्स से बेहतर प्रदर्शन करने के लिए एक नवीन इमेज-ग्राउंडेड यूटिलिटी मेट्रिक का लाभ उठाता है।

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho2026-05-29
🤖 AI

Do Proactive Agents Really Need an LLM to Decide When to Wake and What to Anchor?

यह शोध पत्र एलएलएम-आधारित निर्णय लेने के लिए संरचित उपयोगकर्ता गतिविधि घटनाओं को टेक्स्ट में बदलने की अक्षम प्रथा को एक हल्के, ऑन-डिवाइस टेम्पोरल-ग्राफ-लर्निंग मॉडल से बदलने का प्रस्ताव देता है जो प्रोएक्टिव एजेंटों को ट्रिगर करने के लिए सीधे ग्राफ अपडेट को प्रोसेस करता है, जिससे काफी अधिक सटीकता, तेज़ इन्फरेंस गति और छोटा मेमोरी फुटप्रिंट प्राप्त होता है।

Xiaoze Liu, Ruowang Zhang, Amir H. Abdi, Michel Galley, Zhikai Chen, Siheng Xiong, Xiaoqian Wang, Jing Gao2026-05-29
🤖 machine learning

Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection

यह शोध पत्र यह प्रदर्शित करता है कि LoRA एडेप्टर को डेटा पॉइजनिंग के माध्यम से प्रभावी ढंग से बैकडोर किया जा सकता है ताकि टोकन-स्तरीय सामान्यीकरण हमलों (token-level generalization attacks) को बनाया जा सके जो संरचनात्मक पहचान से बच सकें, जबकि आपूर्ति श्रृंखलाओं में ऐसे समझौता किए गए एडेप्टर की पहचान करने के लिए मजबूत व्यवहारिक और भार-स्तरीय (weight-level) पहचान विधियों का प्रस्ताव करता है।

Travis Lelle2026-05-29
🤖 AI

Do Language Models Track Entities Across State Changes?

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल क्रमिक परिचालनों के माध्यम से इकाई अवस्थाओं (entity states) को वृद्धिशील रूप से ट्रैक करने में विफल रहते हैं, बल्कि इसके बजाय एक गैर-क्रमिक रणनीति पर निर्भर करते हैं जो क्वेरी टोकन पर सूचना को एकत्रित करती है और निष्कासनों के लिए एक नाजुक वैश्विक दमन तंत्र (global suppression mechanism) का उपयोग करती है, जिससे पूर्वानुमानित विफलता मोड उत्पन्न होते जिन्हें यांत्रिक हस्तक्षेप (mechanistic intervention) के माध्यम से आंशिक रूप से कम किया जा सकता है।

Zilu Tang, Qiao Zhao, Gabriel Franco, Derry Wijaya, Aaron Mueller, Sebastian Schuster, Najoung Kim2026-05-29
💻 computer science

CommunityFact: A Dynamic, Multilingual, Multi-domain Benchmark for Misinformation Detection in the Wild

यह शोध पत्र कम्युनिटीफैक्ट (CommunityFact) को पेश करता है, जो गलत सूचना का पता लगाने के लिए एक गतिशील, बहुभाषी और बहु-विषयक बेंचमार्क है जो वास्तविक दुनिया के परिवेश में एलएलएम (LLMs) का मूल्यांकन करता है, यह प्रकट करते हुए कि जबकि वेब एक्सेस प्रदर्शन में महत्वपूर्ण सुधार करता है, वर्तमान मॉडल मानव रेटर्स की तुलना में मिसअलाइन्ड (misaligned) स्रोत-चयन नीतियों को प्रदर्शित करते हैं और भविष्य की सत्यापन प्रणालियों के लिए एक संभावित प्रशिक्षण संकेत के रूप में कम्युनिटी नोट्स (Community Notes) को रेखांकित करता है।

Sahajpreet Singh, Insyirah Mujtahid, Min-Yen Kan, Kokil Jaidka2026-05-29
💻 computer science

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

यह शोध पत्र PPC (Preplan-Plan-CoT) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो योजना बनाने से पहले समस्या के प्रकारों और उपकरणों को स्पष्ट करने के लिए एक स्पष्ट "प्रीप्लान" (preplan) चरण पेश करता है, जो बिना किसी इन्फरेंस ओवरहेड के कई बेंचमार्क पर LLM गणितीय तर्क प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Shaojie Wang, Liang Zhang2026-05-29