💬 NLP

Probabilistic Programs of Thought

यह शोध पत्र "प्रोबेबिलिस्टिक प्रोग्राम्स ऑफ थॉट" (Probabilistic Programs of Thought) प्रस्तुत करता है, जो एक टेस्ट-टाइम फ्रेमवर्क है जो एकल एलएलएम जनरेशन से अगले-टोकन की संभावनाओं (next-token probabilities) का लाभ उठाकर घातांकीय रूप से कई नियतात्मक परिणामों (deterministic outcomes) का प्रतिनिधित्व करने वाले संक्षिप्त संभाव्य कार्यक्रमों का निर्माण करता है, जिससे अतिरिक्त जीपीयू कंप्यूट के बिना कोड और रीजनिंग कार्यों के लिए विविध समाधानों का कुशल सैंपलिंग सक्षम होता है।

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck2026-04-21
💬 NLP

Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

यह शोध पत्र UA-Bench प्रस्तुत करता है, जो डेटा और मॉडल अनिश्चितता के बीच अंतर करने की लार्ज लैंग्वेज मॉडल्स (LLMs) की क्षमता का मूल्यांकन करने के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल इस भेदभाव में संघर्ष करते हैं और यह प्रदर्शित करता है कि एक प्रस्तावित हल्का डेटा संश्लेषण और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) रणनीति उत्तर की सटीकता को बनाए रखते हुए अनिश्चितता एट्रिब्यूशन में प्रभावी रूप से सुधार कर सकती है।

Jingyi Ren, Ante Wang, Yunghwei Lai, Xiaolong Wang, Linlu Gong, Weitao Li, Weizhi Ma, Yang Liu2026-04-21
💬 NLP

CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

यह शोध पत्र CRISP को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो रीजनिंग मॉडल्स के अंतर्निहित अटेंशन पैटर्न्स का लाभ उठाता है—विशेष रूप से टर्मिनेशन टोकन को एक सूचना एंकर के रूप में उपयोग करके—ताकि अनावश्यक चेन-ऑफ-थॉट स्टेप्स को कम किया जा सके, जिससे तार्किक सुसंगतता और सटीकता को बनाए रखते हुए टोकन काउंट में 50-60% की कमी आती है।

Yangsong Lan, Hongliang Dai, Piji Li2026-04-21
💬 NLP

Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA

यह शोध पत्र प्रकट करता है कि सामाजिक पहचान के संकेतक, विशेष रूप से यौन अभिविन्यास और धार्मिक संबद्धता, चिकित्सा संबंधी लार्ज लैंग्वेज मॉडल्स (LLMs) की सटीकता और अनिश्चितता अंशांकन (uncertainization calibration) दोनों को महत्वपूर्ण रूप से विकृत करते हैं, जिससे एक "कैलिब्रेशन संकट" उत्पन्न होता है जो न्यायसंगत और सुरक्षित नैदानिक तैनाती के लिए गंभीर जोखिम पैदा करता है।

Alberto Testoni, Iacer Calixto2026-04-21
💬 NLP

A Universal Avoidance Method for Diverse Multi-branch Generation

यह शोध पत्र UAG (यूनिवर्सल अवॉयडेंस जनरेशन) को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय और गणनात्मक रूप से कुशल रणनीति है जो आउटपुट समानता को दंडित करके डिफ्यूजन और ट्रांसफॉर्मर दोनों मॉडलों में मल्टी-ब्रांच विविधता को महत्वपूर्ण रूप से बढ़ाती है, जिससे अत्याधुनिक तरीकों की तुलना में काफी कम गणनात्मक लागत के साथ 1.9 गुना अधिक विविधता प्राप्त होती है।

Kyeongman Park, Minha Jhang, Kyomin Jung2026-04-21
💬 NLP

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

यह शोध पत्र प्रिसिस डिबगिंग बेंचमार्क (PDB) फ्रेमवर्क प्रस्तुत करता है जो यह प्रकट करता है कि सीमावर्ती (फ्रंटियर) लार्ज लैंग्वेज मॉडल्स, यूनिट-टेस्ट पास दरों को उच्च स्तर पर प्राप्त करने के बावजूद, बार-बार कोड को अत्यधिक संपादित (ओवर-एडिट) करने के कारण सटीक डिबगिंग करने में संघर्ष करते हैं, जो एक ऐसी सीमा है जो पुनरावृत्ति रणनीतियों (इटरेटिव स्ट्रैटेजीज) के साथ भी बनी रहती है और कोडिंग मॉडल की पोस्ट-ट्रेनिंग पाइपलाइनों पर पुनर्विचार करने का आह्वान करती है।

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia2026-04-21
💬 NLP

Neuro-Symbolic Resolution of Recommendation Conflicts in Multimorbidity Clinical Guidelines

यह शोध पत्र एक न्यूरो-सिंबोलिक फ्रेमवर्क प्रस्तुत करता है जो असंरचित नैदानिक दिशानिर्देशों को सिंबोलिक लॉजिक में अनुवादित करता है और उन्हें एक SAT सॉल्वर के साथ सत्यापित करता है ताकि मल्टीमॉर्बिडिटी (बहुरुग्णता) से उत्पन्न होने वाले "लोकल कॉन्फ्लिक्ट्स" (स्थानीय संघर्षों) का प्रभावी ढंग से पता लगाया और उन्हें हल किया जा सके, जिससे 0.861 का F1 स्कोर प्राप्त हुआ और विश्वसनीय मेडिकल AI सिफारिशों को सुनिश्चित करने में अत्याधुनिक LLMs से बेहतर प्रदर्शन किया गया।

Shiyao Xie, Jian Du2026-04-21
💬 NLP

More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage

यह शोध पत्र DIVA बेंचमार्क और सिमेंटिक एलाइनमेंट गैप (Semantic Alignment Gap) मीट्रिक को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि विजन-लैंग्वेज मॉडल एक सुसंगत शाब्दिक श्रेष्ठता पूर्वाग्रह (literal superiority bias) प्रदर्शित करते हैं, जहाँ बढ़ी हुई दृश्य निष्ठा (visual fidelity) और मॉडल का पैमाना अमूर्त मुहावरेदार अर्थों के साथ संघर्ष को हल करने में विफल रहता है, जो यह सुझाव देता है कि बेहतर संरचनात्मक समझ के लिए प्रतिमाशास्त्रीय अमूर्तन (iconographic abstraction) आवश्यक है।

Wei He2026-04-21
💬 NLP

Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions

यह शोध पत्र TPI-Train डेटासेट और TPI-Bench मूल्यांकन ढांचे को पेश करते हुए स्पोकन लैंग्वेज मॉडल्स (Spoken Language Models) की थर्ड-पार्टी इंटररप्शन (Third-Party Interruptions) के प्रति संवेदनशीलता को संबोधित करता है, जो सामूहिक रूप से सिमेंटिक शॉर्टकट लर्निंग (semantic shortcut learning) को कम करते हैं और रोबस्ट मल्टी-पार्टी स्पोकन इंटरैक्शन को सक्षम करने के लिए एकोस्टिक क्यू प्रायोरिटाइजेशन (acoustic cue prioritization) को लागू करते हैं।

Dongwook Lee, Eunwoo Song, Che Hyun Lee, Heeseung Kim, Sungroh Yoon2026-04-21
💬 NLP

ArgBench: Benchmarking LLMs on Computational Argumentation Tasks

यह शोधपत्र ArgBench प्रस्तुत करता है, जो विविध कम्प्यूटेशनल तर्क क्षमता (argumentation capabilities), जिसमें तर्क खनन (argument mining), गुणवत्ता मूल्यांकन, तर्क और सृजन शामिल हैं, के माध्यम से पांच LLM परिवारों के प्रदर्शन का मूल्यांकन और व्यवस्थित रूप से विश्लेषण करने के लिए 33 डेटासेट और 46 कार्यों से युक्त पहला मानकीकृत बेंचमार्क है।

Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth2026-04-21