💬 NLP

EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning

यह शोधपत्र EngTrace प्रस्तुत करता है, जो 1,350 संदूषण-प्रतिरोधी (contamination-resistant) इंजीनियरिंग समस्याओं और एक सत्यापन योग्य दो-चरणीय मूल्यांकन ढांचे से युक्त एक प्रतीकात्मक बेंचमार्क है, जिसका उद्देश्य सुरक्षा-महत्वपूर्ण, भौतिकी-आधारित वर्कफ़्लो में बड़े भाषा मॉडल (LLMs) की प्रक्रिया पर्यवेक्षण और एकीकृत तर्क क्षमताओं का कड़ाई से आकलन करना है।

Ayesha Gull, Muhammad Usman Safder, Rania Elbadry, Fan Zhang, Veselin Stoyanov, Preslav Nakov, Zhuohan Xie2026-06-17
💬 NLP

Would a Large Language Model Pay Extra for a View? Inferring Willingness to Pay from Subjective Choices

यह शोध पत्र यात्रा परिदृश्यों में व्यक्तिपरक भुगतान करने की इच्छा (willingness to pay) का अनुमान लगाने की लार्ज लैंग्वेज मॉडल्स की क्षमता की जांच करता है, जो यह प्रकट करता है कि हालांकि वे सार्थक मूल्यांकन निकाल सकते हैं, वे व्यवस्थित रूप से मानवीय प्राथमिकताओं को बढ़ा-चढ़ाकर बताते हैं और विशेषता-स्तर के विचलन प्रदर्शित करते हैं जिन्हें पर्सोना-आधारित प्रॉम्प्टिंग और पूर्व उपयोगकर्ता विकल्पों पर आधारित करने के माध्यम से कम किया जा सकता है।

Manon Reusens, Sofie Goethals, Toon Calders, David Martens2026-06-17
💬 NLP

DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels

यह शोध पत्र DICE को प्रस्तुत करता है, जो नए CuKe डेटासेट और एक द्वि-चरणीय सुदृढीकरण लर्निंग (bi-phase reinforcement learning) फ्रेमवर्क पर प्रशिक्षित डिफ्यूजन लार्ज लैंग्वेज मॉडल्स की एक श्रृंखला है, जो उच्च-प्रदर्शन वाले CUDA कर्नेल उत्पन्न करने में मौजूदा ऑटोरेग्रेसिव और डिफ्यूजन मॉडल्स से काफी बेहतर प्रदर्शन करता है।

Haolei Bai, Lingcheng Kong, Xueyi Chen, Jianmian Wang, Zhiqiang Tao, Huan Wang2026-06-17
🤖 machine learning

Rift: A Conflict Signature for Deception in Language Models

यह शोध पत्र "रिफ्ट" (Rift) को प्रस्तुत करता है, जो एक पता लगाने योग्य आंतरिक संघर्ष सिग्नेचर है, जिसकी विशेषता उच्च अवशिष्ट रैंक (residual rank) है जो भ्रामक भाषा मॉडल आउटपुट को ईमानदार त्रुटियों और मतिभ्रम (hallucinations) से लगभग पूर्ण सटीकता के साथ अलग करती है, जबकि यह विभिन्न मॉडल परिवारों, भाषाओं और रणनीतिक छिपाने के प्रयासों के बावजूद प्रभावी रहता है और इंजेक्शन के प्रति अदृश्य बना रहता है।

Petr Nyoma2026-06-17✓ Author reviewed
💬 NLP

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

यह शोध पत्र मशीन अनुवाद में लार्ज लैंग्वेज मॉडल्स से प्रति-टोकन (per-token) आत्मविश्वास निकालने के लिए पांच मौखिक विधियों (verbalized methods) को प्रस्तुत और मूल्यांकित करता है, जिसमें यह पाया गया है कि वे आंतरिक संकेतों (internal signals) के साथ कम सहसंबंध दिखाने के बावजूद त्रुटि पहचान और अंशांकन (calibration) में उनके तुलनीय प्रदर्शन करती हैं।

Ali Marashian, Alexis Palmer, Katharina von der Wense2026-06-17
💬 NLP

Are you speaking my languages? On spoken language adherence in multimodal LLMs

यह शोध पत्र "भाषा अनुपालन" (language adherence) को परिभाषित करके, उल्लंघनों को मापने के लिए एक मीट्रिक पेश करके, और ट्रांसक्रिप्शन गुणवत्ता को बनाए रखते हुए इन त्रुटियों को कम करने के लिए ज़ीरो-शॉट गाइडेंस, सुपरवाइज्ड फाइन-ट्यूनिंग और चेन-ऑफ-थॉट रीजनिंग जैसी सॉफ्ट प्रॉम्प्टिंग रणनीतियोंों का मूल्यांकन करके, मल्टीमॉडल एलएलएम-आधारित ऑटोमैटिक स्पीच रिकग्निशन में भाषा की गलत पहचान के मुद्दे को संबोधित करता है।

Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic2026-06-17
🤖 AI

Nothing from Something: Can a Language Model Discover 0?

यह शोध पत्र इस बात की जांच करता है कि क्या भाषा मॉडल शून्य की अवधारणा को स्वतंत्र रूप से खोज सकते हैं, जिसमें यह पाया गया है कि जबकि GPT-2 आकार के मॉडल केवल मानक अंकगणित से इस अवधारणा को सामान्य बनाने में विफल रहते हैं, वे न्यूनतम उदाहरणों के साथ इसे सीख सकते हैं, एक ऐसी प्रक्रिया जो पूर्व भाषा प्रीट्रेनिंग द्वारा काफी तेज हो जाती है।

Phoebe Zeng, Thomas L. Griffiths, Brenden M. Lake2026-06-17
💬 NLP

Examining the Limits of Word2Vec with Toki Pona

यह अध्ययन प्रदर्शित करता है कि यदि पर्याप्त वितरण संबंधी डेटा उपलब्ध हो, तो Word2Vec लगभग 130 शब्दों की अत्यंत छोटी शब्दावली के साथ भी अर्थ संबंधी संबंधों को प्रभावी ढंग से पकड़ सकता है, और यह प्रकट करता है कि कॉर्पस में आकस्मिक गैर-मुख्य टोकन वास्तव में प्रदर्शन में बाधा डालने के बजाय शब्द निकटता को बढ़ाते हैं।

Daniel Zhenhan Huang, Hongchen Wu2026-06-17
🤖 AI

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

यह शोधपत्र SpeechDx को प्रस्तुत करता है, जो भाषण उत्पादन चरणों द्वारा व्यवस्थित 12 डेटासेट और 27 नैदानिक कार्यों में फैला एक व्यापक मल्टी-टास्क बेंचमार्क है, जो यह प्रकट करता है कि जबकि बड़े पैमाने के स्पीच मॉडल मजबूत बेसलाइन के रूप में कार्य करते हैं, कोई भी वर्तमान प्रतिनिधित्व विविध नैदानिक स्थितियों में विश्वसनीय रूप से सामान्यीकरण नहीं कर पाता है।

Sejal Bhalla, Larry Kieu, Aina Merchant, Eyal de Lara, Alex Mariakakis2026-06-17
💬 NLP

Translating the Untranslatable: An Operationalizable Ontology for Untranslatability

यह शोध पत्र एनएलपी (NLP) के लिए इस अवधारणा को कार्यान्वित करने हेतु अननुवादनीयता (untranslatability) की एक संरचित ऑन्टोलॉजी और वर्गीकरण प्रस्तुत करता है, जिसके परिणामस्वरूप एक नया बहुभाषी डेटासेट और प्रारंभिक निष्कर्ष प्राप्त हुए हैं जो यह प्रदर्शित करते हैं कि जब मॉडल व्याख्यात्मक प्रतिपूरक रणनीतियों (explanatory compensation strategies) का उपयोग करते हैं, तो अनुवाद की गुणवत्ता में सुधार होता है।

Jacob Bremerman, Brihi Joshi, Hirona Arai, Xiang Ren, Jonathan May2026-06-17