💬 NLP

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

यह शोध पत्र GameCraft-Bench प्रस्तुत करता है, जो 140 Godot-आधारित कार्यों का एक बेंचमार्क है जिसे कोडिंग एजेंटों की पूर्ण, खेलने योग्य गेम एंड-टू-एंड जेनरेट करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल पहचानने योग्य मैकेनिक्स लागू करने के बावजूद आर्टिफैक्ट पूर्णता और इंटरैक्टिव सुसंगतता प्राप्त करने में काफी संघर्ष करते हैं।

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao D (…)2026-06-17
💬 NLP

Learning task-specific subspaces via interventional post-training of speech foundation models

यह शोध पत्र स्पीच फाउंडेशन मॉडल्स के वितरित निरूपणों (डिस्ट्रिब्यूटेड रिप्रेजेंटेशन्स) को अलग-अलग कंटेंट और स्पीकर सबस्पेस में विलगित करने के लिए कंट्रास्टिव लर्निंग का उपयोग करते हुए एक इंटरवेंशनल पोस्ट-ट्रेनिंग दृष्टिकोण प्रस्तावित करता है, जिससे आउट-ऑफ-डोमेन स्पीकर वेरिफिकेशन और कीवर्ड स्पॉटिंग प्रदर्शन में सुधार होता है।

Jack Cox, Jon Barker2026-06-17
💬 NLP

Fine-tuning LLMs for Passive Depression Severity Estimation from AI Mental Health Dialogue

यह शोध पत्र एक फाइन-ट्यून्ड Qwen3.5-27B मॉडल प्रस्तुत करता है जो स्यूडोलेबल (pseudolabels) का लाभ उठाकर AI मानसिक स्वास्थ्य संवाद ट्रांसक्रिप्ट से निष्क्रिय अवसाद की गंभीरता (PHQ-9 स्कोर) का सटीक अनुमान लगाता है, जिससे उपयोगकर्ताओं द्वारा स्व-रिपोर्ट उपायों को पूरा करने की आवश्यकता के बिना पूर्ण नैदानिक स्पेक्ट्रम में मजबूत प्रदर्शन प्राप्त होता है।

Olivier Tieleman, Ziyi Zhu, Ting Su, Samuel J. Bell, Thomas D. Hull, Caitlin A. Stamatis2026-06-17
💬 NLP

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

यह शोध पत्र VoidPadding का प्रस्ताव करता है, जो एक समर्पित [VOID] टोकन को पैडिंग के लिए पेश करके मास्कड डिफ्यूजन लैंग्वेज मॉडल्स में पैडिंग और टर्मिनेशन भूमिकाओं को अलग करता है, जो [EOS] ओवरफ्लो की समस्याओं को हल करता है और इंस्ट्रक्शन-ट्यून्ड मॉडल्स पर प्रदर्शन और डिकोडिंग दक्षता में महत्वपूर्ण सुधार करता है।

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb2026-06-17
🤖 AI

LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

LegalHalluLens एक ऐसा फ्रेमवर्क है जो टाइप किए गए हैलुसिनेशन प्रोफाइल और एक रिस्क डायरेक्शन इंडेक्स को पेश करके विश्वसनीय कानूनी एआई को बढ़ाता है ताकि छिपे हुए त्रुटि पैटर्न को उजागर किया जा सके, जो फिर फैब्रिकेशन दरों को काफी कम करने और परिनियोजन सुरक्षा में सुधार करने के लिए एक मल्टी-एजेंट डिबेट पाइपलाइन को कैलिब्रेट करता है।

Lalit Yadav, Akshaj Gurugubelli2026-06-17
💬 NLP

When English Isn't the Best Teacher: Source Language Effects in Cross-Lingual In-Context Learning

यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि स्रोत भाषाओं के चयन के लिए पारंपरिक फाइन-ट्यूनिंग-आधारित ह्यूरिस्टिक्स (heuristics) क्रॉस-लिंगुअल इन-कॉन्टेक्स्ट लर्निंग (In-Context Learning) पर विश्वसनीय रूप से लागू नहीं होते हैं, जो विविध कार्यों और मॉडलों में भाषा भ्रम को कम करने और स्थानांतरण को अनुकूलित करने के लिए वैकल्पिक रणनीतियों की आवश्यकता को प्रकट करता है।

Fred Philippy, Siwen Guo, Jacques Klein, Tegawendé F. Bissyandé2026-06-17
💬 NLP

Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond

यह अध्ययन उपयोगकर्ता की पूछताछ को वर्गीकृत करने और LLM प्रतिक्रिया गुणवत्ता का मूल्यांकन करने के लिए WildChat डेटासेट से 14,727 वास्तविक दुनिया के सुरक्षा और गोपनीयता प्रॉम्प्ट का विश्लेषण करता है, जिससे यह पता चलता है कि हालांकि वाणिज्यिक मॉडल आम तौर पर ओपन-वेट मॉडलों से बेहतर प्रदर्शन करते हैं, फिर भी वे कभी-कभी विरोधाभासी सलाह देते हैं जो उपयोगकर्ताओं को गुमराह कर सकती है।

Hobin Kim, Xiaoyuan Wu, Omer Akgul, Lujo Bauer, Nicolas Christin2026-06-17
💬 NLP

HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice

यह शोध पत्र HistoRAG प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ऐतिहासिक अनुसंधान के लिए 'रिट्रीवल-ऑगमेंटेड जनरेशन' (RAG) को अनुकूलित करता है, जिसमें टेम्पोरल विंडोइंग (temporal windowing), पृथक रिट्रीवल और जनरेशन, और पारदर्शी LLM-एज़-जज मूल्यांकन जैसे इतिहासलेखन सिद्धांतों को एकीकृत किया गया है, ताकि मानक RAG के तथ्यात्मक पूर्वाग्रहों को संबोधित किया जा सके और व्याख्यात्मक विद्वत्तापूर्ण प्रथाओं को बेहतर समर्थन दिया जा सके।

Noah J. Kim-Baumann, Torsten Hiltmann2026-06-17
💬 NLP

Structural Role Injection in Handlebars-Templated LLM Prompts: Triple-Brace Interpolation, Delimiter Family, and the Limits of HTML Auto-Escaping

यह शोध पत्र प्रदर्शित करता है कि LLM प्रॉम्प्ट्स में Handlebars का डिफ़ॉल्ट HTML-एस्केपिंग तंत्र स्ट्रक्चरल रोल इंजेक्शन हमलों के विरुद्ध असंगत सुरक्षा प्रदान करता है, जो प्रभावी रूप से केवल एंगल-ब्रैकेट-आधारित डेलीमिटर्स को ही निष्प्रभावी करता है जबकि विभिन्न मॉडलों में टास्क हाइजैकिंग और डेटा एक्सफिल्ट्रेशन के लिए कोलन- और मार्कडाउन-आधारित डेलीमिटर्स को असुरक्षित छोड़ देता है।

Mohammadreza Rashidi2026-06-17
🤖 AI

Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

यह शोध पत्र TAC को प्रस्तुत करता है, जो पशु कल्याण के लिए पहला एजेंटिक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक एआई मॉडल उपयोगकर्ताओं की ओर से यात्रा बुकिंग करते समय पशु शोषण से बचने में लगातार विफल रहते हैं, और कल्याण-जागरूक सिस्टम प्रॉम्प्ट द्वारा स्पष्ट रूप से निर्देशित किए बिना वे संयोग के स्तर से भी नीचे प्रदर्शन करते हैं।

Jasmine Brazilek, Joel Christoph, Miles Tidmarsh, Carol Kline, Oliver Tullio, Arturs Kanepajs2026-06-17