💬 NLP

The Metanym Game: A Self-Contained, Self-Consistent LLM Peer-Community Benchmark for Structural Intelligence

यह शोधपत्र मेटानिम गेम (Metanym Game) का परिचय देता है, जो एक स्व-निहित बेंचमार्क है जो एक प्रतिस्पर्धी, संदूषण-प्रतिरोधी शब्द खेल के माध्यम से LLMs की संरचनात्मक बुद्धिमत्ता का मूल्यांकन करता है जहाँ मॉडल सामग्री उत्पन्न करते हैं और सहकर्मी-समीक्षा (peer-review) करते हैं, जो रेटिंग मैट्रिसेस के एक नवीन स्पेक्ट्रल विश्लेषण का उपयोग करके निश्चित परीक्षण सेटों या ओरेकल मॉडलों पर निर्भर किए बिना तथ्यात्मक सटीकता और निर्णायक सक्षमता को एक साथ मापता है।

David Nordfors2026-06-23
💬 NLP

OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

OTTER एक ब्लैक-बॉक्स रेड-टीमिंग फ्रेमवर्क है जो न्यूनतम टोकन परिवर्तनों के माध्यम से डिटेक्शन से बचने के लिए प्रॉम्प्ट्स को अनुकूलित करके टॉक्सिसिटी-आधारित LLM सुरक्षा प्रणालियों की भंगुरता को प्रदर्शित करता है, जिससे हमले की सफलता दर में उल्लेखनीय वृद्धि होती है और क्लासिफायर हार्डनिंग के लिए व्यावहारिक अंतर्दृष्टि प्राप्त होती है।

Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu2026-06-23✓ Author reviewed
💬 NLP

LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

यह शोध पत्र LLM-आधारित मल्टी-रेफरेंस इवैल्यूएशन (LMRE) का प्रस्ताव करता है, जो एक स्केलेबल विधि है जो सिंगल-रेफरेंस इवैल्यूएशन की सीमाओं को दूर करने के लिए कई वैध वाक्यांश उत्पन्न करती है और वाक्यांश ब्रेक एनोटेशन के आकलन के लिए मानव निर्णय के साथ अधिक निकटता से संरेखित होती है।

Younghan Park, Hoyeon Lee, Hawon Jeong, Jong-Hwan Kim2026-06-23
🤖 AI

Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models

यह शोध पत्र "आंसर इंजीनियरिंग" (Answer Engineering) को प्रस्तुत करता है, जो एक नियतात्मक रनटाइम लेयर (deterministic runtime layer) है जो जनरेशन के दौरान रीजनिंग ट्रेजेक्टरीज (reasoning trajectories) पर स्थानीयकृत, नियम-निर्देशित हस्तक्षेपों को लागू करके लार्ज लैंग्वेज मॉडल्स में प्रोटोकॉल अनुपालन में सुधार करता है, जिससे बिना मॉडल रिट्रेनिंग के अचानक सेंसरिन्यूरल सुनने की शक्ति की हानि (sudden sensorineural hearing loss) के नैदानिक निर्णय लेने में महत्वपूर्ण सटीकता लाभ प्राप्त होता है।

Victor Lavrenko, Anastasiia Molodnitskaia2026-06-23
💬 NLP

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

यह शोध पत्र AdaMem को प्रस्तुत करता है, जो एक अनुकूलन योग्य मेमोरी सिस्टम है जो अप्रासंगिक जानकारी को फ़िल्टर करने के लिए उपयोगकर्ता फीडबैक से भूमिका-विशिष्ट राइट नीतियों (write policies) को सीखता है, जिससे मेमोरी ब्लोट कम होता है और यूनिफॉर्म मेमोरी बेसलाइन की तुलना में लॉन्ग-होरिजन QA सटीकता में महत्वपूर्ण सुधार होता है।

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo2026-06-23
💬 NLP

Who Checks the Citations? Benchmarking Legal Hallucination Detection

यह शोध पत्र एक नई वर्गीकरण पद्धति (taxonomy) और डेटासेट पेश करते हुए एआई-जनित कानूनी उद्धरण भ्रम (hallucinations) की बढ़ती समस्या को संबोधित करता है, यह प्रदर्शित करते हुए कि जहाँ उन्नत एजेंटिक मॉडल कई त्रुटियों का पता लगा सकते हैं, वहीं वे सूक्ष्म अशुद्धियों के साथ संघर्ष करते हैं और महत्वपूर्ण संसाधन एवं पहुंच संबंधी बाधाओं का सामना करते हैं जिनके लिए नीतिगत हस्तक्षेप आवश्यक है।

Patty Liu, Dominik Stammbach, Peter Henderson2026-06-23
💬 NLP

Dementia-Agents: A Multi-Modal Multi-Agent System for Dementia Staging and Phenotyping

यह शोधपत्र डिमेंशिया-एजेंट्स (Dementia-Agents) को प्रस्तुत करता है, जो एक नैदानिक रूप से संरेखित बहु-मोडल बहु-एजेंट ढांचा है, जो अल्जाइमर-केंद्रित दृष्टिकोणों से परे डिमेंशिया की सिंड्रोम-स्तरीय जटिलता को संबोधित करने के लिए विशिष्ट विशेषज्ञ एजेंटों और संभाव्य एकत्रीकरण के माध्यम से संरचित नैदानिक रिकॉर्ड को एकीकृत करके वास्तविक दुनिया के डिमेंशिया स्टेजिंग और फेनोटाइपिंग में मौजूदा मॉडलों से बेहतर प्रदर्शन करता है।

Yaling Shen, Maja Christensen, Yiwen Jiang, Jenna Dennison, David Darby, Amy Brodtmann, Zongyuan Ge2026-06-23
💬 NLP

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

यह शोधपत्र प्रदर्शित करता है कि डच भाषा मॉडल मानव-समान सुसंगतता भ्रम (coherence illusions) प्रदर्शित करते हैं जहाँ विचलित करने वाले संदर्भ असंगत निरंतरता के लिए आश्चर्य (surprisal) को कम कर देते हैं, जबकि अटेंशन एंट्रॉपी और ऊर्जा मेट्रिक्स उन अंतर्निहित साझा तंत्रों को प्रकट करते हैं जो इन प्रभावों को संचालित करते हैं।

Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil2026-06-23
💬 NLP

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

यह शोध पत्र OpenWER का परिचय देता है, जो एक ओपन-सोर्स टूल है जो भाषा-विशिष्ट सामान्यीकरण (normalization) और टोकन-आधारित संरेखण (alignment) को लागू करके क्रॉस-लिंगुअल ऑटोमैटिक स्पीच रिकग्निशन मूल्यांकन की निष्पक्षता और विश्वसनीयता को बढ़ाता है, जिसके परिणामस्वरूप मौजूदा लाइब्रेरी की तुलना में 52 विविध भाषाओं में वर्ड एरर रेट (Word Error Rates) में महत्वपूर्ण कमी आती है।

Korbinian Kuhn, Gottfried Zimmermann2026-06-23
🤖 machine learning

Does RoPE Prevent or Degrade Retrieval Heads? A Mechanistic Analysis Across Model Families

यह शोध पत्र कई मॉडल परिवारों में यांत्रिक विश्लेषण के माध्यम से यह प्रदर्शित करता है कि रोटरी पोज़िशन एम्बेडिंग्स (RoPE) न तो रिट्रीवल हेड्स के निर्माण को रोकते हैं और न ही उनके कार्य को कम करते हैं, और यह पहचानता है कि लॉन्ग-कॉन्टेक्स्ट रिकॉल के लिए अटेंशन नॉर्म्स के बजाय RoPE फ्रीक्वेंसी डाइमेंशन्स ही कारण कारक हैं।

Cengizhan Bayram2026-06-23