💬 NLP

Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study

यह अध्ययन प्रकट करता है कि चित्रलिपि-से-जर्मन अनुवाद के लिए पूर्व में रिपोर्ट किया गया 61.5 BLEU स्कोर 2% परीक्षण डेटा संदूषण (contamination) द्वारा कृत्रिम रूप से बढ़ा दिया गया था, और कठोर विसंदूषण (decontamination) के माध्यम से, इस लुप्तप्राय लेखन प्रणाली के लिए 30.9–39.2 BLEU का एक यथार्थवादी आधारभूत प्रदर्शन सीमा स्थापित करता है।

Ammar Toutou, Abdelrahman Harb, Christine Basta2026-05-11
💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

यह शोध पत्र "थिंक-विथ-रुब्रिक्स" (Think-with-Rubrics) को प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जो प्रशिक्षण के दौरान LLMs द्वारा प्रतिक्रियाओं के साथ रुब्रिक्स उत्पन्न करवाकर, रुब्रिक्स को बाहरी मूल्यांकनकर्ताओं से आंतरिक तर्क मार्गदर्शन में बदल देता है, जिसके परिणामस्वरूप मौजूदा रिवॉर्ड-आधारित बेसलाइनों की तुलना में निरंतर प्रदर्शन सुधार प्राप्त होता है।

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang2026-05-11
💬 NLP

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

यह शोध पत्र "मोलटबुक फाइल्स" (Moltbook Files) प्रस्तुत करता है, जो एआई एजेंटों से भरे एक रेडिट जैसे प्लेटफॉर्म के 232k पोस्ट और 2.2M कमेंट्स का एक डेटासेट है, जो उजागर की गई एपीआई कुंजियों (API keys) जैसे महत्वपूर्ण गोपनीयता जोखिमों और फाइन-ट्यूनिंग करने पर मॉडल की सत्यनिष्ठा में कमी को प्रकट करता है, फिर भी अंततः इस घटना को एक "हानिरहित स्लोपोकैलिप्स" (harmless slopocalypse) के रूप में वर्णित करता है और डेटा संदूषण (data contamination) एवं उभरते हुए मिसअलाइनमेंट (emergent misalignment) जैसे निरंतर बने रहने वाले टेल जोखिमों के प्रति चेतावनी देता है।

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poec (…)2026-05-11
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

यह शोध पत्र InterLV-Search प्रस्तुत करता है, जो इंटरलीव्ड मल्टीमॉडल एजेंटिक सर्च के लिए एक व्यापक बेंचमार्क और मूल्यांकन ढांचा है, जो सक्रिय खोज (active seeking), नियंत्रित ऑफलाइन (controlled offline), और ओपन-वेब सर्च परिदृश्यों में टेक्स्टुअल और विजुअल साक्ष्यों को गतिशील रूप से एकीकृत करने की प्रणालियों की क्षमता में महत्वपूर्ण वर्तमान सीमाओं को उजागर करता है।

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang2026-05-11
💬 NLP

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

यह शोध पत्र 22 भाषा युग्मों में विफलता के तरीकों का विश्लेषण करके इस बात की जांच करता है कि लार्ज लैंग्वेज मॉडल्स कम-संसाधन वाली अनुवाद प्रक्रिया में क्यों संघर्ष करते हैं, और टोकन एक्टिवेशन रेट (TAR) मेट्रिक को प्रस्तुत करता है, जो यह प्रकट करता है कि भाषा-विशिष्ट टोकन का कम उपयोग खराब अनुवाद गुणवत्ता के साथ दृढ़ता से सह-संबद्ध है, विशेष रूप से गैर-अंग्रेजी-केंद्रित युग्मों में।

Shenbin Qian, Yves Scherrer2026-05-11
💬 NLP

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

यह शोध पत्र विज़ुअल एनकोडर और प्रोजेक्टर डिज़ाइनों दोनों में बाधाओं की पहचान करके वीडियो-एलएलएम (Video-LLMs) की कमजोर टेम्पोरल रीजनिंग क्षमताओं का निदान करता है, जिससे एक नया आर्किटेक्चर विकसित होता है जो एरो-ऑफ-टाइम (Arrow-of-Time) कार्य पर लगभग पूर्ण प्रदर्शन प्राप्त करता है और व्यापक टेम्पोरल रीजनिंग बेंचमार्क में महत्वपूर्ण सुधार करता है।

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa2026-05-11
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

यह शोध पत्र POISE प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक पॉलिसी मॉडल की आंतरिक अवस्थाओं पर प्रशिक्षित एक हल्के प्रोब (lightweight probe) का लाभ उठाकर नगण्य लागत पर वैल्यू बेसलाइन का अनुमान लगाता है, जिससे अलग क्रिटिक्स या कई रोलआउट्स के कम्प्यूटेशनल ओवरहेड के बिना स्थिर और कुशल पॉलिसी अनुकूलन प्राप्त होता है।

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
💬 NLP

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

यह शोध पत्र 'जनरेट-देन-मैच' प्रतिमान के तहत एक इंटेंट-ड्रिवन सिमेंटिक आईडी जनरेशन फ्रेमवर्क का प्रस्ताव करता है, जो कन्वर्सेशनल न्यूज़ रिकमेंडेशन में रिट्रीवल बाधाओं को दूर करने के लिए टू-स्टेज ट्रेनिंग और प्रोफाइल-अवेयर ड्यूल-सिग्नल रीजनिंग का उपयोग करता है, जिससे काफी कम लागत पर जीरो हैलुसिनेशन और GPT-4-आधारित बेसलाइन्स की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu2026-05-11
💬 NLP

Is She Even Relevant? When BERT Ignores Explicit Gender Cues

यह शोध पत्र प्रकट करता है कि शून्य से प्रशिक्षित एक डच BERT मॉडल मजबूत, निरंतर पुरुष-डिफ़ॉल्ट लिंग पूर्वाग्रह विकसित करता है जो स्पष्ट प्रासंगिक संकेतों पर हावी हो जाते हैं, जिससे यह प्रदर्शित होता है कि इसकी सीखी गई निरूपण क्षमताएं इस भाषा के प्रत्यक्ष रूपात्मक लिंग अंकन के बावजूद प्रति-रूढ़िवादी लिंग सूचना को सही ढंग से एनकोड करने के लिए अपर्याप्त रूप से गतिशील हैं।

Jonas Klein, Chiara Manna, Eva Vanmassenhove2026-05-11
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

यह शोध पत्र PhoneSafety प्रस्तुत करता है, जो 700 वास्तविक दुनिया के सुरक्षा-महत्वपूर्ण क्षणों का एक बेंचमार्क है जो फोन-उपयोग एजेंटों में वास्तविक सुरक्षा और मात्र अक्षमता के बीच अंतर करता है, यह प्रकट करते हुए कि मजबूत सामान्य क्षमताएं सुरक्षित निर्णय लेने की गारंटी नहीं देती हैं और हानिरहित परिणाम अक्सर वास्तविक सुरक्षा के बजाय कार्य करने में असमर्थता को छिपाते हैं।

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen (…)2026-05-11