💬 NLP

ConPress: Learning Efficient Reasoning from Multi-Question Contextual Pressure

ConPress एक हल्का स्व-पर्यवेक्षित फाइन-ट्यूनिंग (self-supervised fine-tuning) तरीका है जो "स्व-संपीड़न" (Self-Compression) घटना का लाभ उठाता है, जहाँ मॉडल कई प्रश्न प्रस्तुत किए जाने पर स्वाभाविक रूप से तर्क संबंधी निशानों (reasoning traces) को छोटा कर देते हैं, ताकि बड़े तर्क करने वाले मॉडलों को एकल-प्रश्न कार्यों के लिए संक्षिप्त और सटीक समाधान उत्पन्न करने के लिए प्रशिक्षित किया जा सके, जिससे बिना किसी बाहरी शिक्षक या सुदृढीकरण शिक्षण (reinforcement learning) के अनुमान ओवरहेड (inference overhead) को काफी कम किया जा सके।

Jie Deng, Shining Liang, Jun Li, Hongzhi Li, Yutao Xie2026-06-25
💬 NLP

Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

यह शोध पत्र प्रकट करता है कि रूब्रिक-आधारित LLM-as-a-judge मूल्यांकन स्वाभाविक रूप से बहुविकल्पीय कार्यों के समान मॉडल-विशिष्ट स्थिति पूर्वाग्रह (position bias) प्रदर्शित करता है, जहाँ स्कोर विकल्पों और मानदंडों का क्रम निर्णयों को महत्वपूर्ण रूप से प्रभावित करता है, लेकिन यह भी दर्शाता है कि इन क्रमों पर यादृच्छिक क्रमपरिवर्तन (random permutations) लागू करने से इस पूर्वाग्रह को प्रभावी ढंग से कम किया जा सकता है और मानव एनोटेशन के साथ संरेखण में सुधार किया जा सकता है।

Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku2026-06-25
💬 NLP

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

यह शोधपत्र SPARC प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स में विजुअल परसेप्शन को रीजनिंग से अलग करता है ताकि कुशल, एसिमेट्रिक टेस्ट-टाइम स्केलिंग को सक्षम बनाया जा सके और कम टोकन बजट के साथ विजुअल रीजनिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigot (…)2026-06-25
💬 NLP

Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text

यह शोध पत्र क्रॉस-मोडल रोबस्टनेस ट्रांसफर (CMRT) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो टेक्स्ट-आधारित एडवरसैरियल ट्रेनिंग से रोबस्टनेस को स्थानांतरित करके रूपात्मक विविधताओं (morphological variations) के विरुद्ध एंड-टू-एंड स्पीच ट्रांसलेशन मॉडल्स की एडवरसैरियल मजबूती को बढ़ाता है, जिससे एडवरसैरियल स्पीच डेटा उत्पन्न करने की कम्प्यूटेशनल लागत के बिना महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis2026-06-25
💬 NLP

Small edits, large models: How Wikipedia advocacy shapes LLM values

यह शोध पत्र प्रदर्शित करता है कि विकिपीडिया स्वयंसेवकों का एक छोटा, समन्वित समूह पशु कल्याण जैसे विशिष्ट विषयों के संबंध में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के मूल्यों और प्रतिक्रियाओं को महत्वपूर्ण रूप से आकार दे सकता है, क्योंकि उनके लक्षित संपादन असंबंधित सामग्री की तुलना में मॉडल प्रशिक्षण और व्यवहार में असमान रूप से प्रभावशाली हो जाते हैं।

Jasmine Brazilek, Maria Navas, Alexa Gnauck2026-06-25
💬 NLP

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

यह शोधपत्र AgentOdyssey को प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है जो अन्वेषण करने, ज्ञान प्राप्त करने, एपिसोडिक मेमोरी (episodic memory) को बनाए रखने और लंबी अवधि के नियोजन (long horizons) की क्षमताओं का आकलन और निदान करने के लिए प्रक्रियात्मक रूप से ओपन-एंडेड टेक्स्ट गेम्स को उत्पन्न करता है, जिससे यह प्रकट होता है कि हालांकि प्रदर्शन मजबूत मॉडलों के साथ बढ़ता है, फिर भी वर्तमान एजेंटों और मानव-स्तर की दक्षता के बीच महत्वपूर्ण अंतराल बने हुए हैं।

Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu2026-06-25
💬 NLP

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

यह पूर्व-पंजीकृत ऑडिट प्रकट करता है कि चार प्रमुख बायोमेडिकल बिब्लियोग्राफिक एपीआई (APIs), पबमेड सेंट्रल (PubMed Central) के JATS XML ग्राउंड ट्रुथ की तुलना में, विशेष रूप से टाइपोग्राफिक विराम चिह्नों और विशेष व्हाइटस्पेस (whitespace) के मामले में, महत्वपूर्ण और अघोषित वर्ण-स्तर (character-level) की निष्ठा हानि प्रदर्शित करते हैं, जो टेक्स्ट माइनिंग, कॉर्पस निर्माण और एलएलएम (LLM) प्रशिक्षण के लिए जोखिम उत्पन्न करते हैं।

Przemysław Czuma2026-06-25
💬 NLP

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

यह शोधपत्र यह प्रदर्शित करता है कि भाषा मॉडलों में, वह ज्यामितीय दिशा जो किसी व्यवहार (जैसे कि मतिभ्रम/hallucination) का सर्वोत्तम रूप से पता लगाती है, मौलिक रूप से उस दिशा से विसंरेखित है जो उसे नियंत्रित करती है, जो यह प्रकट करता है कि पता लगाना नियंत्रण क्षमता का निहितार्थ नहीं है और यह "पता लगाने-हस्तक्षेप अंतराल" (detection-intervention gap) एक प्रीट्रेनिंग-जनित संरचनात्मक पृथक्करण है न कि नियंत्रणीयता का एक पूर्वानुमेय मीट्रिक।

Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio2026-06-25
💬 NLP

Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

यह शोधपत्र डस्टिन (Dustin) को प्रस्तुत करता है, जो एक स्पार्स वेरिफिकेशन फ्रेमवर्क है जो महत्वपूर्ण टोकन को कुशलतापूर्वक पहचानने और KV कैश लोडिंग लेटेंसी को कम करने के लिए ड्राफ्ट मॉडल लुकअहेड सिग्नल्स को ऐतिहासिक अटेंशन के साथ जोड़ता है, जिससे नगण्य सटीकता हानि के साथ लॉन्ग-कॉन्टेक्स्ट स्पेकुलेटिव डिकोडिंग में महत्वपूर्ण गति प्राप्त होती है।

WenHung Lee, Jian-Jia Chen, Xiaolin Lin, Pei-Shuo Wang, Chi-Chih Chang, Chun-Che Yang, Ning-Chi Huang, Grace Li Zhang, K (…)2026-06-25
💬 NLP

LLM Performance on a Real, Double-Marked GCSE Benchmark

यह शोध पत्र डबल-मार्क्ड (दोहरी बार चिह्नित) GCSE परीक्षा प्रतिक्रियाओं का एक विशाल डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि 'ऑफ-द-शेल्फ' लार्ज लैंग्वेज मॉडल्स, हस्तलिखित गणित और व्यक्तिपरक अंग्रेजी निबंधों सहित विविध विषयों की ग्रेडिंग करने में मानव परीक्षकों की निरंतरता के बराबर या उससे भी अधिक हो सकते हैं, जो स्वचालित अंकन के लिए एक लागत प्रभावी समाधान प्रदान करते हैं।

Malachy Fox, Kavi Samra, Paul Jung2026-06-25