💬 NLP

Small edits, large models: How Wikipedia advocacy shapes LLM values

यह शोध पत्र प्रदर्शित करता है कि विकिपीडिया स्वयंसेवकों का एक छोटा, समन्वित समूह पशु कल्याण जैसे विशिष्ट विषयों के संबंध में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के मूल्यों और प्रतिक्रियाओं को महत्वपूर्ण रूप से आकार दे सकता है, क्योंकि उनके लक्षित संपादन असंबंधित सामग्री की तुलना में मॉडल प्रशिक्षण और व्यवहार में असमान रूप से प्रभावशाली हो जाते हैं।

Jasmine Brazilek, Maria Navas, Alexa Gnauck2026-06-25
💬 NLP

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

यह शोधपत्र AgentOdyssey को प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है जो अन्वेषण करने, ज्ञान प्राप्त करने, एपिसोडिक मेमोरी (episodic memory) को बनाए रखने और लंबी अवधि के नियोजन (long horizons) की क्षमताओं का आकलन और निदान करने के लिए प्रक्रियात्मक रूप से ओपन-एंडेड टेक्स्ट गेम्स को उत्पन्न करता है, जिससे यह प्रकट होता है कि हालांकि प्रदर्शन मजबूत मॉडलों के साथ बढ़ता है, फिर भी वर्तमान एजेंटों और मानव-स्तर की दक्षता के बीच महत्वपूर्ण अंतराल बने हुए हैं।

Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu2026-06-25
💬 NLP

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

यह पूर्व-पंजीकृत ऑडिट प्रकट करता है कि चार प्रमुख बायोमेडिकल बिब्लियोग्राफिक एपीआई (APIs), पबमेड सेंट्रल (PubMed Central) के JATS XML ग्राउंड ट्रुथ की तुलना में, विशेष रूप से टाइपोग्राफिक विराम चिह्नों और विशेष व्हाइटस्पेस (whitespace) के मामले में, महत्वपूर्ण और अघोषित वर्ण-स्तर (character-level) की निष्ठा हानि प्रदर्शित करते हैं, जो टेक्स्ट माइनिंग, कॉर्पस निर्माण और एलएलएम (LLM) प्रशिक्षण के लिए जोखिम उत्पन्न करते हैं।

Przemysław Czuma2026-06-25
💬 NLP

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

यह शोधपत्र यह प्रदर्शित करता है कि भाषा मॉडलों में, वह ज्यामितीय दिशा जो किसी व्यवहार (जैसे कि मतिभ्रम/hallucination) का सर्वोत्तम रूप से पता लगाती है, मौलिक रूप से उस दिशा से विसंरेखित है जो उसे नियंत्रित करती है, जो यह प्रकट करता है कि पता लगाना नियंत्रण क्षमता का निहितार्थ नहीं है और यह "पता लगाने-हस्तक्षेप अंतराल" (detection-intervention gap) एक प्रीट्रेनिंग-जनित संरचनात्मक पृथक्करण है न कि नियंत्रणीयता का एक पूर्वानुमेय मीट्रिक।

Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio2026-06-25
💬 NLP

Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

यह शोधपत्र डस्टिन (Dustin) को प्रस्तुत करता है, जो एक स्पार्स वेरिफिकेशन फ्रेमवर्क है जो महत्वपूर्ण टोकन को कुशलतापूर्वक पहचानने और KV कैश लोडिंग लेटेंसी को कम करने के लिए ड्राफ्ट मॉडल लुकअहेड सिग्नल्स को ऐतिहासिक अटेंशन के साथ जोड़ता है, जिससे नगण्य सटीकता हानि के साथ लॉन्ग-कॉन्टेक्स्ट स्पेकुलेटिव डिकोडिंग में महत्वपूर्ण गति प्राप्त होती है।

WenHung Lee, Jian-Jia Chen, Xiaolin Lin, Pei-Shuo Wang, Chi-Chih Chang, Chun-Che Yang, Ning-Chi Huang, Grace Li Zhang, K (…)2026-06-25
💬 NLP

LLM Performance on a Real, Double-Marked GCSE Benchmark

यह शोध पत्र डबल-मार्क्ड (दोहरी बार चिह्नित) GCSE परीक्षा प्रतिक्रियाओं का एक विशाल डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि 'ऑफ-द-शेल्फ' लार्ज लैंग्वेज मॉडल्स, हस्तलिखित गणित और व्यक्तिपरक अंग्रेजी निबंधों सहित विविध विषयों की ग्रेडिंग करने में मानव परीक्षकों की निरंतरता के बराबर या उससे भी अधिक हो सकते हैं, जो स्वचालित अंकन के लिए एक लागत प्रभावी समाधान प्रदान करते हैं।

Malachy Fox, Kavi Samra, Paul Jung2026-06-25
🤖 machine learning

Why Do Accumulated Transformations Extrapolate?

यह शोध पत्र यह प्रदर्शित करता है कि अटेंशन मैकेनिज्म में स्थिति-अनुक्रमित रोटेशन (position-indexed rotations) को संचित, टोकन-निर्भर ऑर्थोगोनल रूपांतरणों (जैसे कि हाउसहोल्डर रिफ्लेक्शन या SO(2) रोटेशन) से बदलने से स्वाभाविक रूप से लेंथ एक्सट्रपलेशन (length extrapolation) में सुधार होता है, क्योंकि यह एक परिमित मिश्रण विंडो (finite mixing window) बनाता है और इनकोहेरेंस (incoherence) के माध्यम से दूरस्थ टोकन को दबा देता है, हालांकि ALiBi जैसे स्पष्ट 'फार-मास कंट्रोल' तंत्र के बिना अत्यधिक लंबाई पर प्रदर्शन अंततः कम हो जाता है।

Mahesh Godavarti2026-06-25
🤖 AI

Diagnosing and Mitigating Compounding Failures in Agentic Persuasion via Taxonomic Strategy Retrieval

यह शोध पत्र टैक्सोनोमिक स्ट्रैटेजी RAG (TS-RAG) को प्रस्तुत करता है, जो एक नवीन रिट्रीवल फ्रेमवर्क है जो सिमेंटिक लीकेज को समाप्त करने के लिए तर्कसंगत संरचना को विषयगत सामग्री से अलग करता है, जिससे एजेंटिक पर्सुएशन में संचयी त्रुटियों को रोका जा जा सकता है और हल्के एजेंटों को श्रेष्ठ विरोधियों से बेहतर प्रदर्शन करने में सक्षम बनाया जा सकता है।

Pradyumna Narayana, Sana Ayromlou, Purvi Sehgal2026-06-25
🤖 machine learning

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

यह स्थिति पत्र (position paper) तर्क देता है कि जबकि न्यूरल स्केलिंग लॉ के घातांक (exponents) सॉफ्टमैक्स नॉन-लिनियरिटी (Softmax nonlinearity) और रिप्रजेंटेशनल सुपरपोजिशन (representational superposition) जैसे सार्वभौमिक तंत्रों द्वारा निर्धारित होते हैं, उनके गुणांक (coefficients)—जो व्यावहारिक प्रदर्शन और इष्टतम मॉडल विन्यास को निर्देशित करते हैं—विशिष्ट डेटा और वास्तुशिल्प विवरणों के प्रति संवेदनशील होते हैं, जिससे उनका बोध निकट-अवधि के एआई सुधारों की कुंजी बन जाता है।

Yizhou Liu, Jeff Gore2026-06-25
🤖 machine learning

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर मॉडलों में उभरती हुई क्षमताएं प्रशिक्षण के दौरान कार्य-प्रासंगिक, विरल अटेंशन पैटर्न (sparse attention patterns) के अचानक सीखने के परिणामस्वरूप स्टोकेस्टिक रूप से उत्पन्न होती हैं, जिसमें बड़े मॉडल बेहतर शिक्षण दक्षता के कारण इन पैटर्न को पहले प्राप्त कर लेते हैं।

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov2026-06-25✓ Author reviewed