💬 NLP

Depth-Staggered Fibonacci Spacing for Sparse Attention: Static Schedules Beat Learned Dilation and Extrapolate Where Dense Attention Fails

यह शोध पत्र प्रदर्शित करता है कि एक स्थिर, डेप्थ-स्टैगर्ड फाइबोनैकी स्पेसिंग शेड्यूल, स्पार्स अटेंशन के लिए सीखे गए डिलेशन स्कीम्स की तुलना में दक्षता में बेहतर प्रदर्शन करता है और प्रशिक्षण लंबाई के चार गुना तक मजबूत एक्सट्रपलेशन सक्षम करता है, जबकि घने अटेंशन मॉडल ऐसी स्थितियों में ढह जाते हैं, भले ही प्रशिक्षण लंबाई पर स्पार्स वेरिएंट का पर्प्लेक्सिटी अधिक हो।

Chad A. Capps2026-06-30
💬 NLP

Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs

यह शोध पत्र "ग्रेन कैलिब्रेशन" (grain calibration) प्रस्तावित करता है, जो एक ऐसी विधि है जो सैद्धांतिक संरचनाओं को उपवाक्य-स्तरीय घटकों में विभाजित करके और मॉडल द्वारा केवल मानवीय एनोटेशन के साथ सहसंबंध बनाने के बजाय इच्छित संरचनाओं को मापने के लिए स्पष्ट, सिद्धांत-व्युत्पन्न नियमों को लागू करके लार्ज लैंग्वेज मॉडल्स को मापन उपकरणों के रूप में मान्य करती है।

Manuel Pita2026-06-30
💻 computer science

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

यह शोध पत्र Animation2Code प्रस्तुत करता है, जो 1,069 वीडियो-एनिमेशन युग्मों और सटीक टेम्पोरल डायनेमिक्स के साथ निष्पादन योग्य वेब एनिमेशन को पुनर्गठित करने में वर्तमान विजन-लैंग्वेज मॉडल्स की सीमाओं का मूल्यांकन करने और उन्हें प्रकट करने के लिए नवीन मानव-संरेखित मेट्रिक्स से युक्त एक बेंचमार्क है।

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr2026-06-30
💻 computer science

The Undecidability of Artificial General Intelligence (AGI) Alignment

यह शोध पत्र यह स्थापित करता है कि एजीआई (AGI) संरेखण (alignment) असंभव नहीं बल्कि संरचनात्मक रूप से unverifiable (असिद्ध करने योग्य नहीं) है, जो ट्रैखटनब्रॉट की दीवार (Trakhtenbrot's Wall) और एक व्युत्पन्न साउंडनेस-कम्प्लीटनेस-ट्रैक्टेबिलिटी ट्रिलेमा (Soundness-Completeness-Tractability Trilemma) के माध्यम से यह सिद्ध करता है कि वर्तमान रोकथाम रणनीतियाँ अस्थायी सुधार नहीं बल्कि निर्णायक सुरक्षा प्राप्त करने के लिए तार्किक अभिव्यंजना (logical expressivity) का आवश्यक त्याग हैं।

Jose Pascual Gumbau Mezquita2026-06-30
🤖 machine learning

When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

यह शोध पत्र तर्क देता है कि रीजनिंग सिस्टम में टेस्ट-टाइम स्केलिंग (test-time scaling) मौलिक "मोडल" (modal) और "सहसंबंध" (correlation) सीमाओं का सामना करती है जहाँ अत्यधिक सैंपलिंग उत्तर चयन में सुधार करने में विफल रहती है और प्रदर्शन को खराब भी कर सकती है, जो यह सुझाव देता है कि वास्तविक बाधा उत्तर उत्पन्न करने के बजाय सही उत्तरों को पहचानने में निहित है।

Yong Yi Bay, Kathleen A. Yearick2026-06-30
💬 NLP

AnTenA: Actionable and Explainable Tensor Analysis System with Large Language Models

यह शोध पत्र AnTenA को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो मल्टी-आस्पेक्ट टेंसर डेटा में छिपे हुए पैटर्न से कार्रवाई योग्य और व्याख्यात्मक अंतर्दृष्टि उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो गलत या अनुपलब्ध लेबल और मेटाडेटा की सीमाओं को संबोधित करता है।

Dawon Ahn, Auder Der, Evangelos E. Papalexakis2026-06-30
💬 NLP

SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages

यह शोध पत्र SEATauBench प्रस्तुत करता है, जो दक्षिण-पूर्व एशियाई संप्रभु एआई (sovereign AI) के लिए पहला मूल्यांकन ढांचा है जो TauBench को पांच क्षेत्रीय भाषाओं के अनुकूल बनाता है, जिससे यह पता चलता है कि हालांकि अंग्रेजी एजेंट की क्षमताएं स्थानीयकृत बातचीत में अच्छी तरह से स्थानांतरित होती हैं, लेकिन जैसे-जैसे कार्य संदर्भ और टूल विशिष्टताएँ पूरी तरह से स्थानीयकृत होती हैं, उनका प्रदर्शन और मजबूती काफी कम हो जाती है।

My Chiffon Nguyen, Aulia Adila, Saksorn Ruangtanusak, Kittiphat Leesombatwathana, Vissuta Gunawan Lim, Patomporn Payoung (…)2026-06-30
⚡ electrical engineering

Improving Large-Scale Weakly Supervised ASR by Filtering and Selection

यह शोध पत्र बड़े पैमाने पर कमजोर रूप से पर्यवेक्षित (weakly supervised) ASR के लिए एक नवीन तीन-चरणीय प्रशिक्षण दृष्टिकोण प्रस्तावित करता है जो प्रारंभिक प्रीट्रेनिंग को कैरेक्टर एरर रेट-आधारित फ़िल्टरिंग और डोमेन-विशिष्ट ध्वनिक चयन के साथ जोड़ता है, जिससे 90,000-घंटे के जापानी डेटासेट पर कैरेक्टर एरर रेट को 6.4% तक सफलतापूर्वक कम किया गया है।

Kohei Matsuura, Masato Mimura2026-06-30
💬 NLP

Majority Vote Silences Minority Values: Annotator Disagreement at the Hate/Offensive Boundary in HateXplain

यह शोध पत्र यह तर्क देता है कि एनोटेटर असहमति को बहुमत मत लेबल में समेटने की मानक पद्धति घृणा भाषण (हेट स्पीच) डिटेक्शन में एक संरचनात्मक दोष उत्पन्न करती है, जो विवादास्पद सीमावर्ती मामलों को गलत तरीके से 'ग्राउंड ट्रुथ' के रूप में प्रमाणित कर देती है, जिससे मॉडल उन त्रुटियों में उच्च आत्मविश्वास प्रदर्शित करते हैं जिन्हें डाउनस्ट्रीम हस्तक्षेपों द्वारा ठीक नहीं किया जा सकता है।

Joshua Muhumuza, Joab Ezra Agaba, Mercy Amiyo2026-06-30
💻 computer science

Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch

यह शोध पत्र मैथस्विच (Mathswitch) प्रोजेक्ट के विकीडेटा-व्युत्पन्न गणितीय अवधारणा अभिलेखों से शोर (noise) को फ़िल्टर करने में लार्ज लैंग्वेज मॉडल्स के एक वोटिंग एन्सेम्बल की प्रभावकारिता का मूल्यांकन करता है, और भविष्य की सुधार रणनीतियों को सूचित करने के लिए विशिष्ट असहमति पैटर्न की पहचान करता है।

Katja Berčič, Slobodan Stanojevikj2026-06-30