🤖 AI

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

यह शोध पत्र तर्क देता है कि जैसे-जैसे कोडिंग एजेंट अधिक सक्षम होते जा रहे हैं, उनके आउटपुट का विश्वसनीय सत्यापन प्राथमिक बाधा बन गया है क्योंकि मानव इरादे की अपूर्ण विशिष्टता और त्रुटिपूर्ण प्रॉक्सी सत्यापनकर्ताओं के बीच एक अंतर्निहित अंतर मौजूद है, जिसके लिए रिवॉर्ड डिज़ाइन के प्रति एक सह-विकासवादी दृष्टिकोण की आवश्यकता है जो रिवॉर्ड हैकिंग को रोकने और निरंतर सुधार सुनिश्चित करने के लिए स्केलेबिलिटी, निष्ठा और मजबूती के बीच संतुलन बनाए रखे।

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu W (…)2026-06-26
💬 NLP

Axon: A Synthesizing Superoptimizer for Tensor Programs

Axon एक सिंथेसाइजिंग सुपरऑप्टिमाइज़र है जो प्रोग्राम सिंथेसिस और SMT-आधारित सिमेंटिक वेरिफिकेशन का उपयोग करके AI एक्सेलेरेटर्स के लिए उच्च-प्रदर्शन वाले टेंसर प्रोग्राम स्वचालित रूप से उत्पन्न करता है ताकि हैंड-क्राफ्टेड रीराइट रूल्स पर निर्भर रहे बिना बीजगणितीय रूपांतरणों (algebraic transformations) को खोजने, टाइलिंग और इंस्ट्रक्शन सिलेक्शन को अनुकूलित करने और ऑपरेटर्स को फ्यूज करने के लिए किया जा सके।

Akash Kothari, Shaowei Zhu, Daniel Kroening, Chungha Sung2026-06-26
💬 NLP

Phonetic and semantic analyses of spoken corpora of Beijing and Taiwan Mandarin indicate that the neutral tone is a lexical tone

बीजिंग और ताइवान मंदारिन का यह कॉर्पस-आधारित अध्ययन यह प्रदर्शित करता है कि न्यूट्रल टोन (तटस्थ स्वर) एक विशिष्ट शाब्दिक स्वर के रूप में कार्य करता है जिसका अपना टोनल टारगेट और पूर्वानुमेय शब्द-विशिष्ट पिच सिग्नेचर है, जो इसे केवल एक कम या बिना स्वर वाले तत्व के रूप में देखने वाले दृष्टिकोण को चुनौती देता है।

Yuxin Lu, Zhexuan Li, R. Harald Baayen2026-06-26
💬 NLP

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

यह शोध पत्र सोशल-फिजिकल ह्यूमन-रोबोट इंटरैक्शन (spHRI) का एक व्यवस्थित अवलोकन प्रस्तुत करता है जो यह दर्शाता है कि कैसे स्थानीय रूप से चलने वाले छोटे लैंग्वेज मॉडल्स (SLMs) मानव विशेषज्ञ स्क्रीनिंग को प्रभावी ढंग से बढ़ा सकते हैं, जिससे प्रक्रिया में काफी तेजी आती है और उन प्रासंगिक शोध पत्रों की पहचान होती है जिन्हें समीक्षक अन्यथा चूक सकते थे।

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block2026-06-26
💬 NLP

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

यह शोध पत्र ProfileFoundry को प्रस्तुत करता है, जो 100,000 सिंथेटिक, क्रॉस-फील्ड सुसंगत "पर्सन ऑब्जेक्ट्स" का एक नियतात्मक जनरेटर और फिक्स्ड रेफरेंस रिलीज़ है, जिसे वास्तविक उपयोगकर्ता डेटा और असंगत सिंथेटिक विकल्पों की सीमाओं को दूर करते हुए मेमोरी, प्राइवेसी और टूल-यूज़ कार्यों में फाउंडेशन मॉडल्स के जिम्मेदार मूल्यांकन को सक्षम करने के लिए डिज़ाइन किया गया है।

Sriram Selvam, Anneswa Ghosh2026-06-26
🤖 machine learning

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

DualEval एक संयुक्त मॉडल-आइटम अंशांकन (calibration) ढांचे को पेश करता है जो विश्वसनीय मॉडल रैंकिंग और कई डोमेन में आइटम-स्तरीय निदान (diagnostics) उत्पन्न करने के लिए स्थिर बेंचमार्क और एरिना-शैली के प्राथमिकता डेटा को एक साझा लेटेंट स्पेस में एकीकृत करता है।

Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica2026-06-26
💬 NLP

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

यह शोधपत्र ConflictScore प्रस्तुत करता है, जो एक नवीन मीट्रिक और बेंचमार्क है जिसे यह मापने के लिए डिज़ाइन किया गया है कि भाषा मॉडल अपने ग्राउंडिंग दस्तावेजों में विरोधाभासी साक्ष्यों को कितनी अच्छी तरह स्वीकार करते हैं, जो प्रतिक्रियाओं को परमाणु दावों (atomic claims) में विभाजित करके और सहायक एवं विरोधाभासी साक्ष्यों के बीच के अनुपात और संतुलन को मापकर किया जाता है।

Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia2026-06-26
💬 NLP

ProvenAI: Provenance-Native Traces of Evidence in Generated Answers

ProvenAI एक नया ढांचा पेश करता है जो रिट्रीवल-ऑगमेंटेड क्वेश्चन अनswering में पारदर्शिता को बढ़ाता है, इसे तीन स्वतंत्र रूप से मापने योग्य परतों—उत्तर की शुद्धता, उद्धरण निष्ठा और प्रति-दस्तावेज़ प्रभाव—में विभाजित करके, जो उद्धृत स्रोतों और वास्तव में मॉडल आउटपुट को संचालित करने वाले साक्ष्यों के बीच के महत्वपूर्ण अंतराल को उजागर करता है।

Mohammad Faizan, Dalal Alharthi2026-06-26
🤖 machine learning

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

यह शोध पत्र EpiKV प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) KV कैश इविक्शन विधि है जो शोर वाले अटेंशन-आधारित स्कोरिंग को आंतरिक प्रतिनिधित्व परिवर्तनों से प्राप्त एक "एपिफनी स्कोर" (epiphany score) से बदल देता है, जिससे अटेंशन मैट्रिक्स भौतिकीकरण (materialization) या कस्टम कर्नेल की आवश्यकता के बिना काफी लंबे कॉन्टेक्स्ट विंडो और तेज़ इन्फरेंस गति सक्षम होती है।

Steven Kolawole, Virginia Smith2026-06-26
💬 NLP

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

यह शोध पत्र आउट-ऑफ-बैंड एलएलएम (LLM) एजेंट सुरक्षा प्रणालियों के मूल्यांकन के लिए एक संरचित ढांचे का प्रस्ताव करता है, एक अनुकूली हमला प्रोटोकॉल के माध्यम से यह प्रदर्शित करता है कि प्रोजेंट (Progent) प्रणाली एक स्व-होस्ट किए गए एजेंट पर प्रॉम्प्ट इंजेक्शन की सफलता दर को काफी कम कर देती है, और यह तर्क देता है कि इन-बैंड डिटेक्शन की तुलना में नियत बाहरी प्रवर्तन (deterministic external enforcement) अधिक सुदृढ़ सुरक्षा स्थिति प्रदान करता है।

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu2026-06-26