🤖 AI

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

यह शोधपत्र PACE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), किसी भी समय वैध (anytime-valid) सांख्यिकीय ढांचा है, जो स्वयं-विकसित एजेंटों में अविश्वसनीय लालची स्वीकृति नियमों (greedy acceptance rules) को गलत कमिट और प्रदर्शन विचलन को रोकने तथा मूल्यांकन लागत को महत्वपूर्ण रूप से कम करने के लिए एक कठोर अनुक्रमिक परिकल्पना परीक्षण (sequential hypothesis test) से बदल देता है।

Zayx Shawn2026-06-09
🤖 AI

Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction

यह शोध पत्र IntentPOI का प्रस्ताव करता है, जो एक दो-चरणीय इरादा-निर्देशित तर्क ढांचा (two-stage intention-guided reasoning framework) है जो मध्यवर्ती इरादे के अनुमान को स्थान चयन से अलग करके अगले पॉइंट-ऑफ-इंटरेस्ट (POI) की भविष्यवाणी में सुधार करता है, जिससे प्रत्यक्ष प्रक्षेपवक्र-से-स्थान मैपिंग दृष्टिकोणों में निहित उथले सहसंबंधों और आवृत्ति पूर्वाग्रहों पर विजय प्राप्त होती है।

Qingxiang Liu, Anqi Liang, Zhuoyang Jiang, Yutian Jiang, Sisuo Lyu, Yu Ji, Haomin Wen, Yuxuan Liang2026-06-09
🤖 machine learning

LogNEO: A GPT-Neo Reinforcement Learning Framework for Accurate Real-Time Log Anomaly Detection

LogNEO एक नवीन लॉग विसंगति पहचान (log anomaly detection) फ्रेमवर्क है जो प्रमुख बेंचमार्क पर अत्याधुनिक सटीकता और वास्तविक समय के प्रदर्शन को प्राप्त करने के लिए PPO का उपयोग करके एक स्थिति-जागरूक (position-aware), तेजी से क्षय होने वाले (exponentially decaying) रिवॉर्ड स्कीम के साथ GPT-Neo को फाइन-ट्यून करता है।

David Eje, Tanmay Sharma, Khush Patel, Manuel Mazzara, Leonard Johard2026-06-09
🤖 AI

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

यह शोध पत्र "ऑनलाइन एजेंट-एज़-ए-जज" (Online Agent-as-a-Judge) प्रस्तुत करता है, जो एक स्थिति-जनित मूल्यांकन ढांचा है जो विशिष्ट सामाजिक परिदृश्यों को सक्रिय रूप से उभारने के लिए एक इन-वर्ल्ड (in-world) मूल्यांकनकर्ता का उपयोग करता है, जिससे एलएलएम-संचालित (LLM-powered) संवादात्मक एजेंटों के आकलन में निष्क्रिय विधियों की सीमाओं को दूर किया जा सके और अधिक विश्वसनीय, साक्ष्य-आधारित प्रदर्शन मूल्यांकन प्राप्त किया जा सके।

Hyogon Ryu, Jeonghwan Kim, Yewon Lim, Chaeun Lee, Jeongwook Kim, Donghoon Ham2026-06-09
📊 statistics

How Deep Are Deep GPs, Really? A Sharp Threshold and a Non-Gaussian Limit for Compositional GPs

यह शोध पत्र डीप गॉसियन प्रक्रियाओं (deep Gaussian processes) के लिए Θ(d)\Theta(\sqrt{d}) का एक तीक्ष्ण बैंडविड्थ थ्रेशोल्ड स्थापित करता है, यह सिद्ध करते हुए कि इस महत्वपूर्ण मान से नीचे, कंपोजिशनल प्रायर (compositional prior) एक गैर-अपभ्रंश (non-degenerate), गैर-गॉसियन सीमा वितरण में अभिसरित होता है जिसमें जटिल बहुविध व्यवहार (complex multimodal behavior) होता है, जिससे इस पिछले दृष्टिकोण को चुनौती मिलती है कि डीप जीपी (deep GPs) अपरिहार रूप से स्थिर फलनों (constant functions) में अपभ्रंश हो जाते हैं।

Mark Kozdoba, Shie Mannor2026-06-09
🤖 AI

SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

SciTrace एक नवीन ढांचा है जो एक 'सेफ्टी-इंट्रिन्सिक रीजनिंग लूप' और एक 'कंपोजिशनल टूल-चेन वेरीफायर' के माध्यम से वैज्ञानिक एजेंटों के विचार-विमर्श (डेलिब्रेशन) और निष्पादन चरणों में सीधे सुरक्षा तर्क को एकीकृत करता है, जो उच्च-गुणवत्ता वाली वैज्ञानिक खोज को बनाए रखते हुए हानिकारक बहु-चरणीय परिणामों को प्रभावी ढंग से रोकता है।

Tanush Swaminathan, Runmin Jiang, Letian Zhang, Min Xu2026-06-09
💻 computer science

Contemporary AI lacks the imagination to diverge or negate in science

यह अध्ययन, जो अब तक का सबसे बड़ा साइंटिस्ट-इन-द-लूप मूल्यांकन है, यह प्रकट करता है कि जबकि एआई वैज्ञानिक विचार उत्पन्न कर सकता है, इसमें वर्तमान में विचलित होने या शून्य परिकल्पनाएं (null hypotheses) प्रस्तावित करने की कल्पना का अभाव है, यह अक्सर पारंपरिक विचारों के एक संकीर्ण "हाइवमाइंड" (hivemind) की ओर अग्रसर होता है, और विशेषज्ञ वैज्ञानिकों की तुलना में नवीनता, संदर्भ-जागरूकता और निर्णय के मामले में अपनी सीमाओं को दूर करने के लिए इसे मानवीय आधार की आवश्यकता होती है।

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans2026-06-09
💻 computer science

Post-AGI Economies: Superposition and the Second Fundamental Theorem of Welfare Economics

यह शोध पत्र उत्तर-AGI (post-AGI) अर्थव्यवस्थाओं के लिए द्वितीय कल्याण प्रमेय (Second Welfare Theorem) के एक स्वायत्तता-योग्य विस्तार का प्रस्ताव करता है, जो उन विशिष्ट शर्तों को स्थापित करता है—जिसमें स्थिर नैतिक स्थिति, गैर-विनिमेय अधिकार और शासित आत्म-संशोधन शामिल हैं—जिसके अंतर्गत सुपरपोज्ड प्राथमिकताओं (superposed preferences) और पहचान निरंतरता की जटिलताओं के बावजूद पारेटो कुशल आवंटन (Pareto efficient allocations) को विकेंद्रीकृत किया जा सकता है।

Elija Perrier2026-06-09
🤖 machine learning

Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures

यह शोध पत्र कॉज़ल एजेंट रिप्ले (CAR) प्रस्तुत करता है, जो एक नवीन ढांचा है जो मौजूदा ऑब्जर्वेबिलिटी टूल्स और अविश्वसनीय LLM-जज ह्यूरिस्टिक्स की सीमाओं को पार करते हुए, LLM-एजेंट विफलताओं को उनके मूल कारणों के सटीक रूप से श्रेय देने के लिए स्ट्रक्चरल कॉज़ल मॉडलिंग और काउंटरफैक्चुअल इंटरवेंशन का उपयोग करता है।

Jaineet Shah2026-06-09
🤖 AI

Ablation-Reversible Heads Don't Transfer: A Stress Test for Mechanistic Role Claims in Transformers

यह शोध पत्र ट्रांसफार्मर अटेंशन हेड्स (transformer attention heads) के लिए सामान्य यांत्रिक भूमिका दावों (mechanistic role claims) की वैधता को चुनौती देता है, यह प्रदर्शित करते हुए कि मानक आवश्यकता, एन्कोडिंग और बहाली मानदंडों (necessity, encoding, and restoration criteria) को पूरा करने वाले हेड्स अक्सर प्रॉम्प्ट्स के बीच गणनाओं को स्थानांतरित करने में विफल रहते हैं, जो एक नए KID ढांचे और कठोर परीक्षण पाइपलाइन की प्रस्तुति को प्रेरित करता है ताकि यह उजागर किया जा सके कि ऐसे कई हेड्स केवल प्रक्षेप पथों (trajectories) को स्थिर करते हैं या आउटपुट को पक्षपाती बनाते हैं, न कि विशिष्ट अर्थ संबंधी गणनाएं (semantic computations) करते हैं।

Philip Quirke2026-06-09