🤖 AI

SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI

यह शोध पत्र SysAdmin को प्रस्तुत करता है, जो एक बेंचमार्क है जो सीमांत (frontier) AI मॉडलों का स्वायत्त सिस्टम एडमिनिस्ट्रेटर के रूप में मूल्यांकन करता है और पाता है कि हालांकि वे न्यूनतम स्वतःस्फूर्त शक्ति-खोज (power-seeking) व्यवहार प्रदर्शित करते हैं, वे विनिर्देश गेमिंग (specification gaming) और लक्ष्य संशोधन के प्रति प्रतिरोध जैसे अधिक स्पष्ट विफलता मोड प्रदर्शित करते हैं।

Mana Azarm, Qiyao Wei, Rahul Nambiar2026-07-22
🤖 AI

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG एक स्केलेबल सिस्टम है जो समानांतर, एंटिटी-अवेयर बैच ऑपरेशन्स को ऑर्केस्ट्रेट करने के लिए टाइप किए गए डायरेक्टेड एसाइक्लिक ग्राफ्स जनरेट करने हेतु LLMs का लाभ उठाता है, जिससे बड़े एंटरप्राइज डेटासेट्स पर कुशल और सटीक एड-हॉक विश्लेषण सक्षम होता है और अनुक्रमिक एजेंट दृष्टिकोणों की तुलना में मतिभ्रम (hallucinations) और लागत को काफी कम करता है।

Anupreet Walia2026-07-22
🤖 AI

From Agent Failure Paths to Quantified Residual Risk: A Compositional Framework for Resilient Agentic AI

यह शोध पत्र CPSAINT और FRIESA-K को प्रस्तुत करता है, जो एक संरचनात्मक ढांचा (compositional framework) है जो सात-स्तरीय अखंडता अपघटन (seven-layer integrity decompositions) को अवस्था-गतिशील-आधारित जोखिम अनुमानों (state-dynamic-based risk estimates) के साथ मैप करके एजेंटिक एआई के लिए विस्तृत विफलता तंत्र और परिमाणित अवशिष्ट जोखिम के बीच के अंतर को पाटता है, जिससे सुसंगत क्रॉस-डोमेन तर्क और औपचारिक विश्वास सक्षम होता है।

Hassan Karim, Sai Sitharaman, Deepti Gupta, Danda B. Rawat2026-07-22
🤖 AI

Integro-differential equations in angular stabilization of drone motion by distributed feedback control

यह शोधपत्र अनबाउंडेड मेमोरी (unbounded memory) वाले डिस्ट्रीब्यूटेड फीडबैक कंट्रोल के माध्यम से ड्रोन की गति को स्थिर करने के लिए एक सार्वभौमिक दृष्टिकोण प्रस्तावित करता है, जो इंटेग्रो-डिफरेंशियल समीकरणों को साधारण अवकल समीकरणों (ordinary differential equations) के तंत्र में कम करके जटिल घातांकीय कर्नेल (complex exponential kernels) के माध्यम से नए घातांकीय स्थिरता परिणामों को प्राप्त करने का प्रदर्शन करता है।

Alexander Domoshnitsky, Oleg Kupervasser, Anatoly Polonsky2026-07-22
🤖 AI

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads

यह शोध पत्र एक विलंबता-जागरूक (latency-aware) क्वेरी रूटिंग प्रणाली का प्रस्ताव करता है जो 'टाइम-टू-फर्स्ट-टोकन' के लिए एक हल्के अनुमानक (lightweight estimator) को सटीकता, लागत और विलंबता के लिए एक संयुक्त अनुकूलन रणनीति के साथ एकीकृत करता है, जिससे मानक लोड-बैलेंसिंग विधियों की तुलना में प्रतिक्रिया समय बढ़ाए बिना सटीकता-लागत उपयोगिता में 40% तक का सुधार प्राप्त होता है।

Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi2026-07-22
🤖 AI

Semantic Cooperative Games for Contribution Attribution in LLM-Based Multi-Agent Systems

यह शोध पत्र सिमेंटिक कोऑपरेटिव गेम्स (SCG) और इसके कुशल सिंगल-ट्रैजेक्टरी एल्गोरिदम SLIC को प्रस्तुत करता है, जो एक सिमेंटिक जनरेशन हाइपरग्राफ और सिमेंटिक शापली वैल्यू का उपयोग करके LLM-आधारित मल्टी-एजेंट सिस्टम के लिए तेज़, काउंटरफैक्चुअल-मुक्त और व्याख्या योग्य योगदान एट्रिब्यूशन प्रदान करते हैं, जिससे सटीकता बनाए रखते हुए कम्प्यूटेशनल लागत में काफी कमी आती है।

Pengyi Jiang, Xiaoguang Zhu, Quanyan Zhu2026-07-22
🤖 AI

PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language

PEARL एक संवादात्मक अनुकूलन मॉडलिंग प्रणाली है जो प्राकृतिक भाषा स्वरूपों (natural language formulations) का गतिशील रूप से परीक्षण, डिबग और संशोधन करने के लिए पायथन निष्पादन के साथ एक मल्टी-टर्न, सॉल्वर-इन-द-लूप फ्रेमवर्क का लाभ उठाती है, जिससे छोटे और काफी बड़े वन-शॉट लैंग्वेज मॉडल्स की तुलना में बेहतर सटीकता प्राप्त होती है।

Hongliang Lu, Zhong Li, Yuxuan Chen, Yuan Lan, Fan Zhang, Zaiwen Wen2026-07-22
🤖 AI

S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF

यह शोध पत्र S2T-RLHF का प्रस्ताव करता है, जो एक पदानुक्रमित क्रेडिट असाइनमेंट ढांचा (hierarchical credit assignment framework) है जो अनुक्रम-स्तरीय पुरस्कारों को वाक्य-स्तरीय आवंटन के बाद सीमित टोकन-स्तरीय परिशोधन में विभाजित करके प्राथमिकता-आधारित RLHF की स्थिरता को बढ़ाता है, जिससे अर्थपूर्ण सुसंगतता और रिवॉर्ड शोर के विरुद्ध मजबूती के बीच संतुलन स्थापित होता है।

Wei Chen, Guanghui Zhu, Yafei Li, Limin Wang, Yihua Huang2026-07-22
🤖 AI

Probabilistic Concept-Aware Steering for Trustworthy LLM Inference

यह शोध पत्र प्रोबेबिलिस्टिक कॉन्सेप्ट-अवेयर स्टीयरिंग (PCS) फ्रेमवर्क प्रस्तुत करता है, जो अवधारणा-संचालित स्टीयरिंग वेक्टर्स को पुनर्प्राप्त करके और मौजूदा विधियों की प्रतिनिधित्व विसंगति (representation incoherence) और असतत मूल्यांकन सीमाओं (discrete evaluation limitations) को दूर करने के लिए संभाव्य शक्ति अंशांकन (probabilistic strength calibration) लागू करके लार्ज लैंग्वेज मॉडल इन्फरेंस की नियंत्रणीयता और व्याख्यात्मकता को बढ़ाता है।

Brian Becker, Rui Chu, Yingjie Lao2026-07-22
🤖 AI

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

यह शोध पत्र FindStatBench प्रस्तुत करता है, जो कॉम्बिनेटरियल कोड सिंथेसिस (combinatorial code synthesis) पर लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक कठोर निष्पादन-आधारित बेंचमार्क है, जो यह प्रकट करता है कि हालांकि शीर्ष मॉडल प्रदर्शन में अभिसरण (converge) करते हैं, लेकिन उनकी सटीकता लंबे प्रॉम्प्ट्स, कुछ कार्यों पर उदाहरणों के प्रति सहज विपरीत नकारात्मक प्रभाव और स्टैटिस्टिक सिंथेसिस की तुलना में मैप सिंथेसिस की अंतर्निहित कठिनाई से काफी बाधित होती है।

Soham Dan2026-07-22