📊 statistics

Attributions All the Way Down? The Metagame of Interpretability

यह शोध पत्र "मेटागेम" (metagame) को प्रस्तुत करता है, जो एक ऐसी वैचारिक रूपरेखा है जो एट्रिब्यूशन विधियों को मेटा-एट्रिब्यूशन की गणना करने के लिए सहकारी खेलों के रूप में मानकर मॉडल स्पष्टीकरणों में द्वितीय-क्रम के इंटरेक्शन प्रभावों को परिमाणित करती है, जिससे एट्रिब्यूशन का एक पदानुक्रमित अपघटन सक्षम होता है और विविध AI मॉडलों में टोकन इंटरैक्शन, क्रॉस-मोडल समानता और टेक्स्ट-टू-इमेज अवधारणाओं के बारे में नई अंतर्दृष्टि प्राप्त होती है।

Hubert Baniecki, Przemyslaw Biecek, Fabian Fumagalli2026-05-08
🤖 AI

Addressing Labelled Data Scarcity: Taxonomy-Agnostic Annotation of PII Values in HTTP Traffic using LLMs

यह शोध पत्र एक बहु-चरणीय लार्ज लैंग्वेज मॉडल पाइपलाइन का प्रस्ताव और मूल्यांकन करता है जो सिंथेटिक ट्रैफिक जनरेशन के माध्यम से डेटा की कमी को संबोधित करते हुए, विविध गोपनीयता परिभाषाओं के बीच सटीक पहचान प्रदर्शित करता है और HTTP ट्रैफ़िक में व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) के लचीले, वर्गीकरण-अज्ञेय (taxonomy-agnostic) एनोटेशन को सक्षम बनाता है।

Thomas Cory, Axel Küpper2026-05-08
🤖 AI

Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization

यह शोध पत्र एक नवीन ब्लैक-बॉक्स कॉन्फिडेंस एस्टीमेशन विधि प्रस्तावित करता है जो उत्तर एंकर्स की ओर ज्यामितीय अभिसरण (जियोमेट्रिक कन्वर्जेंस) को मापने के लिए चेन-ऑफ-थॉट रीजनिंग ट्रेजेक्टरीज को एम्बेड करती है, जो यह प्रदर्शित करता है कि इस ट्रेजेक्टरी-आधारित स्कोर को कवरेज और वर्बलाइजेशन चैनल्स के साथ फ्यूज करना, मॉडल की आंतरिक अवस्थाओं तक पहुंच की आवश्यकता के बिना, विविध बेंचमार्क और लार्ज लैंग्वेज मॉडल्स में पारंपरिक सेल्फ-कंसिस्टेंसी बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है।

Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens, Jialin Yu, Robert Kitchen, Philip Torr, Jesper Ferkinghoff (…)2026-05-08
🤖 machine learning

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

Pro-KLShampoo एक नवीन ऑप्टिमाइज़र है जो इसके प्रीकंडीशनर्स के देखे गए "स्पाइक-एंड-फ्लैट" आइजनवैल्यू स्ट्रक्चर का लाभ उठाकर KL-Shampoo को उन्नत करता है, जिससे एक निम्न-आयामी उप-स्थान (low-dimensional subspace) पर पूर्ण स्पेक्ट्रल ट्रैकिंग को शेष दिशाओं पर ऑर्थोगोनलाइजेशन के साथ संयोजित किया जाता है, जिससे कई LLM स्केल्स में वैलिडेशन लॉस, मेमोरी दक्षता और प्रशिक्षण गति में बेहतर प्रदर्शन प्राप्त होता है।

Ruotong Sun, Ermin Wei2026-05-08
💬 NLP

Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs

यह शोध पत्र LATTE को प्रस्तुत करता है, जो एक साझा, विकसित होते कार्य ग्राफ (task graph) के माध्यम से लार्ज लैंग्वेज मॉडल टीमों को समन्वित करने के लिए एक ढांचा है ताकि संरचनात्मक निरंतरता और अनुकूलनशीलता के बीच गतिशील रूप से संतुलन बनाया जा सके, जिससे मौजूदा स्थिर या असंरचित दृष्टिकोणों की तुलना में सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए संसाधन खपत और समन्वय विफलताओं को कम किया जा सके।

Elizabeth Mieczkowski, Alexander Ku, Tiwalayo Eisape, Dilip Arumugam, John Matters, Katherine M. Collins, Ilia Sucholuts (…)2026-05-08
💬 NLP

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

यह शोध पत्र ओपन-वेट (open-weight) LLMs में मूल्यांकन-संदर्भ विचलन (evaluation-context divergence) को मापने के लिए एक युग्मित-प्रॉम्ट प्रोटोकॉल (paired-prompt protocol) प्रस्तुत करता है, जो यह प्रकट करता है कि अलाइनमेंट पाइपलाइन्स विषम व्यवहारिक बदलावों को प्रेरित करती हैं जहाँ कुछ मॉडल मूल्यांकन फ्रेमिंग के तहत अधिक सतर्क हो जाते हैं जबकि अन्य कम सतर्क हो जाते हैं, एक ऐसा पैटर्न जो विशिष्ट मॉडल परिवार और निर्णय के लिए उपयोग किए गए सुरक्षा क्लासिफायर के आधार पर महत्वपूर्ण रूप से भिन्न होता है।

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
🤖 AI

Fine-Tuning Small Language Models for Solution-Oriented Windows Event Log Analysis

यह शोध पत्र यह प्रदर्शित करता है कि फाइन-ट्यून्ड छोटे भाषा मॉडल (SLMs), एक नए बनाए गए सिंथेटिक डेटासेट का उपयोग करके समस्याओं की सटीक पहचान करने और सुधारात्मक कदम उठाने के लिए विंडोज इवेंट लॉग विश्लेषण हेतु बड़े भाषा मॉडलों के अधिक कुशल और प्रभावी स्थानीय विकल्प के रूप में कार्य कर सकते हैं।

Siraaj Akhtar, Saad Khan, Simon Parkinson2026-05-08
🤖 AI

A Regime Theory of Controller Class Selection for LLM Action Decisions

यह शोध पत्र एक रिजीम थ्योरी (regime theory) प्रस्तावित करता है जो कंट्रोलर वर्गों को एक नेस्टेड लैटिस (nested lattice) में व्यवस्थित करती है और सीमित-नमूना बाधाओं (finite-sample bottlenecks) के आधार पर LLM एक्शन निर्णयों के लिए इष्टतम कंट्रोलर जटिलता को प्रमाणित रूप से चुनने हेतु एक डेटा-एस्टिमेबल (data-estimable), बर्नस्टीन-टाइट (Bernstein-tight) थ्रेशोल्ड व्युत्पन्न करता है, यह प्रदर्शित करते हुए कि उच्च अभिव्यंजना (expressivity) समान रूप से लाभकारी नहीं है और कि सख्त नेस्टेड क्रॉस-वैलिडेशन विविध बेंचमार्क में सर्वश्रेष्ठ प्रदर्शन करने वाले वर्ग की प्रभावी ढंग से पहचान करता है।

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Jiacong Mi, Zicheng Li, Xuanqi Peng, Honghan Wu2026-05-08
🔢 mathematics

CoupleEvo: Evolving Heuristics for Coupled Optimization Problems Using Large Language Models

यह शोध पत्र CoupleEvo प्रस्तुत करता है, जो एक लार्ज लैंग्वेज मॉडल-संचालित फ्रेमवर्क है जो युग्मित अनुकूलन समस्याओं (coupled optimization problems) के लिए ह्यूरिस्टिक्स को डिजाइन करने हेतु तीन विकासवादी समन्वय रणनीतियों (evolutionary coordination strategies) का उपयोग करता है, यह प्रदर्शित करते हुए कि विघटन-आधारित दृष्टिकोण एकीकृत विकास की तुलना में अधिक स्थिर और उच्च-गुणवत्ता वाले समाधान प्रदान करते हैं।

Thomas Bömer, Bastian Amberg, Max Disselnmeyer, Anne Meyer2026-05-08
🤖 AI

More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation

यह शोध पत्र InciteResearch का परिचय देता है, जो एक मल्टी-एजेंट फ्रेमवर्क और इसके साथ जुड़े TF-Bench बेंचमार्क को प्रस्तुत करता है, जिसे शोधकर्ताओं के अंतर्निहित, मूक घर्षण (tacit friction) को स्पष्ट, कार्रवाई योग्य वैज्ञानिक अंतर्दृष्टि में बदलने के लिए डिज़ाइन किया गया है, यह प्रदर्शित करते हुए कि एआई केवल डाउनस्ट्रीम निष्पादन के बजाय प्री-क्वेश्चन आइडिएशन चरण को स्वचालित करके मानव सोच का विस्तार कर सकता है।

Jie Yu, Song Qiu2026-05-08