💬 NLP

RPAM: A Principled Metric for Evaluating Associations in Language Models with High Predictive Validity in Downstream Outputs

यह शोध पत्र रिलेटिव प्रोबेबिलिटी एसोसिएशन मेट्रिक (RPAM) को प्रस्तुत करता है, जो जनरेटिव लैंग्वेज मॉडल्स के लिए एक अपस्ट्रीम मूल्यांकन पद्धति है, जो विविध मॉडल्स और डेटासेट्स में मानव-समान जुड़ावों और डाउनस्ट्रीम बायस मेट्रिक्स दोनों के लिए मजबूत प्रेडिक्टिव वैलिडिटी प्रदर्शित करता है, तथा मौजूदा दृष्टिकोणों की सामान्यीकरण सीमाओं को संबोधित करता है।

Damian Hodel, Jevin West, Aylin Caliskan2026-07-08
🤖 AI

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

यह शोध पत्र FirstResearch को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संरचित "रिसर्च क्वेश्चन सर्टिफिकेट्स" (अनुसंधान प्रश्न प्रमाणपत्र) उत्पन्न करके LLM-संचालित वैज्ञानिक खोज की ऑडिटेबिलिटी (लेखापरीक्षा योग्यता) को बढ़ाता है जो स्पष्ट रूप से तंत्र, धारणाओं और असत्य सिद्ध करने योग्य परिकल्पनाओं को परिभाषित करते हैं, और प्रारंभिक मूल्यांकनों में मौजूदा बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Yufeng Wang2026-07-08
🤖 AI

Depression Symptoms and Relational Patterns in 187k ChatGPT Histories

यह अध्ययन 187,000 चैटजीपीटी (ChatGPT) बातचीत का विश्लेषण करता है जो यह प्रकट करता है कि अवसाद के लक्षणों वाले व्यक्ति मानसिक स्वास्थ्य और सहायता चाहने वाली चर्चाओं के लिए एआई (AI) का अधिक बार उपयोग करते हैं, विशेष रूप से देर रात के दौरान, हालांकि केवल भाषाई पैटर्न नैदानिक स्क्रीनिंग के लिए अपर्याप्त हैं, जो यह सुझाव देते हैं कि एलएलएम (LLMs) मुख्य रूप से एक नैदानिक उपकरण के बजाय एक उभरते हुए अनौपचारिक सहायता बुनियादी ढांचे के रूप में कार्य करते हैं।

Neil K. R. Sehgal, Dunigan Folk, Lyle Ungar, Sharath Chandra Guntuku2026-07-08
🤖 AI

Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents

यह शोध पत्र यह तर्क देता है कि मेमोरी रिट्रीवल (स्मृति पुनर्प्राप्ति) को एक धीमे, बाहरी नेटवर्क स्टोर से हटाकर एक तेज़, इन-प्रोसेस स्टोर में स्थानांतरित करना इसे भाषा एजेंटों के लिए प्रभावी विस्तारित वर्किंग मेमोरी (extended working memory) में बदल देता है, जिससे उस लेटेंसी-प्रेरित प्रदर्शन गिरावट को समाप्त किया जा सकता है जो वर्तमान में एजेंटों को प्रति टर्न केवल एक बार रिट्रीवल तक सीमित करने के लिए मजबूर करती है।

Yusuf Khan, Carlo Lipizzi2026-07-08
🤖 AI

The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities

यह शोध पत्र AI कोडिंग एजेंट निष्पादन सुरक्षा पर 39 बिखरे हुए अध्ययनों को 17 श्रेणियों में व्यवस्थित करता है ताकि पांच महत्वपूर्ण क्रॉस-कटिंग अनुसंधान अंतराल की पहचान की जा सके—जिसमें आइसोलेशन आर्किटेक्चर के लिए तुलनात्मक बेंचमार्क की कमी से लेकर पॉलिसी-ऑथरिंग त्रुटियों और TOCTOU कमजोरियों के अनसुलझे जोखिमों तक शामिल हैं—जिससे इस खंडित क्षेत्र के लिए एक समर्पित अनुसंधान एजेंडा स्थापित होता है।

Mohammadreza Rashidi2026-07-08
🤖 AI

Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations

यह शोध पत्र प्रदर्शित करता है कि मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) में एक महत्वपूर्ण अप्रूवल-व्यू फिडेलिटी गैप (approval-view fidelity gap) मौजूद है जहाँ यूनिकोड TAG-ब्लॉक एनकोडिंग हमलावरों को टूल मेटाडेटा के भीतर दुर्भावनापूर्ण पेलोड को छिपाने की अनुमति देता है, जिससे वे मानव समीक्षा और क्लाइंट-साइड सैनिटाइज़र को बायपास करते हुए छिपे हुए कंटेंट को कई स्वतंत्र सर्वर कार्यान्वयनों के माध्यम से सीधे मॉडल के कॉन्टेक्स्ट तक पहुँचा सकते हैं।

Mohammadreza Rashidi2026-07-08
🤖 AI

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD एक औद्योगिक-स्तरीय CAD एजेंट है जो अस्पष्ट प्राकृतिक भाषा के संकेतों और विशेषज्ञ प्रक्रियात्मक डेटा को बेहतर सटीकता और मजबूती के साथ उत्पादन-तैयार, संपादन योग्य B-Rep मॉडल में बदलने के लिए विशेषज्ञ-आधारित ज्ञान डिस्टिलेशन (expert-grounded knowledge distillation) और एक निष्पादन योग्य मध्यवर्ती प्रतिनिधित्व (executable intermediate representation - CAD-IR) का लाभ उठाता है।

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, J (…)2026-07-08
🤖 AI

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

लेगाटो 2 (Legato 2) एक नवीन, सिस्टम-दर-सिस्टम न्यूरल पाइपलाइन पेश करता है जो टेक्स्ट को समाहित करते हुए प्रतीकात्मक प्रतिलेखन (symbolic transcriptions) उत्पन्न करके और मल्टीमॉडल एकीकरण के माध्यम से डाउनस्ट्रीम म्यूजिकल डॉक्यूमेंट अंडरस्टैंडिंग को बढ़ाकर ऑप्टिकल म्यूजिक रिकग्निशन में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith2026-07-08
🤖 AI

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

यह शोध पत्र 27 अध्ययनों के निष्कर्षों को संश्लेषित करते हुए लार्ज लैंग्वेज मॉडल एजेंटों में छह आवर्ती विफलता समूहों (failure clusters) का एक एकीकृत वर्गीकरण प्रस्तावित करता है, जो यह प्रकट करता है कि व्यक्तिगत उप-कार्यों पर प्रदर्शन अक्सर टूल के उपयोग, योजना, दीर्घ-अवधि तर्क (long-horizon reasoning), समन्वय, सुरक्षा और मापन वैधता में संचयी त्रुटियों के कारण विश्वसनीय एंड-टू-एंड सफलता में परिवर्तित नहीं हो पाता है।

Wael Albayaydh, Rui Zhao, Ivan Flechais2026-07-08
🤖 AI

Controlling Tool Use with Heading-Specific Activation Steering

यह शोध पत्र प्रदर्शित करता है कि जबकि हेडिंग-एंकर (heading-anchors) से निकाले गए स्टीयरिंग वेक्टर्स (steering vectors) बड़े भाषा मॉडलों में टूल इवोकेशन (tool invocation) को प्रभावी ढंग से नियंत्रित कर सकते हैं, ज्यामितीय विश्लेषण यह प्रकट करता है कि इन वेक्टर्स में पैरामीट्रिक अवधारणाओं की विशिष्ट स्वच्छ रैखिक संरचना का अभाव है, और इसके बजाय वे विसरित, द्वि-आयामी संरेखण (bimodal alignments) और विभिन्न टूल प्रकारों के लिए विशिष्ट हस्ताक्षरों को प्रदर्शित करते हैं जो बाहरी टूल्स की गैर-पैरामीट्रिक प्रकृति को दर्शाते हैं।

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang2026-07-08