🤖 AI

Stress Testing Concept Erasure with Large Language Model Agents

यह शोध पत्र STACE को प्रस्तुत करता है, जो कई LLM एजेंटों का लाभ उठाकर अनुकूलन योग्य स्ट्रेस टेस्ट को पुनरावृत्ति रूप से उत्पन्न और सत्यापित करने वाला एक स्वायत्त ढांचा है, जिससे यह जनरेटिव मॉडल में कॉन्सेप्ट इरेज़र के आकलन के लिए स्थिर मूल्यांकन विधियों की तुलना में अधिक मजबूती से प्रदर्शन करता है और LLM जेलब्रेकिंग जैसे अन्य डोमेन में अपनी प्रयोज्यता प्रदर्शित करता है।

Yuyang Xue, Feng Chen, Zhihua Liu, Edward Moroshko, Jingyu Sun, Steven McDonagh, Sotirios A. Tsaftaris2026-07-21
🤖 AI

PEARL: Auditable Repair for Scientific Reasoning Graph Extraction

PEARL एक प्रशिक्षण-मुक्त ढांचा है जो शोरयुक्त (noisy) LLM-जनित वैज्ञानिक तर्क ग्राफों को एक पियर्सियन स्कीमा (Peircean schema) के तहत भौतिक रूप देकर और साक्ष्य-आधारित सुधार लागू करके उन्हें ऑडिट योग्य, अर्थपूर्ण रूप से वैध संरचनाओं में परिवर्तित करता है, जिससे ARCHE बेंचमार्क पर निष्कर्षण सटीकता में महत्वपूर्ण सुधार होता है।

Bohan Su, Pengze Li, Yuchen Lu, Xi Chen2026-07-21
🤖 machine learning

A Geometric Perspective on Stabilizing Value Conflict Resolution

यह शोध पत्र प्रस्तावित करता है कि मूल्य संघर्ष-केंद्रित (value conflict-focused) चेन-ऑफ-थॉट तर्क को शामिल करने से लॉस लैंडस्केप को ज्यामितीय रूप से सुचारू बनाकर लार्ज लैंग्वेज मॉडल प्रशिक्षण स्थिर होता है, जिससे स्केलर रिवॉर्ड्स के कारण होने वाली अनुकूलन अस्थिरता का समाधान होता है और नैतिक तर्क प्रदर्शन में वृद्धि होती है।

Saket Reddy, Andy Liu2026-07-21
🤖 AI

The Autonomous Agency Scale: A Behavioral Framework for Measuring Self-Directed Behavior in AI Systems

यह शोध पत्र ऑटोनॉमस एजेंसी स्केल (AAS) को प्रस्तुत करता है, जो सात आयामों और दो समयांतरालों में एआई (AI) की स्व-निर्देशन क्षमता को परिमाणित करने वाला एक व्यवहारिक ढांचा है, जो यह प्रकट करता है कि जहाँ वर्तमान कार्य एजेंट निष्क्रिय अवधियों के दौरान वास्तविक स्वायत्तता का अभाव रखते हैं, वहीं निरंतर साथी आर्किटेक्चर (persistent companion architectures) मापने योग्य स्व-निर्देशित व्यवहार प्रदर्शित करते हैं।

Samuel Presgraves2026-07-21✓ Author reviewed
🤖 AI

Towards Agentic Agent-based Models: Feasibility, Performance, and Statistical Model Checking

यह शोध पत्र शेलिंग पृथक्करण मॉडल (Schelling segregation model) को एक हाइब्रिड जनसंख्या के साथ विस्तारित करके, पारंपरिक एजेंट-आधारित मॉडलों में LLM-संचालित एजेंटिक क्षमताओं को एकीकृत करने की व्यवहार्यता और प्रदर्शन की जांच करता है, और मानक नियमों को LLM-आधारित निर्णय लेने से बदलने के सेमेंटिक, परिचालन और कम्प्यूटेशनल प्रभावों का मूल्यांकन करने के लिए सांख्यिकीय मॉडल चेकिंग (statistical model checking) का उपयोग करता है।

Stefano Blando, Emanuele Guerrazzi, Riccardo Porcedda, Giuseppe Squillace, Max Tschaikowski, Andrea Vandin2026-07-21
📊 statistics

Topological Signatures of Context-Level Reliability in TabPFN

यह शोध पत्र प्रदर्शित करता है कि TabPFN के आंतरिक निरूपणों (internal representations) पर लागू जिगज़ैग पर्सिस्टेंट होमोलॉजी (zigzag persistent homology), विशिष्ट टोपोलॉजिकल हस्ताक्षरों—जैसे कि बढ़ी हुई H0H_0 विखंडन (fragmentation) और H1H_1 लूप गतिविधि—को प्रकट करती है जो जटिल ज्यामितीय संरचनाओं वाले टैबुलर कार्यों पर मॉडल की विश्वसनीयता और प्रदर्शन के साथ दृढ़ता से सह-संबंधित हैं और उनका निदान करते हैं।

James Hu, Mahdi Ghelichi2026-07-21
🤖 AI

OntoExtend: A Framework for Requirement-driven and Scalable Ontology Extension with LLMs

यह शोध पत्र OntoExtend प्रस्तुत करता है, जो एक आवश्यकताओं-संचालित ढांचा है जो कॉम्पिटेंसी प्रश्नों (competency questions) के आधार पर ग्राउंडेड ऑन्टोलॉजी एक्सटेंशन प्रस्तावित करने के लिए लार्ज लैंग्वेज मॉडल्स के साथ रिट्रीवल-ऑगमेंटेड जनरेशन का लाभ उठाता है, और EU एवं औद्योगिक डेटासेट पर मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि यह वास्तविक दुनिया में एकीकरण के लिए केवल मामूली संशोधनों की आवश्यकता वाले एक ड्राफ्टिंग असिस्टेंट के रूप में प्रभावी ढंग से कार्य करता है।

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Stefan Schmid, Simon Blattner, Robin Keskisärkkä, Aldo Gangemi, Eva Blom (…)2026-07-21
🤖 AI

SAGE: Subgoal-Conditioned Action Generation for Latent World Model Planning

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक प्रायर-कंडीशन्ड (prior-conditioned) प्लानर है जो लक्ष्य-कंडीशन्ड सबगोल्स (goal-conditioned subgoals) का उपयोग करके एक्शन सीक्वेंस प्रस्तावों को संरचित करता है ताकि लॉन्ग-होरिज़न लेटेंट वर्ल्ड मॉडल प्लानिंग को बेहतर बनाया जा सके, जिससे रैंडम इनिशियलाइजेशन की तुलना में PushT और OGBench Cube जैसे कार्यों पर सफलता दर में काफी सुधार होता है।

Letian Cheng, Qi Zhang, Yisen Wang2026-07-21
🤖 AI

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

यह शोध पत्र HAS (हाइलाइट-गाइडेड अटेंशन स्टीयरिंग) प्रस्तुत करता है, जो मल्टीमॉडल LLM वीडियो सारांशीकरण के लिए एक नवीन विधि है, जो एक वैश्विक निरंतर फ्रेम-स्तरीय हाइलाइट वितरण को उत्पन्न करके सामंजस्य और सूचना प्रतिधारण में सुधार करती है ताकि मॉडल के ध्यान को कम महत्वपूर्ण फ्रेमों को पूरी तरह से अनदेखा किए बिना प्रमुख क्षणों की ओर निर्देशित किया जा सके।

Rui Chu, Yingjie Lao2026-07-21
💬 NLP

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL एक पैरामीटर-कुशल पोस्ट-ट्रेनिंग फ्रेमवर्क है जो एक नवीन काउंटरफैक्चुअल क्रिटिक एडवांटेज के साथ मल्टी-एजेंट डिबेट मैकेनिज्म का उपयोग करके कॉम्पैक्ट लैंग्वेज मॉडल्स में रीजनिंग को बढ़ाता है ताकि LoRA के माध्यम से विशिष्ट जनरेटर और क्रिटिक एजेंटों को अनुकूलित किया जा सके, जिससे गणितीय बेंचमार्क पर सटीकता में उल्लेखनीय सुधार होता है और प्रशिक्षित पैरामीटर्स में भारी कमी आती है।

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma2026-07-21