💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

यह शोध पत्र POISE प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक पॉलिसी मॉडल की आंतरिक अवस्थाओं पर प्रशिक्षित एक हल्के प्रोब (lightweight probe) का लाभ उठाकर नगण्य लागत पर वैल्यू बेसलाइन का अनुमान लगाता है, जिससे अलग क्रिटिक्स या कई रोलआउट्स के कम्प्यूटेशनल ओवरहेड के बिना स्थिर और कुशल पॉलिसी अनुकूलन प्राप्त होता है।

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
📊 statistics

Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

यह शोध पत्र कॉज़ल एनर्जी मिनिमाइजेशन (CEM) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ट्रांसफॉर्मर परतों को सशर्त ऊर्जा फलनों (conditional energy functions) पर अनुकूलन चरणों के रूप में पुनर्व्याख्या करता है ताकि भाषा मॉडलिंग कार्यों में मानक बेसलाइन के अनुरूप बाधित, पैरामीटर-कुशल आर्किटेक्चर प्राप्त किए जा सकें।

Jin Xu, Camille Couturier, Victor Rühle, Saravan Rajmohan, James Hensman2026-05-11
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

यह शोध पत्र PhoneSafety प्रस्तुत करता है, जो 700 वास्तविक दुनिया के सुरक्षा-महत्वपूर्ण क्षणों का एक बेंचमार्क है जो फोन-उपयोग एजेंटों में वास्तविक सुरक्षा और मात्र अक्षमता के बीच अंतर करता है, यह प्रकट करते हुए कि मजबूत सामान्य क्षमताएं सुरक्षित निर्णय लेने की गारंटी नहीं देती हैं और हानिरहित परिणाम अक्सर वास्तविक सुरक्षा के बजाय कार्य करने में असमर्थता को छिपाते हैं।

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen (…)2026-05-11
🤖 AI

Inference Time Causal Probing in LLMs

यह शोध पत्र हिडन-स्टेट ड्रिवन मार्जिन इंटरवेंशन (HDMI) का प्रस्ताव करता है, जो एक प्रोब-मुक्त, ग्रेडिएंट-आधारित विधि है जो मौजूदा क्लासिफायर-निर्भर दृष्टिकोणों की तुलना में अधिक विश्वसनीय कारण संबंधी हस्तक्षेप (causal interventions) प्राप्त करने के लिए मॉडल के नेटिव आउटपुट का उपयोग करके सीधे LLM हिडन स्टेट्स को निर्देशित करती है, साथ ही टेक्स्ट एडिटिंग के लिए एक लुकअहेड वेरिएंट भी पेश करती है।

Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser2026-05-11
💬 NLP

Post-training makes large language models less human-like

यह शोध पत्र Psych-201 डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि पोस्ट-ट्रेनिंग प्रक्रियाएं, जो बड़े भाषा मॉडलों को उपयोगिता के लिए अनुकूलित करती हैं, निरंतर मानव व्यवहार का सटीक रूप से अनुकरण करने की उनकी क्षमता को कम करती हैं, एक ऐसी समस्या जो नई मॉडल पीढ़ियों में बनी रहती है और बदतर होती जाती है और जिसे पर्सोना-इंडक्शन तकनीकों द्वारा हल नहीं किया जा सकता है।

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W (…)2026-05-11
🤖 AI

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

यह शोध पत्र LC-MAPF प्रस्तुत करता है, जो एक सामान्यीकरण योग्य प्री-ट्रेंड मॉडल है जो कुशल फीचर शेयरिंग के लिए एक स्केलेबल, सीखने योग्य मल्टी-राउंड कम्युनिकेशन मॉड्यूल को शामिल करके विकेंद्रीकृत मल्टी-एजेंट पाथफाइंडिंग को बढ़ाता है, जो स्केलेबिलिटी से समझौता किए बिना विविध परिदृश्यों में मौजूदा लर्निंग-आधारित सॉल्वर्स से बेहतर प्रदर्शन करता है।

Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik2026-05-11
🤖 AI

Tacit Knowledge Extraction via Logic Augmented Generation and Active Inference

यह शोध पत्र एक न्यूरो-सिम्बोलिक ढांचे का प्रस्ताव करता है जो लॉजिक-ऑगमेंटेड जनरेशन और एक्टिव इन्फरेंस को जोड़ता है ताकि विनिर्माण जैसे प्रक्रियात्मक डोमेन से अंतर्निहित ज्ञान (tacit knowledge) को निकाला जा सके, जो सफलतापूर्वक अंतर्निहित विशेषज्ञता को बेहतर पूर्णता और अर्थपूर्ण गुणवत्ता वाले औपचारिक, मशीन-व्याख्या योग्य नॉलेज ग्राफ में परिवर्तित करता है।

Lorenzo Lamazzi, Aldo Gangemi, Alessio Giberti, Andrea Giovanni Nuzzolese, Vittorio Andrea Rocca, Mattia Torta, Francesc (…)2026-05-11
🤖 AI

LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

यह शोध पत्र लिथोबेंच (LithoBench) को प्रस्तुत करता है, जो 10,000 विशेषज्ञ-एनोटेटेड रिमोट सेंसिंग इंस्टेंस से बना एक व्यापक बहु-स्तरीय बेंचमार्क है, जिसे भूवैज्ञानिक अर्थ संबंधी समझ और जटिल लिथोलॉजी व्याख्या कार्यों में बड़े मल्टीमॉडल मॉडलों की महत्वपूर्ण सीमाओं का मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han2026-05-11
💬 NLP

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN एक ब्लैकबोर्ड-प्रेरित, मल्टी-एजेंट फ्रेमवर्क है जो इन-स्टेप ऑडिटिंग के साथ एक एडवर्सरियल स्केप्टिक-रिसर्चर-जज लूप में भूमिकाओं को अलग करके LLM रीजनिंग की गुणवत्ता और एपिस्टेमिक ट्रस्ट को बढ़ाता है, जो विविध बेंचमार्क और बैकबोन मॉडल्स पर मोनोलिथिक और कंसेंसस-आधारित बेसलाइन्स से बेहतर प्रदर्शन करता है।

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng2026-05-11
💬 NLP

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

यह अध्ययन प्रकट करता है कि जहाँ स्वचालित लघु उत्तर स्कोरिंग मॉडल स्पष्ट रूप से सही या गलत प्रतिक्रियाओं पर अच्छा प्रदर्शन करते हैं, वहीं वे मध्यम-श्रेणी के, आंशिक रूप से सही उत्तरों पर मानव विशेषज्ञों के साथ सहमति में महत्वपूर्ण गिरावट प्रदर्शित करते हैं, जो एक ऐसी सीमा है जो फ्यू-शॉट लार्ज लैंग्वेज मॉडल्स में सबसे गंभीर है और कार्य-विशिष्ट अनुकूलन बढ़ने के साथ सुधरती है।

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron2026-05-11