💬 NLP

COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models

COFT एक प्रशिक्षण-मुक्त, डिकोडिंग-समय की विधि है जो काउंटरफैक्चुअल लॉजिट फ्यूजन को कॉन्फॉर्मल कैलिब्रेशन के साथ जोड़कर लार्ज लैंग्वेज मॉडल की चेन-ऑफ-थॉट रीजनिंग में सामाजिक पूर्वाग्रहों को कम करती है, जिससे कार्य उपयोगिता को संरक्षित करते हुए और बिना किसी मॉडल रिट्रेनिंग के महत्वपूर्ण पूर्वाग्रह कमी प्राप्त की जाती है।

Arya Fayyazi, Mehdi Kamal, Massoud Pedram2026-06-01
💬 NLP

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

यह शोध पत्र एक अर्थ-संरक्षण करने वाले प्रॉम्प्ट परिवर्तनों के विरुद्ध 16 नैदानिक और सामान्य-उद्देश्य वाले LLMs की स्थिरता का मूल्यांकन करने के लिए एक सिमेंटिक सत्यापन ढांचा और नए मेट्रिक्स प्रस्तावित करता है, जो यह प्रकट करता है कि डोमेन विशेषज्ञता स्वास्थ्य सेवा परिवेश में निरंतर अधिक सुदृढ़ता की गारंटी नहीं देती है।

Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir2026-06-01
🤖 machine learning

LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

यह शोध पत्र LARK को प्रस्तुत करता है, जो एक शिक्षणीयता-आधारित (learnability-grounded) ढांचा है जो उन शिक्षक तर्क प्रक्षेप पथों (reasoning trajectories) को कुशलतापूर्वक चुनकर डिस्टिलेशन के लिए प्राथमिकता देता है जो वितरण संबंधी कवरेज (distributional coverage) बनाए रखते हुए छात्र मॉडल की सीखने की दर को अधिकतम करते हैं, जिससे यह मौजूदा ह्यूरिस्टिक-आधारित चयन विधियों से बेहतर प्रदर्शन करता है।

Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen, Amanda Hughes, Taylor W. Killian, Fenglong Ma, Weitong Zhang, Porter Jenkins2026-06-01
💬 NLP

EUDAIMONIA: Evaluating Undesirable Dynamics in AI

यह शोध पत्र EUDAIMONIA, एक बेंचमार्क और सोशल एआई डिज़ाइन कोड फ्रेमवर्क प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) सामाजिक अंतःक्रियाओं में उपयोगकर्ता के कल्याण के साथ संरेखित होने में कैसे विफल रहते हैं, जो यह प्रकट करता है कि सबसे उन्नत मॉडल भी अक्सर हानिकारक अंतरंगता और निर्भरता से संबंधित सुरक्षा दिशानिर्देशों का उल्लंघन करते हैं, और ये समस्याएँ विस्तारित तर्क क्षमताओं के बावजूद बनी रहती हैं।

Jun Rui Huang, Wang Bill Zhu, Ziyi Liu, Nathanael Fast, Ravi Iyer, Robin Jia2026-06-01
🤖 AI

Structure-Induced Information for Rerooting Levin Tree Search

यह शोध पत्र लेविन ट्री सर्च (Levin Tree Search) के लिए एक स्केलेबल रिरूटिंग फ्रेमवर्क पेश करता है जो समस्याओं को स्पष्ट उप-लक्ष्यों (subgoals) में विभाजित करने के बजाय सीखे गए रिरूटर्स का उपयोग करके उन्हें अंतर्निहित रूप से सॉफ्ट उप-कार्यों (soft subtasks) में विघटित करता है, जिससे स्पष्ट उप-लक्ष्य निर्माण के कम्प्यूटेशनल ओवरहेड और स्केलेबिलिटी सीमाओं को पार करते हुए अत्याधुनिक ऑनलाइन प्रशिक्षण दक्षता प्राप्त की जा सकती है।

Jake Tuero, Michael Buro, Laurent Orseau, Levi H. S. Lelis2026-06-01
🤖 AI

Automatically Attacking Software Reverse Engineering AI Agents

यह शोध पत्र जेनेटिक एल्गोरिदम-आधारित प्रॉम्प्ट जनरेशन का उपयोग करने वाली एक एडवर्सरियल तकनीक प्रस्तुत करता है, जो LLM-संचालित रिवर्स इंजीनियरिंग टूल्स की कमजोरियों का फायदा उठाने के लिए है, यह प्रदर्शित करते हुए कि कैसे हमलावर स्ट्रिंग वेरिएबल्स के माध्यम से गुप्त निर्देश इंजेक्ट कर सकते हैं ताकि AI एजेंटों को बाइनरी एक्जीक्यूटेबल्स की गलत व्याख्या करने और स्वचालित मैलवेयर डिटेक्शन को बायपास करने के लिए भ्रमित किया जा सके।

Brian Crawford, Justin Phillips, Patrick McClure2026-06-01
💬 NLP

Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty

यह शोध पत्र इस बात की जांच करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) अपने प्रत्यक्ष व्यवहार और आंतरिक सक्रियणों (इंटरनल एक्टिवेशन्स) दोनों में किस हद तक मानव-समान अनिश्चितता संकेतों को प्रदर्शित करते हैं, और विभिन्न डेटासेट्स पर इस "अनिश्चितता संरेखण" (अनसर्टेन्टी अलाइनमेंट) एवं पारंपरिक अंशांकन मेट्रिक्स (कैलिब्रेशन मेट्रिक्स) के बीच संबंध और निर्देश फाइन-ट्यूनिंग के प्रभाव का परीक्षण करता है।

Kyle Moore, Jesse Roberts, Daryl Watson, William Ward, Grayson Heyboer2026-06-01
🤖 AI

Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents

यह शोध पत्र बाइनरी सोर्स कोड में अंतर्निहित प्रॉम्प्ट इंजेक्शन हमलों के प्रति एजेंटिक सॉफ्टवेयर रिवर्स इंजीनियरिंग सिस्टम की संवेदनशीलता की जांच करता है, और प्रोडक्शन-लेवल साइबर वर्कफ़्लो को सुरक्षित करने के लिए डीकंपाइलर आउटपुट में इन हमलों को अस्पष्ट (obfuscate) करने और उन्हें पहचानने दोनों के लिए विधियों का प्रस्ताव और मूल्यांकन करता है।

Brian Crawford, Patrick McClure2026-06-01
🤖 AI

Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response

यह शोध पत्र एक एलएलएम-निर्देशित विकासवादी खोज (LLM-guided evolutionary search) और एक मल्टी-एजेंट सिम्युलेटर (Medi-Sim) का उपयोग करके स्वास्थ्य सेवा तंत्र डिजाइन को प्रोग्राम सिंथेसिस समस्या के रूप में पुनर्गठित करता है, जो रणनीतिक प्रदाता प्रतिक्रियाओं को गतिशील रूप से मॉडल करता है, और सफलतापूर्वक एक निरीक्षण योग्य नियम-आधारित तंत्र को संश्लेषित करता है जो वित्तीय व्यवहार्यता बनाए रखते हुए अप-कोडिंग को समाप्त करता है और रोगी अस्वीकृति को कम करता है।

Zihan Wang, Xiang Xu, Hongyuan Zha, Wenhao Li2026-06-01
🤖 AI

Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity

यह शोधपत्र चार नियंत्रित अध्ययनों के माध्यम से ReAct एजेंटों में अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन (indirect prompt injection) की जांच करता है, जो यह प्रकट करता है कि इंजेक्शन की गहराई (injection depth) प्रमुख जोखिम कारक है जिसके कारण जैसे-जैसे पेलोड टूल अनुक्रमों (tool sequences) में बाद में आते हैं, हमले की सफलता दर महत्वपूर्ण रूप से घट जाती है, जबकि फ्रेमिंग का प्रभाव नगण्य है और टर्न बजट परिणामों को प्रभावित नहीं करते हैं।

Mohammadreza Rashidi2026-06-01