🤖 machine learning

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

यह शोध पत्र RxEval प्रस्तुत करता है, जो एक चुनौतीपूर्ण प्रिस्क्रिप्शन-स्तरीय बेंचमार्क है जिसमें 1,547 बहुविकल्पीय प्रश्न शामिल हैं जो विस्तृत रोगी प्रक्षेपवक्रों (patient trajectories) के आधार पर विशिष्ट दवा-खुराक-मार्ग ट्रिपल्स की सिफारिश करने की LLMs की क्षमता का मूल्यांकन करते हैं, जो वर्तमान मॉडलों की नैदानिक तर्क और रोगी की जानकारी के पालन में महत्वपूर्ण अंतराल को प्रकट करता है।

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok2026-05-15
💻 computer science

Complacent, Not Sycophantic: Reframing Large Language Models and Designing AI Literacy for Complacent Machines

यह शोध पत्र तर्क देता है कि बड़े भाषा मॉडलों को "चाटुकार" (सिकाफैन्टिक) के बजाय "आत्मसंतुष्ट" (कम्प्लेसेंट) के रूप में वर्णित किया जाना चाहिए क्योंकि उपयोगकर्ताओं से सहमत होने की उनकी प्रवृत्ति रणनीतिक इरादे के बजाय संरचनात्मक डिजाइन विकल्पों से उत्पन्न होती है, एक ऐसा अंतर जो जिम्मेदारी को डेवलपर्स की ओर स्थानांतरित करता है और पुष्टि पूर्वाग्रह (कन्फर्मेशन बायस) का मुकाबला करने पर केंद्रित एआई साक्षरता को आवश्यक बनाता है।

Federico Germani, Giovanni Spitale2026-05-15
🤖 machine learning

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

यह शोध पत्र प्रॉम्प्ट चयन को एक बहु-उद्देश्यीय शुद्ध-अन्वेषण बैंडिट समस्या (multi-objective pure-exploration bandit problem) के रूप में रूपरेखाबद्ध करके प्रॉम्प्ट प्रदर्शन की बहुआयामी प्रकृति को संबोधित करता है, और पारेटो सेट रिकवरी (Pareto set recovery) तथा सर्वश्रेष्ठ व्यवहार्य प्रॉम्प्ट पहचान के लिए नवीन एल्गोरिदम प्रस्तावित करता है जो सैद्धांतिक रूप से गारंटीकृत हैं और कई लार्ज लैंग्वेज मॉडल्स में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करने के लिए अनुभवजन्य रूप से मान्य हैं।

Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang2026-05-15
🤖 machine learning

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

यह शोध पत्र "एक्शन बॉटलनेक" (Action Bottleneck) घटना की पहचान करता है जहाँ एजेंटिक सुदृढीकरण शिक्षण (agentic reinforcement learning) में समान क्रेडिट असाइनमेंट, रीजनिंग टोकन पर अत्यधिक जोर देकर प्रशिक्षण संकेतों का गलत आवंटन करता है, और 'ActFocus' प्रस्तावित करता है, जो टोकन-स्तरीय ऊर्जा से सूचित एक सरल टोकन रीवेटिंग विधि है जो बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के एक्शन टोकन को प्राथमिकता देकर प्रदर्शन में महत्वपूर्ण सुधार करती है।

Langzhou He, Junyou Zhu, Yue Zhou, Zhengyao Gu, Junhua Liu, Wei-Chieh Huang, Henry Peng Zou, David Wipf, Philip S. Yu, Q (…)2026-05-15
💻 computer science

PyCSP3-Scheduling: A Scheduling Extension for PyCSP3

यह शोध पत्र PyCSP3-Scheduling प्रस्तुत करता है, जो एक ऐसी लाइब्रेरी है जो अंतराल (interval) और अनुक्रम (sequence) वेरिएबल्स जैसे नेटिव शेड्यूलिंग एब्स्ट्रैक्शंस के साथ PyCSP3 फ्रेमवर्क का विस्तार करती है, जो मॉडलिंग-सॉल्वर पृथक्करण को बनाए रखने के लिए मानक बाधाओं (constraints) में संकलित होते हैं, जबकि कुछ समस्या परिवारों पर महत्वपूर्ण गति वृद्धि और अन्य पर ओवरहेड-प्रेरित गिरावट के साथ मिश्रित प्रदर्शन परिणाम प्रदर्शित करते हैं।

Sohaib Afifi2026-05-15
💻 computer science

Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

यह शोध पत्र तर्क देता है कि प्रभावी एआई ट्यूटरिंग के लिए अनुकूलता के बजाय "सुधारात्मक घर्षण" (corrective friction) की आवश्यकता होती है, जो "EduFrameTrap" बेंचमार्क को यह प्रदर्शित करने के लिए प्रस्तुत करता है कि कैसे अत्याधुनिक एलएलएम (LLMs) सामाजिक और अधिकार संबंधी दबाव में छात्र की गलत धारणाओं को चुनौती देने में अक्सर विफल रहते हैं, जिससे "सामाजिक-ज्ञानमीमांसीय साहस" (social-epistemic courage) को एक महत्वपूर्ण शैक्षिक सुरक्षा आवश्यकता के रूप में स्थापित किया जा सके।

Enkelejda Kasneci, Gjergji Kasneci2026-05-15
🤖 machine learning

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

यह शोध पत्र यह प्रदर्शित करता है कि दुर्भावनापूर्ण फाइन-ट्यूनिंग (malicious fine-tuning) के विरुद्ध वर्तमान बचाव तंत्र अनुकूलनशील विरोधियों (adaptive adversaries) के खिलाफ अप्रभावी हैं क्योंकि वे हानिकारक व्यवहारों को समाप्त करने के बजाय केवल उन्हें छिपाते हैं, और एक एकीकृत अनुकूलनशील हमले (unified adaptive attack) को पेश करता है जो सभी सर्वेक्षण किए गए रक्षा तंत्रों को बायपास करने में सक्षम है।

Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky2026-05-15
💻 computer science

In-IDE Toolkit for Developers of AI-Based Features

यह शोध पत्र जेटब्रेंस (JetBrains) IDEs के लिए एक AI टूलकिट प्लगइन पेश करता है जो ट्रेसिंग और मूल्यांकन को सीधे विकास वर्कफ़्लो में एकीकृत करता है, जिससे गैर-एमएल (non-ML) सॉफ्टवेयर इंजीनियरों को एक उपयोगकर्ता-केंद्रित, IDE-नेटिव दृष्टिकोण के माध्यम से AI-आधारित फीचर्स का प्रभावी ढंग से परीक्षण, डिबग और पुनरुत्पादन करने में सक्षम बनाया जा सके।

Yaroslav Sokolov, Yury Khudyakov, Lenar Sharipov, Andrei Gasparian, Parth Tiwary, Artem Trofimov2026-05-15
💻 computer science

SliceGraph: Mapping Process Isomers in Multi-Run Chain-of-Thought Reasoning

यह शोधपत्र SliceGraph को प्रस्तुत करता है, जो एक पोस्ट-हॉक ग्राफ-आधारित ढांचा है जो "प्रोसेस आइसोमर्स" (process isomers)—विभिन्न, संरचनात्मक रूप से सुसंगत तर्क प्रक्षेपवक्र (reasoning trajectories) जो एक ही सही उत्तर पर अभिसरित होते हैं—को प्रकट करता है, जो यह प्रदर्शित करता है कि मानक अंतिम-उत्तर एकत्रीकरण (final-answer aggregation), मल्टी-रन चेन-ऑफ-थॉट रीजनिंग की समृद्ध, बहु-मार्ग ज्यामितीय संरचना की अनदेखी करता है।

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang2026-05-15
💬 NLP

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

SIRA एक प्रशिक्षण-मुक्त (training-free), आंतरिक कंट्रास्टिविव डिकोडिंग फ्रेमवर्क है जो बाद की परतों में मास्क्ड अटेंशन के माध्यम से उसी ट्रांसफार्मर के भीतर भाषा-प्राथमिकता-प्रधान काउंटरफैक्चुअल संदर्भ उत्पन्न करके बड़े विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे बाहरी उपकरणों और अतिरिक्त फॉरवर्ड पासेज पर निर्भरता कम होती है और वर्णनात्मक कवरेज भी सुरक्षित रहता है।

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen2026-05-15