💬 NLP

Towards Just-in-Time Adaptive Feedback: Enhancing Student Learning via Knowledge-Grounded LLM

यह शोध पत्र एक ज्ञान-आधारित लार्ज लैंग्वेज मॉडल फ्रेमवर्क प्रस्तुत करता है जो छात्रों के तर्क संबंधी तर्क (reasoning logic) के आधार पर जस्ट-इन-टाइम अनुकूलन योग्य फीडबैक प्रदान करता है, जो संवादात्मक पुनरावृत्ति के माध्यम से गलत धारणाओं को प्रभावी ढंग से सुधारकर एक बड़े पैमाने के विश्वविद्यालय पाठ्यक्रम में प्रदर्शन को 80% से अधिक सफलतापूर्वक सुधारता है।

Younghun Lee, Amir Bralin, Nobel Sanjay Rebello, Dan Goldwasser2026-05-27
💬 NLP

Probing Minimalist Phase Structure in LLMs: What Universal Dependencies Cannot Represent

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल मिनिमलिस्ट प्रोग्राम (Minimalist Program) की फेज़ सीमाओं (phase boundaries) और कोहेसन (cohesion) जैसे औपचारिक-सिंटैक्टिक एब्स्ट्रैक्शंस को एनकोड करते हैं—जो यूनिवर्सल डिपेंडेंसीज़ (Universal Dependencies) के लिए अदृश्य अवधारणाएं हैं—यह प्रकट करते हुए कि स्ट्रक्चरल प्रोब्स (structural probes), व्ह-मूवमेंट (wh-movement) उद्दीपनों में फेज़-काउंट ग्रेडिएंट्स (phase-count gradients) और साइन एसिमेट्रीज़ (sign asymmetries) का पता लगाते हैं जिन्हें मानक यूडी-आधारित (UD-based) प्रोबिंग कैप्चर नहीं कर सकती।

Yuanhao Chen, Peter Chin2026-05-27
💬 NLP

Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization

यह शोध पत्र यह प्रदर्शित करता है कि LLM सारांशीकरण प्रणालियों से निर्यात किए गए कॉम्पैक्ट वेक्टर प्रतिनिधित्व, यहाँ तक कि जब स्रोत दस्तावेज़ प्रतिबंधित हों, तब भी रोगी की नस्ल जैसी संवेदनशील जानकारी लीक कर सकते हैं, और यह दिखाता है कि सरफेसलोरा (SurfaceLoRA) जैसी शमन रणनीतियों को प्रभावी ढंग से उपयोगिता से समझौता किए बिना ऐसे अनुमान को रोकने के लिए सटीक रूप से लक्षित विशिष्ट एक्सपोज़्ड वेक्टर आर्टिफैक्ट पर केंद्रित होना चाहिए।

Weixin Liu, Bowen Qu, Juming Xiong, Congning Ni, Bradley A. Malin, Zhijun Yin2026-05-27
💬 NLP

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

यह शोध पत्र LURE को प्रस्तुत करता है, जो एजेंटिक इंटरेक्शन ट्राजेक्टरीज (agentic interaction trajectories) को पुन: प्रस्तुत करके यथार्थवादी, परिनियोजन-समान (deployment-like) मूल्यांकन का निर्माण करके AI सुरक्षा बेंचमार्क की वैधता को बढ़ाता है, जिससे मूल्यांकन जागरूकता के कारण मॉडलों के अपने व्यवहार को बदलने की समस्या को कम किया जा सके।

Igor Ivanov, David Demitri Africa2026-05-27
💬 NLP

Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks

Conv-to-Bench एक स्केलेबल, मल्टी-स्टेज फ्रेमवर्क है जो वास्तविक मल्टी-टर्न यूजर-असिस्टेंट संवादों को कोड कार्यों के लिए संरचित, सत्यापन योग्य मूल्यांकन बेंचमार्क में स्वचालित रूप से परिवर्तित करता है, जो श्रम-गहन विशेषज्ञ क्यूरेशन पर निर्भरता को काफी कम करते हुए मानव-निर्मित मानकों के साथ लगभग पूर्ण संरेखण प्राप्त करता है।

Victor M. dos Santos, Andre C. Castro, Samuel L. de S. Toledo, Bruno M. L. Calura, Lisandra C. de M. Menezes, Raul C. R. (…)2026-05-27
💬 NLP

Curation and Extraction of Drug-Related Entities from Reddit Platform

यह शोध पत्र ReDose को प्रस्तुत करता है, जो विशेषज्ञ चिकित्सा इनपुट के साथ निर्मित नशीली दवाओं के उपयोग पर 6,435 एनोटेटेड रेडिट (Reddit) पोस्ट का एक डेटासेट है, और नैदानिक ज्ञान तथा वास्तविक दुनिया के उपयोगकर्ता अनुभवों के बीच के अंतर को पाटने के लिए ड्रग, डोज़ और प्रभाव संस्थाओं (entities) को निकालने में विभिन्न एआई (AI) मॉडलों के प्रदर्शन का मूल्यांकन करता है।

Zewei Wang, Zihan Xu, Yishu Wei, Michael Chary, Yifan Peng2026-05-27
💬 NLP

Model Unlearning Objectives Vary for Distinct Language Functions

यह शोध पत्र तर्क देता है कि लैंग्वेज मॉडल अनलर्निंग को एक मोनोलिथिक कार्य के रूप में मानने के बजाय विशिष्ट कार्यों के अनुरूप तैयार किया जाना चाहिए, जो 7-8B मॉडलों पर प्रयोगों के माध्यम से यह प्रदर्शित करता है कि विशिष्ट उद्देश्य—विशेष रूप से खतरनाक ज्ञान के लिए एक कोसाइन-आधारित मेटा-लर्नड दृष्टिकोण और विषाक्तता (टॉक्सिसिटी) के लिए एक मल्टी-लेयर प्रोब-आधारित विधि—अपने संबंधित लक्ष्यों के लिए बेहतर परिणाम प्रदान करते हैं।

Berk Atil, Vipul Gupta, Rebecca J. Passonneau2026-05-27
💬 NLP

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

यह शोध पत्र Verus-SpecGym प्रस्तुत करता है, जो Rust सत्यापन के लिए अनौपचारिक प्रोग्रामिंग समस्याओं को निष्ठावान औपचारिक विनिर्देशों (formal specifications) में अनुवादित करने की LLMs की क्षमता का मूल्यांकन करने के लिए एक एजेंटिक वातावरण और बेंचमार्क है, जो यह प्रकट करता है कि जहाँ फ्रंटियर मॉडल आशाजनक दिखते हैं, वहीं उनके आउटपुट अभी भी नाजुक हैं और सूक्ष्म त्रुटियों के प्रति संवेदनशील हैं जिन्हें मानक LLM जज अक्सर अनदेखा कर देते हैं।

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parn (…)2026-05-27
💬 NLP

Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records

यह शोध पत्र EHR-ReasonCon प्रस्तुत करता है, जो इलेक्ट्रॉनिक हेल्थ रिकॉर्ड्स में क्लिनिकल नोट्स और स्ट्रक्चर्ड टेबल्स के बीच तर्क-गहन निरंतरता सत्यापन (reasoning-intensive consistency verification) के लिए एक नया विशेषज्ञ-एनोटेटेड बेंचमार्क है, साथ ही EHR-Inspector भी प्रस्तुत करता है, जो एक LLM-आधारित फ्रेमवर्क है जो सतही मिलान की सीमाओं को दूर करने के लिए टेम्पोरल रीजनिंग और टेबल-एक्सप्लोरेशन टूल्स का लाभ उठाकर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Yeonsu Kwon, Jiho Kim, Junseong Choi, Paloma Rabaey, Minseo Kim, Sujeong Im, Jeewon Yang, Jun-Min Lee, Sangji Lee, Jiwon (…)2026-05-27
💬 NLP

Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

यह शोध पत्र प्रकट करता है कि LLM-जनित कहानियों में विविधता आश्चर्यजनक रूप से कम है, जहाँ "Elias" और "lighthouse" जैसे टोकन का एक छोटा समूह आउटपुट पर हावी रहता है क्योंकि वे प्री-ट्रेनिंग डेटा के बजाय प्रेफरेंस अलाइनमेंट डेटासेट्स में अपनी व्यापकता के कारण प्रमुख हैं, जो मॉडल व्यवहार पर छोटे, उच्च-गुणवत्ता वाले डेटासेट्स के असंगत प्रभाव को उजागर करता है।

Sil Hamilton, David Mimno2026-05-27