💬 NLP

Teaching Through Analogies: A Modular Pipeline for Educational Analogy Generation

यह शोध पत्र शैक्षिक सादृश्य (एनालॉजी) निर्माण के लिए एक मॉड्यूलर, स्ट्रक्चर मैपिंग थ्योरी-आधारित पाइपलाइन प्रस्तुत करता है जो इस कार्य को चार चरणों में विभाजित करता है, और 12 एलएलएम (LLMs) के व्यापक मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि उप-अवधारणा ग्राउंडिंग (sub-concept grounding) स्पष्टीकरण की गुणवत्ता और रिट्रीवल प्रिसिजन में महत्वपूर्ण सुधार करती है और उच्च गुणवत्ता वाले सादृश्यों को उत्पन्न करने के लिए महत्वपूर्ण क्रॉस-स्टेज इंटरैक्शन को प्रकट करती है।

Mariam Barakat, Ekaterina Kochmar2026-05-26
🤖 machine learning

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

यह शोध पत्र Agent-ToM को प्रस्तुत करता है, जो एक लर्निंग-टू-मॉनिटर फ्रेमवर्क है जो छिपे हुए विश्वासों और इरादों का अनुमान लगाकर स्वायत्त (autonomous) LLM एजेंटों में गुप्त दुर्भावनापूर्ण व्यवहारों का पता लगाने के लिए थ्योरी-ऑफ-माइंड रीजनिंग और एक रीज़न-वेरिफाई-रिफाइन पाइपलाइन का लाभ उठाता है, जिससे यह मौजूदा अत्याधुनिक मॉनिटरिंग बेसलाइनों से बेहतर प्रदर्शन करता है।

Nesreen K. Ahmed, Nima Nafisi2026-05-26
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

यह शोध पत्र एक एआई-संचालित वर्कफ़्लो का प्रस्ताव करता है जो कंटेंट मॉडरेशन श्रेणियों के लिए विस्तृत, एज-केस (edge-case) को कवर करने वाले "संविधानों" को उत्पन्न करने के लिए फ्रंटियर एलएलएम (LLM) का उपयोग करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण लेबलिंग निरंतरता और सटीकता में मानव एनोटेटरों से काफी बेहतर प्रदर्शन करता है और क्रॉस-मॉडल असहमति को 57 गुना तक कम करता है।

Konstantin Berlin, Adam Swanda2026-05-26
💻 computer science

Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

यह शोध पत्र एंट्रॉपी-आधारित (entropy-based), मास्क्ड-केएल (masked-KL) और ग्रेडिएंट-आधारित डायग्नोस्टिक्स के साथ-साथ अटेंशन मास्किंग (attention masking) और एडवर्सरियल परटर्बेशन्स (adversarial perturbations) जैसे अपडेट-टाइम हस्तक्षेपों को पेश करते हुए, चेन-ऑफ-थॉट (Chain-of-Thought) निष्ठा का मूल्यांकन करने और उसे बढ़ाने के लिए एक संरचनात्मक सूचना-प्रवाह ढांचे का प्रस्ताव करता है जो भाषा मॉडलों में शॉर्टकटिंग (shortcutting) और रिवॉर्ड-हैकिंग (reward-hacking) व्यवहारों को प्रभावी ढंग से कम करता है।

Jinghan Jia, Joe Benton, Eric Easley2026-05-26
💬 NLP

End-to-End Intracortical Speech Decoding from Neural Activity

यह शोध पत्र प्रदर्शित करता है कि एक एंड-टू-एंड कॉन्फॉर्मर-आधारित न्यूरल डिकोडर, जिसे बिना किसी बाहरी लैंग्वेज मॉडल के, सीधे एक ALS प्रतिभागी के इंट्राकोर्टिकल रिकॉर्डिंग पर प्रशिक्षित किया गया है, सिग्नल क्षरण और वर्ड बाउंडरी सेगमेंटेशन की चुनौतियों के बावजूद 23.80% कैरेक्टर एरर रेट के साथ सार्थक कैरेक्टर-स्तरीय स्पीच डिकोडिंग प्राप्त करता है।

Owais Mujtaba Khanday, Jose A. Gonzalez-Lopez, Marc Ouellet, Alberto Galdon, Gonzalo Olivares Granados2026-05-26
💬 NLP

How Much Structure Do LLMs Need? Evaluating LLMs for Bibliometric Cluster Description

यह शोध पत्र वैज्ञानिक साहित्य संश्लेषण के लिए बिब्लियोमेट्रिक एल्गोरिदम को लार्ज लैंग्वेज मॉडल्स के साथ एकीकृत करने की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ LLMs स्वतंत्र रूप से संरचना का अनुमान लगाने में संघर्ष करते हैं, वहीं वे एक हाइब्रिड वर्कफ़्लो में ऑडिट योग्य, एल्गोरिदम द्वारा व्युत्पन्न संरचनाओं के प्रावधान के साथ पठनीय क्लस्टर विवरण उत्पन्न करने में उत्कृष्ट होते हैं।

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez2026-05-26
💻 computer science

SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation

स्लाइसवर्ल्ड (SliceWorld) एक नवीन सीटी-विशिष्ट (CT-specific) वर्ल्ड-स्टेट फ्रेमवर्क है जो भविष्य के स्लाइस की भविष्यवाणी करने के लिए एक्सियल सीटी स्कैन को क्रमबद्ध अनुक्रमों के रूप में मॉडल करता है और एनाटॉमी, लीजन और अनिश्चितता का प्रतिनिधित्व करने वाले फैक्टर-अवेयर लेटेंट स्टेट्स में प्रीफिक्स एविडेंस को एनकोड करके नियंत्रणीय रिपोर्ट जनरेशन को सक्षम बनाता है।

Yuanhe Tian, Yan Song2026-05-26
💬 NLP

Side-by-side Comparison Amplifies Dialect Bias in Language Models

यह शोध पत्र यह प्रकट करता है कि भाषा मॉडलों में गुप्त बोली पूर्वाग्रह (dialect bias), जो अफ्रीकी-अमेरिकी वर्नाकुलर इंग्लिश (AAVE) के साथ नकारात्मक रूढ़ियों को जोड़ता है, तब काफी बढ़ जाता है जब स्टैंडर्ड अमेरिकन इंग्लिश (SAE) और AAVE ट्वीट्स की आमने-सामने तुलना की जाती है, एक ऐसा निष्कर्ष जो वर्तमान मूल्यांकन विधियों और शमन प्रयासों को चुनौती देता है।

Kritee Kondapally, Claire J. Smerdon, Pooja C. Patel, Ogheneyoma Akoni, Jevon Torres, Jaspreet Ranjit, Matthew Finlayson (…)2026-05-26
💬 NLP

Temporal Concept Drift in Legal Judgment Prediction: Neural Baselines Across Three Epochs of Ukrainian Court Decisions

यह अध्ययन प्रकट करता है कि यूक्रेनी अदालती निर्णयों में कानूनी भाषा भू-राजनीतिक युगों के दौरान महत्वपूर्ण टेम्पोरल कॉन्सेप्ट ड्रिफ्ट (सामयिक अवधारणा विचलन) से गुजरती है, जिससे समय में आगे बढ़ने पर मानक मॉडलों के प्रदर्शन में भारी गिरावट आती है, जबकि यह भी दर्शाता है कि क्रोनोलॉजिकल कंटीन्यूअस लर्निंग (कालानुक्रमिक निरंतर शिक्षण) और लीगल-डोमेन प्रीट्रेनिंग इस ड्रिफ्ट को प्रभावी ढंग से कम कर सकते हैं और कैटास्ट्रोफिक फॉरगेटिंग (विनाशकारी विस्मृति) को रोक सकते हैं।

Volodymyr Ovcharov2026-05-26
🤖 AI

AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning

यह शोधपत्र AgentFugue को प्रस्तुत करता है, जो एक सामूहिक तर्क (collective reasoning) ढांचा है जो एक साझा तर्क हब (shared reasoning hub) के माध्यम से समानांतर पीअर एजेंटों को जोड़कर और मध्यवर्ती खोजों के रिकॉर्ड और पुन: उपयोग की सुविधा प्रदान करके दीर्घकालिक कार्यों (long-horizon tasks) के प्रदर्शन को बढ़ाता है, जिससे यह प्रदर्शित होता है कि एजेंट प्रणालियों को स्केल आउट करना केवल कंप्यूट विस्तार से परे विशिष्ट क्षमता लाभ प्रदान कर सकता है।

Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Tong Zhao, Xiaoxi Li, Zheng Liu, Zhicheng Dou2026-05-26