💬 NLP

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

यह शोधपत्र एक सैद्धांतिक ढांचे का प्रस्ताव करता है जो मल्टी-एलएलएम (multi-LLM) एजेंटों के लिए स्थानीय, हस्ताक्षरित और क्रेडिट-संरक्षण वाले प्रशिक्षण संकेतों को उत्पन्न करने हेतु सहयोगात्मक गेम-थ्योरेटिक एट्रिब्यूशन (cooperative game-theoretic attribution) को प्रोसेस रिवॉर्ड मॉडलिंग (process reward modeling) के साथ एकीकृत करता है, जिससे बिना किसी अनुभवजन्य सत्यापन के, सिस्टम-स्तरीय मूल्यांकन और एजेंट-स्तरीय शिक्षण के बीच के अंतर को पाटा जा सके।

Chih-Hsuan (Bella), Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur2026-07-03
💬 NLP

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver एक नवीन फ्रेमवर्क है जो एक दो-चरणीय प्रक्षेपवक्र जनरेटर (two-stage trajectory generator), मानक अनुमान इंजनों (standard inference engines) के साथ संगत एक ट्राइ-आधारित रोलआउट डिज़ाइन (trie-based rollout design), और एक समानांतरता-जागरूक सुदृढीकरण शिक्षण रणनीति (parallelization-aware reinforcement learning strategy) को संयोजित करके बड़े भाषा मॉडलों में अत्याधुनिक समानांतर तर्क प्रदर्शन प्राप्त करता है, जिससे अनुक्रमिक सटीकता से मेल खाते हुए अनुमान विलंबता (inference latency) को महत्वपूर्ण रूप से कम किया जा सकता है।

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Vi (…)2026-07-03
💬 NLP

HAL: Inducing Human-likeness in LLMs with Alignment

यह शोध पत्र HAL को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो कंट्रास्टिव डायलॉग डेटा से एक व्याख्यात्मक, डेटा-संचालित रिवॉर्ड (पुरस्कार) प्राप्त करके भाषा मॉडलों को मानवीय संवादात्मक गुणों के साथ संरेखित करता है, जिससे लक्षित अनुकूलन सक्षम होता है जो समग्र प्रदर्शन से समझौता किए बिना कथित मानव-समानता में सुधार करता है।

Masum Hasan, Junjie Zhao, Ehsan Hoque2026-07-03
💬 NLP

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard एक खुला, तर्क-केंद्रित गार्डरेल मॉडल परिवार है जो संरचित स्पष्टीकरणों के साथ व्याख्यात्मक, बहुआयामी जोखिम मूल्यांकन और दक्षता एवं नीति अनुकूलन क्षमता के बीच संतुलन बनाने वाले एक लचीले, टियर्डेड इन्फरेंस प्रतिमान (tiered inference paradigm) के माध्यम से LLM सुरक्षा को बढ़ाता है।

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranj (…)2026-07-03
💬 NLP

BRIDGE: Predicting Human Task Completion Time From Model Performance

यह शोध पत्र BRIDGE को प्रस्तुत करता है, जो एक साइकोमेट्रिक ढांचा है जो लेटेंट टास्क डिफिकल्टी (अव्यक्त कार्य की कठिनाई) और मानव पूर्णता समय के लघुगणक (लॉग) के बीच एक रैखिक संबंध स्थापित करके मॉडल प्रदर्शन डेटा से मानव कार्य पूर्णता समय की भविष्यवाणी करता है, जिससे महंगी मानवीय एनोटेशन के बिना स्केलेबल क्षमता पूर्वानुमान सक्षम होता है।

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle2026-07-03
💬 NLP

CUICurate: A GraphRAG-based Framework for Automated Clinical Concept Curation for NLP applications

यह शोधपत्र CUICurate को प्रस्तुत करता है, जो एक स्केलेबल और लागत प्रभावी GraphRAG फ्रेमवर्क है जो क्लिनिकल NLP अनुप्रयोगों के लिए व्यापक, क्लिनिशियन-समीक्षा योग्य कॉन्सेप्ट सेट्स के निर्माण को स्वचालित करने के लिए UMLS नॉलेज ग्राफ और लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो रिकॉल और पूर्णता में मैनुअल क्यूरेशन से बेहतर प्रदर्शन करता है।

Victoria Blake, Jamie Novak, Mathew Miller, Sze-yuan Ooi, Blanca Gallego2026-07-03
💬 NLP

TokenScope: Token-Level Explainability and Interpretability for Code-Oriented Tasks in Large Language Models

TokenScope एक इंटरैक्टिव टूल है जिसे कोड-ओरिएंटेड लार्ज लैंग्वेज मॉडल्स की व्याख्यात्मकता (explainability) को बढ़ाने के लिए डिज़ाइन किया गया है, जो जनरेशन के दौरान टोकन-स्तरीय मेट्रिक्स, अटेंशन पैटर्न और संरचनात्मक जानकारी को प्रदर्शित करता है, जिससे इंटरैक्टिव टोकन रिप्लेसमेंट और काउंटरफैक्चुअल ब्रांचिंग जैसी विशेषताओं के माध्यम से व्यवस्थित जांच सक्षम होती है।

Amirreza Esmaeili, Fatemeh Fard2026-07-03
💬 NLP

Safeguarding LLM Agents from Misalignment through Provenance Analysis

यह शोधपत्र ProvenanceGuard को प्रस्तुत करता है, जो एक प्रोवेनेंस-आधारित (provenance-based) ढांचा है जो एजेंट के संदर्भ में ट्रेस करने योग्य साक्ष्यों के विरुद्ध टूल कॉल्स (tool calls) को सत्यापित करके, पारंपरिक LLM-as-a-judge बेसलाइन की तुलना में LLM एजेंट मिसअलाइनमेंट (misalignment) का पता लगाने में महत्वपूर्ण सुधार करता है और गलत हस्तक्षेपों को कम करता है।

Yining She, Yiliang Liang, Eunsuk Kang2026-07-03
💬 NLP

SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings

यह शोधपत्र SPARCLE को प्रस्तुत करता है, जो एक स्पीकर-अवेयर ग्रैफीम प्रतिनिधित्व मॉडल है जिसे टेक्स्ट कैरेक्टर्स को ध्वनिक विशेषताओं (acoustic features) के साथ संरेखित करने के लिए एक कंट्रास्टिविव ऑब्जेक्टिव के साथ प्रशिक्षित किया गया है, जो मानक ग्रैफीम-आधारित मॉडलों की तुलना में अत्यधिक कम-संसाधन वाली स्थितियों में टेक्स्ट-टू-स्पीच जनरेशन की गुणवत्ता में महत्वपूर्ण सुधार करता है और वर्ड एरर रेट को कम करता है।

Priyam Mazumdar, Yurii Halychanskyi, Steven Guo, Mark Hasegawa-Johnson, Volodymyr Kindratenko2026-07-03
💬 NLP

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

यह शोध पत्र प्रदर्शित करता है कि बाइट-पेयर एनकोडिंग (BPE) टोकनाइजेशन महत्वपूर्ण शब्दों को उप-शब्द टुकड़ों में विभाजित करके एलएलएम (LLM) सुरक्षा संरेखण (safety alignment) में शोषण योग्य अंतराल पैदा करता है, जो एक ऐसी भेद्यता है जो कई मॉडल परिवारों में इनकार तंत्र (refusal mechanisms) को दरकिनार कर देती है और जिसे वैश्विक प्रदर्शन पतन (global performance collapse) का कारण बने बिना वर्तमान संरेखण डेटासेट या मानक प्रशिक्षण विन्यासों द्वारा मजबूती से ठीक नहीं किया जा सकता है।

Tung-Ling Li, Hongliang Liu, Yuhao Wu2026-07-03