🤖 AI

PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning

PruneTIR एक इन्फरेंस-टाइम फ्रेमवर्क है जो त्रुटिपूर्ण प्रक्षेप पथों (trajectories) को गतिशील रूप से छाँटकर, टूल कॉल्स को पुन: नमूना बनाकर (resampling), और पुनः प्रयासों को निलंबित करके बड़े भाषा मॉडलों में टूल-एकीकृत तर्क को बढ़ाता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के सटीकता और दक्षता में सुधार होता है।

Luan Zhang, Dandan Song, Zhijing Wu, Zhengyu Chen, Chen Zhang, Yuhang Tian, Huipeng Ma, Chenhao Li, Changzhi Zhou, Xudon (…)2026-05-12
🤖 machine learning

G-Zero: Self-Play for Open-Ended Generation from Zero Data

G-Zero एक वर्िफायर-मुक्त (verifier-free), सह-विकासवादी (co-evolutionary) ढांचा है जो एक आंतरिक "Hint-δ\delta" रिवॉर्ड का उपयोग करके LLM के ओपन-एंडेड आत्म-सुधार को सक्षम बनाता है, जिससे एक प्रपोजर (Proposer) मॉडल को चुनौतीपूर्ण प्रश्न और संकेत उत्पन्न करने के लिए प्रशिक्षित किया जाता है, जिससे एक जनरेटर (Generator) मॉडल DPO के माध्यम से उनसे सीखता है, और इस प्रकार बाहरी जजों की सीमाओं को दरकिनार करता है।

Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin (…)2026-05-12
🤖 machine learning

The Truth Lies Somewhere in the Middle (of the Generated Tokens)

यह शोध पत्र यह प्रदर्शित करता है कि ऑटोरेग्रेसिव रूप से उत्पन्न टोकन के माध्यम से मीन पूलिंग (mean pooling) करने से व्यक्तिगत टोकन अवस्थाओं की तुलना में बेहतर सिमेंटिक निरूपण प्राप्त होते हैं, जो यह प्रकट करता है कि सूचना किसी एक स्थिति तक सीमित होने के बजाय पूरी पीढ़ी प्रक्रिया के दौरान वितरित होती है।

Sophie L. Wang, Phillip Isola, Brian Cheung2026-05-12
🤖 AI

GLiNER2-PII: A Multilingual Model for Personally Identifiable Information Extraction

यह शोध पत्र GLiNER2-PII को प्रस्तुत करता है, जो एक संक्षिप्त बहुभाषी मॉडल है जिसे विविध भाषाओं और प्रारूपों में व्यक्तिगत रूप से पहचान योग्य सूचना (PII) के 42 प्रकारों को प्रभावी ढंग से पहचानने के लिए एक सिंथेटिक कॉर्पस पर प्रशिक्षित किया गया है, और इसने SPY बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया है।

Urchade Zaratiana, Ash Lewis, George Hurn-Maloney2026-05-12
🤖 AI

Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework

यह शोध पत्र C-BPO प्रस्तुत करता है, जो एक प्राथमिकता-कैलिब्रेटेड अनुकूलन ढांचा (preference-calibrated optimization framework) है जो व्यक्तिगत उपयोगकर्ता प्राथमिकताओं को साझा ज्ञान से अलग करने के लिए बाइनरी फीडबैक का लाभ उठाकर लार्ज लैंग्वेज मॉडल वैयक्तिकरण (personalization) को बढ़ाता है, जिससे सामान्य उपयोगिता को बनाए रखते हुए अंतर-उपयोगकर्ता अंतरों को प्रभावी ढंग से मॉडल किया जा सके।

Xilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li2026-05-12
🤖 AI

Swarm Skills: A Portable, Self-Evolving Multi-Agent System Specification for Coordination Engineering

यह शोध पत्र स्वार्म स्किल्स (Swarm Skills) को प्रस्तुत करता है, जो एक पोर्टेबल विनिर्देश और स्व-विकास एल्गोरिदम है जो मल्टी-एजेंट समन्वय प्रोटोकॉल को वितरित करने योग्य, प्रथम-श्रेणी की संपत्तियों में परिवर्तित करता है, जिससे एजेंट टीमों को मानवीय देखरेख के बिना विभिन्न फ्रेमवर्क में अपनी सहयोगात्मक रणनीतियों को स्वायत्त रूप से परिष्कृत करने में सक्षम बनाया जा सके।

Xinyu Zhang, Zhicheng Dou, Deyang Li, Jianjun Tao, Shuo Cheng, Ruifeng Shi, Fangchao Liu, Enrui Hu, Yangkai Ding, Hongbo (…)2026-05-12
🤖 machine learning

GLiNER-Relex: A Unified Framework for Joint Named Entity Recognition and Relation Extraction

GLiNER-Relex एक एकीकृत, ओपन-सोर्स फ्रेमवर्क है जो GLiNER आर्किटेक्चर का विस्तार करता है ताकि एक ही मॉडल में संयुक्त नामित इकाई पहचान (named entity recognition) और संबंध निष्कर्षण (relation extraction) किया जा सके, जिससे कई बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन के साथ किसी भी इकाई और संबंध प्रकार के कुशल ज़ीरो-शॉट अनुमान (zero-shot inference) को सक्षम बनाया जा सके।

Ihor Stepanov, Oleksandr Lukashov, Mykhailo Shtopko, Vivek Kalyanarangan2026-05-12
🤖 AI

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

यह शोध पत्र RevCI प्रस्तुत करता है, जो वैज्ञानिक सहकर्मी समीक्षा विरोधाभासों के लिए साक्ष्य-स्तरीय एनोटेशन और श्रेणीबद्ध तीव्रता लेबल के साथ एक नया बेंचमार्क है, साथ ही IMPACT, एक मल्टी-एजेंट फ्रेमवर्क, और इसका डिस्टिल्ड मॉडल TIDE, जो मिलकर समीक्षकों के मतभेदों की पहचान करने और उनकी गंभीरता का मूल्यांकन करने में मौजूदा बेसलाइन से बेहतर प्रदर्शन करते हैं।

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal2026-05-12
🤖 AI

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

यह शोधपत्र LegalCiteBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है यह प्रदर्शित करता है कि वर्तमान बड़े भाषा मॉडल (large language models) क्लोज्ड-बुक लीगल साइटेशन कार्यों के साथ काफी संघर्ष करते हैं, और मॉडल के पैमाने या डोमेन-विशिष्ट प्रीट्रेनिंग में सुधार के बावजूद अक्सर उच्च भ्रामक दरों के साथ विश्वसनीय लेकिन गलत अधिकार (authorities) उत्पन्न करते हैं।

Sijia Chen, Hang Yin, Shunfan Zhou2026-05-12
⚡ electrical engineering

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

यह शोध पत्र फुल-डुप्लेक्स स्पोकन डायलॉग सिस्टम्स के लिए यूजर-स्ट्रीम रूटिंग रणनीतियों की जांच करता है, जो यह प्रकट करता है कि जहाँ चैनल फ्यूजन प्रश्न उत्तर देने के लिए बेहतर सिमेंटिक ग्राउंडिंग प्रदान करता है, वहीं क्रॉस-अटेंशन रूटिंग यूजर इंटरप्शन के दौरान कॉन्टेक्स्ट करप्शन के विरुद्ध अधिक मजबूती प्रदान करती है, जिससे रूटिंग आर्किटेक्चर एकीकरण और स्थिरता के बीच एक महत्वपूर्ण डिजाइन ट्रेडऑफ के रूप में स्थापित होता है।

Hui Lu, Xueyuan Chen, Huimeng Wang, Shuhai Peng, Shiyin Kang, Xixin Wu, Zhiyong Wu2026-05-12