💬 NLP

Weak-to-Strong Elicitation via Mismatched Wrong Drafts

यह शोध पत्र प्रदर्शित करता है कि वर्तमान समस्या से मेल न खाने वाले एक छोटे, डोमेन-प्रशिक्षित मॉडल से गणितीय रूप से गलत ड्राफ्ट को एक मजबूत लर्नर के GRPO प्रशिक्षण संदर्भ में इंजेक्ट करना, मानक ऑन-पॉलिक फाइन-ट्यूनिंग और अन्य वेरिएंट्स की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे बिना SFT, रिवॉर्ड मॉडल या सिंथेसाइज्ड डेटा की आवश्यकता के, Mathstral-7B मॉडल के लिए MATH-500 पर 71.98% का एक नया स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त होता है।

Wei Deng2026-05-19
💬 NLP

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

यह शोध पत्र हाइब्रिड रिवॉर्ड-साइक्लिक (HRC) मॉडल और डायनेमिक सेल्फ-प्ले प्रेफरेंस ऑप्टिमाइजेशन (DSPPO) को प्रस्तुत करता है ताकि मानव प्राथमिकताओं को स्पष्ट रूप से ऑर्थोगोनल ट्रांजिटिव और साइक्लिक घटकों में विभाजित किया जा सके, जिससे मौजूदा विधियों की सैद्धांतिक सीमाओं को दूर करते हुए कई बेंचमार्क पर बेहतर एलाइनमेंट प्रदर्शन प्राप्त किया जा सके।

Yucong Huang, Xiucheng Li, Kaiqi Zhao, Jing Li2026-05-19
💬 NLP

Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution

यह शोधपत्र AgentRevive प्रस्तुत करता है, जो एक मार्कोव स्टेट-अवेयर (Markov state-aware) फ्रेमवर्क है जो सॉफ्ट ट्रांज़िशन और रिस्क-अवेयर पॉलिसियों के माध्यम से एजेंट स्टेट्स को गतिशील रूप से प्रबंधित करके LLM-आधारित मल्टी-एजेंट सिस्टम की लचीलापन और दक्षता को बढ़ाता है, जिससे टोकन खपत को अनुकूलित करते हुए संभावित रूप से सुधारा जा सकने वाले "ज़ोंबी" एजेंटों के समयपूर्व निष्कासन को रोका जा सके।

Taolin Zhang, Pukun Zhao, Qizhou Chen, Jiuheng Wan, Chen Chen, Xiaofeng He, Chengyu Wang, Richang Hong2026-05-19
💬 NLP

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

यह शोध पत्र AMATA को प्रस्तुत करता है, जो एक अनुकूलन योग्य मल्टी-एजेंट फ्रेमवर्क है जो एजेंट सहयोग को एक नवीन इंट्रा-ट्रैजेक्टरी और इंटर-एजेंट डिपेंडेंसी लर्निंग तकनीकों के साथ ट्रैजेक्टरी प्रेफरेंस अलाइनमेंट समस्या के रूप में औपचारिक रूप देकर ज्ञान-गहन प्रश्न उत्तर (knowledge-intensive question answering) में तथ्यात्मक निरंतरता और व्याख्यात्मकता को बढ़ाता है।

Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong2026-05-19
💬 NLP

Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains

यह शोध पत्र TopoPrior का प्रस्ताव करता है, जो मल्टी-एजेंट LLM सिस्टम के लिए क्वेरी-कंडीशन्ड प्रारंभिक सहयोग संरचनाओं को कुशलतापूर्वक उत्पन्न करने के लिए ऑफलाइन मल्टी-डोमेन कोलैबोरेशन ग्राफ से ट्रांसफरेबल टोपोलॉजी प्रायर्स (topology priors) को सीखता है, जिससे विविध डोमेन में रीजनिंग प्रदर्शन में सुधार करते हुए ऑनलाइन सर्च ओवरहेड और टोकन खपत को कम किया जा सके।

Taolin Zhang, Zijie Zhou, Jiuheng Wan, Tingyuan Hu, Chengyu Wang, Xiaofeng He, Richang Hong2026-05-19
💬 NLP

NewsLens: A Multi-Agent Framework for Adversarial News Bias Navigation

न्यूज़लेंस (NewsLens) एक पांच-एजेंट वाले एडवरसैरियल फ्रेमवर्क को पेश करता है जो केवल राजनीतिक लेबलिंग से आगे बढ़कर समाचार लेखों को व्याख्यात्मक फ्रेमिंग मानचित्रों में विघटित करता है, जो ओपन-वेट लार्ज लैंग्वेज मॉडल्स का उपयोग करके विविध भू-राजनीतिक घटनाओं में वैचारिक चूक, अलंकारिक हेरफेर और संरचनात्मक पूर्वाग्रहों को प्रभावी ढंग से पहचानता है।

Joy Bose2026-05-19
💬 NLP

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

यह शोध पत्र QQJ को प्रस्तुत करता है, जो एक स्केलेबल और मानव-संरेखित मूल्यांकन ढांचा है जो विशेषज्ञ-निर्मित, बहु-आयामी रूब्रिक्स में लार्ज लैंग्वेज मॉडल इवैल्यूएटर्स को एंकर करके स्वचालित मूल्यांकन और मानवीय निर्णय के बीच के अंतर को पाटता है, जिससे पारंपरिक मेट्रिक्स और अनकन्स्ट्रेंड एलएलएम इवैल्यूएटर्स की तुलना में जनरेटिव एआई सिस्टम के लिए बेहतर निरंतरता, व्याख्यात्मकता और नैदानिक क्षमता प्राप्त होती है।

Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri2026-05-19
💬 NLP

MiniGPT: Rebuilding GPT from First Principles

यह शोध पत्र MiniGPT प्रस्तुत करता है, जो एक संक्षिप्त, सिंगल-नोटबुक PyTorch कार्यान्वयन है जो बिना किसी नए वास्तुशिल्प नवाचार के, टाइनी शेक्सपियर (Tiny Shakespeare) डेटासेट पर कैरेक्टर-लेवल लैंग्वेज मॉडल्स की प्रशिक्षण और पीढ़ी क्षमताओं को प्रदर्शित करने के लिए प्रथम सिद्धांतों (first principles) से मूल GPT ऑटोरेग्रेसिव पाइपलाइन को पुनर्गठित करता है।

Jibin Joseph2026-05-19
💬 NLP

Medical Context Distorts Decisions in Clinical Vision Language Models

यह शोध पत्र प्रकट करता है कि क्लिनिकल विजन-लैंग्वेज मॉडल अक्सर वास्तविक दुनिया के परिदृश्यों में विफल हो जाते हैं क्योंकि वे टेक्स्टुअल जानकारी पर अत्यधिक निर्भर होते हैं, अप्रासंगिक क्लिनिकल इतिहास द्वारा भ्रमित हो जाते हैं, और प्रॉम्प्ट विविधताओं के प्रति उच्च संवेदनशीलता प्रदर्शित करते हैं, जिससे चिकित्सा अभ्यास में उनके परिनियोजन से पहले कठोर स्ट्रेस-टेस्टिंग और सुरक्षा उपायों की महत्वपूर्ण आवश्यकता रेखांकित होती है।

David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante2026-05-19
💬 NLP

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing

FastOCR एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो विज़ुअल अटेंशन की टेम्पोरल स्पर्सिटी (temporally sparse nature) का लाभ उठाकर विज़न-लैंग्वेज मॉडल्स में डॉक्यूमेंट पार्सिंग को तेज़ करता है, जिसमें प्रत्येक डिकोडिंग स्टेप पर KV कैश टोकन को गतिशील रूप से प्रून और पुन: उपयोग किया जाता है, जिससे न्यूनतम सटीकता हानि के साथ महत्वपूर्ण विलंबता (latency) में कमी आती है।

Zihan Tang, Leqi Shen, Hui Chen, Ao Wang, Ben Wan, Yan Feng, Ke Zhang, Sicheng Zhao, Tongxuan Liu, Guiguang Ding2026-05-19