💬 NLP

The Automatic Verification of Image-Text Claims (AVerImaTeC) Shared Task

यह शोध पत्र AVerImaTeC साझा कार्य (shared task) प्रस्तुत करता है, जो इमेज-टेक्स्ट क्लेम वेरिफिकेशन सिस्टम को आगे बढ़ाने पर केंद्रित है, जिसमें मूल्यांकन पद्धति का विवरण दिया गया है, यह रिपोर्ट की गई है कि परीक्षण-चरण के सभी छह सबमिशन ने बेसलाइन से बेहतर प्रदर्शन किया और विजेता टीम HUMANE ने 0.5455 का स्कोर प्राप्त किया, और परिणामों से प्राप्त प्रमुख अंतर्दृष्टि पर चर्चा की गई है।

Rui Cao, Zhenyun Deng, Yulong Chen, Michael Schlichtkrull, Andreas Vlachos2026-02-27
💬 NLP

Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

यह शोध पत्र जनरलाइज्ड ऑन-पॉलिसी डिस्टिलेशन (G-OPD) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो लचीले रेफरेंस मॉडल और रिवॉर्ड स्केलिंग को सक्षम करके मानक ऑन-पॉलिसी डिस्टिलेशन का विस्तार करता है, यह प्रदर्शित करते हुए कि रिवॉर्ड एक्सट्रपलेशन (ExOPD) छात्रों को शिक्षक के प्रदर्शन से आगे बढ़ने की अनुमति देता है और शिक्षक के प्री-आरएल बेस मॉडल का उपयोग एक रेफरेंस के रूप में स्ट्रॉन्ग-टू-वीक सेटिंग्स में डिस्टिलेशन को और अधिक बढ़ाता है।

Wenkai Yang, Weijie Liu, Ruobing Xie, Kai Yang, Saiyong Yang, Yankai Lin2026-02-27
💬 NLP

GPT-4o Lacks Core Features of Theory of Mind

मानक बेंचमार्क पर सामाजिक दक्षता प्रदर्शित करने के बावजूद, GPT-4o में एक सुसंगत, डोमेन-जनरल और निरंतर 'थ्योरी ऑफ माइंड' (मनोविज्ञान संबंधी सिद्धांत) का अभाव है, जैसा कि मानसिक अवस्था के अनुमानों और व्यवहार संबंधी भविष्यवाणियों के बीच तार्किक निरंतरता बनाए रखने में इसकी विफलता से सिद्ध होता है।

John Muchovej, Amanda Royka, Shane Lee, Julian Jara-Ettinger2026-02-27
💬 NLP

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

यह शोध पत्र डिफ़र्ड विज़ुअल इंजेशन (DVI) फ्रेमवर्क का प्रस्ताव करता है, जो विज़ुअल कंटेंट के लॉस्य प्री-एम्बेडिंग को स्ट्रक्चर-आधारित पदानुक्रमित इंडेक्सिंग और डिफ़र्ड VLM विश्लेषण रणनीति से बदल देता है, जिससे मौजूदा प्री-इंजेशन विधियों की रिट्रीवल और विवरण-हानि की सीमाओं को दूर करते हुए विज़ुअल-सघन इंजीनियरिंग दस्तावेज़ QA पर काफी अधिक सटीकता प्राप्त होती है।

Tao Xu2026-02-27
💬 NLP

BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios

यह शोध पत्र BankMathBench को प्रस्तुत करता है, जो एक डोमेन-विशिष्ट बेंचमार्क है जिसे वास्तविक बैंकिंग परिदृश्यों में लार्ज लैंग्वेज मॉडल्स की संख्यात्मक तर्क क्षमताओं का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि इस डेटासेट पर प्रशिक्षण लेने से एकल-उत्पाद गणनाओं से लेकर जटिल बहु-शर्त तुलनाओं तक के कार्यों में सटीकता काफी बढ़ जाती है।

Yunseung Lee, Subin Kim, Youngjun Kwak, Jaegul Choo2026-02-27
💬 NLP

Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences

यह शोध पत्र Duel-Evolve को प्रस्तुत करता है, जो एक रिवॉर्ड-फ्री टेस्ट-टाइम स्केलिंग विधि है जो एक बेयसियन इवोल्यूशनरी फ्रेमवर्क के भीतर एक LLM की अपनी पेयरवाइज सेल्फ-प्रेफरेंसेस (pairwise self-preferences) का लाभ उठाकर गणित और कोडिंग बेंचमार्क पर मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है, जिसमें किसी बाहरी रिवॉर्ड मॉडल या ग्राउंड-ट्रुथ लेबल की आवश्यकता नहीं होती है।

Sweta Karlekar, Carolina Zheng, Magnus Saebo, Nicolas Beltran-Velez, Shuyang Yu, John Bowlan, Michal Kucer, David Blei2026-02-27
💬 NLP

Graph Your Way to Inspiration: Integrating Co-Author Graphs with Retrieval-Augmented Generation for Large Language Model Based Scientific Idea Generation

यह शोध पत्र GYWI प्रस्तुत करता है, जो एक ऐसी प्रणाली है जो बड़े भाषा मॉडलों (Large Language Models) की नियंत्रणीय, पता लगाने योग्य और नवीन वैज्ञानिक विचार उत्पन्न करने की क्षमता को बढ़ाने के लिए सह-लेखक ज्ञान ग्राफ (co-author knowledge graphs) को हाइब्रिड रिट्रीवल-ऑगमेंटेड जनरेशन और सुदृढीकरण शिक्षण-आधारित प्रॉम्प्ट अनुकूलन (reinforcement learning-based prompt optimization) के साथ एकीकृत करती है, जो मुख्यधारा के मॉडलों की तुलना में कई मूल्यांकन मेट्रिक्स में बेहतर प्रदर्शन प्रदर्शित करती है।

Pengzhen Xie, Huizhi Liang2026-02-27
💬 NLP

Comparative Analysis of Neural Retriever-Reranker Pipelines for Retrieval-Augmented Generation over Knowledge Graphs in E-commerce Applications

यह शोध पत्र ई-कॉमर्स नॉलेज ग्राफ पर रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के लिए न्यूरल रिट्रीवर-रीरैंकर पाइपलाइनों का एक तुलनात्मक विश्लेषण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि STaK डेटासेट पर अनुकूलित कॉन्फ़िगरेशन रिट्रीवल सटीकता में मौजूदा बेंचमार्क से काफी बेहतर प्रदर्शन करते हैं और उत्पादन-तैयार डोमेन-विशिष्ट RAG सिस्टम के लिए एक व्यावहारिक ढांचा स्थापित करते हैं।

Teri Rumble, Zbyněk Gazdík, Javad Zarrin, Jagdeep Ahluwalia2026-02-27
💬 NLP

Misinformation Exposure in the Chinese Web: A Cross-System Evaluation of Search Engines, LLMs, and AI Overviews

यह शोध एक वास्तविक दुनिया के क्वेरी डेटासेट को पेश करते हुए चीनी वेब में पारंपरिक खोज इंजनों, स्टैंडअलोन एलएलएम (LLMs) और एआई ओवरव्यू की तथ्यात्मक विश्वसनीयता का मूल्यांकन करता है, जो महत्वपूर्ण सटीकता असमानताओं को प्रकट करता है और चीनी उपयोगकर्ताओं के गलत सूचनाओं के क्षेत्रीय जोखिम का अनुमान लगाता है।

Geng Liu, Junjie Mu, Li Feng, Mengxiao Zhu, Francesco Pierri2026-02-27
💬 NLP

Scaling In, Not Up? Testing Thick Citation Context Analysis with GPT-5 and Fragile Prompts

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ GPT-5 विविध व्याख्यात्मक परिकल्पनाओं को उत्पन्न करके सघन उद्धरण संदर्भ विश्लेषण (thick citation context analysis) के लिए एक स्थिर सह-विश्लेषक के रूप में कार्य कर सकता है, वहीं इसके विशिष्ट पठन और शब्दावली व्यवस्थित रूप से प्रॉम्प्ट स्कैफोल्डिंग द्वारा आकार लेती हैं, जो अक्सर मानव विशेषज्ञ पुनर्निर्माणों की तुलना में निषेध (admonishment) से वंशावली (lineage) की ओर ध्यान केंद्रित करती हैं।

Arno Simons2026-02-27