💬 NLP

Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

यह शोध पत्र एक गोल्ड-गाइडेड प्रोग्रामैटिक डिस्टिलेशन फ्रेमवर्क प्रस्तावित करता है जो त्रुटिपूर्ण प्राकृतिक भाषा तर्क के बजाय निष्पादन-सत्यापित पायथन प्रोग्रामों का उपयोग करके बड़े भाषा मॉडलों से विश्वसनीय संख्यात्मक तर्क को कॉम्पैक्ट स्टूडेंट मॉडलों में स्थानांतरित करता है, जिससे TAT-QA वित्तीय तर्क बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Yun Dong, Erica Zhao, Elana Chen2026-07-17
💬 NLP

Does generative AI supersede supervised XMLC? A Benchmark Study on Automated Subject Indexing with German Scientific Literature

जर्मन वैज्ञानिक साहित्य के लिए स्वचालित विषय अनुक्रमण (सब्जेक्ट इंडेक्सिंग) पर इस बेंचमार्क अध्ययन में यह पाया गया है कि जहाँ पर्यवेक्षित ट्रांसफॉर्मर-आधारित XMLC विधियाँ समग्र बाइनरी प्रासंगिकता में उत्कृष्ट हैं, वहीं LLM-आधारित जनरेटिव दृष्टिकोण ग्रेडेड प्रासंगिकता और विषय शब्दावली की 'लॉन्ग टेल' को संभालने में उनसे बेहतर प्रदर्शन करते हैं, जो उन्हें भविष्य के उपयोग के लिए एक आशाजनक विकल्प के रूप में स्थापित करते हैं।

Maximilian Kähler, Katja Konermann, Lisa Kluge, Markus Schumacher2026-07-17
🤖 machine learning

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

यह शोध पत्र यह प्रदर्शित करता है कि संकीर्ण, तथ्यात्मक रूप से सुदृढ़ डेटासेट पर लार्ज लैंग्वेज मॉडल्स को फाइनट्यून करने से व्यापक "वैचारिक सामान्यीकरण" (ideological generalization) उत्पन्न हो सकता है, जिससे सामान्य क्षमताओं और सटीकता को बनाए रखते हुए असंबंधित क्षेत्रों (जैसे आपराधिक न्याय या स्वास्थ्य संबंधी विश्वासों) में महत्वपूर्ण और प्रवर्धित बदलाव आते हैं।

Robert Graham, Edward Stevinson, Yariv Barsheshat2026-07-17
🤖 machine learning

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

यह शोध पत्र एक लागत प्रभावी विधि प्रस्तावित करता है जो पहले मानव-लिखित समाधानों पर क्लासिक इंस्ट्रक्शन ट्यूनिंग लागू करके और फिर परिणामी मॉडल को मूल रीजनिंग मॉडल के साथ मर्ज करके डोमेन-विशिष्ट रीजनिंग क्षमताओं को पुनः प्राप्त करने के माध्यम से, सत्यापन योग्य और गैर-सत्यापन योग्य दोनों डोमेन में रीजनिंग लैंग्वेज मॉडल्स को उन्नत करता है।

Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev2026-07-17
💬 NLP

Latent Trajectory Discrimination for AI-Generated Text Detection

यह शोध पत्र ज्योमेट्रिक ट्रैजेक्टरी और कॉन्ट्रास्टिव लर्निंग (GTCL) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो स्थिर दस्तावेज़ एम्बेडिंग पर निर्भर रहने के बजाय अनुक्रमों (sequences) के माध्यम से पाठ्य निरूपणों (textual representations) के गतिशील विकास को मॉडल करके AI-जनित टेक्स्ट डिटेक्शन में सुधार करता है, जिससे कई बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenic (…)2026-07-17
💬 NLP

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench एक व्यापक बेंचमार्क है जिसे वास्तविक दुनिया के संसाधनों से प्राप्त एक पदानुक्रमित वर्गीकरण का लाभ उठाकर विविध ToC, ToB और ToE परिदृश्यों में सामान्य AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो स्पष्ट स्टेट स्पेस के साथ 1,431 निष्पादन योग्य कार्यों का निर्माण करता है, जिससे योजना बनाने (planning), बाधा बनाए रखने (constraint maintenance) और अनुकूलनशील सुधार (adaptive correction) के संबंध में वर्तमान फ्रंटियर मॉडल्स की महत्वपूर्ण सीमाओं का पता चलता है।

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Ha (…)2026-07-17
💬 NLP

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents

यह शोध पत्र एक बहु-एजेंट ढांचे को प्रस्तुत करता है जो वैचारिक निष्ठा के साथ पक्षपाती राजनीतिक गठबंधन वार्ताओं को सिम्युलेट करने के लिए फाइन-ट्यूनिंग, प्रेफरेंस ऑप्टिमाइज़ेशन और रिट्रीवल-ऑगमेंटेड जनरेशन को जोड़ता है, जिसमें यह मान्य करने के लिए एक नवीन वंश-अनुक्रमण (लीनिएज ट्रेसिंग) प्रणाली पेश की गई है कि घोषणापत्र-आधारित सामग्री वास्तविक दुनिया के समझौते के परिणामों की कैसे भविष्यवाणी करती है।

Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel2026-07-17
💬 NLP

Grokipedia vs Wikipedia: An LLM-Based Audit of Political Neutrality along Ideologies

ग्रोकिपीडिया (Grokipedia) और विकिपीडिया (Wikipedia) की तुलना करने वाले एक बड़े पैमाने के ऑडिट से पता चलता है कि कई एआई न्यायाधीशों द्वारा एलएलएम-जनित ग्रोकिपीडिया को विकिपीडिया की तुलना में कम तटस्थ माना गया है, जिसमें ग्रोकिपीडिया आर्थिक रूप से दक्षिणपंथी राजनेताओं के पक्ष में पूर्वाग्रह प्रदर्शित करता है जबकि सामाजिक रूप से उदार लोगों को दंडित करता है, जबकि विकिपीडिया इसके विपरीत प्रवृत्ति दर्शाता है।

Filippos Vlahos, Guillaume Bied, Tijl De Bie2026-07-17
🤖 machine learning

On-Policy Delta Distillation

यह शोध पत्र ऑन-पॉलिसी डेल्टा डिस्टिलेशन (OPD2^2) को प्रस्तुत करता है, जो सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन पोस्ट-ट्रेनिंग विधि है, जो एक "डेल्टा सिग्नल" का लाभ उठाती है—जो एक शिक्षक मॉडल और रीजनिंग ट्यूनिंग से पूर्व उसके बेस के बीच के अंतर को दर्शाता है—ताकि रीजनिंग क्षमताओं को अधिक प्रभावी ढंग से स्थानांतरित किया जा सके और न्यूनतम पोस्ट-ट्रेनिंग के साथ गणित, विज्ञान और कोड बेंचमार्क में मजबूत प्रदर्शन प्राप्त किया जा सके।

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han2026-07-17
💬 NLP

MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

MedFailBench एक ओपन-सोर्स, क्लिनिशियन-निर्मित बेंचमार्क है जो चिकित्सा एआई मूल्यांकन के केंद्र को उत्तर की सटीकता से हटाकर विशिष्ट सुरक्षा सीमा विफलताओं (सेफ्टी बाउंड्री फेलियर्स) की पहचान करने पर केंद्रित करता है, जिसके लिए यह मॉडल त्रुटियों के विश्लेषण हेतु एक गंभीरता-एनोटेटेड विफलता एटलस और वर्गीकरण (टैक्सोनॉमी) प्रदान करता है।

Goktug Ozkan2026-07-17