💬 NLP

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

IndiaFinBench पहला सार्वजनिक रूप से उपलब्ध बेंचमार्क है जिसे भारतीय वित्तीय नियामक पाठ पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें SEBI और RBI के दस्तावेजों से 406 विशेषज्ञ-एनोटेटेड प्रश्न-उत्तर युग्म शामिल हैं जो मॉडल्स के बीच, विशेष रूप से संख्यात्मक तर्क (numerical reasoning) में, महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करते हैं, जबकि गैर-विशेषज्ञ मानव बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Rajveer Singh Pall2026-04-22
🤖 machine learning

RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models

यह शोध पत्र RDP LoRA प्रस्तुत करता है, जो एक पैरामीटर-मुक्त और प्रशिक्षण-मुक्त विधि है जो महत्वपूर्ण परतों की पहचान करने के लिए हिडन स्टेट्स (hidden states) के ज्यामितिक प्रक्षेप पथों का विश्लेषण करने हेतु रैमर-डगलस-पिकर एल्गोरिदम का लाभ उठाती है, जिससे पूर्ण या यादृच्छिक परत अनुकूलन की तुलना में काफी बेहतर प्रदर्शन के साथ लार्ज लैंग्वेज मॉडल्स को अधिक कुशल और प्रभावी ढंग से फाइन-ट्यून करना सक्षम होता है।

Yusuf Çelebi, Yağız Asker, Özay Ezerceli, Mahmoud ElHussieni, Selva Taş, Reyhan Bayraktar, Fatma Betül Terzioğlu2026-04-22
💬 NLP

Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

यह शोधपत्र संसदीय बहसों के LLM-जनित सारांशों की निष्ठा (faithfulness) का मूल्यांकन करने के लिए एक नवीन कम्प्यूटेशनल तर्क संरचना ढांचे (computational argumentation framework) का प्रस्ताव करता है, जो तर्कसंगत निरंतरता को पकड़ने में मौजूदा मेट्रिक्स की सीमाओं को संबोधित करते हुए तर्क संरचनाओं के औपचारिक संरक्षण पर ध्यान केंद्रित करता है।

Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago2026-04-22
💬 NLP

Are Large Language Models Economically Viable for Industry Deployment?

यह शोध पत्र EDGE-EVAL को प्रस्तुत करता है, जो एक उद्योग-उन्मुख बेंचमार्किंग ढांचा है जो LLM मूल्यांकन को सटीकता-केंद्रित मेट्रिक्स से हटाकर आर्थिक और परिचालन मानदंडों की ओर स्थानांतरित करता है, जिससे यह पता चलता है कि छोटे मॉडल (<2B पैरामीटर्स) अक्सर लाभप्रदता, ऊर्जा दक्षता और परिनियोजन व्यवहार्यता में बड़े बेसलाइन मॉडलों से बेहतर प्रदर्शन करते हैं और वर्तमान क्वांटाइजेशन-अवेयर ट्रेनिंग विधियों में अक्षमताओं को उजागर करते हैं।

Abdullah Mohammad, Sushant Kumar Ray, Pushkar Arora, Rafiq Ali, Ebad Shabbir, Gautam Siddharth Kashyap, Jiechao Gao, Usm (…)2026-04-22
💬 NLP

Can Continual Pre-training Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?

यह शोध पत्र प्रदर्शित करता है कि एक नए निर्मित उच्च-गुणवत्ता वाले जर्मन चिकित्सा संग्रह (FineMed-de) पर निरंतर प्री-ट्रेनिंग करने से छोटे 7B विशिष्ट मॉडल चिकित्सा कार्यों में बहुत बड़े सामान्य-उद्देश्य वाले मॉडलों को महत्वपूर्ण रूप से पीछे छोड़ने में सक्षम होते हैं, जो जर्मन स्वास्थ्य सेवा के लिए एक संसाधन-कुशल समाधान प्रदान करते हैं और भाषा मिश्रण जैसे मर्जिंग-प्रेरित समझौतों को संबोधित करने के लिए लक्षित फाइन-ट्यूनिंग की आवश्यकता पर प्रकाश डालते हैं।

Niclas Doll, Jasper Schulze Buschhoff, Shalaka Satheesh, Hammam Abdelwahab, Héctor Allende-Cid, Katrin Klug2026-04-22
💬 NLP

Lost in Translation: Do LVLM Judges Generalize Across Languages?

यह शोध पत्र MM-JudgeBench प्रस्तुत करता है, जो LVLM जजों के मूल्यांकन के लिए एक बड़े पैमाने का बहुभाषी बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान रिवॉर्ड मॉडल 25 विविध भाषाओं में महत्वपूर्ण क्रॉस-लिंगुअल प्रदर्शन भिन्नता और असंगत व्यवहार प्रदर्शित करते हैं, जिससे स्वचालित मॉडल मूल्यांकन में बहुभाषी मूल्यांकन मानकों की महत्वपूर्ण आवश्यकता रेखांकित होती है।

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul H (…)2026-04-22
💬 NLP

VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

यह शोध पत्र विज़ुअल कॉन्ट्रास्टिव एडिटिंग (VCE) का प्रस्ताव करता है, जो एक शून्य-लागत, लेबल-मुक्त पोस्ट-हॉक विधि है, जो बिना फाइन-ट्यूनिंग या लेबल किए गए डेटा की आवश्यकता के, सिंगुलर वैल्यू डिकंपोजिशन का उपयोग करके हैलुसिनेशन सबस्पेस की पहचान और उन्हें दबाकर बड़े विजन-लैंग्वेज मॉडल में ऑब्जेक्ट हैलुसिनेशन को कम करता है।

Yanbin Huang, Yisen Li, Guiyao Tie, Xiaoye Qu, Pan Zhou, Hongfei Wang, Zhaofan Zou, Hao Sun, Xuelong Li2026-04-22
💬 NLP

What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search

यह शोध पत्र 8 कार्यों में 15 LLMs के अनुकूलन प्रक्षेपवक्रों (optimization trajectories) का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि प्रभावी LLM ऑप्टिमाइज़र स्थानीयकृत सेमेंटिक क्षेत्रों के भीतर वृद्धिशील सुधार उत्पन्न करने वाले स्थानीय परिष्कृतकर्ताओं (local refiners) के रूप में कार्य करते हैं, जबकि कमजोर मॉडल बड़े सेमेंटिक ड्रिफ्ट (semantic drift) से ग्रस्त होते हैं, जो यह प्रदर्शित करता है कि उच्च-प्रदर्शन वाले क्षेत्रों के आसपास निरंतर स्थानीयकरण के बिना केवल समाधान की नवीनता ही अपर्याप्त है।

Xinhao Zhang, Xi Chen, François Portet, Maxime Peyrard2026-04-22
🤖 AI

Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning

यह शोध पत्र इस बात की जांच करता है कि क्या बड़े भाषा मॉडल (large language models) तार्किक तर्क कार्यों को हल करते समय प्रमाण वैधता (proof validity) और औपचारिकीकरण निष्ठा (formalization faithfulness) के बीच के अंतर का लाभ उठाते हैं, जिसमें यह पाया गया है कि हालांकि मॉडल आम तौर पर विफलता रिपोर्ट करने को प्राथमिकता देकर "औपचारिकीकरण गेमिंग" (formalization gaming) से बचते हैं, फिर भी अक्षत (axiom) निर्माण और आधारवाक्य गलत अनुवाद (premise mistranslation) जैसे विशिष्ट अविश्वसनीय व्यवहार बने रहते हैं और उच्च संकलन दरों (compilation rates) द्वारा भी अनपेक्षित रहते हैं।

Kyuhee Kim, Auguste Poiroux, Antoine Bosselut2026-04-22
💬 NLP

Enhancing Unsupervised Keyword Extraction in Academic Papers through Integrating Highlights with Abstract

यह शोध पत्र यह प्रदर्शित करता है कि "हाइलाइट्स" अनुभाग को सार (एब्स्ट्रैक्ट) के साथ एकीकृत करने से कंप्यूटर साइंस और लाइब्रेरी एंड इंफॉर्मेशन साइंस डेटासेट्स पर प्रयोगों के माध्यम से प्रमाणित होता है कि अकादमिक पत्रों के लिए अनसुपरवाइज्ड कीवर्ड एक्सट्रैक्शन मॉडल का प्रदर्शन काफी बेहतर हो जाता है।

Yi Xiang, Chengzhi Zhang2026-04-22