💬 NLP

Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की अधिकतम त्रुटि-मुक्त तर्क सीमा का मूल्यांकन करने के लिए ज़ीरो-एरर होराइज़न (ZEH) मीट्रिक प्रस्तुत करता है, जो यह प्रकट करता है कि GPT-5.2 जैसे अत्याधुनिक सिस्टम भी मौलिक कार्यों में विफल रहते हैं, साथ ही एल्गोरिद्मिक इमर्जेंस (एल्गोरिद्मिक उद्भव) के विश्लेषण में ZEH की उपयोगिता और इसके मूल्यांकन को स्केल करने के लिए कुशल कम्प्यूटेशनल विधियों का प्रस्ताव देता है।

Ryoma Sato2026-01-23
💬 NLP

PhysProver: Advancing Automatic Theorem Proving for Physics

यह शोध पत्र PhysProver को प्रस्तुत करता है, जो भौतिकी में औपचारिक प्रमेय सिद्ध करने (formal theorem proving) को बेहतर बनाने वाला पहला ढांचा है, जो एक समर्पित डेटासेट का उपयोग करके DeepSeek-Prover-V2 मॉडल को 'वेरिफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning with Verifiable Rewards) पर प्रशिक्षित करता है, जिससे भौतिकी और सामान्य गणितीय डोमेन दोनों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Hanning Zhang, Ruida Wang, Rui Pan, Wenyuan Wang, Bingxu Meng, Tong Zhang2026-01-23
💬 NLP

Hallucination Mitigating for Medical Report Generation

यह शोध पत्र KERM का प्रस्ताव करता है, जो एक ज्ञान-संवर्धित ढांचा (knowledge-enhanced framework) है जो मेडिकल रिपोर्ट जनरेशन में मतिभ्रम (hallucinations) को कम करने और नैदानिक सटीकता में सुधार करने के लिए MedCLIP-आधारित रिट्रीवल, एक कॉन्टेक्स्ट प्यूरिफिकेशन मॉड्यूल और फाइन-ग्रेन्ड रिइन्फोर्समेंट लर्निंग को एकीकृत करता है।

Ruoqing Zhao, Runze Xia, Piji Li2026-01-23
💬 NLP

Agentic Confidence Calibration

यह शोध पत्र एजेंटिक कॉन्फिडेंस कैलिब्रेशन (Agentic Confidence Calibration) को एक नई समस्या के रूप में प्रस्तुत करता है और होलिस्टिक ट्रजेक्टरी कैलिब्रेशन (Holistic Trajectory Calibration - HTC) का प्रस्ताव देता है, जो एक नैदानिक ढांचे (diagnostic framework) के रूप में एक एजेंट के संपूर्ण प्रक्षेपवक्र (trajectory) में प्रक्रिया-स्तरीय विशेषताओं का लाभ उठाता है ताकि उच्च-जोखिम वाले परिवेशों में एआई एजेंटों की विश्वसनीयता, व्याख्यात्मकता और सामान्यीकरण में महत्वपूर्ण सुधार किया जा सके।

Jiaxin Zhang, Caiming Xiong, Chien-Sheng Wu2026-01-23
💬 NLP

HumanLLM: Towards Personalized Understanding and Simulation of Human Nature

व्यक्तिगत संदर्भ को पकड़ने में मानक LLMs की सीमाओं से प्रेरित होकर, यह शोध पत्र HumanLLM प्रस्तुत करता है, जो वास्तविक दुनिया के उपयोगकर्ता लॉग के एक बड़े पैमाने के "कॉग्निटिव जीनोम डेटासेट" पर प्रशिक्षित एक फाउंडेशन मॉडल है, जो मानव व्यवहार, विचारों और लेखन शैलियों के व्यक्तिगत अनुकरण और भविष्यवाणी में महत्वपूर्ण सुधार करता है।

Yuxuan Lei, Tianfu Wang, Jianxun Lian, Zhengyu Hu, Defu Lian, Xing Xie2026-01-23
💬 NLP

SteerEval: Inference-time Interventions Strengthen Multilingual Generalization in Neural Summarization Metrics

यह शोध पत्र यह प्रदर्शित करता है कि बहुभाषी न्यूरल सारांशीकरण मेट्रिक्स को एक अंग्रेजी आंतरिक पिवट (English internal pivot) की ओर निर्देशित करने के लिए इन्फरेंस-टाइम हस्तक्षेप (inference-time interventions) लागू करने से विविध भाषाओं में मानवीय निर्णयों के साथ उनका सहसंबंध महत्वपूर्ण रूप से सुधर जाता है।

Silvia Casola, Ryan Soh-Eun Shim, Felicia Körner, Yuchen Mao, Barbara Plank2026-01-23
💬 NLP

ExDR: Explanation-driven Dynamic Retrieval Enhancement for Multimodal Fake News Detection

यह शोध पत्र ExDR का प्रस्ताव करता है, जो एक स्पष्टीकरण-संचालित गतिशील पुनर्प्राप्ति ढांचा (explanation-driven dynamic retrieval framework) है जो पुनर्प्राप्ति ट्रिगरिंग और साक्ष्य चयन को अनुकूलित करने के लिए मॉडल-जनित स्पष्टीकरणों का लाभ उठाता है, जिससे मल्टीमॉडल फेक न्यूज डिटेक्शन की सटीकता और मजबूती में महत्वपूर्ण सुधार होता है।

Guoxuan Ding, Yuqing Li, Ziyan Zhou, Zheng Lin, Daren Zha, Jiangnan Li2026-01-23
💬 NLP

Determinants of Training Corpus Size for Clinical Text Classification

MIMIC-III डेटा का उपयोग करने वाला यह अध्ययन प्रदर्शित करता है कि जबकि 600 एनोटेटेड दस्तावेज़ नैदानिक पाठ वर्गीकरण (clinical text classification) में निकट-इष्टतम प्रदर्शन प्राप्त करने के लिए आम तौर पर पर्याप्त हैं, विशिष्ट लर्निंग कर्व और सटीकता केवल कॉर्पस के आकार के बजाय शोर वाले शब्दावली (noisy vocabulary) के मुकाबले मजबूत भविष्य कहने वाले शब्दों के अनुपात द्वारा महत्वपूर्ण रूप से निर्धारित होती है।

Jaya Chaturvedi, Saniya Deshpande, Chenkai Ma, Robert Cobb, Angus Roberts, Robert Stewart, Daniel Stahl, Diana Shamsutdi (…)2026-01-23
💬 NLP

Evaluating and Achieving Controllable Code Completion in Code LLM

यह शोध पत्र कोड LLMs में निर्देश-अनुपालन मूल्यांकन की कमी को दूर करने के लिए कंट्रोलेबल कोड कंप्लीशन बेंचमार्क (C3-Bench) प्रस्तुत करता है, ओपन-सोर्स और प्रोप्रायटरी मॉडल्स के बीच महत्वपूर्ण प्रदर्शन अंतराल को उजागर करता है, और एक डेटा सिंथेसिस पाइपलाइन प्रस्तावित करता है जो एक फाइन-ट्यून्ड मॉडल को इस नए बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करने में सक्षम बनाता है।

Jiajun Zhang, Zeyu Cui, Lei Zhang, Jian Yang, Jiaxi Yang, Qiang Liu, Zilei Wang, Binyuan Hui, Liang Wang, Junyang Lin2026-01-23
💬 NLP

Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain

यह शोध पत्र Mecellem को प्रस्तुत करता है, जो तुर्की कानूनी डोमेन अनुकूलन के लिए एक ढांचा है जिसमें एक अभिनव चेकपॉइंट चयन रणनीति के माध्यम से 112.7 बिलियन टोकन पर स्क्रैच से प्री-ट्रेन किया गया ModernBERT-आधारित एनकोडर, और एक चार-चरणीय निरंतर प्री-ट्रेनिंग पाठ्यक्रम के माध्यम से उन्नत Qwen-आधारित डिकोडर मॉडल शामिल हैं, जो सामूहिक रूप से अत्याधुनिक रिट्रीवल प्रदर्शन और बेहतर कम्प्यूटेशनल दक्षता के साथ महत्वपूर्ण पर्प्लेक्सिटी कमी प्राप्त करते हैं।

Özgür Uğur, Mahmut Göksu, Mahmut Çimen, Musa Yılmaz, Esra Şavirdi, Alp Talha Demir, Rumeysa Güllüce, İclal Çetin, Ömer C (…)2026-01-23