💬 NLP

Understanding LLM Failures: A Multi-Tape Turing Machine Analysis of Systematic Errors in Language Model Reasoning

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में व्यवस्थित तर्क संबंधी विफलताओं का कठोरता से विश्लेषण करने और उन्हें स्थानीयकृत करने के लिए एक औपचारिक मल्टी-टेप ट्यूरिंग मशीन फ्रेमवर्क प्रस्तावित करता है, जो यह समझने के लिए ज्यामितीय रूपकों (जियोमेट्रिक मेटाफर्स) के स्थान पर एक सिद्धांत-आधारित विकल्प प्रदान करता है कि टोकनाइज़ेशन और आंतरिक प्रतिनिधित्व त्रुटियों में कैसे योगदान देते हैं और चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकें कैसे कार्य करती हैं।

Magnus Boman2026-02-20
💬 NLP

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

यह शोध पत्र रोगी वरीयता डेटा पर प्रशिक्षित एक बहु-उद्देश्यीय संरेखण ढांचे (MODPO) को पेश करके वर्तमान एआई थेरेपी प्रणालियों की सीमाओं को संबोधित करता है, जो नैदानिक सुरक्षा को चिकित्सीय सहानुभूति और स्वायत्तता के साथ सफलतापूर्वक संतुलित करता है, और स्वचालित मेट्रिक्स तथा ब्लाइंड क्लिनिशियन मूल्यांकन दोनों में सिंगल-ऑब्जेक्टिव और मानक फाइन-ट्यूनिंग दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh (…)2026-02-20
🧬 biology

PREFER: An Ontology for the PREcision FERmentation Community

यह शोध पत्र PREFER को प्रस्तुत करता है, जो बेसिक फॉर्मल ऑन्टोलॉजी (BFO) के साथ संरेखित एक ओपन-सोर्स ऑन्टोलॉजी है जो इंटरऑपरेबिलिटी चुनौतियों को दूर करने, स्वचालित क्रॉस-प्लेटफ़ॉर्म निष्पादन को सक्षम करने और सिंथेटिक बायोलॉजी में मशीन लर्निंग को सुगम बनाने के लिए प्रिसिजन फर्मेंटेशन डेटा हेतु एक एकीकृत मानक स्थापित करता है।

Txell Amigó, Shawn Zheng Kai Tan, Angel Luu Phanthanourak, Sebastian Schulz, Pasquale D. Colaianni, Dominik M. Maszczyk (…)2026-02-20
💬 NLP

References Improve LLM Alignment in Non-Verifiable Domains

यह शोध पत्र एक संदर्भ-निर्देशित दृष्टिकोण प्रस्तावित करता है जो उच्च-गुणवत्ता वाले संदर्भ आउटपुट का लाभ उठाकर LLM-आधारित मूल्यांकनकर्ताओं को बेहतर बनाता है, जिससे उन गैर-सत्यापन योग्य डोमेन में प्रभावी आत्म-सुधार और संरेखण ट्यूनिंग सक्षम होती है जहाँ पारंपरिक सत्यापन योग्य पुरस्कार उपलब्ध नहीं हैं।

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan2026-02-20
💬 NLP

Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark

यह शोध पत्र डेमोSQए (DemosQA) बेंचमार्क प्रस्तुत करता है, जो सोशल मीडिया से व्युत्पन्न एक नवीन ग्रीक प्रश्न-उत्तर डेटासेट है, और ग्रीक सामाजिक और सांस्कृतिक बारीकियों को पकड़ने में उनकी प्रभावशीलता का आकलन करने के लिए 11 एकभाषी और बहुभाषी लार्ज लैंग्वेज मॉडल्स (LLMs) का एक विस्तृत मूल्यांकन प्रस्तुत करता है।

Charalampos Mastrokostas, Nikolaos Giarelis, Nikos Karacapilidis2026-02-20
💬 NLP

Hybrid-Gym: Training Coding Agents to Generalize Across Tasks

यह शोध पत्र Hybrid-Gym को प्रस्तुत करता है, जो एक प्रशिक्षण वातावरण है जिसमें स्केलेबल सिंथेटिक टास्क शामिल हैं जिन्हें भाषा मॉडलों को हस्तांतरणीय कोडिंग कौशल सिखाने के लिए डिज़ाइन किया गया है, जो SWE-Bench और SWT-Bench जैसे विविध वास्तविक-विश्व बेंचमार्क पर उनके सामान्यीकरण प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yiqing Xie, Emmy Liu, Gaokai Zhang, Nachiket Kotalwar, Shubham Gandhi, Sathwik Acharya, Xingyao Wang, Carolyn Rose, Grah (…)2026-02-20
💬 NLP

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

यह शोध पत्र IndicJR प्रस्तुत करता है, जो 12 दक्षिण एशियाई भाषाओं में जेलब्रेक सुदृढ़ता का मूल्यांकन करने वाला एक जज-मुक्त बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान सुरक्षा संरेखण अनुबंध-बद्ध प्रारूपों द्वारा अतिरंजित हैं, अंग्रेजी-से-इंडिक स्थानांतरण हमलों के प्रति अत्यधिक संवेदनशील हैं, और रोमनकृत या मिश्रित-लिपि इनपुट द्वारा महत्वपूर्ण रूप से समझौता किए गए हैं।

Priyaranjan Pattnayak, Sanchari Chowdhuri2026-02-20
💬 NLP

Claim Automation using Large Language Model

यह शोध पत्र प्रदर्शित करता है कि स्थानीय रूप से तैनात, लो-रैंक एडाप्टेशन (LoRA) द्वारा फाइन-ट्यून किया गया लार्ज लैंग्वेज मॉडल, बीमा दावों के लिए सटीक, संरचित सुधारात्मक-कार्रवाई अनुशंसाएं उत्पन्न करने में सामान्य-उद्देश्य वाले मॉडलों से काफी बेहतर प्रदर्शन करता है, जो विनियमित डोमेन में निर्णय लेने की प्रक्रिया को स्वचालित करने के लिए एक विश्वसनीय और शासन योग्य समाधान प्रदान करता है।

Zhengda Mo, Zhiyu Quan, Eli O'Donohue, Kaiwen Zhong2026-02-20
💬 NLP

Training Large Reasoning Models Efficiently via Progressive Thought Encoding

यह शोध पत्र प्रोग्रेसिव थॉट एनकोडिंग (Progressive Thought Encoding) को प्रस्तुत करता है, जो एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो लार्ज रीजनिंग मॉडल्स को जटिल गणितीय बेंचमार्क पर काफी अधिक सटीकता प्राप्त करने में सक्षम बनाती है, साथ ही मध्यवर्ती तर्क (intermediate reasoning) को निश्चित आकार के वेक्टर्स में एनकोड करके मेमोरी बाधाओं को दूर करती है, जिससे सुदृढीकरण शिक्षण (reinforcement learning) के दौरान फुल-कैश बैकप्रोपैगेशन की आवश्यकता समाप्त हो जाती है।

Zeliang Zhang, Xiaodong Liu, Hao Cheng, Hao Sun, Chenliang Xu, Jianfeng Gao2026-02-20
💬 NLP

ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders

यह शोध पत्र ConvApparel पेश करता है, जो एक नवीन डेटासेट और एक व्यापक सत्यापन ढांचा है जिसे एक ड्यूल-एजेंट डेटा संग्रह प्रोटोकॉल और काउंटरफैक्चुअल वैलिडेशन का लाभ उठाकर कन्वर्सेशनल रिकमेंडर्स के लिए LLM-आधारित यूजर सिम्युलेटर्स में "रियलिज्म गैप" को पाटने के लिए डिज़ाइन किया गया है, ताकि यह प्रदर्शित किया जा सके कि डेटा-संचालित सिम्युलेटर्स प्रॉम्प्टेड बेसलाइन्स की तुलना में अधिक मजबूत सामान्यीकरण प्रदान करते हैं।

Ofer Meshi, Krisztian Balog, Sally Goldman, Avi Caciularu, Guy Tennenholtz, Jihwan Jeong, Amir Globerson, Craig Boutilie (…)2026-02-20