💬 NLP

RoboPhD: Self-Improving Text-to-SQL Through Autonomous Agent Evolution

RoboPhD एक स्व-सुधार (self-improving) फ्रेमवर्क है जहाँ AI एजेंट एक न्यूनतम 70-लाइन बेसलाइन से एक परिष्कृत 1500-लाइन सिस्टम में एक क्लोज्ड-लूप, ELO-आधारित चयन प्रक्रिया के माध्यम से स्वायत्त रूप से विकसित होते हैं, जो BIRD डेटासेट पर स्टेट-ऑफ-द-आर्ट टेक्स्ट-टू-SQL प्रदर्शन प्राप्त करता है और कमजोर मॉडलों को महत्वपूर्ण रूप से बढ़ाकर लागत प्रभावी "स्किप अ टियर" (skip a tier) परिनियोजन को सक्षम बनाता है।

Andrew Borthwick, Stephen Ash2026-01-27
💬 NLP

Surprisal and Metaphor Novelty Judgments: Moderate Correlations and Divergent Scaling Effects Revealed by Corpus-Based and Synthetic Datasets

यह अध्ययन प्रदर्शित करता है कि जहाँ भाषा मॉडल सरप्राइज़ल (surprisal) रूपक नवीनता (metaphor novelty) एनोटेशन के साथ मध्यम सहसंबंध दिखाता है, वहीं यह विचलित स्केलिंग व्यवहार प्रदर्शित करता है—कॉर्पस-आधारित डेटा पर बड़े मॉडलों के साथ इसकी भविष्य कहने वाली शक्ति घटती है लेकिन सिंथेटिक डेटा पर बढ़ती है—जो भाषाई रचनात्मकता के लिए एक व्यापक मीट्रिक के रूप में इसकी सीमाओं को रेखांकित करता है।

Omar Momen, Emilie Sitter, Berenike Herrmann, Sina Zarrieß2026-01-27
💬 NLP

Explaining Generalization of AI-Generated Text Detectors Through Linguistic Analysis

यह शोध पत्र एक व्यवस्थित अध्ययन प्रस्तुत करता है जो विविध मॉडलों, प्रॉम्प्ट्स और डोमेनों को कवर करने वाला एक व्यापक बेंचमार्क निर्मित करता है ताकि यह प्रदर्शित किया जा सके कि विभिन्न स्थितियों में एआई-टेक्स्ट डिटेक्टरों का सामान्यीकरण प्रदर्शन (generalization performance), काल (tense) के उपयोग और सर्वनाम की आवृत्ति जैसे विशिष्ट भाषाई विशेषता परिवर्तनों के साथ महत्वपूर्ण रूप से सह-संबंधित है।

Yuxi Xia, Kinga Stańczak, Benjamin Roth2026-01-27
💬 NLP

Bears, all bears, and some bears. Language Constraints on Language Models' Inductive Inferences

यह शोध पत्र प्रदर्शित करता है कि विजन लैंग्वेज मॉडल्स (Vision Language Models) आगमनात्मक अनुमान कार्यों (inductive inference tasks) में सामान्य (generic), सार्वभौमिक (universal) और अनिश्चित (indefinite) बहुवचन कथनों के बीच अंतर करते समय मानव-समान व्यवहारिक संरेखण और प्रतिनिधिगत विशिष्टताओं को प्रदर्शित करते हैं, जो यह सुझाव देता है कि ये मॉडल सतही पैटर्न से परे सूक्ष्म भाषाई बाधाओं को समझते हैं।

Sriram Padmanabhan, Siyuan Song, Kanishka Misra2026-01-27
💬 NLP

MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models

यह शोध पत्र MemoryRewardBench प्रस्तुत करता है, जो विविध दीर्घ-संदर्भ (long-context) बोध और सृजन कार्यों के माध्यम से बड़े भाषा मॉडलों (large language models) में दीर्घकालिक स्मृति प्रबंधन का आकलन करने की रिवॉर्ड मॉडल्स की क्षमता का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है।

Zecheng Tang, Baibei Ji, Ruoxi Sun, Haitian Wang, WangJie You, Zhang Yijun, Wenpeng Zhu, Ji Qi, Juntao Li, Min Zhang2026-01-27
💬 NLP

Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models

यह शोध पत्र तर्क देता है कि टोकनाइज़ेशन को एक स्थिर प्रीप्रोसेसिंग चरण के बजाय, मॉडल के साथ संदर्भ-जागरूक सह-डिज़ाइन (context-aware co-design) की आवश्यकता वाले एक मुख्य मॉडलिंग निर्णय के रूप में पुनर्कल्पित किया जाना चाहिए, ताकि लार्ज लैंग्वेज मॉडल्स में भाषाई विसंगति, पूर्वाग्रह और अक्षमता के मुद्दों को संबोधित किया जा सके।

Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari2026-01-27
💬 NLP

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

यह शोध पत्र Jet-RL को प्रस्तुत करता है, जो एक एकीकृत FP8 सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रोलआउट और प्रशिक्षण दोनों में सुसंगत FP8 परिशुद्धता लागू करके मिश्रित-परिशुद्धता रणनीतियों के कारण होने वाली प्रशिक्षण अस्थिरता और सटीकता पतन को हल करता है, जिससे स्थिर अभिसरण बनाए रखते हुए महत्वपूर्ण गति प्राप्त होती है।

Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu2026-01-27
💬 NLP

Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction

यह शोध पत्र 'ट्रैजेक्टरी रिप्ले वाया कॉन्सेप्ट-बेसिस रिकंस्ट्रक्शन' नामक एक ढांचे का प्रस्ताव करता है जो बिना लक्ष्य-पक्ष पर्यवेक्षण (target-side supervision) के विविध लार्ज लैंग्वेज मॉडल्स में रिफ्यूज़ल इंटरवेंशन को सफलतापूर्वक स्थानांतरित करता है, जो सुरक्षा संरेखण (safety alignment) के अंतर्निहित सार्वभौमिक, निम्न-आयामी अर्थ संबंधी सर्किट के अस्तित्व के लिए पुख्ता प्रमाण प्रदान करता है।

Tony Cristofano2026-01-27
💬 NLP

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

यह अध्ययन एलाइनमेंट (alignment) को LLM-as-a-judge प्रणालियों में संख्यात्मक पूर्वाग्रह के प्राथमिक कारण के रूप में पहचानता है और यह प्रदर्शित करता है कि स्कोर रेंज को समायोजित करना इस पूर्वाग्रह को कम करने और मूल्यांकन प्रदर्शन को सुधारने के लिए सबसे प्रभावी ह्यूरिस्टिक रणनीति है।

Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi2026-01-27
💬 NLP

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI एक एजेंटिक, मल्टी-मोडल रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम है जो सेक्शन-अवेयर चंकिंग, स्ट्रक्चर्ड क्वेरी प्लानिंग और टेक्स्ट-डायग्राम फ्यूजन को एकीकृत करके जटिल 3GPP तकनीकी विशिष्टताओं की खोज और समझ में महत्वपूर्ण सुधार करता है ताकि मौजूदा बेसलाइन्स की तुलना में बेहतर रिकॉल और फेथफुलनेस प्राप्त की जा सके।

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad2026-01-27