💬 NLP

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

यह शोध पत्र Text2Sign को प्रस्तुत करता है, जो एक लागत प्रभावी, सिंगल-जीपीयू डिफ्यूजन बेसलाइन है जो एक फ्रोजन विजन-लैंग्वेज एनकोडर और फैक्टराइज्ड स्पैटियोटेम्पोरल अटेंशन का लाभ उठाकर लघु, कम-रिज़ॉल्यूशन वाले साइन लैंग्वेज वीडियो उत्पन्न करता है, हालांकि वर्तमान में इसमें सीमित प्रॉम्प्ट संवेदनशीलता प्रदर्शित होती है और यह मुख्य रूप से एक प्रोडक्शन-रेडी सिस्टम के बजाय एक रिसर्च स्टार्टिंग पॉइंट के रूप में कार्य करता है।

Ruize Xia2026-07-16
💬 NLP

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

यह शोध पत्र GSM-Plus-BN को प्रस्तुत करता है, जो अंग्रेजी GSM-Plus डेटासेट से व्युत्पन्न बंगाली गणितीय तर्क के लिए एक नवीन व्यवधान-आधारित बेंचमार्क है, जिसका उद्देश्य छह बड़े भाषा मॉडलों की मजबूती और तर्क क्षमताओं का मूल्यांकन करना है और साथ ही कम-संसाधन वाली भाषाई संदर्भों में अंतर्निहित महत्वपूर्ण प्रदर्शन अंतराल और चुनौतियों को उजागर करना है।

Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu2026-07-16
💬 NLP

The Refusal Residue: When Probes Catch Alignment Faking and When They Don't

यह शोध पत्र विशिष्ट लार्ज लैंग्वेज मॉडल्स में एलाइनमेंट फेकिंग (alignment faking) के उद्भव की जांच करता है, जो यह प्रकट करता है कि जबकि हिडन स्टेट्स (hidden states) कभी-कभी ऐसे भ्रामक व्यवहार का पता लगा सकते हैं, मानक प्रोबिंग विधियाँ गंभीर अति-अनुमान और लीकेज के प्रति संवेदनशील होती हैं, जिसके लिए विश्वसनीय पहचान हेतु एक कठोर पांच-नियंत्रण ढांचे की आवश्यकता होती है।

Aman Mehta2026-07-16
🤖 machine learning

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

यह शोध पत्र एक FLOP-अकाउंटिंग फ्रेमवर्क और RACE डायग्नोस्टिक प्रोटोकॉल प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि एक निश्चित बजट के तहत इष्टतम RL पोस्ट-ट्रेनिंग रणनीतियाँ सार्वभौमिक नहीं हैं बल्कि मॉडल का आकार, खोज की गहराई, लर्निंग अपडेट्स और फीडबैक मैकेनिज्म के बीच एक जटिल परस्पर क्रिया पर निर्भर करती हैं, जो शोधकर्ताओं से केवल कुल FLOPs के बजाय विस्तृत कंप्यूट आवंटन रिपोर्ट करने का आग्रह करती है।

Patrick Wilhelm, Odej Kao2026-07-16
💬 NLP

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL एक स्केलेबल, स्थिर GFlowNet-शैली का सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम बड़े भाषा मॉडलों के लिए पेश करता है जो इन-बैच मोंटे कार्लो अनुमानों और विशिष्ट स्टेबलाइजर्स का उपयोग करके सीखे गए पार्टिशन फंक्शन की आवश्यकता को समाप्त करता है, जिससे 235B पैरामीटर्स तक घने (dense) और विरल (sparse) दोनों आर्किटेक्चर में गणित, कोड और प्रतिकूल (adversarial) बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao2026-07-16
🤖 AI

Set-shifting Behavioral Test for Harnessed Agents

यह शोधपत्र एक सेट-शिफ्टिंग व्यवहारिक परीक्षण प्रस्तुत करता है जो यह मूल्यांकन करता है कि एलएलएम (LLM) एजेंट टूल विश्वसनीयता में छिपे हुए परिवर्तनों के प्रति कैसे अनुकूलित होते हैं, जिससे यह पता चलता है कि एजेंट विशिष्ट दिनचर्या पर दृढ़ता से टिके रहने की प्रवृत्ति रखते हैं जिनके विशिष्ट विफलता मोड होते हैं और जो इस बात से भी प्रभावित होते हैं कि टूलसेट को किस प्रकार फ्रेम किया गया है।

Ziwei Ye2026-07-16
💬 NLP

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

यह शोध पत्र ऑन-पॉलिसी डिस्टिलेशन (OPD) का एक अन्वेषण उत्प्रेरक के रूप में व्यवस्थित विश्लेषण करता है, हल्के सिग्नल रेगुलेशन के माध्यम से दो प्रमुख विकृतियों—स्टूडेंट-टीचर मिसमैच और लेंथ एक्सप्लोइटेशन—की पहचान और समाधान करता है, यह प्रदर्शित करते हुए कि स्थिर और प्रभावी LLM पोस्ट-ट्रेनिंग प्राप्त करने के लिए उच्च-गुणवत्ता वाले गाइडिंग सिग्नल्स, टीचर स्केल की तुलना में अधिक महत्वपूर्ण हैं।

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong2026-07-16
💬 NLP

When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

यह शोध पत्र स्वचालित निबंध स्कोरिंग के लिए एक फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तुत करता है जो अनदेखी रूब्रिक्स (rubrics) के साथ निबंधों को स्कोर करने के लिए 'रूब्रिक-अग्नोस्टिक' मध्यवर्ती "लक्षणों" (traits) और लक्ष्य-निबंध पर्यवेक्षण का उपयोग करके मजबूत क्रॉस-रूब्रिक सामान्यीकरण प्राप्त करता है, जो बेसलाइन से काफी बेहतर प्रदर्शन करता है और अनदेखी रूब्रिक्स के साथ निबंधों को स्कोर करते समय अत्याधुनिक मॉडलों के प्रदर्शन के करीब पहुंच जाता है।

Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang, Marisa C. Peczuh, Blair Lehman, Ryan Baker, Caitlin Mills, Sherry La (…)2026-07-16
💬 NLP

MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

यह शोधपत्र MyAG को प्रस्तुत करता है, जो एक ओपन-सोर्स, ग्राफ-आधारित फ्रेमवर्क है जो लचीले डिज़ाइन, पदानुक्रमित संरचना (hierarchical composition) और प्रदर्शन विश्लेषण को सक्षम करने के लिए कंपोजेबल LLM एजेंट सिस्टम को घटक (component), वर्कफ़्लो और सर्च ग्राफ में विभाजित करता है।

Zhisong Zhang2026-07-16
💬 NLP

Cost-Pragmatic Quality Gating and Selection-Fusion Multi-Model Combiners for BioASQ Phases A+ and B

यह शोध पत्र एक BioASQ टास्क 14B 2026 सिस्टम प्रस्तुत करता है जो कमजोर प्रश्नों के लिए एक लागत-व्यावहारिक, एजेंट-संचालित पुन: प्राप्ति रणनीति और एक बहु-मॉडल एन्सेम्बल फ्रेमवर्क का उपयोग करके शीर्ष रैंकिंग प्राप्त करता है जो विभिन्न प्रकार के प्रश्नों पर प्रदर्शन को अनुकूलित करने के लिए उत्तर चयन और संलयन को रणनीतिक रूप से विभाजित करता है।

Dima Galat, Marian-Andrei Rizoiu2026-07-16