💬 NLP

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

स्केलबॉक्स (ScaleBox) एक उच्च-सटीकता और स्केलेबल कोड सत्यापन प्रणाली है जो स्वचालित विशेष-जज जनरेशन, सूक्ष्म-स्तरीय समानांतर निष्पादन और मल्टी-नोड समन्वय के माध्यम से मौजूदा सैंडबॉक्स की सीमाओं को संबोधित करती है, जिससे बड़े भाषा मॉडलों (large language models) के बड़े पैमाने पर कोड प्रशिक्षण और मूल्यांकन की सटीकता और दक्षता दोनों में महत्वपूर्ण सुधार होता है।

Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpe (…)2026-05-01
💬 NLP

Syntactically-guided Information Maintenance in Sentence Comprehension

यह शोध पत्र जापानी में वाक्य बोध के एक तर्कसंगत विवरण का प्रस्ताव और सत्यापन करता है, जो यह प्रदर्शित करता है कि पाठक पूर्वानुमानित शीर्षों (heads) और अपूर्ण निर्भरताओं के आधार पर चयनात्मक रूप से वाक्यात्मक जानकारी बनाए रखते हैं, जहाँ परिणामी रखरखाव लागत (maintenance costs) वे विशिष्ट कारक हैं जो पूर्वानुमेयता के लाभों के विरुद्ध संतुलन (trade off) बनाते हैं।

Shinnosuke Isono, Kohei Kajikawa2026-05-01
💬 NLP

HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats

यह शोध पत्र हेल्थबेंच प्रोफेशनल (HealthBench Professional) का परिचय देता है, जो एक कठोर ओपन बेंचमार्क है जिसमें वास्तविक दुनिया के नैदानिक कार्यों पर लार्ज लैंग्वेज मॉडल्स की प्रगति का मूल्यांकन और ट्रैकिंग करने के लिए चिकित्सक-लिखित संवाद और विशेषज्ञ-निर्णायक रूब्रिक्स शामिल हैं, जो यह प्रदर्शित करता है कि विशेष GPT-5.4 मॉडल बेस मॉडल्स और मानव चिकित्सकों दोनों से बेहतर प्रदर्शन करता है।

Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharma (…)2026-05-01
💬 NLP

Debiasing Reward Models via Causally Motivated Inference-Time Intervention

यह शोध पत्र एक कारण-प्रेरित (causally motivated) इन्फरेंस-टाइम हस्तक्षेप का प्रस्ताव करता है जो रिवॉर्ड मॉडल्स में पूर्वाध-सहसंबंधित न्यूरॉन सक्रियणों को दबाकर प्रतिक्रिया की लंबाई जैसे अप्रासंगिक लक्षणों के प्रति संवेदनशीलता को कम करता है, जिससे छोटे मॉडल्स बिना किसी समझौते के अत्याधुनिक 70B मॉडल्स के तुलनीय अलाइनमेंट प्रदर्शन प्राप्त करने में सक्षम होते हैं।

Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida2026-05-01
💬 NLP

Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition

यह शोध पत्र ऑटोमैटिक स्पीच रिकग्निशन प्रणालियों के लिए एक गुणात्मक मूल्यांकन ढांचा प्रस्तावित करता है जो भाषा मॉडल रीस्कोरिंग के माध्यम से प्राप्त होने वाले रूपात्मक-वाक्यविन्यास (morpho-syntactic) और अर्थ संबंधी (semantic) सुधारों का विश्लेषण करने के लिए POSER और EmbER मेट्रिक्स पेश करते हुए वर्ड एरर रेट (Word Error Rate) से आगे बढ़ता है।

Thibault Bañeras-Roux, Mickaël Rouvier, Jane Wottawa, Richard Dufour2026-05-01
💬 NLP

Entropy of Ukrainian

यह शोध पत्र क्लॉड शैनन के 1951 के वर्ण भविष्यवाणी प्रयोग को 184 स्वयंसेवकों के साथ दोहराकर यूक्रेनी भाषा की एंट्रॉपी (entropy) का अनुमान लगाने वाला पहला अध्ययन प्रस्तुत करता है, जो प्रति वर्ण लगभग 1.201 बिट्स की ऊपरी सीमा प्रदान करता है और इस परिणाम की तुलना वर्तमान लार्ज लैंग्वेज मॉडल्स (Large Language Models) से करता है।

Anton Lavreniuk, Mykyta Mudryi, Markiian Chaklosh2026-05-01
💬 NLP

HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics

यह शोध पत्र HATS को प्रस्तुत करता है, जो कि 143 एनोटेटरों से प्राप्त मानव-अनुभूत ट्रांसक्रिप्शन त्रुटियों वाला एक नवीन फ्रांसीसी डेटासेट है, जिसका उद्देश्य मानव प्राथमिकताओं और विभिन्न ऑटोमैटिक स्पीच रिकग्निशन मेट्रिक्स के बीच सहसंबंध की जांच और मूल्यांकन करना है।

Thibault Bañeras Roux, Jane Wottawa, Mickael Rouvier, Teva Merlin, Richard Dufour2026-05-01
💬 NLP

JaiTTS: A Thai Voice Cloning Model

JaiTTS-v1.0 एक अत्याधुनिक थाई वॉयस क्लोनिंग टेक्स्ट-टू-स्पीच मॉडल है जो VoxCPM आर्किटेक्चर पर आधारित है, जो स्पष्ट टेक्स्ट नॉर्मलाइजेशन के बिना कोड-स्विचिंग और अंकगणित को प्रभावी ढंग से संभालकर बेहतर कैरेक्टर एरर रेट प्राप्त करता है और मानव मूल्यांकन में व्यावसायिक फ्लैगशिप मॉडल्स से बेहतर प्रदर्शन करता है।

Jullajak Karnjanaekarin, Pontakorn Trakuekul, Narongkorn Panitsrisit, Sumana Sumanakul, Vichayuth Nitayasomboon, Nithid (…)2026-05-01
💬 NLP

Language Ideologies in a Multilingual Society: An LLM-based Analysis of Luxembourgish News Comments

यह शोध पत्र लक्ज़मबर्गिश, जो कि एक कम संसाधन वाली भाषा है, के उपयोगकर्ता टिप्पणियों के भीतर भाषाई विचारधाराओं का पता लगाने में मशीन अनुवाद के साथ और उसके बिना, बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की प्रभावशीलता का मूल्यांकन करता है, और यह पाता है कि हालांकि वे बहु-वर्ग एनोटेशन (मल्टी-क्लास एनोटेशन) के लिए अभी तक पूर्ण नहीं हैं, फिर भी वे बहुभाषी समाजों में वैचारिक सामग्री की पहचान करने के लिए व्यावहारिक उपकरण के रूप में कार्य करते हैं।

Emilia Milano, Alistair Plum, Yves Scherrer, Christoph Purschke2026-05-01
🤖 AI

Contextual Agentic Memory is a Memo, Not True Memory

यह शोध पत्र तर्क देता है कि वर्तमान एजेंटिक मेमोरी सिस्टम वास्तविक भार-आधारित (weight-based) स्मृति के बजाय केवल समानता-आधारित लुकअप (similarity-based lookups) करते हैं, जो एक मौलिक श्रेणीगत त्रुटि है जो सामान्यीकरण और सुरक्षा को सीमित करती है, और तेज़ उदाहरण भंडारण (exemplar storage) को धीमी नियम सुदृढ़ीकरण (rule consolidation) के साथ एकीकृत करने के लिए एक तंत्रिका वैज्ञानिक द्वि-प्रणाली (neuroscientific dual-system) दृष्टिकोण अपनाने का प्रस्ताव देता है।

Binyan Xu, Xilin Dai, Kehuan Zhang2026-05-01