💻 computer science

Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness

यह शोध पत्र स्वचालित लघु-उत्तर ग्रेडिंग के लिए रूब्रिक-कंडीशन्ड (rubric-conditioned) एलएलएम (LLM) के प्रदर्शन का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ बाइनरी कार्यों के लिए विशेषज्ञों के साथ संरेखण मजबूत है, वहीं जटिल रूब्रिक्स के साथ यह घट जाता है, हालांकि अनिश्चितता-आधारित विdeferral (deferral) के माध्यम से सटीकता में सुधार किया जा सकता है और मजबूती परीक्षण (robustness testing) प्रॉम्प्ट इंजेक्शन के प्रति लचीलेपन के बावजूद पर्यायवाची प्रतिस्थापन के प्रति संवेदनशीलता को उजागर करता है।

Haotian Deng, Chris Farber, Jiyoon Lee, David Tang2026-01-15
💻 computer science

Emissions and Performance Trade-off Between Small and Large Language Models

यह अध्ययन प्रदर्शित करता है कि फाइन-ट्यून किए गए स्मॉल लैंग्वेज मॉडल्स विभिन्न कार्यों में लार्ज लैंग्वेज मॉडल्स के समान प्रदर्शन प्राप्त कर सकते हैं और साथ ही कार्बन उत्सर्जन को भी काफी कम कर सकते हैं, जो टिकाऊ एआई की दिशा में एक व्यवहार्य मार्ग प्रदान करते हैं।

Anandita Garg, Uma Gaba, Deepan Muthirayan, Anish Roy Chowdhury2026-01-15
💻 computer science

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

यह शोध पत्र PediaMind-R1 को प्रस्तुत करता है, जो एक विशेष लार्ज लैंग्वेज मॉडल है जो प्रारंभिक बाल देखभाल के लिए व्यक्तिगत, मनोवैज्ञानिक रूप से आधारित तर्क प्रदान करने हेतु थॉमस-चेस टेम्परामेंट थ्योरी और एक दो-चरणीय प्रशिक्षण पाइपलाइन को एकीकृत करता है।

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng2026-01-15
💻 computer science

Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment

यह अध्ययन प्रदर्शित करता है कि एलएलएम (LLM) का उपयोग करके स्वचालित उत्तर मिलान, वर्बोसिटी (verbosity) और उत्तर एम्बेडिंग (answer embedding) जैसी रणनीतिक पाठ हेरफेर युक्तियों के विरुद्ध भी सुदृढ़ बना रहता है, जिसमें बाइनरी स्कोरिंग विशेष रूप से प्रभावी सिद्ध होती है, जिससे संदर्भ उत्तरों की उपलब्धता में मानव मूल्यांकन के एक स्केलेबल विकल्प के रूप में इसकी विश्वसनीयता प्रमाणित होती है।

Manas Khatore, Sumana Sridharan, Kevork Sulahian, Benjamin J. Smith, Shi Feng2026-01-15
💻 computer science

Navigating Ideation Space: Decomposed Conceptual Representations for Positioning Scientific Ideas

यह शोध पत्र "आइडिएशन स्पेस" (Ideation Space) प्रस्तुत करता है, जो एक विखंडित वैचारिक प्रतिनिधित्व ढांचा है जो वैज्ञानिक ज्ञान को अनुसंधान समस्याओं, कार्यप्रणालियों और मुख्य निष्कर्षों में विभाजित करता है ताकि अधिक सटीक साहित्य पुनर्प्राप्ति और विभेदक नवीनता मूल्यांकन सक्षम किया जा सके, जिससे वर्तमान एम्बेडिंग और एलएलएम-आधारित मूल्यांकन दृष्टिकोणों की प्रमुख सीमाओं को संबोधित किया जा सके।

Yuexi Shen, Minqian Liu, Dawei Zhou, Lifu Huang2026-01-15
💻 computer science

Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity

यद्यपि बड़े भाषा मॉडल संवाद की सतही-स्तर की व्याख्या में मनुष्यों के अनुरूप होते हैं, वे प्रतिनिधित्व स्तर पर महत्वपूर्ण रूप से भिन्न होते हैं, विशेष रूप से मुहावरों, स्लैंग और व्यंग्य जैसे संदर्भ-निर्भर और सामाजिक-व्यावहारिक लाक्षणिक भाषा को संसाधित करते समय, जिसमें GPT-4 परीक्षण किए गए मॉडलों के बीच मानवीय प्रतिमानों के सबसे निकटतम सन्निकटन का प्रदर्शन करता है।

Samhita Bollepally, Aurora Sloman-Moll, Takashi Yamauchi2026-01-15
💻 computer science

Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers

यह शोध पत्र इस धारणा को चुनौती देता है कि "ग्रोकिंग" (grokking) तर्क करने की क्षमताओं में एक मौलिक बदलाव का प्रतिनिधित्व करता है, बल्कि यह प्रदर्शित करता है कि ग्रॉक्ड मॉडल केवल याद किए गए तथ्यों को मौजूदा निष्कर्ष पथों में एकीकृत करते हैं, बिना गैर-ग्रॉक्ड समकक्षों की तुलना में बेहतर स्थानांतरणीयता या संरचनात्मक तर्क की वास्तविक महारत हासिल किए।

Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen2026-01-15
💻 computer science

SITA: Learning Speaker-Invariant and Tone-Aware Speech Representations for Low-Resource Tonal Languages

यह शोध पत्र SITA का प्रस्ताव करता है, जो एक हल्का मल्टी-ऑब्जेक्टिव अनुकूलन ढांचा (framework) है जो प्रीट्रेन्ड स्पीच एनकोडर्स को बेहतर बनाने के लिए स्पीकर-इनवेरिएंट और टोन-अवेयर रिप्रजेंटेशन प्राप्त करता है, जिससे ह्मोंग और मैंडरिन जैसी कम-संसाधन वाली टोनल भाषाओं के लिए लेक्सिकल रिट्रीवल और ASR प्रदर्शन में महत्वपूर्ण सुधार होता है।

Tianyi Xu, Xuan Ouyang, Binwei Yao, Shoua Xiong, Sara Misurelli, Maichou Lor, Junjie Hu2026-01-15
💻 computer science

Efficient Multilingual Dialogue Processing via Translation Pipelines and Distilled Language Models

टीम Kl33n3x का NLPAI4Health 2025 साझा कार्य के लिए सिस्टम फॉरवर्ड ट्रांसलेशन, एक 2.55B पैरामीटर वाले डिस्टिल्ड लैंग्वेज मॉडल और रिवर्स ट्रांसलेशन को संयोजित करने वाले एक तीन-चरणीय पाइपलाइन का उपयोग करके नौ भारतीय भाषाओं में प्रतिस्पर्धी बहुभाषी संवाद सारांशीकरण और प्रश्न उत्तर प्राप्त करता है, जिससे कम-संसाधन वाली भाषा प्रसंस्करण के लिए कॉम्पैक्ट, गैर-फाइन-ट्यून्ड मॉडलों की प्रभावशीलता प्रदर्शित होती है।

Santiago Martínez Novoa, Nicolás Rozo Fajardo, Diego Alejandro González Vargas, Nicolás Bedoya Figueroa2026-01-15
💻 computer science

Mi:dm 2.0 Korea-centric Bilingual Language Models

KT ने Mi:dm 2.0 पेश किया है, जो एक द्विभाषी लार्ज लैंग्वेज मॉडल परिवार है जिसमें 11.5B और 2.3B पैरामीटर वेरिएंट शामिल हैं जो कोरिया-विशिष्ट बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक व्यापक डेटा पाइपलाइन और सांस्कृतिक संरेखण का लाभ उठाते हैं, जबकि MIT लाइसेंस के तहत अनुसंधान और वाणिज्यिक अनुप्रयोगों दोनों का समर्थन करते हैं।

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-E (…)2026-01-15