💻 computer science

Word Synchronization Challenge: A Benchmark for Word Association Responses for Large Language Models

यह शोध पत्र 'वर्ड सिंक्रोनाइज़ेशन चैलेंज' (शब्द तुल्यकालन चुनौती) को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो गतिशील शब्द साहचर्य कार्यों के माध्यम से मानव संज्ञानात्मक प्रक्रियाओं की नकल करने और मानव विचार पैटर्न के साथ संरेखित होने की बड़े भाषा मॉडलों की क्षमता का मूल्यांकन करता है, जिससे अधिक सहानुभूतिपूर्ण और सूक्ष्म मानव-मशीन सहयोग के विकास को बढ़ावा मिलता है।

Tanguy Cazalets, Joni Dambre2026-01-15
💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

यह शोध पत्र बास्क, कैटलन, गैलिशियन और स्पेनिश के लिए TruthfulQA बेंचमार्क के एक पेशेवर रूप से अनुवादित विस्तार को प्रस्तुत करता है ताकि 12 अत्याधुनिक (state-of-the-art) LLMs का मूल्यांकन किया जा सके, जो यह प्रकट करता है कि हालांकि प्रदर्शन संसाधन स्तर के अनुसार भिन्न होता है, भाषाओं के बीच सत्यनिष्ठा (truthfulness) संबंधी विसंगतियां अपेक्षा से कम हैं और मशीन अनुवाद क्रॉस-लिंगुअल सत्यनिष्ठा मूल्यांकन के लिए एक स्केलेबल विकल्प प्रदान करता है।

Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri2026-01-15
💻 computer science

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

AutoToM एक स्वचालित ढांचा है जो अनुमान अनिश्चितता द्वारा निर्देशित बेयसियन इनवर्स प्लानिंग के माध्यम से एजेंट मॉडलों को पुनरावृत्ति रूप से परिष्कृत करके थ्योरी ऑफ माइंड रीजनिंग को बढ़ाता है, जिससे विविध बेंचमार्क में मौजूदा तरीकों से बेहतर, स्केलेबल, सुदृढ़ और व्याख्या योग्य मानसिक अनुमान प्राप्त होता है।

Zhining Zhang, Chuanyang Jin, Mung Yao Jia, Shunchi Zhang, Tianmin Shu2026-01-15
💻 computer science

A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models

यह शोध पत्र OpenAI मॉडलों का उपयोग करके एंड-टू-एंड ज़ीरो-शॉट बायोमेडिकल संबंध निष्कर्षण (biomedical relation extraction) के मूल्यांकन के लिए एक बेंचमार्क प्रस्तुत करता है, जो यह दर्शाता है कि हालांकि ये बड़े भाषा मॉडल कुछ डेटासेट्स पर पर्यवेक्षित प्रदर्शन (supervised performance) के करीब पहुँचते हैं, फिर भी वे कई संबंधों वाले जटिल इनपुट के मामले में संघर्ष करते हैं।

Aviv Brokman, Xuguang Ai, Yuhang Jiang, Shashank Gupta, Ramakanth Kavuluru2026-01-15
💻 computer science

Quiet Feature Learning in Algorithmic Tasks

यह शोधपत्र प्रकट करता है कि एल्गोरिद्मिक कार्यों पर प्रशिक्षित ट्रांसफॉर्मर मॉडल "क्वाइट फीचर लर्निंग" (शांत विशेषता शिक्षण) से गुजरते हैं, जहाँ महत्वपूर्ण मध्यवर्ती गणनाएँ लॉस (loss) के स्थिर रहने की अवधि के दौरान अर्जित की जाती हैं, जो सीखने की प्रगति के एकमात्र संकेतक के रूप में क्रॉस-एन्ट्रॉपी की विश्वसनीयता को चुनौती देती है।

Prudhviraj Naidu, Zixian Wang, Leon Bergen, Ramamohan Paturi2026-01-15
💻 computer science

Development and Evaluation of HopeBot: an LLM-based chatbot for structured and interactive PHQ-9 depression screening

यह अध्ययन प्रदर्शित करता है कि होपबॉट (HopeBot), जो इंटरैक्टिव PHQ-9 प्रशासन के लिए डिज़ाइन किया गया एक LLM-संचालित चैटबॉट है, पारंपरिक तरीकों के साथ मजबूत स्कोरिंग सहमति प्राप्त करता है और साथ ही उच्च उपयोगकर्ता विश्वास, सहजता और पुन: उपयोग की इच्छा अर्जित करता है, जो अवसाद स्क्रीनिंग के लिए एक स्केलेबल सहायक के रूप में इसकी क्षमता को प्रमाणित करता है।

Zhijun Guo, Alvina Lai, Julia Ive, Alexandru Petcu, Yutong Wang, Luyuan Qi, Johan H Thygesen, Kezhi Li2026-01-15
💻 computer science

LingVarBench: Benchmarking LLMs on Entity Recognitions and Linguistic Verbalization Patterns in Phone-Call Transcripts

यह शोधपत्र LingVarBench प्रस्तुत करता है, जो एक बेंचमार्क और सिंथेटिक डेटा जनरेशन पाइपलाइन है जो भाषाई रूप से विविध पैटर्न और LLM-नमूनाकृत (LLM-sampled) मानों का लाभ उठाकर एक्सट्रैक्शन प्रॉम्प्ट्स को स्वचालित रूप से अनुकूलित करता है, जिससे फोन-कॉल ट्रांसक्रिप्ट में स्ट्रक्चर्ड एंटिटी रिकग्निशन पर मानव-ट्यून किए गए मॉडलों के तुलनीय प्रदर्शन प्राप्त होता है और साथ ही डेटा गोपनीयता और एनोटेशन लागत की चुनौतियों पर विजय प्राप्त होती है।

Seyedali Mohammadi, Manas Paldhe, Amit Chhabra, Youngseo Son, Vishal Seshagiri2026-01-15
💻 computer science

Where to Begin: Efficient Pretraining via Subnetwork Selection and Distillation

यह शोध पत्र स्मॉल लैंग्वेज मॉडल्स (SLMs) के प्रीट्रेनिंग के लिए एक कुशल फ्रेमवर्क प्रस्तुत करता है जो संरचनात्मक रूप से स्पार्स सबनेटवर्क इनिशियलाइजेशन की पहचान करने के लिए इवोल्यूशनरी सर्च को बड़े मॉडल्स से नॉलेज डिस्टिलेशन के साथ जोड़ता है, जिससे मानक बेसलाइन्स के तुलनीय प्रदर्शन प्राप्त करते हुए कंप्यूटेशनल लागत में काफी कमी आती है।

Arjun Krishnakumar, Rhea Sanjay Sukthanker, Hannan Javed Mahadik, Gabriela Kadlecová, Vladyslav Moroshan, Timur Carstens (…)2026-01-15
💻 computer science

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

यह शोध पत्र SOP-Maze को पेश करता है, जो वास्तविक व्यावसायिक डेटा से प्राप्त एक नया बेंचमार्क है जो कार्यों को पार्श्व (lateral) और गहन (deep) तर्क चुनौतियों में वर्गीकृत करके जटिल मानक संचालन प्रक्रियाओं (SOPs) पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो अत्याधुनिक मॉडल्स में रूट ब्लाइंडनेस (route blindness), संवादात्मक भंगुरता (conversational fragility) और गणना संबंधी त्रुटियों की महत्वपूर्ण कठिनाइयों को उजागर करता है।

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao2026-01-15
💻 computer science

Structured yet Bounded Temporal Understanding in Large Language Models

यह शोध पत्र इस बात की जांच करता है कि कैसे बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की सामयिक समझ और समानता संबंधी निर्णय डिएक्टिक (अतीत-वर्तमान-भविष्य) और अनुक्रमिक (पहले-बाद में) संदर्भ ढांचों के बीच भिन्न होते हैं, जो सामयिक दूरी, अंतराल संबंधों और घटना की अवधि से प्रभावित विशिष्ट संरचनात्मक पैटर्न को प्रकट करते हैं।

Damin Zhang, Julia Rayz2026-01-15