💻 computer science

Benchmarking LLM Tool-Use in the Wild

यह शोध पत्र WildToolBench प्रस्तुत करता है, जो वास्तविक दुनिया के उपयोगकर्ता व्यवहारों पर आधारित एक नया बेंचमार्क है ताकि जटिल, अव्यवस्थित और लचीले मल्टी-टर्न टूल-उपयोग परिदृश्यों को संभालने में वर्तमान लार्ज लैंग्वेज मॉडल्स की महत्वपूर्ण सीमाओं को उजागर किया जा सके, जिससे यह पता चलता है कि ऑर्केस्ट्रेशन, प्रासंगिक अनुमान और गतिशील निर्देश संक्रमणों की चुनौतियों के कारण कोई भी मूल्यांकित मॉडल 15% सटीकता से अधिक नहीं है।

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang2026-04-09
💻 computer science

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

यह ऑडिट अध्ययन प्रकट करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का मूल्यांकन केवल एपीआई एंडपॉइंट्स के माध्यम से करना वास्तविक दुनिया के चैटबॉट व्यवहारों को पकड़ने में विफल रहता है, जो यह दर्शाता है कि इंटरफ़ेस-विशिष्ट कारक, सामयिक गतिशीलता और नीतिगत विकल्प भ्रमपूर्ण या षड्यंत्रकारी विचारधारा के सुदृढ़ीकरण को महत्वपूर्ण रूप से प्रभावित करते हैं, जिसमें नए मॉडल अभी भी पर्याप्त सुरक्षा जोखिम और समय के साथ अस्थिर प्रदर्शन प्रदर्शित करते हैं।

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci2026-04-09
💬 NLP

The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?

यह शोध पत्र 'स्टेपवाइज़ इन्फॉर्मेटिवनेस अज़म्प्शन' (Stepwise Informativeness Assumption) का प्रस्ताव करता है और अनुभवजन्य रूप से इसे मान्य करता है, जो यह स्पष्ट करता है कि मैक्सिमम-लाइक्लीहुड और रीइन्फोर्समेंट लर्निंग प्रशिक्षण के माध्यम से वैध रीजनिंग ट्रेसेस (reasoning traces) अपेक्षा के माध्यम से उत्तर-प्रासंगिक सूचना संचित करते हैं, जिससे बड़े भाषा मॉडलों में आंतरिक एंट्रॉपी डायनेमिक्स और तर्क की शुद्धता के बीच सहसंबंध स्थापित होता है।

Mar Gonzàlez I Català, Haitz Sáez de Ocáriz Borde, George D. Montañez, Pietro Liò2026-04-09
💬 NLP

Depression Detection at the Point of Care: Automated Analysis of Linguistic Signals from Routine Primary Care Encounters

यह अध्ययन प्रदर्शित करता है कि नियमित प्राथमिक चिकित्सा ऑडियो रिकॉर्डिंग से भाषाई संकेतों का स्वचालित विश्लेषण, विशेष रूप से ज़ीरो-शॉट GPT मॉडल और द्वैत (dyadic) ट्रांसक्रिप्ट का उपयोग करके, समय पर नैदानिक निर्णय लेने में सहायता के लिए अवसाद का प्रभावी ढंग से पता लगा सकता है।

Feng Chen, Manas Bedmutha, Janice Sabin, Andrea Hartzler, Nadir Weibel, Trevor Cohen2026-04-09
💬 NLP

Hallucination as output-boundary misclassification: a composite abstention architecture for language models

यह शोध पत्र एक मिश्रित अपवर्जन (abstention) वास्तुकला प्रस्तावित करता है जो निर्देश-आधारित इनकार (instruction-based refusal) को एक संरचनात्मक गेटिंग तंत्र के साथ जोड़ता है—जिसमें असमर्थित दावों का पता लगाने के लिए स्व-संगति (self-consistency), पैराफ्रेस स्थिरता (paraphrase stability) और उद्धरण कवरेज (citation coverage) का उपयोग किया जाता है—ताकि दोनों दृष्टिकोणों की पूरक शक्तियों का लाभ उठाकर बड़े भाषा मॉडलों में मतिभ्रम (hallucinations) को प्रभावी ढंग से कम किया जा सके।

Angelina Hintsanen2026-04-09
💬 NLP

Emergent decentralized regulation in a purely synthetic society

यह शोध पत्र प्रदर्शित करता है कि मोल्टबुक नेटवर्क पर स्वायत्त एआई एजेंटों का एक विशुद्ध रूप से कृत्रिम समाज अंतर्जात स्व-नियमन प्रदर्शित करता है, जहाँ अन्य एजेंटों से सुधारात्मक प्रतिक्रिया प्राप्त करने की संभावना उनके पोस्ट में निर्देशात्मक भाषा की तीव्रता के आनुपातिक रूप से बढ़ती है।

Md Motaleb Hossen Manik, Ge Wang2026-04-09
💬 NLP

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

यह शोध पत्र Text2DistBench को प्रस्तुत करता है, जो वास्तविक दुनिया के यूट्यूब कमेंट्स का उपयोग करने वाला एक स्वचालित और निरंतर अपडेट होने वाला बेंचमार्क है, जो वितरण संबंधी ज्ञान (जैसे कि भावना अनुपात और विषय आवृत्तियाँ) को अनुमान लगाने की बड़े भाषा मॉडलों की क्षमता का मूल्यांकन करता है, जो विभिन्न वितरण प्रकारों के बीच प्रदर्शन के महत्वपूर्ण अंतर को प्रकट करता है।

Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin2026-04-09
💬 NLP

Cross-Lingual Transfer and Parameter-Efficient Adaptation in the Turkic Language Family: A Theoretical Framework for Low-Resource Language Models

यह शोध पत्र तुर्की भाषा परिवार के भीतर बड़े भाषा मॉडलों के क्रॉस-लिंगुअल ट्रांसफर और पैरामीटर-कुशल अनुकूलन को अनुकूलित करने के लिए एक सैद्धांतिक ढांचे का प्रस्ताव करता है, जिसमें तुर्की ट्रांसफर गुणांक (TTC) और एक वैचारिक स्केलिंग मॉडल पेश किया गया है ताकि यह विश्लेषण किया जा सके कि अज़रबैजानी, कज़ाख, उज़्बेक, तुर्कमेन और गागाउज़ में अनुकूलन प्रदर्शन को टाइपोलॉजिकल समानताएं और संसाधन विषमताएं कैसे प्रभावित करती हैं।

O. Ibrahimzade, K. Tabasaransky2026-04-09
💬 NLP

Extracting Breast Cancer Phenotypes from Clinical Notes: Comparing LLMs with Classical Ontology Methods

यह शोध पत्र अनस्ट्रक्चर्ड क्लिनिकल नोट्स से ब्रेस्ट कैंसर फेनोटाइप्स निकालने के लिए एक LLM-आधारित फ्रेमवर्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह शास्त्रीय ऑन्टोलॉजी-आधारित विधियों के समान सटीकता प्राप्त करता है जबकि अन्य रोगों के लिए अधिक अनुकूलन क्षमता प्रदान करता है।

Abdullah Bin Faiz, Arbaz Khan Shehzad, Asad Afzal, Momin Tariq, Muhammad Siddiqi, Muhammad Usamah Shahid, Maryam Noor Aw (…)2026-04-09
💬 NLP

TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents

यह शोध पत्र TelcoAgent-Bench प्रस्तुत करता है, जो अंग्रेजी और अरबी में टेलीकॉम एलएलएम (LLM) एजेंटों की विश्वसनीयता और परिचालन निरंतरता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बहुभाषी बेंचमार्किंग फ्रेमवर्क है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल टेलीकॉम समस्याओं को समझते हैं, लेकिन वे परिदृश्य विविधताओं के बीच निरंतर समस्या निवारण निष्पादन और स्थिरता बनाए रखने में संघर्ष करते हैं।

Lina Bariah, Brahim Mefgouda, Farbod Tavakkoli, Enrique Molero, Louis Powell, Merouane Debbah2026-04-09