💻 computer science

AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation

यह शोध पत्र AfriScience-MT को प्रस्तुत करता है, जो विशेषज्ञ अनुवाद और शब्दावली विकास के माध्यम से छह अफ्रीकी भाषाओं में वैज्ञानिक ग्रंथों का एक समानांतर संग्रह (parallel corpus) है, जिसका उपयोग मशीन अनुवाद प्रणालियों को बेंचमार्क करने और यह प्रदर्शित करने के लिए किया जाता है कि क्लोज्ड-सोर्स मॉडल वर्तमान में इन भाषाओं के लिए वैज्ञानिक सामग्री का अनुवाद करने में ओपन-सोर्स विकल्पों से बेहतर प्रदर्शन करते हैं।

Idris Abdulmumin, Tajuddeen Gwadabe, Shamsuddeen Hassan Muhammad, David Ifeoluwa Adelani, Nomonde Khalo, Ibrahim Said Ah (…)2026-05-29
🤖 AI

Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence

यह शोध पत्र HetMedAgent का प्रस्ताव करता है, जो एक विषम बहु-एजेंट ढांचा (heterogeneous multi-agent framework) है जो सामान्यज्ञ LLMs, डोमेन-विशिष्ट विशेषज्ञ मॉडलों और चिकित्सकों के बीच सहयोग को व्यवस्थित करता है ताकि यह प्रदर्शित किया जा सके कि साक्ष्य संलयन (evidence fusion) और अनुकूलन योग्य अनिश्चितता प्रबंधन के माध्यम से उत्कृष्ट चिकित्सा निर्णय लेने के लिए विशेषज्ञ मॉडल अपरिहार्य बने हुए हैं।

Yanan Wang, Shuaicong Hu, Jian Liu, Guohui Zhou, Aiguo Wang, Cuiwei Yang2026-05-29
💻 computer science

DySem: Uncovering Dynamic Semantic Components via Multilingual Consensus for Calculating Semantic Textual Similarity

DySem एक नवीन, प्रशिक्षण-मुक्त ढांचा है जो बहुभाषी आम सहमति के माध्यम से लार्ज लैंग्वेज मॉडल्स के भीतर गतिशील, नमूना-विशिष्ट अर्थ संबंधी घटकों की पहचान करके सिमेंटिक टेक्स्टुअल सिमिलरिटी में सुधार करता है, जिससे स्थिर, उच्च-आयामी अंतिम-परत (last-layer) निरूपणों के उपयोग की सीमाओं को दूर किया जा सके।

Kaijie Zheng, Weiqin Wang, Yile Wang, Hui Huang2026-05-29
🤖 machine learning

Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

यह शोध पत्र स्टेट वैल्यू एस्टीमेशन बेंचमार्क (SVEB) को पेश करके और दो नवीन तकनीकों, Numca और Hista, का प्रस्ताव देकर LLM सुदृढीकरण शिक्षण (reinforcement learning) में सटीक स्टेट वैल्यू अनुमान की चुनौती को संबोधित करता है, जो बिना किसी महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के प्रशिक्षण स्थिरता और प्रदर्शन में काफी सुधार करते हैं।

Zizhe Chen, Jiqian Dong, Yizhou Tian, Garry Yang, Yongqiang Chen, Zhitang Chen, James Cheng2026-05-29
💻 computer science

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

यह शोधपत्र ActTraitBench प्रस्तुत करता है, जो एक मानव-आधारित ढांचा है जो लार्ज लैंग्वेज मॉडल्स में व्याप्त 'नॉलेज-डिसीजन गैप' (ज्ञान-निर्णय अंतराल) को मापता है जहाँ सक्षम मॉडल निरंतर स्व-रिपोर्ट के बावजूद व्यवहार संबंधी निर्णयों में भिन्न हो सकते हैं, और इस विषमता को कम करने के लिए 'चेन ऑफ कॉग्निटिव अलाइनमेंट' (CoCA) का प्रस्ताव करता है।

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu2026-05-29
🤖 AI

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

यह शोध पत्र SAAS को प्रस्तुत करता है, जो एक स्व-जागरूक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ज्ञान की सीमाओं को गतिशील रूप से मॉडल करके और सटीकता से समझौता किए बिना कम्प्यूटेशनल लागत को कम करने के लिए चरण-वार अनुकूलन लागू करके एजेंटिक खोज प्रणालियों में अत्यधिक खोज (over-search) को कम करता है।

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su2026-05-29
🤖 machine learning

Data filtering methods for training language models

यह शोध पत्र रूसी टेक्स्ट वर्गीकरण डेटासेट में लेबल त्रुटियों का पता लगाने के लिए कॉन्फिडेंट लर्निंग और डेटासेट कार्टोग्राफी का एक तुलनात्मक विश्लेषण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि हालांकि दोनों विधियाँ रैंडम रिमूवल से बेहतर प्रदर्शन करती हैं, उनकी मॉडल प्रदर्शन में सुधार करने की प्रभावशीलता काफी हद तक डेटासेट के आकार और शोर के स्तरों पर निर्भर करती है, जिसमें कॉन्फिडेंट लर्निंग छोटे, शोर वाले डेटासेट पर महत्वपूर्ण लाभ प्रदान करती है।

Egor Shevchenko, Elena Bruches2026-05-29
🤖 AI

PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing

यह शोध पत्र PRAIB को प्रस्तुत करता है, जो एक नवीन बेंचमार्क फ्रेमवर्क और एक बड़े पैमाने का अनुभवजन्य अध्ययन है जो मानव फीडबैक के विरुद्ध 11,000 मशीन-जनित समीक्षाओं का विश्लेषण करता है ताकि महत्वपूर्ण व्यवहारिक विचलन—जैसे कि सकारात्मक पूर्वाग्रह, अति-आत्मविश्वास, और सूक्ष्म कमियों को न देख पाना—को प्रकट किया जा सके, जिससे पीयर रिव्यू प्रक्रिया में LLMs की वर्तमान विश्वसनीयता और सीमाओं को निर्धारित करने के लिए एक नैदानिक उपकरण प्रदान किया जा सके।

Krzysztof Żurawicki, Julia Farganus, Arkadiusz Gaweł, Mateusz Bystroński, Tomasz Jan Kajdanowicz2026-05-29
🤖 AI

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

यह शोध पत्र \textsc{Ptah} को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो विश्वसनीय, उद्धरण-सत्य और विजुअल इंटरलीव्ड मल्टीमॉडल डीप रिसर्च रिपोर्ट्स तैयार करने के लिए प्लानिंग, विजुअल वर्किंग मेमोरी के साथ साक्ष्य संग्रह, और वेरीफायर-प्रवर्तित रिपोर्ट जनरेशन को ऑर्केस्ट्रेट करता है।

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Zhicheng Dou2026-05-29
💻 computer science

ExCAM: Explainable Cultural Awareness Metrics

यह शोध पत्र ExCAM प्रस्तुत करता है, जो बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल) के आउटपुट में सांस्कृतिक त्रुटियों की पहचान करने, उन्हें रेटिंग देने और समझाने के लिए पहला समर्पित मीट्रिक है, साथ ही ExCAM40k डेटासेट भी प्रस्तुत करता है, जो मौजूदा बेसलाइन की तुलना में सांस्कृतिक अशुद्धियों का पता लगाने में 80% तक सटीकता प्राप्त करता है।

Christoph Leiter, Haiyue Song, Hour Kaing, Jin Tei, Hideki Tanaka, Masao Utiyama, Steffen Eger2026-05-29