🤖 AI

Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

यह शोध पत्र रोबोटिक स्वास्थ्य सहायकों को नियंत्रित करने के लिए 72 लार्ज लैंग्वेज मॉडल्स की सुरक्षा का मूल्यांकन 270 हानिकारक निर्देशों के एक नए डेटासेट के माध्यम से करता है, जिससे यह पता चलता है कि आधे से अधिक मॉडल्स में उल्लंघन की उच्च दर है, प्रोप्राइटरी मॉडल्स ओपन-वेट मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करते हैं, और वर्तमान सुरक्षा स्तर सुरक्षित नैदानिक तैनाती के लिए अपर्याप्त बने हुए हैं।

Mahiro Nakao, Kazuhiro Takemoto2026-04-30
🤖 AI

Graph Construction and Matching for Imperative Programs using Neural and Structural Methods

यह शोध पत्र एक ऐसे पाइपलाइन को प्रस्तुत करता है जो एब्स्ट्रैक्ट सिंटैक्स ट्री पार्सिंग को सिमेंटिक एम्बेडिंग्स के साथ एकीकृत करके, इम्पैरेटिव प्रोग्रामों और उनके एनोटेशन को एकीकृत, टाइप किए गए एट्रिब्यूटेड ग्राफ्स में परिवर्तित करता है, जिससे सत्यापन आर्टिफैक्ट्स के पुन: उपयोग को सुगम बनाने के लिए विभिन्न भाषाओं और एनोटेशन शैलियों के बीच सुसंगत ग्राफ प्रतिनिधित्व सक्षम होता है।

Arshad Beg, Diarmuid O'Donoghue, Rosemary Monahan2026-04-30
🤖 AI

Star-Fusion: A Multi-modal Transformer Architecture for Discrete Celestial Orientation via Spherical Topology

यह शोध पत्र स्टार-फ्यूजन (Star-Fusion) को प्रस्तुत करता है, जो एक मल्टी-मोडल ट्रांसफार्मर आर्किटेक्चर है जो गोलाकार के-मीन्स (spherical K-Means) क्लस्टरिंग और एक त्रिपक्षीय फ्यूजन रणनीति का उपयोग करके खगोलीय अभिविन्यास निर्धारण (celestial attitude determination) को एक विविक्त टोपोलॉजिकल वर्गीकरण कार्य के रूप में पुनर्गठित करता है, जो संसाधन-सीमित हार्डवेयर पर उच्च सटीकता और वास्तविक समय की अनुमान दक्षता प्राप्त करता है।

May Hammad, Menatallh Hammad2026-04-30
🤖 AI

Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics

यह शोध पत्र नेपाल में स्वचालित माध्यमिक-स्तर के गणित मूल्यांकन के लिए विषम (heterogeneous) एलएलएम (LLMs) का मूल्यांकन करने हेतु एक बहु-आयामी रूब्रिक का उपयोग करते हुए एक ह्युमन-इन-द-लूप बेंचमार्किंग फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि मानव विशेषज्ञों के साथ सहमति प्राप्त करने के लिए मॉडल का पैमाना (scale) तुलना में निर्देश बाधाओं (instruction constraints) के साथ स्थापत्य अनुकूलता (architectural compatibility) अधिक महत्वपूर्ण है और यह निष्कर्ष निकालता है कि ये मॉडल स्वायत्त प्रमाणन के बजाय सहायक साक्ष्य निष्कर्षण (assistive evidence extraction) के लिए सबसे उपयुक्त हैं।

Jatin Bhusal, Nancy Mahatha, Aayush Acharya, Raunak Regmi2026-04-30
🤖 AI

ATLAS: An Annotation Tool for Long-horizon Robotic Action Segmentation

ATLAS एक मॉड्यूलर, कीबोर्ड-केंद्रित एनोटेशन टूल है जिसे लॉन्ग-होरिज़न रोबोटिक एक्शन सेगमेंटेशन के लिए डिज़ाइन किया गया है जो मल्टी-मोडल डेटा (वीडियो और प्रोप्रियोसेप्टिव सिग्नल्स) को सिंक्रोनाइज़ करता है ताकि मौजूदा विजन-ओनली टूल्स की तुलना में एनोटेशन दक्षता और टेम्पोरल बाउंड्री सटीकता में महत्वपूर्ण सुधार किया जा सके।

Sergej Stanovcic, Daniel Sliwowski, Dongheui Lee2026-04-30
💬 NLP

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

यह शोध पत्र ReaLM-Retrieve को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रीजनिंग-स्टेप स्तर पर ज्ञान के अंतराल (knowledge gaps) का पता लगाकर बड़े रीजनिंग मॉडल्स के लिए रिट्रीवल टाइमिंग को अनुकूलित करता है, जो मानक और निश्चित-अंतराल वाले दृष्टिकोणों की तुलना में अनावश्यक रिट्रीवल कॉल्स को कम करते हुए उत्तर की सटीकता और रिट्रीवल दक्षता में उल्लेखनीय सुधार करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-30
💬 NLP

Domain-Adapted Small Language Models for Reliable Clinical Triage

यह अध्ययन प्रदर्शित करता है कि एक डोमेन-अनुकूलित, फाइन-ट्यून्ड ओपन-सोर्स स्मॉल लैंग्वेज मॉडल (Qwen2.5-7B), क्लिनिकल ट्राइएज नैरेटिव्स से इमरजेंसी सेवेरिटी इंडेक्स स्कोर को सटीक रूप से असाइन करने में बेसलाइन मॉडल्स और उन्नत प्रोप्रायटरी लार्ज लैंग्वेज मॉडल्स दोनों से काफी बेहतर प्रदर्शन करता है, जो आपातकालीन विभागों के लिए एक विश्वसनीय और गोपनीयता-संरक्षण निर्णय-सहायता उपकरण प्रदान करता है।

Manar Aljohani, Brandon Ho, Kenneth McKinley, Dennis Ren, Xuan Wang2026-04-30
🤖 AI

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

बियांन क्यू (Bian Que) कुआईशौ (KuaiShou) के सर्च इंजन पर तैनात एक एजेंटिक फ्रेमवर्क है जो एक एकीकृत परिचालन प्रतिमान (unified operational paradigm), गतिशील डेटा और ज्ञान पुनर्प्राप्ति के लिए लचीली कौशल व्यवस्था और एक स्व-विकसित तंत्र पेश करके बड़े पैमाने पर सिस्टम संचालन में ऑर्केस्ट्रेशन बाधा को संबोधित करता है, जिससे अंततः अलर्ट की मात्रा में 75% की कमी आती है और औसत समाधान समय (mean time to resolution) में 50% से अधिक की कटौती होती है।

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen W (…)2026-04-30
🤖 machine learning

Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data

यह शोध पत्र प्रदर्शित करता है कि यूनिफॉर्म-आधारित डिस्क्रीट डिफ्यूजन मॉडल (Uniform-based Discrete Diffusion Models) अनदेखे डेटा को पुनर्प्राप्त करने में सक्षम एसोसिएटिव मेमोरीज (associative memories) के रूप में कार्य करते हैं, जहाँ याद रखने (memorization) से सामान्यीकरण (generalization) की ओर संक्रमण प्रशिक्षण सेट के आकार द्वारा नियंत्रित होता है और इसे अनुमानित टोकन अनुक्रमों की कंडीशनल एंट्रॉपी (conditional entropy) के माध्यम से व्यावहारिक रूप से पहचाना जा सकता है।

Bao Pham, Mohammed J. Zaki, Luca Ambrogioni, Dmitry Krotov, Matteo Negri2026-04-30
🤖 AI

Resume-ing Control: (Mis)Perceptions of Agency Around GenAI Use in Recruiting Workflows

22 भर्ती पेशेवरों के साक्षात्कार के आधार पर, यह शोध पत्र प्रकट करता है कि जहाँ भर्तीकर्ता यह मानते हैं कि अंतिम अधिकार उनके पास है, वहीं जेनरेटिव एआई एक अदृश्य वास्तुकार बन गया है जो भर्ती कार्यप्रवाह और निर्णयों को आकार दे रहा है, जो अक्सर विकल्प के बजाय बाहरी दबावों से प्रेरित होता है, जिसके परिणामस्वरूप भर्तीकर्ताओं के कौशल ह्रास और समझौतापूर्ण निगरानी की उच्च लागत पर मामूली दक्षता लाभ प्राप्त होते हैं।

Sajel Surati, Rosanna Bellini, Emily Black2026-04-30