🤖 AI

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

यह शोध पत्र "प्री-फ्लाइट" (Pre-Flight) का परिचय देता है, जो विमानन परिचालन ज्ञान पर लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए डिज़ाइन किए गए 300 विशेषज्ञ-लिखित बहुविकल्पीय प्रश्नों का एक ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान में सबसे उन्नत मॉडल भी विशेषज्ञ-स्तर की विश्वसनीयता में काफी पीछे हैं और विमानन में जिम्मेदार एआई परिनियोजन के लिए डोमेन-विशिष्ट मूल्यांकन की आवश्यकता को रेखांकित करता है।

Alex Brooker, Tim Hughes2026-07-03
💬 NLP

Non-synchronism in Global Usage of Research Methods in Library and Information Science from 1990 to 2019

यह अध्ययन 1990 और 2019 के बीच 81 देशों से प्रकाशित 5,281 शोध पत्रों का मैनुअल कंटेंट विश्लेषण और डीप लर्निंग का उपयोग करके विश्लेषण करता है ताकि लाइब्रेरी और सूचना विज्ञान अनुसंधान विधियों में निरंतर लेकिन संकुचित होती वैश्विक असमानताओं को प्रकट किया जा सके, जो राष्ट्रीय अनुशासन विकास का मार्गदर्शन करने और अंतर्राष्ट्रीय सहयोग को बढ़ावा देने के लिए अंतर्दृष्टि प्रदान करता है।

Chengzhi Zhang, Liang Tian2026-07-03
🤖 AI

Safety Targeted Embedding Exploit via Refinement

यह शोध पत्र STEER को प्रस्तुत करता है, जो एक ग्रेडिएंट-गाइडेड हमला है जो कम-संसाधन वाली भाषाओं में सुरक्षा प्रशिक्षण अंतराल का लाभ उठाने के लिए इनकार-प्रेरित (refusal-inducing) शब्दों को पुनरावृत्ति रूप से अनुवादित करता है ताकि बहुभाषी लार्ज लैंग्वेज मॉडल्स के सुरक्षा तंत्रों को बायपास किया जा सके, जिससे उच्च हमला सफलता दर प्राप्त होती है और यह प्रदर्शित होता है कि अंग्रेजी-केंद्रित सुरक्षा संरेखण विविध भाषाई इनपुट पर सामान्य होने में विफल रहता है।

Joshua Adrian Cahyono2026-07-03
🤖 AI

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach एक स्व-विकसित रूब्रिक फ्रेमवर्क है जो वास्तविक रोलआउट्स से प्रक्रिया-उन्मुख मानदंडों को व्युत्पन्न करके LLM एजेंटों के मूल्यांकन और प्रशिक्षण में सुधार करता है ताकि कौशल चयन, अनुपालन, संयोजन और प्रतिबिंब का आकलन किया जा सके, जिससे वास्तविक प्रक्रिया गुणवत्ता को आकस्मिक कार्य सफलता से अलग किया जा सके।

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue2026-07-03
💬 NLP

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

NAVER LABS Europe का IWSLT 2026 सबमिशन अपने मल्टी-स्टेज ASR, ST, और SQA पाइपलाइन को SpeechMapper प्रोजेक्टर और एक सिंथेटिक वैज्ञानिक डेटासेट (fakACL) के साथ उन्नत करके इंस्ट्रक्शन-फॉलोइंग शॉर्ट ट्रैक में संयुक्त प्रथम स्थान की रैंकिंग प्राप्त करता है, जो एक अधिक कॉम्पैक्ट आर्किटेक्चर और एक कमजोर LLM बैकबोन के साथ बेहतर प्रदर्शन सक्षम करता है।

Marcely Zanon Boito, Hemant Yadav, Jean-Luc Meunier, Ioan Calapodescu2026-07-03
💬 NLP

Towards a Phonology-Informed Evaluation of Multilingual TTS

यह शोध पत्र बहुभाषी टेक्स्ट-टू-स्पीच प्रणालियों के मूल्यांकन के लिए एक क्लासिफायर-आधारित ढांचे का प्रस्ताव करता है, जो असमिया स्वर सामंजस्य (vowel harmony) विश्लेषण के माध्यम से यह प्रदर्शित करता है कि मानक नैचुरलनेस मेट्रिक्स उन व्यवस्थित ध्वन्यात्मक विकृतियों का पता लगाने में विफल रहते हैं जो संश्लेषित भाषण (synthesized speech) में मौजूद होती हैं लेकिन मानव भाषण में अनुपस्थित होती हैं।

Sneha Ray Barman, Neeraj Kumar Sharma, Shakuntala Mahanta2026-07-03
🤖 AI

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

यह शोध पत्र ScopeEdit प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक ऑनलाइन एडिटर है जो अपडेट को ऑर्थोगोनल लो-रैंक स्पेस के भीतर मोडैलिटी-लोकल और एविडेंस-गेटेड शेयर्ड ब्रांचेस में विघटित करके एडिट-स्कोपेड जनरलाइजेशन प्राप्त करता है, जिससे स्थिर क्रॉस-मोडल नॉलेज ट्रांसफर सुनिश्चित होता है और साथ ही सिमेंटिक बाउंड्रीज़ को सख्ती से नियंत्रित करते हुए निरंतर कंप्यूटेशनल ओवरहेड बनाए रखा जाता है।

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li2026-07-03
💬 NLP

Using embeddings to predict spoken word duration and pitch in Mandarin monosyllabic words

यह अध्ययन प्रदर्शित करता है कि संदर्भयुक्त एम्बेडिंग्स (contextualized embeddings) स्वाभाविक भाषण में मंदारिन एक-शब्दांश वाले शब्दों की अवधि और पिच कंटूर दोनों की प्रभावी ढंग से भविष्यवाणी करते हैं, जिससे मिलीसेकंड के पैमाने पर अनुभवजन्य f0 कंटूरों का सटीक पुनर्निर्माण संभव हो पाता है।

Xiaoyun Jin, Mirjam Ernestus, R. Harald Baayen2026-07-03
💬 NLP

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

यह शोध पत्र EduArt को प्रस्तुत करता है, जो कई भाषाओं और प्रारूपों में 871 मानव-लिखित प्रश्नों से बना एक मनोवैज्ञानिक रूप से सुदृढ़, शैक्षिक-स्तरीय बेंचमार्क है, जो यह प्रकट करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स बहुविकल्पीय कला इतिहास पहचान में उत्कृष्ट हैं, वहीं उनका प्रदर्शन मुक्त-अंत वाले (open-ended) और त्रुटि-पहचान वाले कार्यों पर नाटकीय रूप से गिर जाता है, जो पहचान और कला-ऐतिहासिक ज्ञान को विश्वसनीय रूप से तैनात करने की क्षमता के बीच एक महत्वपूर्ण अंतर को उजागर करता है।

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza2026-07-03
💬 NLP

OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets

यह शोध पत्र OpenSafeIntent को प्रस्तुत करता है, जो एक ही कार्य के सौहार्दपूर्ण (benign), दोहरे उपयोग वाले (dual-use) और दुर्भावनापूर्ण (malicious) वेरिएंट्स वाले नियंत्रित प्रॉम्प्ट सेट्स का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि सुरक्षित पूर्णता का मूल्यांकन करने के लिए मिलान किए गए प्रॉम्प्ट्स के माध्यम से इरादा-कैलिब्रेटेड व्यवहार का आकलन करना आवश्यक है, न कि केवल अलग-थलग इनपुट से प्राप्त औसत सुरक्षा स्कोर पर निर्भर रहना।

Rheeya Uppaal, Seungwoo Lyu, Selina Sung, Junjie Hu2026-07-03