💻 computer science

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

यह शोध पत्र IEA को प्रस्तुत करता है, जो एक संवादात्मक इमेज एडिटिंग एजेंट है जिसे तीन-चरणीय मल्टीटास्क अलाइनमेंट पाइपलाइन के माध्यम से प्रशिक्षित किया गया है जो पारदर्शी और व्याख्या योग्य संपादन उत्पन्न करने के लिए पैरामीटराइज्ड टूल्स का लाभ उठाता है, और मौजूदा जनरेटिव और टूल-कॉलिंग विधियों की तुलना में बेहतर इंस्ट्रक्शन फॉलोइंग और संवेदी गुणवत्ता प्राप्त करता है।

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Ziha (…)2026-06-09
💻 computer science

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

यह शोध पत्र Sci-Rho को प्रस्तुत करता है, जो पाँच विषयों और सात भाषाओं में 4,242 निष्पादन योग्य (executable) STEM समस्या टेम्पलेट्स वाला एक बहुभाषी, दृश्य-आधारित (visually-grounded) प्रतीकात्मक बेंचमार्क है, जो यह प्रकट करता है कि जब अत्याधुनिक विज़न-लैंग्वेज मॉडल्स का मूल्यांकन स्थिर औसत के बजाय सबसे खराब स्थिति वाले बदलावों (worst-case variations) के विरुद्ध किया जाता है, तो उनमें महत्वपूर्ण मजबूती संबंधी अंतराल (robustness gaps) होते हैं।

Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto2026-06-09
🤖 machine learning

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

यह शोध पत्र एक हस्तक्षेप-आधारित ढांचे और लेटेंट वल्नरेबिलिटी स्कोर (LVS) को पेश करते हुए यह तर्क देता है कि व्यवहार संबंधी सुरक्षा मूल्यांकन लार्ज लैंग्वेज मॉडल की मजबूती का आकलन करने के लिए अपर्याप्त हैं, जो यह प्रकट करता है कि मॉडल अपने लेटेंट रिप्रजेंटेशन में महत्वपूर्ण आंतरिक कमजोरियों को संजोए रखते हुए भी सुरक्षित बाहरी व्यवहार बनाए रख सकते हैं।

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo2026-06-09
💬 NLP

Diffusion Language Model Parallel Decoding via Product-of-Experts Bridge

यह शोध पत्र PoE-Bridge प्रस्तुत करता है, जो एक नवीन डिकोडिंग फ्रेमवर्क है जो समानांतर ड्राफ्टिंग, रिजेक्शन सैंपलिंग और इम्पोर्टेंस सैंपलिंग को कुशलतापूर्वक संयोजित करने के लिए एक मध्यवर्ती प्रोडक्ट-ऑफ-एक्सपर्ट्स वितरण का लाभ उठाकर डिफ्यूजन लैंग्वेज मॉडल्स को महत्वपूर्ण रूप से त्वरित करता है और ऑटोरिग्रेसिव-स्तर की गुणवत्ता को पुनः प्राप्त करता है।

Juntong Shi, Brian L. Trippe, Jure Leskovec, Stefano Ermon, Minkai Xu2026-06-09
💬 NLP

What's the Point? Spatial Grammar & Index Resolution for Sign Language Processing

यह शोध पत्र स्थानिक संदर्भ समाधान (spatial reference resolution) को इंडेक्स डिटेक्शन और डिस्कोर्स एंटिटी लिंकिंग में विभाजित करने वाले एक ढांचे को पेश करके साइन लैंग्वेज रिकग्निशन में स्थानिक इंडेक्सिंग के अंडर-मॉडलिंग को संबोधित करता है, जिससे स्वचालित एनोटेशन सक्षम होता है और एक सहायक इंडेक्सिंग विशेषज्ञ के साथ फ्रोजन एसएलआर (SLR) मॉडलों को उन्नत किया जाता है।

Oline Ranum, Simon Hadfield, Richard Bowden2026-06-09
💬 NLP

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

यह शोध पत्र SurgiQ को प्रस्तुत करता है, जो एक बड़े पैमाने का, बहु-डोमेन बेंचमार्क है जिसमें 13,000 से अधिक विशेषज्ञ-सत्यापित प्रश्न शामिल हैं जिन्हें लार्ज लैंग्वेज मॉडल्स में सर्जिकल तर्क (surgical reasoning) का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ शीर्ष मॉडल 68.1% सटीकता प्राप्त करते हैं, वहीं प्रक्रियात्मक बारीकियों (procedural nuances) को संभालने में महत्वपूर्ण अंतराल बने हुए हैं और वर्तमान में सामान्य-उद्देश्य वाले मॉडल विशिष्ट बायोमेडिकल मॉडल्स से बेहतर प्रदर्शन कर रहे हैं।

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini2026-06-09
💬 NLP

Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics

यह शोध पत्र सपोर्ट वेक्टर रूब्रिक्स (SVR) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रूब्रिक निर्माण को मैक्स-मार्जिन बाउंड्री लर्निंग के रूप में पुनर्गठित करता है ताकि प्राथमिकता डेटा से कंट्रास्टिव फीचर्स को प्रभावी ढंग से निकाला जा सके, जिससे बड़े भाषा मॉडलों (LLMs) के लिए स्व-निर्मित और मानव-एनोटेटेड मूल्यांकन मानदंडों के बीच प्रदर्शन के अंतर को कम किया जा सके।

Mengyuan Sun, Yu Li, Zhuohao Yu, Shikun Zhang, Wei Ye2026-06-09
💻 computer science

On Low-Bit Quantization Errors in Speaker Verification: Diagnostic and Mitigation

यह शोध पत्र लेयर-वाइज़ और स्कोर-लेवल विश्लेषणों के माध्यम से स्पीकर वेरिफिकेशन प्रदर्शन पर लो-बिट क्वांटाइजेशन के प्रभाव की जांच करता है, एक महत्वपूर्ण 2-बिट थ्रेशोल्ड की पहचान करता है और एक कैलिब्रेटेड मल्टी-प्रिसिजन कैस्केड प्रस्तावित करता है जो कम्प्यूटेशनल और मेमोरी लागतों को काफी कम करते हुए FP32 के निकट सटीकता प्राप्त करता है।

Hugo Leguillier, Driss Matrouf, Guillaume Lechien, Mickael Rouvier2026-06-09
💬 NLP

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ मल्टीमॉडल एलएलएम (LLM) एजेंट उच्च लेबल संरेखण के माध्यम से संदर्भ खेलों (reference games) में समन्वय प्राप्त करते हैं, वहीं वे मानव-समान भागीदार-विशिष्ट परंपराओं को विकसित करने में विफल रहते हैं, और इसके बजाय निरंतर विस्तृत विवरणों पर निर्भर रहते हैं जो अंतःक्रिया इतिहास के साथ संकुचित नहीं होते हैं।

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb2026-06-09
💻 computer science

Assessing the Energy and Carbon Emissions of Neural Speaker Verification Model in Training and Inference

यह शोध पत्र VoxCeleb2 पर प्रशिक्षित ResNet-आधारित स्पीकर वेरिफिकेशन मॉडलों की ऊर्जा खपत और कार्बन उत्सर्जन का मूल्यांकन करता है, जो यह प्रकट करता है कि गहरे या चौड़े नेटवर्क की तुलना में, जो भारी ऊर्जा लागतों पर घटते सटीकता लाभ प्रदान करते हैं, मध्यम आकार के या चरण-केंद्रित आर्किटेक्चर बेहतर प्रदर्शन-से-पर्यावरणीय-प्रभाव ट्रेड-ऑफ (सौदा) प्रदान करते हैं।

Hugo Leguillier, Driss Matrouf, Guillaume Lechien, Mickael Rouvier2026-06-09