💻 computer science

Comparative Evaluation of Machine Translation Systems on Images with Text

यह शोध पत्र टेक्स्ट वाले चित्रों के लिए मशीन अनुवाद प्रणालियों का एक तुलनात्मक मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स, अनुवाद की गुणवत्ता और प्रासंगिक समझ के मामले में मॉड्यूलर OCR-आधारित पाइपलाइनों और एंड-टू-एंड दृष्टिकोणों दोनों से बेहतर प्रदर्शन करते हैं।

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta2026-05-29
🤖 machine learning

PhoneWorld: Scaling Phone-Use Agent Environments

PhoneWorld एक स्केलेबल पाइपलाइन पेश करता है जो 34 ऐप्स में वास्तविक मोबाइल GUI प्रक्षेप पथों (trajectories) को स्वचालित रूप से नियंत्रणीय, सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है, जिससे मैनुअल बेंचमार्क निर्माण से ध्यान हटाकर फोन-उपयोग वातावरण के बड़े पैमाने पर उत्पादन पर केंद्रित करते हुए कई बेंचमार्क पर एजेंट के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Wein (…)2026-05-29
💻 computer science

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

यह शोध पत्र एक नैदानिक ढांचे (diagnostic framework) को पेश करके उस पोस्ट-ट्रेनिंग बाधा की पहचान करता है और उसे संबोधित करता है जहाँ विजन-लैंग्वेज मॉडल धारणा (perception) की तुलना में तर्क (reasoning) में अधिक सुधार करते हैं, जो सुपरवाइज्ड फाइन-ट्यूनिंग और रिइन्फोर्समेंट लर्निंग में इस विषमता के विशिष्ट कारणों को प्रकट करता है, और एंड-टू-एंड प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए डायनेमिक लॉस रीवेटिंग और परसेप्शन-अवेयर रिवार्ड्स जैसे लक्षित हस्तक्षेपों का प्रस्ताव करता है।

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng2026-05-29
🤖 AI

Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation

यह शोध पत्र सोर्स-ग्राउंडेड सिमेंटिक रीइन्फोर्समेंट लर्निंग (SG-SRL) का प्रस्ताव करता है, जो कम-संसाधन वाले लक्ष्य-भाषा उत्पादन को बेहतर बनाने के लिए क्रॉस-लिंगुअल सिमेंटिक रिवॉर्ड्स के साथ रेफरेंस-फ्री रीइन्फोर्समेंट लर्निंग का उपयोग करता है, जिसमें प्रचुर स्रोत-भाषा मोनोलिंगुअल डेटा का लाभ उठाया जाता है, और इसके बाद तथ्यात्मक सटीकता को बनाए रखते हुए वर्बोसिटी (शब्दों की अधिकता) को सुधारने के लिए एक लाइटवेट रिकवरी स्टेज का उपयोग किया जाता है।

Zeli Su, Ziyin Zhang, Zewei Pan, Zhou Liu, Dingcheng Huang, Dehan Li, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Jun Zhou (…)2026-05-29
🤖 machine learning

DynaGraph: Lightweight Multi-Model Interaction Framework via Dynamic Topological Reconfiguration

DynaGraph एक हल्का मल्टी-मॉडल फ्रेमवर्क है जो स्टैटिक पाइपलाइन्स और अनकन्स्ट्रेंड डायनेमिक एजेंट्स की सीमाओं को पार करते हुए, एक साझा बेस मॉडल पर डायनेमिक टोपोलॉजिकल रीकॉन्फ़िगरेशन और टाइम-डिवीजन PEFT एडेप्टर का उपयोग करके, काफी कम लेटेंसी और टोकन खपत के साथ 72B-स्तर की रीजनिंग क्षमताएं प्राप्त करता है।

Yanxing Guo, Zihao Zheng, Fangzhou Wu, Ling Liang, Lin Bao, Zongwei Wang, Yimao Cai2026-05-29
💻 computer science

World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models

यह शोध पत्र \wmw का परिचय देता है, जो एक मूल्यांकन ढांचा और \tracebank डेटासेट है जो विजन-लैंग्वेज मॉडल्स (Vision-Language Models) का ऑडिट करने के लिए उन्हें टाइप किए गए भौतिक अवस्था-परिवर्तन ट्रेसेस (physical state-transition traces) उत्पन्न करने की आवश्यकता रखता है, जिससे छिपी हुई तर्क संबंधी विफलताओं का खुलासा होता है और भौतिक निरंतरता में सुधार संभव होता है जिसे पारंपरिक केवल-उत्तर वाले बेंचमार्क नहीं पकड़ पाते हैं।

Emmanuelle Bourigault2026-05-29
💻 computer science

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

यह शोध पत्र DiffSpot प्रस्तुत करता है, जो एक कोड-संचालित बेंचमार्क है जो यह प्रदर्शित करता है कि अत्याधुनिक विज़न-लैंग्वेज मॉडल भी वेब इंटरफेस में सूक्ष्म दृश्य अंतरों का पता लगाने में संघर्ष करते हैं, जो सरल परिवर्तनों पर भी कम रिकॉल दर प्राप्त करते हैं और यह दर्शाता है कि पता लगाने की कठिनाई पिक्सेल परिमाण या सिमेंटिक दूरी के बजाय CSS प्रॉपर्टी द्वारा महत्वपूर्ण रूप से भिन्न होती है।

Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou2026-05-29
🤖 AI

DLM-SWAI: Steering Diffusion Language Models Before They Unmask

यह शोध पत्र DLM-SWAI का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त इन्फरेंस-टाइम विधि है जो डीनोइजिंग के दौरान पूर्व-निर्धारित स्कोर के साथ टोकन वितरण को पक्षपाती बनाकर डिफ्यूजन लैंग्वेज मॉडल्स को वांछित शैलियों और सुरक्षा गुणों की ओर निर्देशित करती है, जिससे बिना पुनरप्रशिक्षण या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के प्रभावी नियंत्रण प्राप्त होता है।

Hyeseon An, Yo-Sub Han2026-05-29
💻 computer science

Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR

यह शोध पत्र IndicKLAR को प्रस्तुत करता है, जो 18 भारतीय भाषाओं और उनके कोड-मिक्स्ड (code-mixed) वेरिएंट्स के लिए एक बेंचमार्क है, जो यह दर्शाता है कि कोड-मिक्स्ड इनपुट अंग्रेजी और मूल भाषाओं के बीच क्रॉस-लिंगुअल नॉलेज कंसिस्टेंसी गैप को महत्वपूर्ण रूप से कम करते हैं, और अक्सर मॉडल हस्तक्षेप के बिना अंग्रेजी के प्रदर्शन के बराबर पहुँच जाते हैं।

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Aditya Joshi, Akshay Agarwal, Jasabanta Patro2026-05-29
💻 computer science

Classification of non-analyzable word types in web documents to implement an effective Korean e-learning system

यह शोध पत्र वेब दस्तावेज़ों में पाए जाने वाले गैर-विश्लेषणात्मक अनौपचारिक कोरियाई अभिव्यक्तियों को प्रभावी ढंग से वर्गीकृत करने और संभालने के लिए लोकल ग्रामर ग्राफ्स (LGG) का उपयोग करने का प्रस्ताव करता है, जिससे उच्च-स्तरीय कोरियाई ई-लर्निंग प्रणालियों की क्षमताओं को बढ़ाया जा सके।

Sang-Taek Park, Ae-Lim Ahn, Eric Laporte, Jee-Sun Nam2026-05-29