🤖 AI

SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

SimGym एक ऐसा फ्रेमवर्क है जो लाइव ब्राउज़र में संचालित होने वाले ट्रैफिक-ग्राउंडेड विजन-लैंग्वेज मॉडल एजेंटों का लाभ उठाता है ताकि ई-कॉमर्स ए/बी टेस्ट का तेजी से और सटीक रूप से अनुकरण किया जा सके, जो वास्तविक परिणामों के साथ 77% दिशात्मक संरेखण (directional alignment) प्राप्त करता है और वास्तविक उपयोगकर्ताओं को अपुष्ट वेरिएंट्स के संपर्क में लाए बिना प्रायोगिक चक्रों को हफ्तों से घटाकर एक घंटे से भी कम कर देता है।

Han Li, Vibhor Malik, Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ailin Fan, Keat Yang Koay, Yuanzheng Zhu, Meys (…)2026-05-20
💬 NLP

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स के लिए वर्तमान अनिश्चितता मात्रा निर्धारण (Uncertainty Quantification) विधियाँ मौलिक रूप से विफल रहती हैं क्योंकि वे बाहरी तथ्यात्मक शुद्धता के बजाय केवल अनसुपरवाइज्ड क्लस्टरिंग के माध्यम से आंतरिक पीढ़ी निरंतरता को मापती हैं, जिससे सुरक्षा की एक भ्रामक भावना पैदा होती है जो आत्मविश्वासी मतिभ्रम (hallucinations) का पता नहीं लगा सकती।

Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei2026-05-20
💬 NLP

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

यह शोध पत्र स्टेपवाइज कॉन्फिडेंस एट्रिब्यूशन (SCA) प्रस्तुत करता है, जो ब्लैक-बॉक्स LLMs में बहु-चरणीय तर्क विफलताओं का निदान करने के लिए एक ढांचा है, जो सर्वसम्मति संरचनाओं के आधार पर चरण-स्तरीय आत्मविश्वास स्कोर असाइन करने के लिए इंफॉर्मेशन बॉटलनेक सिद्धांत को लागू करता है, जिससे पारंपरिक उत्तर-स्तर की प्रतिक्रिया की तुलना में अधिक प्रभावी आत्म-सुधार सक्षम होता है।

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei2026-05-20
🤖 AI

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

AquaUI एक ट्रेनिंग-मुक्त, इन्फरेंस-टाइम टोकन रिडक्शन विधि है जो GUI एजेंटों के लिए एडेप्टिव क्वाडट्रीज़ (adaptive quadtrees) का उपयोग करती है ताकि स्क्रीनशॉट के गैर-समान स्थानिक सूचना घनत्व (non-uniform spatial information density) का लाभ उठाया जा सके, जिससे मल्टी-स्टेप इंटरैक्शन में लगभग पूर्ण प्रदर्शन और टेम्पोरल कंसिस्टेंसी बनाए रखते हुए महत्वपूर्ण गति और टोकन में कमी प्राप्त होती है।

Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen2026-05-20
💬 NLP

FormalASR: End-to-End Spoken Chinese to Formal Text

यह शोधपत्र FormalASR को प्रस्तुत करता है, जो दो कॉम्पैक्ट एंड-टू-एंड मॉडल्स (0.6B और 1.7B) का एक जोड़ा है, जिन्हें नए निर्मित बड़े पैमाने के डेटासेट्स पर सीधे बोले गए चीनी भाषा को औपचारिक लिखित पाठ में ट्रांसक्राइब करने के लिए प्रशिक्षित किया गया है, जिससे त्रुटि दर में काफी कमी आती है और विलंब उत्पन्न करने वाले पोस्ट-प्रोसेसिंग LLMs की आवश्यकता समाप्त हो जाती है।

Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang2026-05-20
🤖 AI

Exploring and Developing a Pre-Model Safeguard with Draft Models

यह शोध पत्र एक प्री-मॉडल सेफगार्ड का प्रस्ताव करता है जो ड्राफ्ट रिस्पॉन्स जनरेट करने के लिए बड़े लैंग्वेज मॉडल्स से छोटे ड्राफ्ट मॉडल्स में जेलब्रेक हमलों की ट्रांसफरेबिलिटी का लाभ उठाता है, जिससे मौजूदा गार्ड्स को पोस्ट-मॉडल ऑडिटिंग की उच्च कम्प्यूटेशनल लागतों से बचते हुए, टारगेट मॉडल इन्फरेंस से पहले असुरक्षित प्रॉम्प्ट्स को अधिक सटीकता से पहचानने में सक्षम बनाया जा सके।

Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik2026-05-20
💬 NLP

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

यह शोधपत्र STAR-PólyaMath को प्रस्तुत करता है, जो एक निरंतर मेटा-स्ट्रैटेजिस्ट (Meta-Strategist) और संरचित रीज़नर-वेरिफायर (Reasoner-Verifier) लूप्स वाला एक मल्टी-एजेंट फ्रेमवर्क है, जो मेटा-स्तरीय पर्यवेक्षण के माध्यम से मतिभ्रम (hallucination), मेमोरी विखंडन (memory fragmentation) और टूल के दुरुपयोग को प्रभावी ढंग से कम करके आठ शीर्ष-स्तरीय गणितीय बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong2026-05-20
💬 NLP

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

यह शोध पत्र HalluWorld को प्रस्तुत करता है, जो भाषा मॉडलों में मतिभ्रम (hallucinations) का व्यवस्थित रूप से मूल्यांकन और वर्गीकरण करने के लिए स्पष्ट संदर्भ विश्व मॉडलों (reference world models) का उपयोग करने वाला एक नियंत्रित बेंचमार्क है, जो यह प्रकट करता है कि जबकि संवेदी त्रुटियाँ (perceptual errors) काफी हद तक हल हो गई हैं, बहु-चरणीय अवस्था ट्रैकिंग (multi-step state tracking), कारण सिमुलेशन (causal simulation) और परहेज (abstention) में चुनौतियाँ बनी हुई हैं।

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng2026-05-20
💬 NLP

IMLJD: A Computational Dataset for Indian Matrimonial Litigation Analysis

यह शोध पत्र IMLJD को प्रस्तुत करता है, जो सुप्रीम कोर्ट और कर्नाटक हाई कोर्ट (2000-2024) के 3,613 भारतीय वैवाहिक मुकदमेबाजी संबंधी निर्णयों से बना एक खुला कम्प्यूटेशनल डेटासेट है, जो दोनों न्यायालयों के बीच क्वैशिंग याचिका (quashing petition) की सफलता दर में एक महत्वपूर्ण असमानता के साथ-साथ कानूनी विश्लेषण के लिए संरचित मेटाडेटा और एक नॉलेज ग्राफ को प्रकट करता है।

Joy Bose2026-05-20
💬 NLP

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

यह शोध पत्र PAVE को प्रस्तुत करता है, जो एक नवीन चार-मॉड्यूल वाला संज्ञानात्मक आर्किटेक्चर है जो जनरेटिव एजेंटों को संरचित, व्याख्या योग्य और तर्कसंगत निर्णय लेने में सक्षम बनाता है ताकि वे केवल आपातकालीन ट्रिगर्स द्वारा सख्ती से न्यायसंगत होने पर ही नियमों का वैध रूप से उल्लंघन कर सकें, जबकि अधिकार के प्रति सम्मान और सीमित दायरे को बनाए रखें।

Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel2026-05-20