🤖 AI

Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

यह शोध पत्र पर्सोना पॉलिसीज़ (PPol) को प्रस्तुत करता है, जो एक विकासवादी खोज-आधारित ढांचा है जो मानक LLM सिम्युलेटर्स के सहकारी पूर्वाग्रह (cooperative bias) को दूर करने के लिए विविध, मानव-समान उपयोगकर्ता व्यक्तित्व (personas) उत्पन्न करता है, जिससे वास्तविक दुनिया के इंटरेक्शन परिदृश्यों में LLM एजेंटों की मजबूती और मूल्यांकन सटीकता में महत्वपूर्ण सुधार होता है।

Harshita Chopra, Kshitish Ghate, Aylin Caliskan, Tadayoshi Kohno, Chirag Shah, Natasha Jaques2026-05-14
📊 statistics

RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems

यह शोधपत्र RISED को प्रस्तुत करता है, जो एक व्यापक पूर्व-तैनाती सुरक्षा ढांचा (pre-deployment safety framework) है, जो नैदानिक AI प्रणालियों का पांच आयामों—विश्वसनीयता (Reliability), समावेशिता (Inclusivity), संवेदनशीलता (Sensitivity), समानता (Equity), और तैनातक्षमता (Deployability)—में मूल्यांकन करता है, ताकि उन महत्वपूर्ण विफलताओं का पता लगाया जा सके जिन्हें समग्र सटीकता मेट्रिक्स द्वारा छोड़ दिया जाता है और एक सुदृढ़, न्यायसंगत और परिचालन रूप से व्यवहार्य तैनाती सुनिश्चित की जा सके।

Rohith Reddy Bellibatlu2026-05-14
🤖 machine learning

Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

यह शोध पत्र व्यवस्थित रूप से यह प्रदर्शित करता है कि बड़े भाषा मॉडलों के सुपरवाइज्ड फाइन-ट्यूनिंग के लिए इष्टतम डेटा कठिनाई डेटासेट के आकार पर निर्भर करती है, जो सामान्यीकरण (generalization) और एक्सट्रपलेशन (extrapolation) के बीच एक ट्रेड-ऑफ को उजागर करती है जहाँ बड़े डेटा बजट कठिन उदाहरणों से लाभान्वित होते हैं।

Siyuan Liu (IIIS, Tsinghua University), Tinghong Chen (College of AI, Tsinghua University,Shanghai Qi Zhi Institute), Xi (…)2026-05-14
🤖 AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

यह शोध पत्र AgentLens प्रस्तुत करता है, जो यह प्रदर्शित करके कि केवल बाइनरी टेस्ट परिणामों पर निर्भर रहना समाधान की गुणवत्ता में महत्वपूर्ण अंतरों को छिपा देता है, SWE-agent मूल्यांकन में "लकी पास" (Lucky Pass) घटनाओं की व्यापकता को उजागर करता है, और मॉडल प्रदर्शन को अधिक सटीक रूप से रैंक करने के लिए टास्क-लेवल प्रिफिक्स ट्री एक्सेप्टर (Prefix Tree Acceptor) संदर्भों का उपयोग करते हुए एक प्रोसेस-लेवल मूल्यांकन पद्धति का प्रस्ताव करता है।

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu2026-05-14
🤖 AI

Anatomy-Slot: Unsupervised Anatomical Factorization for Homologous Bilateral Reasoning in Retinal Diagnosis

यह शोध पत्र Anatomy-Slot का प्रस्ताव करता है, जो एक अनसुपरवाइज्ड (unsupervised) विधि है जो रेटिनल इमेज टोकन को एनाटॉमिकल स्लॉट्स में विभाजित करती है और द्वि-दिशीय क्रॉस-अटेंशन (bidirectional cross-attention) के माध्यम से उन्हें समरूप आँखों (homologous eyes) में संरेखित करती है, जो मोनोक्यूलर बेसलाइन्स की तुलना में द्विपक्षीय निदान सटीकता और मजबूती में महत्वपूर्ण सुधार करती है।

Yingzhe Ma, Xiao Yang, Yuguo Yin, Zheyu Wang2026-05-14
🤖 AI

AuraMask: An Extensible Pipeline for Developing Aesthetic Anti-Facial Recognition Image Filters

यह शोधपत्र AuraMask को प्रस्तुत करता है, जो एक विस्तार योग्य पाइपलाइन है जो सौंदर्यपूर्ण, इंस्टाग्राम-शैली के इमेज फिल्टर उत्पन्न करता है जो चेहरे की पहचान प्रणालियों (facial recognition systems) को प्रभावी ढंग से बाधित करते हैं और साथ ही पूर्ववर्ती प्रतिकूल तरीकों (adversarial methods) की तुलना में काफी अधिक उपयोगकर्ता स्वीकृति प्राप्त करते हैं।

Jacob Lagogiannis, William Agnew, Rosa I. Arriaga, Sauvik Das2026-05-14
🤖 AI

CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation

यह शोध पत्र CRePE का प्रस्ताव करता है, जो एक नवीन पोजीशनल एनकोडिंग विधि है जो वीडियों जनरेशन में एकीकृत, स्थिर कैमरा नियंत्रण और बाहरी ज्यामिति कंडीशनिंग को सक्षम करने के लिए कर्व्ड रे एक्सपेक्टेशंस (curved ray expectations) और एक ज्योमेट्रिक अटेंशन अडैप्टर का लाभ उठाता है, जो वाइड-एंगल और फिशआई लेंसों के लिए मौजूदा पिनहोल-आधारित एनकोडिंग की सीमाओं को प्रभावी ढंग से संबोधित करता है।

Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye2026-05-14
🤖 machine learning

The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models

यह शोध पत्र ऑटोरेग्रेसिव लैंग्वेज मॉडलिंग में प्रोबेबिलिस्टिक सर्किट्स और लार्ज लैंग्वेज मॉडल्स के बीच अभिव्यक्ति अंतराल (expressivity gap) की पहचान और विश्लेषण करता है, जो यह प्रकट करता है कि जबकि लॉजिट-स्पेस पैरामीट्राइजेशन और डिकम्पोजेबल आर्किटेक्चर विशिष्ट बाधाओं को कम कर सकते हैं, स्ट्रक्चर्ड-डिकम्पोजेबल पीसी (PCs) की निश्चित रूटिंग संरचना ट्रांसफॉर्मर्स की तुलना में विषम डिपेंडेंसी टोपोलॉजी को मॉडल करने की उनकी क्षमता को मौलिक रूप से सीमित करती है।

Zhiyu Zhao, Xuejie Liu, Muhan Zhang, Anji Liu2026-05-14
🤖 AI

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

यह शोध पत्र Seg-Agent को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो इटरेटिव विजुअल फीडबैक सक्षम करने के लिए 'सेट-ऑफ-मार्क' विजुअल प्रॉम्प्टिंग के साथ एक स्पष्ट मल्टीमॉडल चेन-ऑफ-रीजनिंग लूप का उपयोग करके स्टेट-ऑफ-द-आर्ट लैंग्वेज-गाइडेड सेगमेंटेशन प्राप्त करता है, और इसके साथ ही व्यापक मूल्यांकन के लिए 'वेरियस-लैंगसेग' (Various-LangSeg) नामक एक नए बेंचमार्क का प्रस्ताव करता है।

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu2026-05-14
🤖 AI

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

AdaFocus एक कुशल लॉन्ग-वीडियो अंडरस्टैंडिंग फ्रेमवर्क है जो एक क्वेरी-अवेयर एडेप्टिव रिलेवेंस-डाइवर्सिटी सैंपलर को अनसर्टेन्टी-ट्रिगर, जीरो-कैश डिस्क रिट्रीवल मैकेनिज्म के साथ जोड़कर रिजिड वन-शॉट एनकोडिंग की सीमाओं को दूर करता है, ताकि मांग पर उच्च-रिज़ॉल्यूशन साक्ष्य को प्रगतिशील रूप से प्राप्त किया जा सके, जिससे कई बेंचमार्क में श्रेष्ठ सटीकता-दक्षता ट्रेड-ऑफ हासिल होता है।

Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin2026-05-14