🤖 AI

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

यह शोध पत्र GTA को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो मौजूदा बेंचमार्क की सीमाओं को दूर करने और मजबूत प्रशिक्षण एवं मूल्यांकन को सक्षम करने के लिए क्रॉलिंग, रिट्रीवल-आधारित सीडिंग और स्वचालित सत्यापन को एकीकृत करके वास्तविक, मल्टी-हॉप वेब एजेंट कार्यों को निष्पादन योग्य प्रक्षेपवक्रों (ट्रैजेक्टरीज) के साथ स्वचालित रूप से उत्पन्न करता है।

Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu2026-05-29
💻 computer science

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

यह शोधपत्र AgentREVEAL फ्रेमवर्क और HarmURLBench को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि LLM एजेंटों में वेब रिट्रीवल (web retrieval), सिंगल-स्टेप इंटीग्रेशन और "सेफ सोर्स पैराडॉक्स" (Safe Source Paradox) दोनों के माध्यम से हानिकारक अनुपालन (harmful compliance) को बढ़ाकर सुरक्षा संरेखण (safety alignment) को कम करता है, जो एक मौलिक सुरक्षा-उपयोगिता ट्रेड-ऑफ (safety-utility trade-off) को उजागर करता है जहाँ वही प्रासंगिकता जो रिट्रीवल को उपयोगी बनाती है, एक भेद्यता (vulnerability) के रूप में भी कार्य करती है।

Aditya Nawal, Manit Baser, Mohan Gurusamy2026-05-29
🤖 AI

Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI

यह शोध पत्र एक व्याख्या योग्य, एआई-संचालित निर्णय परत का प्रस्ताव करता है जो ग्रेड-आधारित परिणामों पर निर्भर रहने के बजाय छात्र स्व-रिपोर्ट, देखी गई कठिनाइयों और शिक्षक की चिंताओं को एकीकृत करके अलग-थलग पड़े शिक्षार्थियों की पहचान करता है और पाठ्यक्रम विषयों को प्राथमिकता देता है, जो एक स्नातक सीएस पाठ्यक्रम में प्रशिक्षक अंतर्दृष्टि के साथ संरेखित होने और जोखिम वाले छात्रों को सामने लाने में अपनी प्रभावशीलता प्रदर्शित करता है।

Junsoo Park, Youssef Medhat, Htet Phyo Wai, Ploy Thajchayapong, Ashok K. Goel2026-05-29
💻 computer science

Wait! There's a Way Out: A Decision Mechanism for Forecasting Conversational Derailment

यह शोध पत्र संवादात्मक विचलन (कन्वर्सेशनल डेरेलमेंट) के पूर्वानुमान के लिए एक नवीन निर्णय तंत्र प्रस्तावित करता है जो भविष्योन्मुखी सिमुलेशन का उपयोग करके अलर्ट ट्रिगरिंग को संभावना अनुमान से अलग करता है ताकि तब तक अलर्ट को स्थगित किया जा सके जब तक कि सुधार की संभावना हो, जिससे सटीकता से समझौता किए बिना गलत सकारात्मक परिणामों (फॉल्स पॉजिटिव्स) को काफी कम किया जा सके।

Laerdon Kim, Vivian Nguyen, Cristian Danescu-Niculescu-Mizil2026-05-29
💻 computer science

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

यह शोध पत्र डेटासेट, मॉडल और उत्पन्न सामग्री के बीच संपत्ति संरक्षण और उत्पत्ति सत्यापन की खंडित स्थिति को संबोधित करने के लिए एक व्यापक जीवनचक्र-आधारित वर्गीकरण और मूल्यांकन ढांचे का प्रस्ताव करते हुए, एलएलएम (LLM) फिंगरप्रिंटिंग और वॉटरमार्किंग तकनीकों को एकीकृत और सर्वेक्षण करने हेतु "निहित पहचान" (इम्प्लिसिट आइडेंटिटी) की अवधारणा प्रस्तुत करता है।

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo2026-05-29
💻 computer science

Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits

यह शोध पत्र BaSE का प्रस्ताव देने के लिए LLM-निर्देशित विकासवादी खोज (evolutionary search) की अनुभवजन्य नियमितताओं का विश्लेषण करता है, जो एक मल्टी-आर्म्ड बैंडिट एल्गोरिदम है जो समानांतर प्रक्षेप पथों (parallel trajectories) के बीच कंप्यूट को गतिशील रूप से आवंटित करता है, जिससे अंतर्निहित मॉडल या प्रॉम्प्ट्स को संशोधित किए बिना पारंपरिक डेप्थ-ब्रेड्थ रणनीतियों की तुलना में औसत फिटनेस में 12.3% सुधार और उन्नत विश्वसनीयता प्राप्त होती है।

Sixue Xing, Haoyu He, Kerui Wu, Zhuo Yang, Haozheng Luo, Tianfan Fu, Aarthy Nagarajan2026-05-29
💻 computer science

Accommodation Goes Both Ways: Studying Linguistic Convergence Between Humans and Language Models

यह अध्ययन प्रकट करता है कि मानव-LLM अंतःक्रियाओं में भाषाई अनुकूलन विषम है, जिसमें भाषा मॉडल कई भाषाओं में उपयोगकर्ताओं की शैलियों के प्रति काफी अधिक ओवरकन्वर्ज (overconverge) होते हैं, जबकि मनुष्य LLMs के प्रति उन दरों पर अनुकूलित होते हैं जो मानव-मानव संवादों के तुलनीय हैं।

Terra Blevins2026-05-29
🤖 AI

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek एक दो-चरणीय प्रशिक्षण पाइपलाइन पेश करता है जो एक ऐसे खोज एजेंट के लिए है जो निष्पादन योग्य शेल कमांड के माध्यम से सीधे टेक्स्ट कॉर्पोरा के साथ इंटरैक्ट करता है, जो ओपन-डोमेन प्रश्नोत्तर बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और पारंपरिक पुनर्प्राप्ति-आधारित प्रणालियों के लिए एक व्यावहारिक, स्केलेबल विकल्प प्रदान करता है।

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani2026-05-29
💻 computer science

Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk Decoding

यह शोध पत्र ConSUM को प्रस्तुत करता है, जो एक ऐसा रीरैंकिंग फ्रेमवर्क है जो उम्मीदवार आउटपुट के बीच सहमति और स्रोत दस्तावेज़ के साथ निरंतरता को संतुलित करने के लिए मिनिमम बेयस रिस्क डिकोडिंग का लाभ उठाकर उत्पन्न सारांशों की तथ्यात्मकता को बढ़ाता है, जिससे मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Riza Setiawan Soetedjo, Yusuke Sakai, Hidetaka Kamigaito, Jingun Kwon, Manabu Okumura, Taro Watanabe2026-05-29
💻 computer science

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

यह शोध पत्र नई जानकारी, निर्माण विधियों और एक मूल्यांकन रूब्रिक के साथ AnswerCarefully डेटासेट पर निर्माण करके, अवैध गतिविधियों के संबंध में LLM सुरक्षा के मूल्यांकन के लिए एक उन्नत प्रश्न-उत्तर डेटासेट प्रस्तुत करता है, जिसके परिणाम JAI-Trust परियोजना के लिए लक्षित हैं।

Kenji Imamura, Masao Ideuchi, Atsushi Fujita2026-05-29