💬 NLP

Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments

यह अध्ययन मल्टी-आर्म्ड बैंडिट कार्यों में लार्ज लैंग्वेज मॉडल्स, मनुष्यों और एल्गोरिदम की एक्सप्लोरेशन-एक्सप्लोइटेशन रणनीतियों की तुलना करता है और पाता है कि जबकि "सोचने" (thinking) को सक्षम करने से लार्ज लैंग्वेज मॉडल्स स्थिर वातावरण में अधिक मानव-समान हो जाते हैं, वे फिर भी जटिल, गैर-स्थिर वातावरण में मानवीय अनुकूलन क्षमता और निर्देशित अन्वेषण (directed exploration) प्राप्त करने में संघर्ष करते हैं।

Ziyuan Zhang, Darcy Wang, Ningyuan Chen, Rodrigo Mansur, Vahid Sarhangian2026-05-04
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

यह शोध पत्र InfantAgent-Next को प्रस्तुत करता है, जो एक अत्यधिक मॉड्यूलर मल्टीमॉडल जनरलिस्ट एजेंट है जो सहयोगी, चरण-दर-चरण कंप्यूटर इंटरैक्शन को सक्षम करने के लिए टूल-आधारित और शुद्ध विजन क्षमताओं को एकीकृत करता है, जिससे OSWorld, GAIA और SWE-Bench सहित विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Di (…)2026-05-04
🤖 AI

Controllable Logical Hypothesis Generation for Abductive Reasoning in Knowledge Graphs

यह शोध पत्र CtrlHGen प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो नॉलेज ग्राफ में एबडक्टिव रीजनिंग के लिए नियंत्रणीय, लंबे और जटिल तार्किक परिकल्पनाओं (हाइपोथीसिस) को उत्पन्न करने हेतु परिकल्पना स्थान के पतन (कोलैप्स) और अति-संवेदनशीलता की समस्या का समाधान करता है, जबकि बेंचमार्क डेटासेट्स पर नियंत्रण स्थितियों और अर्थ संबंधी समानता पर श्रेष्ठ अनुपालन प्रदर्शित करता है।

Yisen Gao, Jiaxin Bai, Tianshi Zheng, Qingyun Sun, Ziwei Zhang, Xingcheng Fu, Jianxin Li, Yangqiu Song2026-05-04
💬 NLP

Lightweight Domain Adaptation of a Large Language Model for Legal Assistance in the Indian Context

यह शोध पत्र लीगल असिस्ट एआई (Legal Assist AI) का परिचय देता है, जो एक हल्का ढांचा है जो ऑल-इंडिया बार एग्जामिनेशन पर GPT-3.5 टर्बो जैसे बड़े मॉडलों से बेहतर प्रदर्शन करने के लिए रिट्रीवल-ऑगमेंटेड जनरेशन और एक विशिष्ट भारतीय कानूनी संग्रह के साथ संयोजित 8-बिलियन-पैरामीटर क्वांटाइज्ड लामा 3.1 मॉडल का लाभ उठाता है, और साथ ही प्रभावी रूप से मतिभ्रम (hallucinations) को कम करता है तथा 22 गुना अधिक पैरामीटर दक्षता प्राप्त करता है।

Jatin Gupta, Akhil Sharma, Saransh Singhania, Ali Imam Abidi2026-05-04
🤖 AI

A Benchmark Dataset for Graph Regression with Homogeneous and Multi-Relational Variants

यह योगदान RelSC को प्रस्तुत करता है, जो ग्राफ रिग्रेशन के लिए एक नवीन बेंचमार्क डेटासेट है, जिसे रनटाइम लेबल वाले प्रोग्राम ग्राफ से प्राप्त किया गया है और यह होमोजेनियस एवं मल्टी-रिलेशनल दोनों वेरिएंट्स में उपलब्ध है ताकि यह मूल्यांकन किया जा सके कि संरचनात्मक प्रतिनिधित्व के निर्णय मॉडल के प्रदर्शन को कैसे प्रभावित करते हैं।

Peter Samoaa, Marcus Vukojevic, Morteza Haghir Chehreghani, Antonio Longa2026-05-04
🤖 AI

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

यह शोध पत्र एक नवीन प्रॉम्प्ट-चेनिंग फ्रेमवर्क का उपयोग करके मानक कंप्यूटर विज़न कार्यों पर GPT-4o जैसे अग्रणी मल्टीमॉडल फाउंडेशन मॉडल्स का बेंचमार्किंग करता है ताकि यह प्रकट किया जा सके कि हालांकि वे मजबूत सिमेंटिक समझ के साथ सम्मानजनक सामान्यज्ञों के रूप में कार्य करते हैं, फिर भी वे ज्यामितीय कार्यों में विशेषज्ञ मॉडल्स से पीछे हैं और विशिष्ट विफलता मोड प्रदर्शित करते हैं।

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir2026-05-04
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

यह शोध पत्र ExCyTIn-Bench प्रस्तुत करता है, जो माइक्रोसॉफ्ट सेंटिनलल (Microsoft Sentinel) लॉग्स और इन्वेस्टिगेशन ग्राफ से 7,542 प्रश्न उत्पन्न करके साइबर खतरे की जांच पर LLM एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान शीर्ष मॉडल केवल 0.606 रिवॉर्ड स्कोर प्राप्त करते हैं और भविष्य में सुधार की महत्वपूर्ण गुंजाइश को उजागर करता है।

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto (…)2026-05-04
🤖 AI

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

यह कार्य दो मनोवैज्ञानिक मेट्रिक्स वाले एक "कॉन्टैक्ट सर्चिंग क्वेश्चन्स" ढांचे को पेश करके सौम्य प्रॉम्प्ट्स पर लार्ज लैंग्वेज मॉडल्स में स्व-प्रेरित धोखे की जांच करता है और यह प्रदर्शित करता है कि धोखे की प्रवृत्तियाँ अक्सर कार्य की कठिनाई के साथ बढ़ती हैं और अधिक मॉडल क्षमता द्वारा आवश्यक रूप से कम नहीं होती हैं।

Zhaomin Wu, Mingzhe Du, See-Kiong Ng, Bingsheng He2026-05-04
💬 NLP

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

यह शोधपत्र InterChart प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जिसे विजन-लैंग्वेज मॉडल्स की कई संबंधित चार्ट्स के बीच तर्क करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि विघटित दृश्य कार्यों (decomposed visual tasks) पर बेहतर प्रदर्शन के बावजूद वर्तमान अत्याधुनिक मॉडल क्रॉस-चार्ट एकीकरण और जटिल बहु-चरणीय तर्क में काफी संघर्ष करते हैं।

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta2026-05-04
🤖 AI

CASE: An Agentic AI Framework for Enhancing Scam Intelligence in Digital Payments

यह शोध पत्र CASE को प्रस्तुत करता है, जो एक एजेंटिक एआई (Agentic AI) फ्रेमवर्क है जो स्कैम पीड़ितों का सक्रिय रूप से साक्षात्कार करने और संरचित इंटेलिजेंस निकालने के लिए संवादात्मक एजेंटों का लाभ उठाता है, जिसे जब गूगल पे इंडिया पर लागू किया गया, तो इसके परिणामस्वरूप स्कैम प्रवर्तन वॉल्यूम में 21% की वृद्धि हुई।

Nitish Jaipuria, Lorenzo Gatto, Zijun Kan, Shankey Poddar, Bill Cheung, Diksha Bansal, Ramanan Balakrishnan, Aviral Suri (…)2026-05-04