💻 computer science

Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs

यह शोध पत्र लो-रैंक एक्टिवेशन कोऑर्डिनेट्स की पहचान करने और एक काउंटरफैक्चुअल रिपोर्ट क्लैंप लागू करने के माध्यम से बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को आंतरिक प्रोत्साहन अनुकूलता (इंटरनल इनसेंटिव कम्पैटिबिलिटी) के साथ संरेखित करने के लिए एक प्रशिक्षण-मुक्त विधि प्रस्तावित करता है, जो यह सुनिश्चित करता है कि मॉडल वास्तविक साक्ष्यों के प्रति उत्तरदायी बने रहते हुए वर्जित दबावों का प्रतिरोध करें।

Sen Yang, Yuen-Hei Yeung2026-07-15
💻 computer science

Dynamic Resource Allocation for Ensemble Determinization MCTS

यह शोध पत्र एनसेंबल डिटरमिनिज़ेशन MCTS के लिए दो गतिशील संसाधन आवंटन रणनीतियों—डिटरमिनिज़ेशन पेड़ों की संख्या को समायोजित करना और सिम्युलेशन बजट को गैर-समान रूप से वितरित करना—का प्रस्ताव और सत्यापन करता है, जो जयपुर, लॉस्ट सिटीज़ और स्पेंडर जैसे उच्च-अनिश्चितता वाले बोर्ड गेम में सांख्यिकीय रूप से महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

Jakub Kowalski, Adam CięĊkowski, Artur KrzyĊyński, Mark H. M. Winands2026-07-15
⚡ electrical engineering

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

यह शोध पत्र E3 प्रस्तुत करता है, जो एक जटिलता-जागरूक (complexity-aware) ढांचा है जो AI एजेंटों को कार्य की कठिनाई का अनुमान लगाने और दायरे को बढ़ाने से पहले न्यूनतम व्यवहार्य पथों (minimum viable paths) को निष्पादित करने में सक्षम बनाता है, जिससे मौजूदा विधियों के समान सफलता दर प्राप्त करते हुए कम्प्यूटेशनल लागत और अनावश्यक फ़ाइल निरीक्षणों को भारी रूप से कम किया जा सके।

Junjie Yin, Xinyu Feng2026-07-15
🤖 AI

On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes

यह शोध पत्र पांच नए बेंचमार्क डेटासेट पेश करके और यह प्रदर्शित करके वीडियो एक्शन डिटेक्शन पर अवरोधों (occlusions) के प्रभाव की जांच करता है कि सिम्बोलिक घटकों और विशिष्ट प्रशिक्षण विधियों से उन्नत मॉडल स्थिर और गतिशील दोनों प्रकार के अवरोधों को संभालने में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करते हैं।

Rajat Modi, Vibhav Vineet, Yogesh Singh Rawat2026-07-14
🤖 AI

Asynchronous Perception Machine For Efficient Test-Time-Training

यह शोध पत्र एसिंक्रोनस परसेप्शन मशीन (APM) को प्रस्तुत करता है, जो टेस्ट-टाइम-ट्रेनिंग के लिए एक गणनात्मक रूप से कुशल आर्किटेक्चर है जो आउट-ऑफ-डिस्ट्रीब्यूशन डेटा को पहचानने और बिना किसी डेटासेट-विशिष्ट प्री-ट्रेनिंग या प्रिटैक्स्ट टास्क की आवश्यकता के, एक सिंगल फॉरवर्ड पास में सिमेंटिक क्लस्टरिंग उत्पन्न करने के लिए इमेज पैचेस को एसिंक्रोनस रूप से प्रोसेस करता है।

Rajat Modi, Yogesh Singh Rawat2026-07-14
🤖 AI

Measuring AI Ability to Complete Long Software Tasks

यह शोध पत्र मानव प्रयास के साथ उनकी तुलना करके एआई (AI) क्षमताओं को मापने के लिए "50%-कार्य-पूर्णता समय क्षितिज" (50%-task-completion time horizon) मीट्रिक प्रस्तुत करता है, जिसमें यह पाया गया है कि फ्रंटियर मॉडल अब उन कार्यों को 50 मिनट में पूरा कर सकते हैं जिन्हें पूरा करने में मनुष्यों को आमतौर पर 50 मिनट लगते हैं, और यह दोगुना होने का रुझान सुझाव देता है कि एआई पांच वर्षों के भीतर महीने भर के सॉफ्टवेयर कार्यों को स्वचालित कर सकता है।

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney (…)2026-07-14
🤖 machine learning

Adaptive Reinforcement Learning for Unobservable Random Delays

यह शोध पत्र एक सामान्य इंटरेक्शन लेयर फ्रेमवर्क और एक मॉडल-आधारित एक्टर-क्रिटिक विद डिले अडैप्टेशन (ACDA) एल्गोरिदम प्रस्तुत करता है जो सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एजेंटों को अदृश्य, समय-परिवर्तनीय विलंब (डिली) और पैकेट लॉस के प्रति गतिशील रूप से अनुकूल होने में सक्षम बनाता है, जो लोकोमोशन बेंचमार्क में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

John Wikman, Alexandre Proutiere, David Broman2026-07-14
💬 NLP

Can Argus Judge Them All? Comparing VLMs Across Domains

यह शोध पत्र ARGUS-EVAL को प्रस्तुत करता है, जो एक नया ढांचा है जो बेंचमार्क क्षमता और क्रॉस-डेटासेट विश्वसनीयता के बीच संतुलन बनाकर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो Qwen-2.5VL-3B-Instruct और CLIP जैसे मॉडल्स के बीच पारंपरिक प्रदर्शन रैंकिंग और वास्तविक दुनिया की स्थिरता के बीच महत्वपूर्ण विसंगतियों को प्रकट करता है।

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem2026-07-14
💬 NLP

Interaction Techniques that Encourage Longer Prompts Can Improve Psychological Ownership when Writing with AI

यह शोधपत्र प्रदर्शित करता है कि एआई प्रॉम्प्ट इंटरफेस को अतिरिक्त उपयोगकर्ता प्रयास की आवश्यकता के लिए संशोधित करना, जैसे कि एक बटन को दबाकर रखना या एक स्लाइडर को हिलाना, प्रभावी रूप से प्रॉम्प्ट की लंबाई और उत्पन्न सामग्री के प्रति उपयोगकर्ताओं के मनोवैज्ञानिक स्वामित्व दोनों को बढ़ाता है।

Nikhita Joshi, Daniel Vogel2026-07-14
🤖 AI

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

यह शोध पत्र "ट्रोजन हॉर्स प्रॉम्प्टिंग" (Trojan Horse Prompting) को प्रस्तुत करता है, जो एक नवीन जेलब्रेक तकनीक है जो संवादात्मक मल्टीमॉडल मॉडलों के अपने ही द्वारा निर्मित पिछले कथनों पर उनके निहित विश्वास का लाभ उठाकर सुरक्षा तंत्रों को दरकिनार करने और हानिकारक सामग्री उत्पन्न करने के लिए उपयोग की जाती है, जो वर्तमान सुरक्षा संरेखण रणनीतियों में एक गंभीर भेद्यता को प्रकट करती है।

Wei Duan, Li Qian2026-07-14