💬 NLP

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

यह शोध पत्र Spider 2.0-AIFunc को प्रस्तुत करता है, जो 125 वास्तविक दुनिया के डेटाबेस में 465 सत्यापित इंस्टेंस का एक नया बेंचमार्क है जिसे स्नोफ्लेक (Snowflake) प्लेटफॉर्म पर AI-नेटिव SQL क्वेरी उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि शीर्ष प्रोप्रायटरी मॉडल 67-70% सटीकता प्राप्त करते हैं, पारंपरिक टेक्स्ट-टू-SQL कार्यों के लिए अनुकूलित वर्तमान एजेंट फ्रेमवर्क इस उभरते परिवेश में प्रभावी रूप से स्थानांतरित नहीं होते हैं।

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He2026-07-08
🤖 AI

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

यह शोध पत्र VendorBench-100 को प्रस्तुत करता है, जो एक एकीकृत क्रॉस-पैराडाइम बेंचमार्क है जो एक क्यूरेटेड 100-छवि कॉर्पस का उपयोग करके कमर्शियल एपीआई (commercial APIs), विजन-लैंग्वेज मॉडल्स और ओपन-सोर्स डिटेक्टर्स के माध्यम से 36 डीपफेक डिटेक्शन मॉडल्स का मूल्यांकन करता है, जिससे यह खुलासा होता है कि हालांकि कमर्शियल एपीआई मेडियन प्रदर्शन में अग्रणी हैं, फिर भी रैंकिंग क्षमता (ROC-AUC) और विश्वसनीय निर्णय लेने (MCC) के बीच एक महत्वपूर्ण विचलन मौजूद है।

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh2026-07-08
🤖 AI

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

यह शोध पत्र एक ऐसे मूल मेटा-आर्किटेक्चर में संज्ञानात्मक प्रोटोकॉल को समाहित करके विषम एआई पारिस्थितिक तंत्रों के विकास के लिए एक सैद्धांतिक रूपरेखा प्रस्तावित करता है जो सख्त शासन अपरिवर्तनीयताओं (governance invariants) को बनाए रखते हुए स्व-सुसंगत, पथ-आश्रित टोपोलॉजिकल विकास को संचालित करने के लिए संरचनात्मक तनाव, ऑफलाइन आवर्ती लूप और अनुमान-समय प्लास्टिसिटी का उपयोग करता है।

Heting Mao2026-07-08
🤖 AI

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

यह शोध पत्र UI2App को प्रस्तुत करता है, जो केवल स्थिर UI स्क्रीनशॉट से निष्पादन योग्य इंटरैक्शन व्यवहारों को अनुमानित करने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो वर्तमान मॉडल्स की दृश्य पुनर्निर्माण क्षमताओं और जटिल, स्टेट-कोहेरेंट वेब एप्लिकेशन उत्पन्न करने की उनकी क्षमता के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen2026-07-08
🤖 AI

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard एक 4B-पैरामीटर वाला सुरक्षा गार्डरेल है जो "रीज़निंग-एक्टिव ट्रेनिंग, रीज़निंग-फ्री इन्फरेंस" प्रतिमान को अपनाकर उच्च-सटीकता और कम-विलंबता वाली मॉडरेशन प्राप्त करता है, जहाँ यह इन्फरेंस के दौरान केवल संरचित सुरक्षा लेबल उत्सर्जित करने के लिए इरादा-संचालित पर्यवेक्षण और लक्षित कठिन-मामला अनुकूलन के माध्यम से प्रशिक्षण के दौरान जटिल तर्क पैटर्न को आंतरिक रूप से आत्मसात कर लेता है।

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei L (…)2026-07-08
🤖 AI

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

यह शोध पत्र अनसुपरवाइज्ड डिक्शनरी लर्निंग का उपयोग करके एक पोस्ट-हॉक इंटरप्रिटेबिलिटी फ्रेमवर्क प्रस्तावित करता है ताकि एंड-टू-एंड ऑटोनॉमस ड्राइविंग मॉडल्स को अर्थपूर्ण अवधारणाओं में विघटित किया जा सके, जिससे त्रुटिपूर्ण व्यवहारों की पहचान और लक्षित हस्तक्षेप सक्षम हो सके जो समग्र ड्राइविंग प्रदर्शन में सुधार करते हैं।

Franz Motzkus, Sebastian Bernhard2026-07-08
🤖 AI

Harnessing Code Agents for Automatic Software Verification

यह शोध पत्र यह प्रदर्शित करता है कि एक सामान्य-उद्देश्य वाले LLM कोड एजेंट को मानव-डिज़ाइन की गई निश्चित रणनीतियों के साथ सीमित करने के बजाय, उसे एक साउंडनेस-प्रवर्तक सत्यापन हार्नेस (soundness-enforcing verification harness) में लपेटने से जटिल सॉफ्टवेयर प्रणालियों का पूर्णतः स्वचालित और पूर्ण औपचारिक सत्यापन सक्षम होता है, जो विशेषज्ञ हस्तक्षेप के बिना Coq और Lean 4 में हजारों लेम्मा पर 100% प्रमाण कवरेज प्राप्त करता है।

Shuangxiang Kan, Shuanglong Kan, Sebastian Ertel2026-07-08
🤖 AI

Responsible Personalisation: The Double-Edged Sword of Personalisation in Human-Robot Interaction

यह शोध पत्र एक एम्बॉडिमेंट-जागरूक (embodiment-aware), जीवनचक्र-आधारित ढांचे का प्रस्ताव करके मानव-रोबोट संपर्क में नैतिक जोखिमों की खंडित समझ को संबोधित करता है, जो व्यवस्थित रूप से विश्लेषण करता है कि विभिन्न संदर्भों में वैयक्तिकरण जोखिम कैसे विकसित होते हैं और जिम्मेदार रोबोट व्यवहार के लिए कार्रवाई योग्य डिजाइन अनुशंसाएं प्रदान करता है।

Antonio Andriella, Jauwairia Nasir, Andrea Rezzani, Alyssa Kubota, Dimitri Lacroix, Tamlin Love, Aniol Civit, Vicky Char (…)2026-07-08
🤖 machine learning

What Images Cannot Say: Language-Guided Olfactory Representation Learning

यह शोध पत्र SCENT को प्रस्तुत करता है, जो एक मल्टीमॉडल फ्रेमवर्क है जो विज़न-लैंग्वेज मॉडल्स से भाषा-निर्देशित सिमेंटिक डिस्क्रिप्टर्स का लाभ उठाकर दृश्य दृश्यों और इलेक्ट्रॉनिक-नोज़ संकेतों के बीच के अंतर को पाटने के लिए है, जिससे न्यूयॉर्क स्मेल्स्स (New York Smells) डेटासेट पर स्टेट-ऑफ-द-आर्ट क्रॉसमोडल रिट्रीवल और व्याख्यात्मक घ्राण प्रतिनिधित्व शिक्षण (interpretable olfactory representation learning) प्राप्त होता है।

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton2026-07-08
🤖 AI

ExplAIner: A Declarative Query Language for Explaining Classification Models

यह शोध पत्र ExplAIner को प्रस्तुत करता है, जो एक डिक्लेरेटिव (declarative) क्वेरी भाषा है जो बूलियन वर्गीकरण मॉडलों के लिए विभिन्न स्पष्टीकरण धारणाओं को एकीकृत करती है और यह स्थापित करती है कि इसका मूल्यांकन SAT सॉल्वर कॉल्स की एक निश्चित संख्या के माध्यम से सुलभ है, जबकि इसका अनुकूलन-उन्मुख अंश, Opt-FOIL, बहुपद कॉल्स के साथ न्यूनतम स्पष्टीकरणों की गणना करने में सक्षम बनाता है।

Marcelo Arenas, Pablo Barceló, Diego Bustamante, Jose Caraball, María Alejandra Schild, Bernardo Subercaseaux2026-07-08