🤖 AI

Harnessing Code Agents for Automatic Software Verification

यह शोध पत्र यह प्रदर्शित करता है कि एक सामान्य-उद्देश्य वाले LLM कोड एजेंट को मानव-डिज़ाइन की गई निश्चित रणनीतियों के साथ सीमित करने के बजाय, उसे एक साउंडनेस-प्रवर्तक सत्यापन हार्नेस (soundness-enforcing verification harness) में लपेटने से जटिल सॉफ्टवेयर प्रणालियों का पूर्णतः स्वचालित और पूर्ण औपचारिक सत्यापन सक्षम होता है, जो विशेषज्ञ हस्तक्षेप के बिना Coq और Lean 4 में हजारों लेम्मा पर 100% प्रमाण कवरेज प्राप्त करता है।

Shuangxiang Kan, Shuanglong Kan, Sebastian Ertel2026-07-08
🤖 AI

Responsible Personalisation: The Double-Edged Sword of Personalisation in Human-Robot Interaction

यह शोध पत्र एक एम्बॉडिमेंट-जागरूक (embodiment-aware), जीवनचक्र-आधारित ढांचे का प्रस्ताव करके मानव-रोबोट संपर्क में नैतिक जोखिमों की खंडित समझ को संबोधित करता है, जो व्यवस्थित रूप से विश्लेषण करता है कि विभिन्न संदर्भों में वैयक्तिकरण जोखिम कैसे विकसित होते हैं और जिम्मेदार रोबोट व्यवहार के लिए कार्रवाई योग्य डिजाइन अनुशंसाएं प्रदान करता है।

Antonio Andriella, Jauwairia Nasir, Andrea Rezzani, Alyssa Kubota, Dimitri Lacroix, Tamlin Love, Aniol Civit, Vicky Char (…)2026-07-08
🤖 machine learning

What Images Cannot Say: Language-Guided Olfactory Representation Learning

यह शोध पत्र SCENT को प्रस्तुत करता है, जो एक मल्टीमॉडल फ्रेमवर्क है जो विज़न-लैंग्वेज मॉडल्स से भाषा-निर्देशित सिमेंटिक डिस्क्रिप्टर्स का लाभ उठाकर दृश्य दृश्यों और इलेक्ट्रॉनिक-नोज़ संकेतों के बीच के अंतर को पाटने के लिए है, जिससे न्यूयॉर्क स्मेल्स्स (New York Smells) डेटासेट पर स्टेट-ऑफ-द-आर्ट क्रॉसमोडल रिट्रीवल और व्याख्यात्मक घ्राण प्रतिनिधित्व शिक्षण (interpretable olfactory representation learning) प्राप्त होता है।

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton2026-07-08
🤖 AI

ExplAIner: A Declarative Query Language for Explaining Classification Models

यह शोध पत्र ExplAIner को प्रस्तुत करता है, जो एक डिक्लेरेटिव (declarative) क्वेरी भाषा है जो बूलियन वर्गीकरण मॉडलों के लिए विभिन्न स्पष्टीकरण धारणाओं को एकीकृत करती है और यह स्थापित करती है कि इसका मूल्यांकन SAT सॉल्वर कॉल्स की एक निश्चित संख्या के माध्यम से सुलभ है, जबकि इसका अनुकूलन-उन्मुख अंश, Opt-FOIL, बहुपद कॉल्स के साथ न्यूनतम स्पष्टीकरणों की गणना करने में सक्षम बनाता है।

Marcelo Arenas, Pablo Barceló, Diego Bustamante, Jose Caraball, María Alejandra Schild, Bernardo Subercaseaux2026-07-08
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

रुबेंच (Rubench) एक रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग बेंचमार्क है जिसमें लाइव ओपन-सोर्स प्रोजेक्ट्स से मूल रूप से तैयार की गई 25 रूसी कार्य विशिष्टताएँ शामिल हैं, जिसे वास्तविक रखरखाव कार्यों पर उत्पाद-ग्रेड कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि डेटा संदूषण प्रतिरोध सुनिश्चित करना और कठोर सांख्यिकीय विश्लेषण एवं प्रक्षेपवक्र ऑडिटिंग के माध्यम से तैनात सिस्टम व्यवहारों में महत्वपूर्ण अंतर्दृष्टि को प्रकट करना भी इसका उद्देश्य है।

Evgeny Shilov (Independent Researcher)2026-07-08
🤖 machine learning

TILDE: TILt-based Distributional Erasure for Concept Unlearning

यह शोध पत्र TILDE का प्रस्ताव करता है, जो टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल में कॉन्सेप्ट अनलर्निंग (concept unlearning) के लिए एक नया फ्रेमवर्क है, जो इस कार्य को एक वितरण संरेखण समस्या (distributional alignment problem) के रूप में तैयार करता है ताकि अवांछित अवधारणाओं को प्रभावी ढंग से दबाते हुए सौहार्दपूर्ण डेटा पर मॉडल की गुणवत्ता, विविधता और सिमेंटिक कवरेज को संरक्षित किया जा सके।

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji2026-07-08
🤖 AI

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

यह शोध पत्र "एनालिसिस-बाय-प्रॉक्सि" (Analysis-by-Proxy) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह प्रकट करता है कि इमेज एडिटिंग के लिए कंडीशन एनकोडर के रूप में उपयोग किए जाने वाले विजन-लैंग्वेज मॉडल्स एक सिंगल फॉरवर्ड पास में महत्वपूर्ण लोकलाइजेशन सिग्नल्स को प्रसारित करने में कैसे विफल रहते हैं, क्योंकि ये स्थानिक प्रतिनिधित्व वर्तमान पाइपलाइनों में उपयोग किए जाने वाले पूर्व-निर्धारित कंडीशनिंग पॉइंट्स तक पहुँचने के बजाय मध्यवर्ती परतों (intermediate layers) में छिपे रहते हैं।

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik2026-07-08
🤖 AI

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

यह शोध पत्र डैनस (Danus) का परिचय देता है, जो एक ओपन-सोर्स ऑर्केस्ट्रेशन सिस्टम है जो कई समानांतर प्रूफ-सर्च एजेंटों और एक स्टेटलेस वेरीफायर को समन्वित करने के लिए एक साझा फैक्ट-ग्राफ मेमोरी का लाभ उठाता है, जिससे बीजगणितीय ज्यामिति (algebraic geometry) और कॉम्बिनेटरिक्स (combinatorics) जैसे क्षेत्रों की शोध-स्तरीय समस्याओं के लिए लंबी, जटिल गणितीय प्रमेयों के सफल निर्माण को सक्षम बनाया जा सके।

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Z (…)2026-07-08
💬 NLP

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

यह शोध पत्र BioASQ 14b टास्क B के लिए एक प्रश्न-प्रकार-जागरूक (question-type-aware) लार्ज लैंग्वेज मॉडल फ्रेमवर्क प्रस्तुत करता है जो प्रतिस्पर्धी प्रदर्शन प्राप्त करने और बैच 4 के फैक्टॉइड सबटास्क में प्रथम स्थान प्राप्त करने के लिए अनुकूलित इन्फरेंस रणनीतियों—जैसे कि हाँ/नहीं वाले प्रश्नों के लिए स्निपेट शफलिंग, फैक्टॉइड्स के लिए चेन-ऑफ-थॉट, और सूचियों के लिए मल्टी-एजेंट सहयोग—का उपयोग करता है।

Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang2026-07-08
💬 NLP

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

यह शोधपत्र DataGovBench प्रस्तुत करता है, जो सरकारी ओपन डेटा से प्राप्त एक नया बेंचमार्क है जो जटिल टेबल QA और खोजपूर्ण अंतर्दृष्टि (exploratory insight) कार्यों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे वर्तमान मॉडल्स और वास्तविक दुनिया के डेटा एनालिटिक्स की मांगों के बीच महत्वपूर्ण प्रदर्शन अंतराल का पता चलता है।

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen2026-07-08