💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

रुबेंच (Rubench) एक रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग बेंचमार्क है जिसमें लाइव ओपन-सोर्स प्रोजेक्ट्स से मूल रूप से तैयार की गई 25 रूसी कार्य विशिष्टताएँ शामिल हैं, जिसे वास्तविक रखरखाव कार्यों पर उत्पाद-ग्रेड कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि डेटा संदूषण प्रतिरोध सुनिश्चित करना और कठोर सांख्यिकीय विश्लेषण एवं प्रक्षेपवक्र ऑडिटिंग के माध्यम से तैनात सिस्टम व्यवहारों में महत्वपूर्ण अंतर्दृष्टि को प्रकट करना भी इसका उद्देश्य है।

Evgeny Shilov (Independent Researcher)2026-07-08
🤖 machine learning

TILDE: TILt-based Distributional Erasure for Concept Unlearning

यह शोध पत्र TILDE का प्रस्ताव करता है, जो टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल में कॉन्सेप्ट अनलर्निंग (concept unlearning) के लिए एक नया फ्रेमवर्क है, जो इस कार्य को एक वितरण संरेखण समस्या (distributional alignment problem) के रूप में तैयार करता है ताकि अवांछित अवधारणाओं को प्रभावी ढंग से दबाते हुए सौहार्दपूर्ण डेटा पर मॉडल की गुणवत्ता, विविधता और सिमेंटिक कवरेज को संरक्षित किया जा सके।

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji2026-07-08
🤖 AI

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

यह शोध पत्र "एनालिसिस-बाय-प्रॉक्सि" (Analysis-by-Proxy) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह प्रकट करता है कि इमेज एडिटिंग के लिए कंडीशन एनकोडर के रूप में उपयोग किए जाने वाले विजन-लैंग्वेज मॉडल्स एक सिंगल फॉरवर्ड पास में महत्वपूर्ण लोकलाइजेशन सिग्नल्स को प्रसारित करने में कैसे विफल रहते हैं, क्योंकि ये स्थानिक प्रतिनिधित्व वर्तमान पाइपलाइनों में उपयोग किए जाने वाले पूर्व-निर्धारित कंडीशनिंग पॉइंट्स तक पहुँचने के बजाय मध्यवर्ती परतों (intermediate layers) में छिपे रहते हैं।

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik2026-07-08
🤖 AI

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

यह शोध पत्र डैनस (Danus) का परिचय देता है, जो एक ओपन-सोर्स ऑर्केस्ट्रेशन सिस्टम है जो कई समानांतर प्रूफ-सर्च एजेंटों और एक स्टेटलेस वेरीफायर को समन्वित करने के लिए एक साझा फैक्ट-ग्राफ मेमोरी का लाभ उठाता है, जिससे बीजगणितीय ज्यामिति (algebraic geometry) और कॉम्बिनेटरिक्स (combinatorics) जैसे क्षेत्रों की शोध-स्तरीय समस्याओं के लिए लंबी, जटिल गणितीय प्रमेयों के सफल निर्माण को सक्षम बनाया जा सके।

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Z (…)2026-07-08
💬 NLP

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

यह शोध पत्र BioASQ 14b टास्क B के लिए एक प्रश्न-प्रकार-जागरूक (question-type-aware) लार्ज लैंग्वेज मॉडल फ्रेमवर्क प्रस्तुत करता है जो प्रतिस्पर्धी प्रदर्शन प्राप्त करने और बैच 4 के फैक्टॉइड सबटास्क में प्रथम स्थान प्राप्त करने के लिए अनुकूलित इन्फरेंस रणनीतियों—जैसे कि हाँ/नहीं वाले प्रश्नों के लिए स्निपेट शफलिंग, फैक्टॉइड्स के लिए चेन-ऑफ-थॉट, और सूचियों के लिए मल्टी-एजेंट सहयोग—का उपयोग करता है।

Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang2026-07-08
💬 NLP

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

यह शोधपत्र DataGovBench प्रस्तुत करता है, जो सरकारी ओपन डेटा से प्राप्त एक नया बेंचमार्क है जो जटिल टेबल QA और खोजपूर्ण अंतर्दृष्टि (exploratory insight) कार्यों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे वर्तमान मॉडल्स और वास्तविक दुनिया के डेटा एनालिटिक्स की मांगों के बीच महत्वपूर्ण प्रदर्शन अंतराल का पता चलता है।

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen2026-07-08
📊 statistics

Pitwall: Faithful Natural-Language Race-Strategy Briefings from a Calibrated Real-Time Monte Carlo Engine

यह शोधपत्र पिटवॉल (Pitwall) का परिचय देता है, जो एक ऐसी उत्पादन प्रणाली है जो एक आर्किटेक्चरल सत्यापन लूप को लागू करके निष्ठापूर्ण, बहुभाषी फॉर्मूला 1 रेस-रणनीति ब्रीफिंग तैयार करती है जहाँ प्रत्येक तथ्यात्मक दावे को एक कैलिब्रेटेड, वास्तविक समय के मोंटे कार्लो इंजन के विरुद्ध सत्यापित किया जाता है, जिससे जमीनी वास्तविकता सुनिश्चित होती है और फाइन-ट्यून्ड मॉडलों में जीवंतता और मतिभ्रम (hallucination) के बीच महत्वपूर्ण समझौतों का अनावरण होता है।

Juan S. Santillana (Independent Researcher)2026-07-08
🤖 AI

Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

यह शोध पत्र एक रिकॉल-नियंत्रित प्रोब कैस्केड (recall-controlled probe cascade) प्रस्तुत करता है जो विफल होने वाले एपिसोड्स का पूर्वानुमान लगाने और उन्हें जल्दी रोकने के लिए LLM एजेंटों की हिडन स्टेट्स (hidden states) के हल्के विश्लेषण का लाभ उठाता है, जिससे उपयोगकर्ता द्वारा निर्दिष्ट वैश्विक सफलता दर की गारंटी देते हुए इन्फरेंस कंप्यूट (inference compute) को काफी कम किया जा सकता है।

Kai Ruan, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun2026-07-08
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

यह शोध पत्र NAICS-GH प्रस्तुत करता है, जो 6,588 GitHub रिपॉजिटरी का एक उच्च-परिशुद्धता, सार्वजनिक रूप से जारी कॉर्पस है जिसे BAAI/bge-large-en एम्बेडिंग्स और GPT-4.1 को संयोजित करने वाले एक 'रिट्रीव-एंड-वेरिफाई' पाइपलाइन का उपयोग करके NAICS 2022 उद्योग क्षेत्रों के साथ लेबल किया गया है, जो 96.98% मानव-सत्यापित परिशुद्धता प्राप्त करता है और ओपन-सोर्स नवाचार अनुसंधान में उद्योग वर्गीकरण के लिए एक बेंचमार्क के रूप में कार्य करता है।

Kevin Xu, Alexander Quispe2026-07-08
🤖 AI

FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

यह शोध पत्र FootsiesGym को प्रस्तुत करता है, जो न्यूनतमवादी फाइटिंग गेम 'Footsies' पर आधारित एक ओपन-सोर्स, वेक्टरकृत बेंचमार्क वातावरण है, जिसे दो-खिलाड़ी शून्य-योग (zero-sum) अपूर्ण-सूचना वाले खेलों के लिए सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम के कुशल अनुसंधान और प्रशिक्षण को सुगम बनाने के लिए डिज़ाइन किया गया है।

Chase McDonald, Nathan Tsang, Wesley N. Kerr2026-07-08