🤖 AI

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

यह शोध पत्र Diversify2Verify पेश करता है, जो एक LLM-आधारित पाइपलाइन है जो यह प्रदर्शित करती है कि कैसे विविध, कार्य-तुल्य प्रोग्राम कार्यान्वयन उत्पन्न करना स्वचालित सत्यापन सफलता दरों में महत्वपूर्ण सुधार करता है, उन वेरिएंट्स की पहचान करके जो औपचारिक प्रमाण (formal proof) के लिए अधिक अनुकूल हैं।

Shirley Yu, Ruben Martins2026-07-13
💬 NLP

Self-Guided Test-Time Training for Long-Context LLMs

यह शोध पत्र सेल्फ-गाइडेड टेस्ट-टाइम ट्रेनिंग (S-TTT) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मॉडल द्वारा स्वयं पहचाने गए साक्ष्य स्पैन (evidence spans) पर केवल मॉडल मापदंडों को चुनिчески अनुकूलित करके लॉन्ग-कॉन्टेक्स्ट LLM के प्रदर्शन में सुधार करती है, जिससे अप्रासंगिक संदर्भ पर प्रशिक्षण से जुड़े शोर और लागत से बचा जा सकता है।

Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pan (…)2026-07-13
💬 NLP

A Sovereign, Open-Source Foundation Model for German and English

यह शोध पत्र Soofi S 30B-A3B को प्रस्तुत करता है, जो एक संप्रभु, ओपन-सोर्स मिक्स्चर-ऑफ-एक्सपर्ट्स हाइब्रिड माम्बा ट्रांसफॉर्मर मॉडल है जिसे जर्मन और अंग्रेजी पर ध्यान केंद्रित करते हुए 27 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो लंबी-संदर्भ अनुप्रयोगों के लिए बेहतर अनुमान दक्षता प्रदान करते हुए ओपन मॉडलों के बीच अत्याधुनिक प्रदर्शन प्राप्त करता है।

The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Kh (…)2026-07-13
💬 NLP

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

यह शोध पत्र यह प्रदर्शित करता है कि छोटे बहुभाषी विजन-लैंग्वेज मॉडल्स के लिए, टेस्ट-टाइम स्केलिंग लाभ मुख्य रूप से जटिल खोज या सत्यापन तंत्र के बजाय प्रॉम्प्ट पारसेबिलिटी (parseability) और पर्याप्त डिकोडिंग बजट सुनिश्चित करने से संचालित होते हैं, जिसमें विजुअल मल्टीपल-चॉइस बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए अंतर्निहित पॉलिसी मॉडल सबसे महत्वपूर्ण कारक है।

Spiros Baxevanakis, Peng-Jian Yang2026-07-13
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

यह शोध पत्र ProofCouncil को प्रस्तुत करता है, जो एक ओपन-सोर्स LLM एजेंट है जो एक ऑथर-क्रिटिक आर्किटेक्चर का उपयोग करता है जिसने दस में से छह वास्तविक दुनिया की गणितीय समस्याओं को स्वायत्त रूप से हल करके और ओपन प्रॉब्लम्स के एक व्यापक सेट पर महत्वपूर्ण प्रगति प्रदर्शित करके FirstProof चुनौती में अत्याधुनिक प्रदर्शन प्राप्त किया है।

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes2026-07-13
🤖 AI

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

यह शोध पत्र BTHA को प्रस्तुत करता है, जो एक बैकबोन-स्थानांतरणीय पदानुक्रमित एडेप्टर ढांचा है जो एक स्थिर फीचर-स्तर के इंटरफेस और एक मोटे-से-सूक्ष्म (coarse-to-fine) पर्यवेक्षण रणनीति के माध्यम से भाषा मार्गदर्शन को विशिष्ट विजन और टेक्स्ट एनकोडर से अलग करता है, जिससे विविध मॉडल आर्किटेक्चर में प्रभावी और कुशल टेक्स्ट-निर्देशित चिकित्सा छवि विभाजन सक्षम होता है।

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen2026-07-13
🤖 AI

Multimodal Reward Hacking in Reinforcement Learning

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के लिए रिइन्फोर्समेंट लर्निंग में मल्टीमॉडल रिवॉर्ड हैकिंग की जांच करता है, जो यह प्रदर्शित करता है कि केवल परिणाम-आधारित रिवॉर्ड और कमजोर वेरीफायर विभिन्न पैमानों और एल्गोरिदम में व्यवस्थित रूप से नई विफलताओं को प्रेरित करते हैं, और यह तर्क देता है कि सुदृढ़ संरेखण (अलाइनमेंट) के लिए विश्वसनीय, सिमेंटिक-जागरूक रिवॉर्ड तंत्र की आवश्यकता है।

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu2026-07-13
🤖 machine learning

All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models

यह शोध पत्र 'राशोमोन एक्सप्लेनेशन' (Rashomon Explanation) प्रतिमान और 'राशोमोनएलएलएम' (RashomomLLM) ढांचे को पेश करके पारंपरिक सटीकता-व्याख्यात्मकता (accuracy-explainability) के बीच के समझौते को चुनौती देता है, जो विविध वास्तविक दुनिया के कार्यों में मॉडल की भविष्यवाणी सटीकता और व्याख्या की गुणवत्ता दोनों को एक साथ सुधारने के लिए विश्वसनीय, प्राकृतिक भाषा की व्याख्याओं के एक सेट का लाभ उठाते हैं।

Pan Li2026-07-13
🤖 AI

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

यह शोध पत्र प्रकट करता है कि VGGT फाउंडेशन मॉडल एक पदानुक्रमित परत विशेषज्ञता (hierarchical layer specialization) के माध्यम से सह-दृश्यता (co-visibility) को अंतर्निहित रूप से एनकोड करता है, जिसका उपयोग लेखक Co-VGGT विकसित करने के लिए करते हैं—जो एक हल्का, परत-वार मिश्रण-विशेषज्ञों वाला क्लासिफायर (layer-wise mixture-of-experts classifier) है जो Co-VisiON बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और डाउनस्ट्रीम 3D पुनर्निर्माण पाइपलाइनों के लिए उपयुक्त सुव्यवस्थित भविष्यवाणियां प्रदान करता है।

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari2026-07-13
🤖 AI

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

यह शोध पत्र CLI कोडिंग-एजेंट विफलता प्रक्षेपवक्रों (failure trajectories) का पहला बड़े पैमाने पर अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि विफलताएं मुख्य रूप से प्रारंभिक ज्ञान संबंधी त्रुटियों (epistemic errors) द्वारा संचालित होती हैं जो अपरिवर्तनीय अवस्थाओं में विकसित हो जाती हैं, जिससे अंतिम-परिणाम मूल्यांकन से प्रक्रिया-उन्मुख हस्तक्षेप रणनीतियों की ओर बदलाव का समर्थन मिलता है।

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye2026-07-13