💬 NLP

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

यह शोध पत्र IMProofBench प्रस्तुत करता है, जो एक गतिशील बेंचमार्क है जिसमें वेब सर्च और SageMath जैसे उपकरणों के साथ एक एजेंटिक फ्रेमवर्क में मूल्यांकित 77 सहकर्मी-समीक्षित अनुसंधान-स्तरीय गणितीय समस्याएं शामिल हैं, जिसे पारंपरिक प्रतियोगिता-शैली के कार्यों से परे लार्ज लैंग्वेज मॉडल्स की अत्याधुनिक क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है।

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Al (…)2026-07-10
💬 NLP

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

यह शोध पत्र "रिप्रजेंटेशन-एज़-अ-जज" (Representation-as-a-Judge) का प्रस्ताव करता है, जो एक प्रतिमान परिवर्तन है जहाँ छोटे भाषा मॉडल आउटपुट का कुशलतापूर्वक और सटीक रूप से मूल्यांकन करने के लिए सतही पीढ़ी (surface generation) के बजाय आंतरिक छिपी हुई अवस्थाओं (internal hidden states) का लाभ उठाते हैं, जो इस परिकल्पना पर आधारित है कि मूल्यांकन के लिए पीढ़ी की तुलना में काफी कम अर्थ संबंधी क्षमता (semantic capacity) की आवश्यकता होती है।

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Da (…)2026-07-10
💬 NLP

Towards Isolated Interventions via Almost Orthogonal Features in Language Models

यह शोध पत्र एक ऑर्थोगोनैलिटी रेगुलराइजेशन (orthogonality regularization) विधि का प्रस्ताव और सत्यापन करता है जो भाषा मॉडल के फीचर्स को लगभग ऑर्थोगोनल होने के लिए बाध्य करती है, जिससे फीचर एंटैंगलमेंट (feature entanglement) कम होता है और मॉडल के प्रदर्शन से समझौता किए बिना अधिक विश्वसनीय, पृथक कारण संबंधी हस्तक्षेप (causal interventions) सक्षम होते हैं।

Moritz Miller, Florent Draye, Bernhard Schölkopf2026-07-10
💬 NLP

Where do LLMs Fall Short in CBT-Guided Affective Reasoning?

यह शोध पत्र यह प्रकट करता है कि जहाँ LLMs के पास मजबूत सैद्धांतिक CBT ज्ञान है, वहीं वे रणनीतिक हस्तक्षेपों के बजाय सत्यापन और प्रतिबिंब (validation and reflection) पर डिफ़ॉल्ट होने के कारण इसे व्यवहार में प्रभावी ढंग से लागू करने में विफल रहते हैं, एक ऐसी सीमा जो 'मल्टीपल चेन-ऑफ-थॉट' जैसी उन्नत प्रॉम्प्टिंग तकनीकों के साथ भी बनी रहती है और जिसे एक नए "प्रोटोकॉल लीवरेज फोर्स" मीट्रिक द्वारा मापा गया है जो न्यूनतम व्यवहारिक बदलाव दर्शाता है।

Vaishnavi Sinha, Pooja Guttal, Pranay Deep Reddy Katike, Vishal Sinha, Gerald Ndawula, Lira Yoon, Andrea Kleinsmith, Man (…)2026-07-10
💬 NLP

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

यह शोध पत्र TR-RAG प्रस्तुत करता है, जो एक शिक्षक-नियमित सुदृढीकरण शिक्षण (टीचर-रेगुलराइज्ड रीइन्फोर्समेंट लर्निंग) ढांचा है जो अंग्रेजी-साक्ष्य क्रॉस-लिंगुअल रिट्रीवल-ऑगमेंटेड जनरेशन में भाषा विचलन (लैंग्वेज ड्रिफ्ट) को प्रभावी ढंग से कम करने और साक्ष्य ग्राउंडिंग में सुधार करने के लिए एक फ्रोजन टीचर एंकर और एक डीकंपोज्ड रिवॉर्ड सिग्नल के साथ ऑन-पॉलिसी डिस्टिलेशन को जोड़ता है।

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen2026-07-10
💻 computer science

Uncertainty-gated selection for block-sparse attention

यह शोध पत्र ब्लॉक-स्पार्स अटेंशन के लिए एक अनसर्टेन्टी-गेटेड राउटर पेश करता है जो अस्पष्ट टॉप-के (top-k) स्कोर वाले क्वेरीज़ के लिए चयनित की-ब्लॉक्स (key blocks) को गतिशील रूप से विस्तारित करता है, जिससे कई मॉडल आर्किटेक्चर में लगभग-डेंस (near-dense) दक्षता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट रिट्रीवल सटीकता और रिकॉल में महत्वपूर्ण सुधार होता है।

Thomas Rossi2026-07-10
💻 computer science

SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition

यह शोध पत्र SPL (स्ट्रक्चर्ड प्रॉम्प्ट लैंग्वेज) प्रस्तुत करता है, जो एक डिक्लेरेटिव फ्रेमवर्क है जो मॉडल-अज्ञेय वर्कफ़्लो ऑर्केस्ट्रेशन को सक्षम करने के लिए एक ही स्पेसिफिकेशन के भीतर नियत और संभाव्य गणना को एकीकृत करता है, और व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि इसका सॉल्वर-आधारित दृष्टिकोण अनवेरिफाइड LLM-ओनली आउटपुट की तुलना में काफी उच्च मशीन-वेरिफाइड शुद्धता प्राप्त करता है।

Wen G. Gong2026-07-10
💻 computer science

Collective Intelligence with Foundation Models

यह शोध पत्र एक मल्टी-एजेंट फ्रेमवर्क प्रस्तावित करता है जो फाउंडेशन मॉडल्स का लाभ उठाता है, जहाँ एक विषम विशिष्ट एजेंटों का समूह (हेटरोजीनियस एनसेंबल), न कि रेडंडेंट होमोजेनियस एजेंट, सहयोगात्मक ड्राफ्टिंग, आलोचना और सर्वसम्मति संश्लेषण के माध्यम से तर्क की सटीकता, त्रुटि पहचान और समाधान विश्वसनीयता को महत्वपूर्ण रूप से बढ़ाता है।

J. de Curtò, I. de Zarzà2026-07-10
💬 NLP

From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier

यह शोध पत्र गणित के लिए एआई (AI) के प्रति एक प्रतिमान परिवर्तन (paradigm shift) का तर्क देता है, जो पूर्व-निर्धारित समस्याओं को हल करने से लेकर सीमांत चुनौतियों (frontier challenges) से निपटने में सक्षम अनुसंधान एजेंटों के रूप में कार्य करने की ओर केंद्रित है, साथ ही वर्तमान सीमाओं की एक व्यवस्थित समीक्षा प्रस्तुत करता है और भविष्य के विकास के लिए एक रणनीतिक रोडमैप की रूपरेखा तैयार करता है।

Eric Jiang, Xiao Liang, Yikai Zhang, Yingjia Wan, Mengting Li, Haikang Deng, Alexander K. Taylor, Justin Baker, Rushil R (…)2026-07-10
🤖 machine learning

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

यह सर्वेक्षण विजन, लैंग्वेज, ऑडियो और वीडियो मोडैलिटीज में मल्टीमॉडल अनलर्निंग विधियों, डेटासेट्स और बेंचमार्क का एक एकीकृत, सिस्टम-ओरिएंटेड वर्गीकरण प्रस्तुत करता है, जो मॉडल की समग्र उपयोगिता को बनाए रखते हुए फाउंडेशन मॉडल्स से संवेदनशील या कॉपीराइट वाली जानकारी को चुनिंदा रूप से हटाने की चुनौती का समाधान करता है।

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil2026-07-10