🤖 AI

FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models

यह शोध पत्र FormalRewardBench प्रस्तुत करता है, जो 250 विशेषज्ञ-क्यूरेटेड प्राथमिकता युग्मों (preference pairs) का उपयोग करके औपचारिक प्रमेय सिद्ध करने (formal theorem proving) में रिवॉर्ड मॉडल्स के मूल्यांकन के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि फ्रंटियर LLMs प्रमाण गुणवत्ता मूल्यांकन में विशिष्ट थ्योरम प्रोवर्स से बेहतर प्रदर्शन करते हैं और विभिन्न इंजेक्ट की गई त्रुटियों से सही प्रमाणों को अलग करने में वर्तमान मॉडल्स की सीमाओं को उजागर करता है।

Zeynel A. Uluşan, Burak S. Akbudak, Can S. Erer, Gözde Gül Şahin2026-05-12
🤖 AI

Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality

यह अध्ययन प्रदर्शित करता है कि कंप्यूटर विज़न मॉडलों को स्केल करना उनके लोकलाइजेशन-आधारित स्पष्टीकरणों (explanations) की गुणवत्ता को लगातार बेहतर नहीं बनाता है, क्योंकि छोटे आर्किटेक्चर अक्सर बड़े आर्किटेक्चर के समान या उनसे बेहतर प्रदर्शन करते हैं, जो सुरक्षा-महत्वपूर्ण अनुप्रयोगों के लिए भविष्य कहनेवाला सटीकता (predictive accuracy) के साथ स्पष्टीकरण क्षमता (explainability) का स्पष्ट रूप से मूल्यांकन करने की आवश्यकता को रेखांकित करता है।

Mateusz Cedro, Marcin Chlebus2026-05-12
📊 statistics

Coarsening Linear Non-Gaussian Causal Models with Cycles

यह शोध पत्र चक्रों वाले उच्च-आयामी रैखिक गैर-गाऊसी मॉडलों से निम्न-आयामी कारणत्मक DAGs सीखने के लिए एक विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि ऐसे सारांश पहचान योग्य, प्रेक्षण तुल्यता वर्गों (observational equivalence classes) में अपरिवर्तनीय और स्पष्ट नमूना जटिलता सीमाओं के साथ घनीय समय (cubic time) में गणनीय हैं।

Francisco Madaleno, Francisco C Pereira, Alex Markham2026-05-12
🤖 AI

Automated Approach for Solving Infinite-state Polynomial Reachability Games

यह शोध पत्र एक सुदृढ़ (sound), अर्ध-पूर्ण (semi-complete) और उप-घातांकीय (sub-exponential) स्वचालित एल्गोरिदम प्रस्तुत करता है जो अनंत-अवस्था वाले बहुपद पहुँचतात्मकता खेलों (infinite-state polynomial reachability games) को हल करने के लिए रैंकिंग प्रमाणपत्रों का उपयोग करता है, और सिंडरेला-स्टेपमदर (Cinderella-Stepmother) जैसे चुनौतीपूर्ण परिदृश्यों में REACH खिलाड़ी के लिए जीतने वाली रणनीतियों की सफलतापूर्वक गणना करता है जहाँ पिछले तरीके विफल रहे थे।

Krishnendu Chatterjee, Ehsan Kafshdar Goharshady, Mehrdad Karrabi, Maximilian Seeliger, {\DJ}or{\dj}e Žikelić2026-05-12
🤖 AI

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

यह शोध पत्र RevCI प्रस्तुत करता है, जो वैज्ञानिक सहकर्मी समीक्षा विरोधाभासों के लिए साक्ष्य-स्तरीय एनोटेशन और श्रेणीबद्ध तीव्रता लेबल के साथ एक नया बेंचमार्क है, साथ ही IMPACT, एक मल्टी-एजेंट फ्रेमवर्क, और इसका डिस्टिल्ड मॉडल TIDE, जो मिलकर समीक्षकों के मतभेदों की पहचान करने और उनकी गंभीरता का मूल्यांकन करने में मौजूदा बेसलाइन से बेहतर प्रदर्शन करते हैं।

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal2026-05-12
🤖 AI

MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

यह शोध पत्र MTA-RL को प्रस्तुत करता है, जो एक नवीन ढांचा है जो स्पष्ट 3D अफोर्डेंस (affordance) निरूपण उत्पन्न करने के लिए मल्टी-मोडल ट्रांसफॉर्मर के माध्यम से RGB और LiDAR डेटा को संलयित करके सुदृढ़ शहरी स्वायत्त ड्राइविंग को बढ़ाता है, जो अत्याधुनिक बेसलाइन की तुलना में बेहतर प्रदर्शन, नमूना दक्षता और ज़ीरो-शॉट सामान्यीकरण प्राप्त करने के लिए सुदृढीकरण शिक्षण (Reinforcement Learning) नीति हेतु एक संक्षिप्त अवलोकन स्थान के रूप में कार्य करता है।

Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin2026-05-12
🤖 AI

DynGhost: Temporally-Modelled Transformer for Dynamic Ghost Imaging with Quantum Detectors

DynGhost एक ट्रांसफॉर्मर-आधारित आर्किटेक्चर है जो डायनेमिक घोस्ट इमेजिंग में मौजूदा विधियों की सीमाओं को दूर करने के लिए स्थानिक और टेम्पोरल अटेंशन ब्लॉक्स के वैकल्पिक उपयोग के साथ-साथ एक क्वांटम-अवेयर ट्रेनिंग फ्रेमवर्क का लाभ उठाता है, जिससे वास्तविक फोटॉन-स्टार्व्ड और पॉइसोनियन नॉइज़ स्थितियों के तहत बेहतर पुनर्निर्माण प्रदर्शन प्राप्त होता है।

Vittorio Palladino, Ahmet Enis Cetin2026-05-12
🤖 AI

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

यह शोधपत्र LegalCiteBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है यह प्रदर्शित करता है कि वर्तमान बड़े भाषा मॉडल (large language models) क्लोज्ड-बुक लीगल साइटेशन कार्यों के साथ काफी संघर्ष करते हैं, और मॉडल के पैमाने या डोमेन-विशिष्ट प्रीट्रेनिंग में सुधार के बावजूद अक्सर उच्च भ्रामक दरों के साथ विश्वसनीय लेकिन गलत अधिकार (authorities) उत्पन्न करते हैं।

Sijia Chen, Hang Yin, Shunfan Zhou2026-05-12
🤖 AI

TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment

यह शोध पत्र TRACE का प्रस्ताव करता है, जो एक टोकन-रूटेड सेल्फ-डिस्टिलेशन विधि है जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) के दौरान एनोटेटर द्वारा चिह्नित महत्वपूर्ण स्पैन (critical spans) पर चुनिंदा रूप से KL डाइवर्जेंस लागू करती है, जिससे ग्रेडिएंट बर्बादी और विशेषाधिकार प्राप्त सूचना रिसाव (privileged-information leakage) को कम किया जाता है, जिससे मानक GRPO और फुल-रिस्पॉन्स सेल्फ-डिस्टिलेशन बेसलाइनों की तुलना में लॉन्ग-हॉरइजन मैथ रीजनिंग और आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन में महत्वपूर्ण सुधार होता है।

Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen, Yulan Hu, Zheng Pan, Xin Li, Lan-Zhe Guo2026-05-12
🤖 machine learning

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

यह शोध पत्र SPACE का प्रस्ताव करता है, जो एक मेमोरी-कुशल विधि है जो बड़े पैमाने के डिफ्यूजन मॉडल्स से विशिष्ट अवधारणाओं को प्रभावी ढंग से मिटाने के लिए क्रॉस-अटेंशन मापदंडों में पुनरावृत्ति से स्पर्सिटी (sparsity) उत्पन्न करती है, जबकि प्रतिकूल प्रॉम्प्ट्स (adversarial prompts) के विरुद्ध मजबूती बनाए रखती है।

Nicola Novello, Andrea M. Tonello2026-05-12