💻 computer science

A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation

यह शोध पत्र A2RBench प्रस्तुत करता है, जो अद्वितीय समाधान सुनिश्चित करने के लिए चक्र निरंतरता (cycle consistency) का उपयोग करके औपचारिक रूप से सत्यापन योग्य अमूर्त तर्क बेंचमार्क उत्पन्न करने के लिए एक स्वचालित पाइपलाइन है, जो यह प्रकट करता है कि वर्तमान LLMs अमूर्त तर्क में मनुष्यों की तुलना में काफी खराब प्रदर्शन करते हैं और उच्च-आयामी कार्यों के साथ संघर्ष करते हैं।

Qingchuan Ma, Yuexiao Ma, Yongkang Xie, Tianyu Xie, Xiawu Zheng, Rongrong Ji2026-05-19
💻 computer science

Rover: Context-aware Conflict Resolution with LLM

रोवर एक नवीन संघर्ष समाधान प्रणाली है जो प्रोग्राम विश्लेषण और एक मल्टी-लेयर कोड प्रॉपर्टी ग्राफ को एकीकृत करके लार्ज लैंग्वेज मॉडल्स को उन्नत करती है ताकि संदर्भ-जागरूक प्रॉम्प्ट उत्पन्न किए जा सकें, जिससे यह जटिल कोड मर्जिंग संघर्षों को सटीक रूप से हल करने में मौजूदा उपकरणों से बेहतर प्रदर्शन करती है।

Qingyu Zhang, Junzhe Li, Jiayi Lin, Changhua Luo, Chenxiong Qian2026-05-19
💻 computer science

ContractBench: Can LLM Agents Preserve Observation Contracts?

यह शोधपत्र ContractBench प्रस्तुत करता है, जो एक नियतात्मक (deterministic) बेंचमार्क है जो यह प्रकट करता है कि वर्तमान फ्रंटियर LLM एजेंट्स अक्सर ऑब्जर्वेशन कॉन्ट्रैक्ट्स (जैसे कि सेशन टोकन और URL) की टेम्पोरल वैधता और बाइट-लेवल अखंडता को बनाए रखने में विफल रहते हैं, एक ऐसी क्षमता जो मॉडल के आकार के साथ एकतुल्य रूप से (monotonically) नहीं बढ़ती है और जिसमें सुधार के लिए विशिष्ट फेल्योर-अवेयर ट्रेनिंग की आवश्यकता होती है।

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen2026-05-19
💬 NLP

OProver: A Unified Framework for Agentic Formal Theorem Proving

OProver, Lean 4 में एजेंटिक औपचारिक प्रमेय प्रमाण (agentic formal theorem proving) के लिए एक एकीकृत ढांचा है जो इटरेटिव प्रूफ रिवीज़न को कंपाइलर फीडबैक और रिट्रीवल के साथ एकीकृत करता है, जो निरंतर प्रीट्रेनिंग, रिपेयर ट्रेजेक्टरीज पर सुपरवाइज्ड फाइन-ट्यूनिंग और कठिन मामलों पर रीइन्फोर्समेंट लर्निंग को संयोजित करने वाले एक नवीन प्रशिक्षण पाइपलाइन के माध्यम से कई बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त करता है।

David Ma, Kaijing Ma, Shawn Guo, Yunfeng Shi, Enduo Zhao, Jiajun Shi, Zhaoxiang Zhang, Gavin Cheung, Jiaheng Liu, Zili W (…)2026-05-19
💻 computer science

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving

यह शोध पत्र CLAP को प्रस्तुत करता है, जो एक स्थान-जागरूक (location-aware) फ्रेमवर्क है जो सामान्य फ्रेमों पर प्रदर्शन से समझौता किए बिना, दुर्लभ, सुरक्षा-महत्वपूर्ण लॉन्ग-टेल ड्राइविंग परिदृश्यों में नियोजन त्रुटियों को महत्वपूर्ण रूप से कम करने के लिए फ्रोजन विजन-लैंग्वेज-एक्शन मॉडल्स के लेटेंट स्पेस में प्रति-रोडब्लॉक सॉफ्ट प्रॉम्प्ट्स को अनुकूलित करता है।

Ruiyang Zhu, Yuehan He, Boyuan Zheng, Zesen Zhao, Ahmad Chalhoub, Qingzhao Zhang, Z. Morley Mao2026-05-19
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

यह शोध पत्र LEAP को प्रस्तुत करता है, जो एक सीखने योग्य एंड-टू-एंड अनुकूली प्रूनिंग (adaptive pruning) विधि है जो बड़े भाषा मॉडलों में सुलभ अनस्ट्रक्चर्ड स्पैरसिटी लर्निंग (unstructured sparsity learning) को सक्षम करने के लिए प्रति-भार बर्नौली-वाया-गमबेल-सिग्मॉइड रिलैक्सेशन (per-weight Bernoulli-via-Gumbel-sigmoid relaxation) का उपयोग करता है, जो उच्च स्पैरसिटी स्तरों पर ज़ीरो-शॉट सटीकता में मौजूदा लेयर-वाइज़ बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi2026-05-19
💻 computer science

Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models

यह शोध पत्र "अटेंशन हाइजैकिंग" (Attention Hijacking) को प्रस्तुत करता है, जो एक नवीन प्रतिकूल हमला (adversarial attack) है जो आंतरिक अटेंशन वितरण को स्पष्ट रूप से एक निरंतर छवि-प्रधान पैटर्न की ओर निर्देशित करके विजन-लैंग्वेज मॉडल्स में रिस्पॉन्स मैनिपुलेशन की क्रॉस-क्वेरी ट्रांसफरेबिलिटी को बढ़ाता है, जिससे हेरफेर किए गए आउटपुट की विशिष्ट क्वेरी शब्दावली पर निर्भरता कम हो जाती है।

Zhiqiang Wang, Dongrui Liu, Yan Li, Zonghao Ying, Wei Xue, Wenhan Luo, Yike Guo2026-05-19
💬 NLP

Weak-to-Strong Elicitation via Mismatched Wrong Drafts

यह शोध पत्र प्रदर्शित करता है कि वर्तमान समस्या से मेल न खाने वाले एक छोटे, डोमेन-प्रशिक्षित मॉडल से गणितीय रूप से गलत ड्राफ्ट को एक मजबूत लर्नर के GRPO प्रशिक्षण संदर्भ में इंजेक्ट करना, मानक ऑन-पॉलिक फाइन-ट्यूनिंग और अन्य वेरिएंट्स की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे बिना SFT, रिवॉर्ड मॉडल या सिंथेसाइज्ड डेटा की आवश्यकता के, Mathstral-7B मॉडल के लिए MATH-500 पर 71.98% का एक नया स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त होता है।

Wei Deng2026-05-19
🤖 machine learning

Learning Higher-Order Structure from Incomplete Spatiotemporal Data: Multi-Scale Hypergraph Laplacians with Neural Refinement

यह शोध पत्र मल्टी-स्केल हाइपरग्राफ लैपलेसियन्स विद न्यूरल रिफाइनमेंट (MSHL) को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो मल्टी-स्केल हाइपरग्राफ के माध्यम से उच्च-क्रम समूह संबंधों की खोज करके और सुरक्षित, अनुकूली गैर-रेखीय सुधार लागू करके सेंसर नेटवर्क में संरचित लुप्त डेटा को प्रभावी ढंग से प्रतिस्थापित करता है, जिससे यह वास्तविक ट्रैफ़िक परिदृश्यों में पारंपरिक युग्मवार ग्राफ विधियों से बेहतर प्रदर्शन करता है।

Keshu Wu, Sixu Li, Zihao Li, Zhiwen Fan, Xiaopeng Li, Yang Zhou2026-05-19
💻 computer science

TClone: Low-Latency Forking of Live GUI Environments for Computer-Use Agents

TClone एक लो-लेटेंसी फोर्क करने योग्य वर्कस्पेस सिस्टम है जो कंप्यूटर-यूज़ एजेंट्स को कॉपी-ऑन-राइट मेमोरी और एसिंक्रोनस चेकपॉइंटिंग का उपयोग करके लाइव GUI एनवायरनमेंट्स को सुरक्षित रूप से स्नैपशॉट, ब्रांच और रोलबैक करने में सक्षम बनाता है, जिससे आइसोलेशन और स्टेट रिकवरी सुनिश्चित करते हुए टास्क लेटेंसी को काफी कम किया जा सके।

Yutong Huang, Vikranth Srivatsa, Alex Asch, Hansin Tushar Patwa, Yiying Zhang2026-05-19