💻 computer science

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

यह शोध पत्र यह प्रदर्शित करता है कि रिट्रीवल (retrieval), मल्टी-एविडेंस सिंथेसिस (multi-evidence synthesis) और रीजनिंग कार्यों को कवर करने वाली एक सावधानीपूर्वक क्यूरेट की गई, डेटा-केंद्रित रेसिपी, जो एक न्यूनतम आउटकम-आधारित GRPO सेटअप के साथ संयुक्त है, जटिल रिवॉर्ड इंजीनियरिंग पर निर्भर हुए बिना, लार्ज लैंग्वेज मॉडल्स में लॉन्ग-कॉन्टेक्स्ट रीजनिंग और एजेंटिक क्षमताओं को महत्वपूर्ण रूप से बढ़ाती है।

Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao2026-06-19
💻 computer science

ScholarSum: Student-Teacher Abstractive Summarization via Knowledge Graph Reasoning and Reflective Refinement

ScholarSum एक पदानुक्रमित परावर्तक ग्राफ-आधारित ढांचा (hierarchical reflective graph-based framework) है जो वैश्विक सुसंगतता के लिए ज्ञान ग्राफ तर्क (knowledge graph reasoning) और तथ्यात्मक निरंतरता के लिए पुनरावृत्ति-आधारित साक्ष्य शोधन (iterative evidence-based refinement) का लाभ उठाते हुए, प्रवाहपूर्ण और तथ्यात्मक रूप से विश्वसनीय वैज्ञानिक सारांश उत्पन्न करने के लिए छात्र-शिक्षक लेखन प्रक्रिया का अनुकरण करता है।

Bohou Zhang, Xiaoyu Tao, Mingyue Cheng, Huijie Liu, Qi Liu2026-06-19
💻 computer science

Aligning Implied Statements for Implicit Hate Speech Generalizability with Context-Bounded Semi-hard Negative Mining

यह शोध पत्र ImpSH का प्रस्ताव करता है, जो एक ट्रिपलेट-आधारित ढांचा है जो मानक सुपरवाइज्ड कंट्रास्टिव लर्निंग की तुलना में निहित घृणास्पद भाषण (इम्प्लिसिट हेट स्पीच) का पता लगाने की क्रॉस-डोमेन सामान्यीकरण क्षमता और स्थिरता में सुधार करने के लिए कॉन्टेक्स्ट-बाउंडेड सेमी-हार्ड नेगेटिव माइनिंग का उपयोग करके पोस्ट को उनके निहित कथनों के साथ संरेखित करता है।

Wicaksono Leksono Muhamad, Yunita Sari2026-06-19
💻 computer science

Approximate Structured Diffusion for Sequence Labelling

यह शोध पत्र एक नवीन दृष्टिकोण प्रस्तावित करता है जो शोर वाले लेबल अनुक्रमों (noisy label sequences) पर आधारित एक न्यूरल कंडीशनल रैंडम फील्ड (neural Conditional Random Field) को प्रशिक्षित करने के लिए डिफ्यूजन मॉडल्स का लाभ उठाता है, जिससे दीर्घ-रेंज निर्भरताओं (long-range dependencies) को कैप्चर किया जा सके और अनुमानित निष्कर्ष (approximate inference) के माध्यम से POS-टैगिंग में 16.5% की त्रुटि कमी प्राप्त की जा सके।

Nicolas Floquet, Joseph Le Roux, Nadi Tomeh2026-06-19
💻 computer science

SAGE: Stochastic Prompt Optimization via Agent-Guided Exploration

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक स्टोकेस्टिक प्रॉम्प्ट ऑप्टिमाइज़ेशन फ्रेमवर्क है जो ओपन-एंडेड टास्क-ओरिएंटेड डायलॉग सिस्टम को प्रभावी ढंग से सुधारने के लिए मल्टी-एजेंट एक्सप्लोरेशन और डायग्नोस्टिक कोड निष्पादन का लाभ उठाता है, जो निरंतर, एजेंट-निर्देशित ए/बी टेस्टिंग के माध्यम से उपयोगकर्ता प्रतिधारण (यूज़र रिटेंशन) में सांख्यिकीय रूप से सुदृढ़ लाभ प्रदर्शित करता है।

Ziyi Zhu, Luka Smyth, Saki Shinoda, Jinghong Chen2026-06-19
💻 computer science

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

यह शोध पत्र REVES का प्रस्ताव करता है, जो एक दो-चरणीय पुनरावृत्ति ढांचा (two-stage iterative framework) है जो सफल रिकवरी प्रक्षेपवक्रों (trajectories) से मध्यवर्ती "नियर-मिस" (near-miss) चरणों को विच्छेदित संशोधन और सत्यापन प्रॉम्प्ट्स में परिवर्तित करके प्रशिक्षण को संवर्धित करता है, जिससे कुशल ऑफ-पॉलिसी लर्निंग सक्षम होती है जो कोडिंग, गणितीय और बाधा-संतोष (constraint-satisfaction) कार्यों में मानक मल्टी-टर्न आरएल (RL) और विकासवादी खोज (evolutionary search) विधियों से काफी बेहतर प्रदर्शन करती है।

Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingy (…)2026-06-19
💬 NLP

ESBMC-GraphPLC: Formal Verification of Graphical PLCopen XML Ladder Diagram Programs Using SMT-Based Model Checking

यह शोध पत्र ESBMC-GraphPLC प्रस्तुत करता है, जो एक औपचारिक सत्यापन उपकरण (formal verification tool) है जो ग्राफ-आधारित रंंग लॉजिक (rung logic) को SMT-आधारित मॉडल चेकिंग के लिए एक वैध GOTO मध्यवर्ती प्रतिनिधित्व (intermediate representation) में परिवर्तित करने हेतु एक DFS-आधारित रिज़ॉल्वर को लागू करके ग्राफिकल PLCopen XML लैडर डायग्राम्स को संभालने में मौजूद अंतर को हल करता है, जिससे मौजूदा टेक्स्टुअल फॉर्मेट सपोर्ट को प्रभावित किए बिना CONTROLLINO और OpenPLC Editor जैसे एडिटर्स से प्रोग्रामों का सही सत्यापन सक्षम होता है।

Pierre Dantas, Lucas Cordeiro, Waldir Junior2026-06-19
💻 computer science

Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

यह शोध पत्र डिकपल्ड सर्च ग्राउंडिंग (DSG) का परिचय देता है, जो एक वेंडर-अज्ञेय (vendor-agnostic) आर्किटेक्चर है जो रूटिंग और कैशिंग पर सूक्ष्म नियंत्रण प्रदान करने के लिए सर्च रिट्रीवल को रीजनिंग मॉडल्स से अलग करता है, जिससे विविध LLM वर्कलोड्स में मूल-सटीकता (near-native accuracy) प्राप्त करते हुए लागत और विलंबता (latency) में भारी कमी आती है।

Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das2026-06-19
💻 computer science

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPO एक नवीन ग्राफ-आधारित सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो तर्क संबंधी रोलआउट्स (reasoning rollouts) को निर्देशित अचक्रीय ग्राफ़ (directed acyclic graphs) के रूप में प्रदर्शित करता है ताकि अर्थपूर्ण रूप से समान पथों को मिलाया जा सके और शाखाओं के बीच सूचना साझा की जा सके, जिससे अनावश्यक अन्वेषण और एडवांटेज-एस्टिमेशन वेरिएंस (advantage-estimation variance) को कम किया जा सके और तर्क संबंधी बेंचमार्क पर मौजूदा चेन- और ट्री-आधारित विधियों से बेहतर प्रदर्शन किया जा सके।

Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun2026-06-19
💻 computer science

G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment

यह शोध पत्र G-IdiomAlign प्रस्तुत करता है, जो एक ग्लॉस-पिवोटेड (gloss-pivoted) बेंचमार्क है जो क्रॉस-लिंगुअल मुहावरा संरेखण (idiom alignment) को बेहतर बनाने के लिए अंग्रेजी परिभाषाओं का लाभ उठाता है और यह प्रकट करता है कि हालांकि स्पष्ट अर्थ संबंधी पिवोट्स शाब्दिक अनुवाद पूर्वाग्रहों को कम करने में मदद करते हैं, फिर भी सटीक मुहावरेदार अनुवाद उत्पन्न करने में महत्वपूर्ण चुनौतियां बनी हुई हैं, विशेष रूप से कम-संसाधन वाली भाषाओं के लिए।

Fengying Ye, Yanming Sun, Runzhe Zhan, Zheqi Zhang, Lidia S. Chao, Derek F. Wong2026-06-19