💬 NLP

Distributionally Robust Reinforcement Learning with Human Feedback

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने के लिए रिवॉर्ड-आधारित RLHF और रिवॉर्ड-फ्री DPO के डिस्ट्रीब्यूशनली रोबस्ट वेरिएंट्स पेश करता है, जो कन्वर्जेंस गारंटी के साथ मिनीबैच ग्रेडिएंट डिसेंट एल्गोरिदम का प्रस्ताव देते हैं जो मानक तरीकों की तुलना में आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करते हैं।

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic2026-06-30
🤖 AI

SPHERE: An Evaluation Card for Human-AI Systems

यह शोध पत्र SPHERE को प्रस्तुत करता है, जो मानव-एआई (human-AI) प्रणालियों के मूल्यांकन में पारदर्शिता और कठोरता को मानकीकृत करने और सुधारने के लिए डिज़ाइन किया गया एक पांच-आयामी मूल्यांकन कार्ड है, जिसे 39 प्रणालियों की समीक्षा और बेहतर मूल्यांकन प्रथाओं के लिए तीन सिफारिशों के माध्यम से प्रदर्शित किया गया है।

Qianou Ma, Dora Zhao, Xinran Zhao, Chenglei Si, Chenyang Yang, Ryan Louie, Ehud Reiter, Diyi Yang, Tongshuang Wu2026-06-30
🤖 AI

Integrating Counterfactual Simulations with Language Models for Explaining Multi-Agent Behaviour

यह शोध पत्र AXIS को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो काउंटरफैक्चुअल प्रॉम्प्ट्स के माध्यम से एनवायरनमेंट सिम्युलेटर्स से पूछताछ करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे मल्टी-एजेंट सिस्टम के लिए मानव-केंद्रित स्पष्टीकरण उत्पन्न होते हैं जो मौजूदा बेसलाइन्स की तुलना में कथित शुद्धता और लक्ष्य भविष्यवाणी सटीकता में महत्वपूर्ण सुधार करते हैं।

Bálint Gyevnár, Christopher G. Lucas, Stefano V. Albrecht, Shay B. Cohen2026-06-30
🤖 machine learning

Physics-Informed Distillation of Diffusion Models for PDE-Constrained Generation

यह शोध पत्र फिजिक्स-इन्फॉर्म्ड डिस्टिलेशन ऑफ डिफ्यूजन मॉडल्स (PIDDM) का प्रस्ताव करता है, जो एक पोस्ट-हॉक डिस्टिलेशन दृष्टिकोण है जो डिफ्यूजन प्रक्रिया के बजाय स्वयं डिस्टिलेशन चरण के दौरान PDE बाधाओं को लागू करता है, जिससे जेन्स गैप (Jensen's Gap) की सीमा को पार करते हुए बेहतर PDE संतुष्टि और कम कम्प्यूटेशनल ओवरहेड के साथ सिंगल-स्टेप जनरेशन प्राप्त किया जा सके।

Yi Zhang, Peng Wang, Difan Zou2026-06-30
💻 computer science

Multimodal Representation Alignment for Cross-modal Information Retrieval

यह शोध पत्र क्रॉस-मोडल रिट्रीवल के लिए ज्यामितीय संबंधों और संरेखण रणनीतियों की अनुभवजन्य जांच करता है, जिसमें यह पाया गया है कि कोसाइन समानता अन्य मेट्रिक्स से बेहतर प्रदर्शन करती है और विभिन्न मॉडलों में छवि और टेक्स्ट प्रतिनिधित्व को संरेखित करने के लिए एक कस्टम कंट्रास्टिव लॉस, MSE से श्रेष्ठ है।

Fan Xu, Luis A. Leiva2026-06-30
💻 computer science

Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action

यह शोध पत्र सॉफ्टवेयर इंजीनियरिंग में लार्ज लैंग्वेज मॉडल्स के लिए टेस्ट-टाइम रीजनिंग तकनीकों का सर्वेक्षण करता है, जो यह प्रदर्शित करता है कि संरचना और निष्पादन फीडबैक जैसे कोड-विशिष्ट संकेतों का लाभ उठाना जटिल कार्यों पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और कोड-केंद्रित रीजनिंग के लिए भविष्य की अनुसंधान दिशाओं को रेखांकित करता है।

Saurabh Pujar, Ira Ceka, Irene Manotas, Gail Kaiser, Baishakhi Ray, Shyam Ramji2026-06-30
💻 computer science

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo एक नया बेंचमार्क है जो स्टार्ड्यू वैली (Stardew Valley) गेम पर आधारित है, जो 1,000 क्यूरेटेड कार्यों के माध्यम से जटिल उत्पादन-जीवित सिमुलेशन (production-living simulations) में ओपन-एंडेड एजेंटिक मल्टीमॉडल LLMs का मूल्यांकन करता है, जिससे यह पता चलता है कि GPT-4.1 जैसे अत्याधुनिक मॉडल भी विज़ुअल समझ, तर्क और लो-लेवल मैनिपुलेशन में काफी संघर्ष करते हैं, और केवल 12.7% सफलता दर प्राप्त करते हैं।

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An2026-06-30
📊 statistics

Beyond Correlation: Learning Supervised, Sample-Distinct, and Eigenimage-Interpretable Representations

यह शोध पत्र सुपरवाइज्ड और अनसुपरवाइज्ड डाइमेंशनलिटी रिडक्शन के लिए एक नवीन फ्रेमवर्क प्रस्तावित करता है जो सैंपल-डिस्टिंक्ट और आइगेनइमेज-इंटरप्रिटेबल रिप्रेजेंटेशन उत्पन्न करने के लिए तीन नए इंडिपेंडेंस क्राइटेरिया का उपयोग करता है, जो MNIST और जेंडर फेस डेटासेट्स पर PCA, t-SNE, LDA और VAE जैसे स्थापित बेसलाइन्स की तुलना में कंट्रास्ट, क्लासिफिकेशन एक्यूरेसी और इंटरप्रिटेबिलिटी में महत्वपूर्ण सुधार प्राप्त करता है।

Mojtaba Moattari2026-06-30
🤖 machine learning

LLM Serving Optimization with Variable Prefill and Decode Lengths

यह शोध पत्र विषम अनुरोध लंबाई (heterogeneous request lengths) के साथ निश्चित KV-कैश बाधाओं (fixed KV-cache constraints) के तहत ऑफलाइन LLM सर्विंग शेड्यूलिंग की NP-हार्ड समस्या को संबोधित करने के लिए सॉर्टेड-F (Sorted-F) एल्गोरिदम का प्रस्ताव देता है, जो एक स्थिर-कारक सन्निकटन गारंटी (constant-factor approximation guarantee) प्राप्त करता है और मानक बेसलाइन की तुलना में एंड-टू-एंड विलंबता (end-to-end latency) को काफी कम करता है।

Meixuan Wang, Yinyu Ye, Zijie Zhou2026-06-30
💻 computer science

TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

यह शोध पत्र TAR का प्रस्ताव करता है, जो एक टेम्पोरल एंकर तंत्र को पेश करके वीडियो टेम्पोरल ग्राउंडिंग को उन्नत करता है ताकि प्रगतिशील, विजुअल-ग्राउंडेड रीजनिंग को लागू किया जा सके और एक बूटस्ट्रैपिंग प्रतिमान (पैराडाइम) को उच्च-गुणवत्ता वाला प्रशिक्षण डेटा स्वायत्त रूप से उत्पन्न करने के लिए उपयोग किया जा सके, जिससे कंप्यूटेशनल रूप से महंगे बाहरी मॉडलों पर निर्भर किए बिना मतिभ्रम (हैलुसिनेशन) को कम करते हुए अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Chaohong Guo, Xun Mo, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long2026-06-30