🤖 AI

Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents

यह शोध पत्र Open-SWE-Traces को प्रस्तुत करता है, जो वास्तविक दुनिया के पुल रिक्वेस्ट (pull requests) से प्राप्त 207,489 सॉफ्टवेयर इंजीनियरिंग एजेंट प्रक्षेपवक्रों (trajectories) का एक बड़े पैमाने का, बहुभाषी डेटासेट है, जो विविध SWE-bench मूल्यांकनों पर अत्याधुनिक परिणाम प्राप्त करने में सक्षम उच्च-प्रदर्शन वाले, ओपन-सोर्स मॉडलों के डिस्टिलेशन (distillation) को सक्षम बनाता है।

Wasi Uddin Ahmad, Nikolai Ludwig, Somshubra Majumdar, Boris Ginsburg2026-06-16
🤖 machine learning

Mojo: A Promising Tool for Scalable Financial AI Efficiency

यह शोध पत्र Mojo को एक उच्च-प्रदर्शन, पायथन-अनुकूल सिस्टम लैंग्वेज के रूप में प्रस्तुत करता है जो बिट-एक्जैक्ट (bit-exact) नियत निष्पादन और एकीकृत मल्टी-आर्किटेक्चर परिनियोजन को सक्षम करके क्वांटिटेटिव फाइनेंस में पारंपरिक "टू-लैंग्वेज टैक्स" को समाप्त करता है, जिससे नियामक पुनरुत्पादकता सुनिश्चित करते हुए वित्तीय AI वर्कलोड्स में महत्वपूर्ण तेजी आती है।

Henry Han2026-06-16
🤖 AI

Auditing Reward Hackability in Code RL Training Environments

यह शोध पत्र कोड RL प्रशिक्षण वातावरणों की रिवॉर्ड हैकिंग के प्रति महत्वपूर्ण संवेदनशीलता को मात्रात्मक रूप से निर्धारित करता है, जो यह प्रकट करता है कि कमजोर टेस्ट सूट्स के कारण 28.5% तक कार्य गलत समाधानों को स्वीकार कर लेते हैं, और एक गोल्ड-सैनिटी गेटेड LLM जज प्रक्रिया प्रस्तावित करता है जो इन अधिकांश टूटे हुए कार्यों को सफलतापूर्वक सुदृढ़ करता है।

Shreshth Rajan2026-06-16
🤖 AI

Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games

माइंड-स्टूडियो (Mind-Studio) एक ऐसा फ्रेमवर्क है जो इंटरैक्शन ट्रेजेक्टरीज से निष्पादन योग्य (executable), pygame-शैली के वर्ल्ड मॉडल्स को संश्लेषित करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करता है, जो आंशिक रूप से दृश्यमान (partially observable) एटाारी (Atari) गेम्स में पिछले दृष्टिकोणों की तुलना में काफी बेहतर नेक्स्ट-स्टेट प्रेडिक्शन और ब्रांच-लेवल फिडेलिटी प्रदर्शित करता है।

Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai2026-06-16
💬 NLP

PVminerLLM2: Improving Structured Extraction of Patient Voice via Preference Optimization

PVminerLLM2 टोकन-स्तरीय स्थिरीकरण (token-level stabilization) और भ्रम-जागरूक युग्म निर्माण (confusion-aware pair construction) के साथ एक नवीन प्राथमिकता अनुकूलन ढांचे (preference optimization framework) को पेश करता है, जो रोगी-जनित पाठ से संरचित निष्कर्षण (structured extraction) की सटीकता में उल्लेखनीय सुधार करता है, और सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) एवं मौजूदा प्राथमिकता अनुकूलन बेसलाइन दोनों से बेहतर प्रदर्शन करता है।

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Elyas Irankhah, Sreeraj Ramachandran, Ashley (…)2026-06-16
🤖 machine learning

Phys-JEPA: Physics-Informed Latent World Models for Multivariate Time-Series Forecasting

Phys-JEPA एक भौतिकी-सूचित जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर पेश करता है जो केवल आउटपुट स्तर पर ही नहीं, बल्कि लेटेंट स्टेट ट्रांज़िशन के भीतर सीधे भौतिक निरंतरता (physical consistency) को लागू करता है, जिससे जेना क्लाइमेट, ट्रैफिक और इलेक्ट्रिसिटी जैसे वास्तविक दुनिया के डेटासेट पर मल्टीवेरिएट टाइम-सीरीज़ पूर्वानुमान की सटीकता और व्याख्यात्मकता में सुधार होता है।

Weizhi Nie, Weichao Liu, Honglin Guo, Yuting Su2026-06-16
💬 NLP

Long-Context Modeling via GSS-Transformer Hybrid Architecture with Learnable Mixing

यह शोध पत्र पैरेलल हाइब्रिड आर्किटेक्चर (PHA) का प्रस्ताव करता है, जो एक नवीन लॉन्ग-कॉन्टेक्स्ट मॉडलिंग फ्रेमवर्क है जो मौजूदा हाइब्रिड और प्योर अटेंशन बेसलाइन्स की तुलना में थ्रूपुट में उल्लेखनीय सुधार करने और मेमोरी उपयोग को कम करने के साथ-साथ ट्रांसफॉर्मर-स्तर की परप्लेक्सिटी प्राप्त करने के लिए एक सीखने योग्य मिक्सिंग मैकेनिज्म के साथ गेटेड स्टेट स्पेस, ग्रुपड क्वेरी अटेंशन और फीड-फॉरवर्ड नेटवर्क्स को समानांतर रूप से स्वतंत्र रूप से चलाता है।

Kuzey Torlak, Hüseyin Arda Arslan, Anıl Dervişoğlu, Beyza Nur Deniz, Onur Boyar2026-06-16
🤖 AI

RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation

यह शोधपत्र RecourseBench को प्रस्तुत करता है, जो एक मॉड्यूलर और संवादात्मक मूल्यांकन ढांचा है जो पाइपलाइन को पांच परतों में विभाजित करके, 28 अत्याधुनिक विधियों को एकीकृत करके, और एक स्वचालित चार-स्तरीय सत्यापन प्रणाली के माध्यम से विधि-स्तरीय पुनरुत्पादकता (reproducibility) को लागू करके एल्गोरिद्मिक रिकोर्स (algorithmic recourse) में पुनरुत्पादकता की कमी को संबोधित करता है।

Zahra Khotanlou, Hashir Ahmed, Chenghao Tan, Ahmed Abdelaal, Amir-Hossein Karimi2026-06-16
🤖 AI

Know Your Limits : On the Faithfulness of LLMs as Solvers and Autoformalizers in Legal Reasoning

यह शोध पत्र प्रकट करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स औपचारिक तर्क ढाँचों के माध्यम से कानूनी एंटेलमेंट कार्यों में उच्च सटीकता प्राप्त करते हैं, वहीं उनका प्रदर्शन अक्सर "स्कोप लॉन्ड्रिंग" जैसे व्यवस्थित विफलता मोडों के कारण अविश्वसनीय होता है, जहाँ मॉडल वास्तव में अंतर्निहित प्रतीकात्मक सॉल्वर को निष्पादित किए बिना तार्किक रूप से असंगत निष्कर्ष उत्पन्न करते हैं।

Olivia Peiyu Wang, Sanna Wong-Toropainen, Daneshvar Amrollahi, Ryan Bai, Tashvi Bansal, Arush Garg, Leilani H. Gilpin2026-06-16
🤖 AI

Thinking with Visual Grounding

यह शोध पत्र "विजुअली ग्राउंडेड थिंकिंग" (visually grounded thinking) का परिचय देता है, जो एक ऐसा ढांचा है जहाँ विजन-लैंग्वेज मॉडल प्राकृतिक भाषा के तर्क को स्पष्ट दृश्य ग्राउंडिंग (visual groundings) के साथ अंतर्निहित करते हैं, जो एक स्केलेबल सिंथेसिस पाइपलाइन और ग्राउंडिंग-अवेयर रिइन्फोर्समेंट लर्निंग के माध्यम से प्रशिक्षित होने पर, गिनती और स्थानिक तर्क कार्यों पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, जिससे छोटे मॉडल बहुत बड़े समकक्ष मॉडलों का मुकाबला करने में सक्षम होते हैं।

Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang2026-06-16