🤖 machine learning

Reinforcing Human Behavior Simulation via Verbal Feedback

यह शोध पत्र DITTO प्रस्तुत करता है, जो मानव व्यवहार को बेहतर ढंग से सिम्युलेट करने के लिए मौखिक फीडबैक के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से प्रशिक्षित एक मॉडल है, साथ ही SOUL बेंचमार्क सुइट भी प्रस्तुत करता है, जो बेस मॉडलों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है और कई मानव-समान सिमुलेशन कार्यों पर GPT-5.4 से आगे निकल जाता है।

Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang (…)2026-05-21
⚡ electrical engineering

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA एक बड़े पैमाने का, इमेज-ग्राउंडेड बेंचमार्क है जिसमें 12 डेटासेट और पांच क्लिनिकल डोमेन के 3D ब्रेन MRI वॉल्यूम से व्युत्पन्न लगभग 57,000 प्रश्न-उत्तर जोड़े शामिल हैं, जिसे सख्त इमेज-ग्राउंडिंग प्रोटोकॉल और विशेषज्ञ सत्यापन के माध्यम से टेक्स्ट-ओनली शॉर्टकट को समाप्त करते हुए 3D मेडिकल विजुअल रीजनिंग का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Mohammad H. Abbasi (Stanford University), Favour Nerrise (Stanford University), Shaurnav Ghosh (Stanford University), Ri (…)2026-05-21
💻 computer science

Pseudo-Formalization for Automatic Proof Verification

यह शोध पत्र 'स्यूडो-फॉर्मलाइजेशन' (Pseudo-Formalization) प्रस्तुत करता है, जो प्राकृतिक भाषा की लचीलेपन और औपचारिक मॉड्यूलैरिटी (formal modularity) का संयोजन करने वाला एक हाइब्रिड प्रूफ़ फॉर्मेट है, और एक संबंधित 'ब्लॉक वेरिफिकेशन' (Block Verification) एल्गोरिदम भी प्रस्तुत करता है जो ओलंपियाड और अनुसंधान-स्तर के बेंचमार्क में गणितीय प्रमाणों को सटीक रूप से सत्यापित करने में मौजूदा 'LLM-as-judge' बेसलाइनों की तुलना में काफी बेहतर प्रदर्शन करता है।

Slim Barkallah, Luke Bailey, Kaiyue Wen, Mohammed Abouzaid, Tengyu Ma2026-05-21
🤖 machine learning

OpenSeisML: Open Large-Scale Real Seismic and well-log Dataset for Generative AI

यह शोध पत्र OpenSeisML को प्रस्तुत करता है, जो UK नेशनल डेटा रिपॉजिटरी से वास्तविक भूकंपीय (seismic) और वेल-लॉग डेटासेट्स का एक क्यूरेटेड संग्रह है, जिसमें समय-से-गहराई रूपांतरण (time-to-depth conversion) के लिए एक स्वचालित पाइपलाइन शामिल है, ताकि सार्वजनिक डेटा की कमी को दूर किया जा सके और भूकंपीय व्युत्क्रमण (seismic inversion) तथा अनिश्चितता मात्रा निर्धारण (uncertainty quantification) के लिए जनरेटिव एआई मॉडल के प्रशिक्षण को सक्षम बनाया जा सके।

Ipsita Bhar, Huseyin Tuna Erdinc, Thales Souza, Charles Jones, Felix J. Herrmann2026-05-21
📊 statistics

Sample Complexity of Transfer Learning: An Optimal Transport Approach

यह शोध पत्र सैद्धांतिक रूप से यह प्रदर्शित करता है कि एक इष्टतम परिवहन ढांचे (optimal transport framework) का लाभ उठाते हुए, ट्रांसफर लर्निंग उच्च-आयामी सेटिंग्स (d>3d > 3) में प्रत्यक्ष शिक्षण की तुलना में बेहतर नमूना दक्षता (sample efficiency) प्राप्त करती है, जो विशेष रूप से जटिल, गैर-सुचारू मॉडलों वाले कार्यों में लाभकारी है, जिसे इमेज क्लासिफिकेशन प्रयोगों के माध्यम से संख्यात्मक रूप से मान्य किया गया है।

Haoyang Cao, Xin Guo, Wenpin Tang, Guan Wang2026-05-21
📊 statistics

Latent Process Generator Matching

यह शोध पत्र लेटेंट प्रोसेस जनरेटर मैचिंग (Latent Process Generator Matching) प्रस्तुत करता है, जो एक सामान्य ढांचा है जो प्रेक्षित जनरेटिव अवस्थाओं को सुलभ मार्कोव प्रक्रियाओं के नियतात्मक प्रक्षेपों (deterministic projections) के रूप में मॉडल करता है, जिससे जनरेटर मैचिंग को स्थिर लेटेंट वेरिएबल्स से समय-निर्भर लेटेंट कंडिशनल प्रक्रियाओं तक विस्तारित किया जाता है और यह सुनिश्चित किया जाता है कि सीखा गया जनरेटर लक्षित मार्जिनल वितरणों से मेल खाता है।

Lukas Billera, Hedwig Nora Nordlinder, Ben Murrell2026-05-21
📊 statistics

Spectral bandits for smooth graph functions with applications in recommender systems

यह शोध पत्र स्मूथ ग्राफ फंक्शन्स के लिए स्पेक्ट्रल बैंडिट्स की अवधारणा प्रस्तुत करता है, जिसमें दो कुशल एल्गोरिदम का प्रस्ताव दिया गया है जो संचयी रिग्रेट (cumulative regret) को कम करने के लिए एक छोटे प्रभावी आयाम (effective dimension) का लाभ उठाते हैं, जैसे कि कंटेंट-आधारित अनुशंसा (content-based recommendation) जैसी ऑनलाइन लर्निंग समस्याएं, जहाँ वस्तुओं की रेटिंग ग्राफ पर उनके पड़ोसियों के समान होती है।

Tomáš Kocák, Michal Valko, Rémi Munos, Branislav Kveton, Shipra Agrawal2026-05-21
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

यह शोध पत्र बड़े भाषा मॉडलों के लिए एक नवीन पोस्ट-ट्रेनिंग पद्धति प्रस्तुत करता है जो एक फ्रोजन SFT संदर्भ नीति और एक प्रशिक्षण योग्य नीति के लॉजिट्स (logits) का औसत निकालकर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) को बेहतर बनाती है, जिससे KL रेगुलराइजेशन या क्रिटिक की आवश्यकता समाप्त हो जाती है और प्रभावी रूप से RL की तर्क क्षमताओं को SFT की फॉर्मेटिंग स्थिरता के साथ जोड़ा जाता है।

Xingwei Gan, Ying Zhu2026-05-21
📊 statistics

Group-Aware Matrix Estimation and Latent Subspace Recovery

यह शोध पत्र ग्रुप-अवेयर मैट्रिक्स एस्टिमेशन (GAME) प्रस्तुत करता है, जो एक उत्तल (convex) एस्टिमेटर है जो विषम मैट्रिक्स पूर्णता समस्याओं में उपसमूह-विशिष्ट लेटेंट संरचनाओं को पुनः प्राप्त करने के लिए ओवरलैपिंग न्यूक्लियर-नॉर्म दंडों का उपयोग करता है, जो विशेष रूप से संरचित मिसिंगनेस और विशिष्ट लो-रैंक ग्रुप वेरिएशन्स वाले परिदृश्यों में मानक विधियों की तुलना में बेहतर पुनर्निर्माण सटीकता और सबस्पेस फिडेलिटी प्रदर्शित करता है।

Hamza Golubovic, Matthew Shen, Genevera I. Allen, Tarek M. Zikry2026-05-21
💬 NLP

Multi-agent Collaboration with State Management

यह शोधपत्र STORM को प्रस्तुत करता है, जो एक स्टेट-ओरिएंटेड (state-oriented) प्रबंधन ढांचा है जो कोडिंग बेंचमार्क पर पारंपरिक वर्कस्पेस आइसोलेशन बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हुए और साझा कोडबेस के सुसंगत दृश्यों को सुनिश्चित करते हुए, राइट टाइम (write time) पर कोड संघर्षों का पता लगाने और उन्हें हल करने के लिए मल्टी-एजेंट इंटरैक्शन को मध्यस्थता प्रदान करता है।

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong2026-05-21