🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

यह शोध पत्र LlamaWeb प्रस्तुत करता है, जो llama.cpp के लिए एक WebGPU बैकएंड है जो स्टैटिक मेमोरी प्लानिंग, एक ट्यूनेबल कर्नेल लाइब्रेरी और टेम्पलेटेड GPU कर्नेल का उपयोग करके ब्राउज़रों में मेमोरी-कुशल, प्रदर्शन-पोर्टेबल और मल्टी-प्रिसिजन LLM इन्फरेंस प्राप्त करता है, जिसके परिणामस्वरूप विविध हार्डवेयर पर मौजूदा फ्रेमवर्क की तुलना में मेमोरी के उपयोग में उल्लेखनीय कमी और डिकोड थ्रूपुट में वृद्धि होती है।

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen2026-05-21
🤖 machine learning

SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction

यह शोध पत्र SAVER का प्रस्ताव करता है, जो एक चयनात्मक मल्टीमॉडल सूचना निष्कर्षण ढांचा (selective multimodal information extraction framework) है, जो यह निर्णय लेने के लिए कि कब और छवियों के किस उपसमुच्चय (subset) से परामर्श करना है, एक कॉन्फॉर्मल ग्राउंडेबिलिटी गेट (Conformal Groundability Gate) का उपयोग करता है, जिससे हमेशा चालू रहने वाले फ्यूजन तरीकों की तुलना में निष्कर्षण सटीकता में सुधार होता है और कंप्यूटिंग लागत एवं विलंबता (latency) में काफी कमी आती है।

Miaobo Hu, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao2026-05-21
🤖 machine learning

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

यह शोध पत्र एडेप्टिव ग्रुप पॉलिसी ऑप्टिमाइज़ेशन (AGPO) का प्रस्ताव करता है, जो एक क्रिटिक-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मानक PPO और GRPO विधियों की तुलना में गणित और STEM बेंचमार्क पर LLM तर्क प्रदर्शन को बेहतर बनाने के लिए समूह-स्तरीय सांख्यिकी का उपयोग करके क्लिपिंग बाउंड्स और डिकोडिंग तापमान को गतिशील रूप से समायोजित करता है।

Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao2026-05-21
📊 statistics

Everywhere Valid Bounds on False Discovery Proportions in Conformal Inference

यह शोध पत्र एक परिमित-नमूना (finite-sample), वितरण-मुक्त (distribution-free) ढांचे को प्रस्तुत करता है जो कॉन्फॉर्मल इन्फरेंस में सभी संभावित रिजेक्शन थ्रेशोल्ड के लिए फॉल्स डिस्कवरी प्रोपोर्शन (false discovery proportion) पर एक साथ, उच्च-संभाव्यता वाले ऊपरी बाउंड (upper bounds) स्थापित करता है, जिससे लचीले पोस्ट हॉक चयन को सक्षम बनाया जा सके और मौजूदा विधियों की तुलना में अधिक कड़े गारंटियाँ प्रदान की जा सकें।

Ziang Song, Ying Jin, Emmanuel J. Candès2026-05-21
🤖 machine learning

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

यह शोध पत्र डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड (Distribution-Aware Reward) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) उद्देश्य है जो निरंतर रैंक की संभाव्यता स्कोर (Continuous Ranked Probability Score) के साथ कई डिकोड किए गए नमूनों का मूल्यांकन करके, बड़े भाषा मॉडलों को प्रतिगमन कार्यों (regression tasks) के लिए कैलिब्रेटेड प्रेडिक्टिव वितरण उत्पन्न करने हेतु अनुकूलित करता है, जिससे पारंपरिक पॉइंट-एस्टीमेट प्रशिक्षण विधियों की तुलना में अनिश्चितता अनुमान, रैंकिंग प्रदर्शन और मजबूती में सुधार होता है।

Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter2026-05-21
🤖 machine learning

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

यह शोध पत्र एक नए मूल्यांकन प्रतिमान और "हैक-वेरिफिएबल टेक्स्टएरिना" (Hack-Verifiable TextArena) बेंचमार्क को प्रस्तुत करता है, जो भाषा मॉडलों द्वारा ऐसी कमजोरियों के शोषण को मापने के लिए नियत, स्वचालित और स्केलेबल माप को सक्षम करने हेतु वातावरण में सीधे पता लगाने योग्य रिवॉर्ड हैकिंग अवसरों को समाहित करता है।

Amit Roth, Ankur Samanta, Matan Halevy, Yoav Levine, Yonathan Efroni2026-05-21
🤖 machine learning

The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering

यह शोध पत्र VerifySteer प्रस्तुत करता है, जो पैराग्राफ सीमाओं पर छिपे हुए-अवस्था संकेतों (hidden-state signals) का पता लगाकर और उन्हें चुनिंदा रूप से निर्देशित करके चरण-वार सत्यापनकर्ता की कठोरता को नियंत्रित और बेहतर बनाने की एक विधि है, जिससे यह काफी कम कम्प्यूटेशनल लागत के साथ मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Yefan Zhou, Yilun Zhou, Austin Xu, Soroush Vosoughi, Shafiq Joty, Jiang Gui2026-05-21
📊 statistics

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

यह शोध पत्र एक एकल-बैच ढांचे का प्रस्ताव करके—जो क्रॉस-फिटेड प्रीकंडीशनिंग को वेरिएन्स-करेक्टेड इनवर्जन के साथ जोड़ता है—प्रीकंडीशन्ड लैंग्वेज मॉडल ऑप्टिमाइज़र में दो फाइनाइट-सैंपल बायस (ग्रेडिएंट-प्रीकंडीशनर कपलिंग और नॉनलीनियर इनवर्जन बायस) की पहचान और सुधार करता है, जिससे AdamW, Sophia और Shampoo जैसे मॉडलों में प्रीट्रेनिंग लॉस कम होता है और प्रदर्शन में सुधार होता है।

Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas (…)2026-05-21
🤖 machine learning

ShapeBench: A Scalable Benchmark and Diagnostic Suite for Standardized Evaluation in Aerodynamic Shape Optimization

यह शोध पत्र ShapeBench को प्रस्तुत करता है, जो एक ओपन-सोर्स, स्केलेबल बेंचमार्क और डायग्नोस्टिक सुइट है जिसमें 103 विविध एरोडायनामिक शेप ऑप्टिमाइज़ेशन कार्य और मानकीकृत बेसलाइन शामिल हैं ताकि शास्त्रीय और LLM-संचालित ऑप्टिमाइज़ेशन विधियों के निष्पक्ष, व्यवस्थित मूल्यांकन को सक्षम किया जा सके, जो समस्या वर्गों के बीच महत्वपूर्ण प्रदर्शन भिन्नता और अधिक सामान्य-उद्देश्य वाले दृष्टिकोणों की आवश्यकता को प्रकट करता है।

Shaghayegh Fazliani, Krissh Chawla, Jack Guo, Yiren Shen, Matthias Ihme, Madeleine Udell2026-05-21
💬 NLP

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

यह शोध पत्र चेतावनी देता है कि अवलोकन संबंधी डेटा (observational data) पर प्रशिक्षण के कारण LLM-सिम्युलेटेड प्रयोगों में "यूजर ड्रिफ्ट" (user drift) की समस्या होती है, जो कन्फाउंडिंग बायस (confounding bias) को जन्म देती है, और इस समस्या का पता लगाने के लिए नेगेटिव कंट्रोल आउटकम्स (negative control outcomes) का उपयोग करने तथा इसे कम करने के लिए परिष्कृत पर्सोना विनिर्देशों (refined persona specifications) का प्रस्ताव करता है।

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour2026-05-21