🤖 machine learning

Uncertainty-aware reinforcement learning for chemical language models

यह शोध पत्र दो अनिश्चितता-जागरूक सुदृढीकरण शिक्षण (अनसर्टेन्टी-अवेयर रीइन्फोर्समेंट लर्निंग) ढांचों का प्रस्ताव और मूल्यांकन करता है जो रासायनिक भाषा मॉडलों के लिए अविश्वसनीय रासायनिक स्थान की खोज के जोखिमों को कम करते हैं, या तो अनिश्चितता को एक अनुकूलन उद्देश्य के रूप में मानकर या नीति अपडेट को नियंत्रित करके, जो अंततः काफी उच्च वास्तविक हिट दर के साथ अधिक सुदृढ़ आणविक डिजाइन प्राप्त करता है।

Borja Medina, Jon Paul Janet2026-06-25
🤖 machine learning

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

एक्स्ट्रा (ExTra) एक GRPO-संगत फ्रेमवर्क है जो विविध सही समाधानों के लिए नवीनता पुरस्कारों (novelty rewards) और आसान एवं कठिन रीजनिंग कार्यों पर मानक RLVR की सीमाओं को दूर करने के लिए एंट्रॉपी-निर्देशित प्रीफिक्स पुनर्जनन (entropy-guided prefix regeneration) को जोड़कर भाषा मॉडल सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है, जिससे सटीकता और इन्फरेंस-टाइम कवरेज में महत्वपूर्ण सुधार होता है।

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low2026-06-25
🤖 machine learning

Internal Data Repetition Destroys Language Models

यह शोध पत्र यह प्रदर्शित करता है कि चिनचिला-युग के स्केलिंग प्रतिमान (scaling paradigm) में, डेटा पुनरावृत्ति व्यवस्थित रूप से भाषा मॉडल के प्रदर्शन को नुकसान पहुँचाती है, क्योंकि यह एक मध्यवर्ती पुनरावृत्ति संख्या पर एक कंप्यूट-तुल्य हानि शिखर (compute-equivalent loss peak) उत्पन्न करती है जो मॉडल के आकार के साथ बढ़ता है, एक ऐसी घटना जिसे विश्लेषणात्मक रूप से स्मृति (memorization) और सामान्यीकरण (generalization) के बीच एक सांख्यिकीय समझौते के रूप में समझाया गया है।

Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo (…)2026-06-25
🤖 machine learning

Do Thinking Tokens Help with Safety?

यह शोध पत्र इस धारणा को चुनौती देता है कि रीजनिंग मॉडल्स में थिंकिंग टोकन्स वास्तविक सुरक्षा विचार-विमर्श को सक्षम करते हैं, बल्कि यह प्रकट करता है कि इनकार या अनुपालन के परिणाम दृश्यमान सोच शुरू होने से पहले ही काफी हद तक निर्धारित हो जाते हैं, जिसमें सोचने की प्रक्रिया अक्सर वास्तविक संशोधन के बजाय केवल प्रीफिक्स पूर्णता (prefix completion) के रूप में कार्य करती है।

Narutatsu Ri, Abhishek Panigrahi, Sanjeev Arora2026-06-25
🤖 AI

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

यह शोध पत्र युवियन वीएल (Yuvion VL) को प्रस्तुत करता है, जो कंटेंट और एआई सुरक्षा के लिए विशेष रूप से निर्मित मल्टीमॉडल फाउंडेशन मॉडल्स का एक परिवार है, जो वास्तविक दुनिया के मल्टीमॉडल जोखिमों की पहचान करने में उद्योग-अग्रणी मजबूती और प्रदर्शन प्राप्त करने के लिए एक एडवर्सरियल-अवेयर डेटा पाइपलाइन, एक तीन-चरणीय प्रशिक्षण रणनीति और एक नवीन कन्फ्यूज-देन-कॉन्ट्रास्ट फाइन-ट्यूनिंग फ्रेमवर्क का लाभ उठाता है।

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian (…)2026-06-25
🤖 machine learning

LLM-ACES: Closed-Loop Discovery of Dynamical Systems with LLM-Guided Adaptive Search

यह शोध पत्र LLM-ACES प्रस्तुत करता है, जो एक क्लोज्ड-लूप फ्रेमवर्क है जो अनुकूलन योग्य डेटा अधिग्रहण और प्रतीकात्मक परिकल्पना निर्माण को निर्देशित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो सीमित, शोर वाले डेटा से शासन करने वाले साधारण साधारण अवकल समीकरणों (ordinary differential equations) को सटीक रूप से और कुशलतापूर्वक पुनर्प्राप्त करने में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Nikhil Abhyankar, Sha Li, Sanchit Kabra, Naren Ramakrishnan, Yulia Gel, Chandan K. Reddy2026-06-25
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।

Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang (…)2026-06-25
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

यह शोध पत्र इस बात की जांच करता है कि क्या विजन-लैंग्वेज मॉडल रीजनिंग टोकन काउंट को रिएक्शन टाइम के प्रॉक्सी के रूप में उपयोग करके मानव जैसे विजुअल सर्च व्यवहार प्रदर्शित करते हैं, जिसमें यह पाया गया है कि हालांकि मॉडल फ्लैट फीचर सर्च कॉस्ट और बढ़ते कंजंक्शन कॉस्ट जैसे प्रमुख मानवीय हस्ताक्षरों की नकल करते हैं, वे टारगेट-प्रेजेंट स्लोप्स, एन्यूमरेशन सटीकता और एडेप्टिव डेलिब्रेशन रणनीतियों में स्पष्ट संज्ञानात्मक विचलन भी प्रकट करते हैं।

Farahnaz Wick2026-06-25
📊 statistics

Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

यह शोध पत्र PACE का प्रस्ताव करता है, जो AdamW के लिए एक ऑप्टिमाइज़र रैपर है जो प्रशिक्षण को इटरैट-एवरेज्ड (iterate-averaged) लैंग्वेज मॉडल्स की त्रुटि को कम करने के लिए एक ऑप्टिमल-कंट्रोल समस्या के रूप में मानता है, जो सुपरवाइज्ड फाइन-ट्यूनिंग और प्रीट्रेनिंग कार्यों में सैद्धांतिक अभिसरण गारंटी (theoretical convergence guarantees) और अनुभवजन्य सुधार दोनों को प्रदर्शित करता है।

Kwok Chun Au, Adam Block2026-06-25
🤖 AI

Beyond Shapley: Efficient Computation of Asymmetric Shapley Values

यह शोध पत्र कॉज़ल ग्राफ्स (causal graphs) का लाभ उठाकर एसिमेट्रिक शापली वैल्यूज (Asymmetric Shapley Values) की गणना के लिए कुशल एल्गोरिदम प्रस्तुत करता है, जो यह प्रदर्शित करता है कि रूटेड डायरेक्टेड ट्रीज़ (rooted directed trees) के लिए सटीक गणना बहुपद समय (polynomial time) में संभव है और मानक शापली वैल्यू गणनाओं की #P-कठिनाई (#P-hardness) को दूर करने के लिए किसी भी अनिश्चित कॉज़ल DAGs के लिए एक समान सैंपलिंग-आधारित सन्निकटन विधि प्रस्तावित करता है।

Ezequiel Companeetz, Santiago Cifuentes, Sergio Abriola2026-06-25