🤖 machine learning

Why Do Accumulated Transformations Extrapolate?

यह शोध पत्र यह प्रदर्शित करता है कि अटेंशन मैकेनिज्म में स्थिति-अनुक्रमित रोटेशन (position-indexed rotations) को संचित, टोकन-निर्भर ऑर्थोगोनल रूपांतरणों (जैसे कि हाउसहोल्डर रिफ्लेक्शन या SO(2) रोटेशन) से बदलने से स्वाभाविक रूप से लेंथ एक्सट्रपलेशन (length extrapolation) में सुधार होता है, क्योंकि यह एक परिमित मिश्रण विंडो (finite mixing window) बनाता है और इनकोहेरेंस (incoherence) के माध्यम से दूरस्थ टोकन को दबा देता है, हालांकि ALiBi जैसे स्पष्ट 'फार-मास कंट्रोल' तंत्र के बिना अत्यधिक लंबाई पर प्रदर्शन अंततः कम हो जाता है।

Mahesh Godavarti2026-06-25
🤖 AI

Diagnosing and Mitigating Compounding Failures in Agentic Persuasion via Taxonomic Strategy Retrieval

यह शोध पत्र टैक्सोनोमिक स्ट्रैटेजी RAG (TS-RAG) को प्रस्तुत करता है, जो एक नवीन रिट्रीवल फ्रेमवर्क है जो सिमेंटिक लीकेज को समाप्त करने के लिए तर्कसंगत संरचना को विषयगत सामग्री से अलग करता है, जिससे एजेंटिक पर्सुएशन में संचयी त्रुटियों को रोका जा जा सकता है और हल्के एजेंटों को श्रेष्ठ विरोधियों से बेहतर प्रदर्शन करने में सक्षम बनाया जा सकता है।

Pradyumna Narayana, Sana Ayromlou, Purvi Sehgal2026-06-25
🤖 machine learning

When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift

यह अध्ययन प्रदर्शित करता है कि जबकि मल्टीमॉडल सेंसर फ्यूजन मानक मूल्यांकन प्रोटोकॉल के तहत मवेशियों की मुद्रा वर्गीकरण में उच्च सटीकता प्राप्त करता है, यह टेम्पोरल डिस्ट्रीब्यूशन शिफ्ट और व्यक्तिगत पशुओं के बीच सामान्यीकरण करने में विफल रहता है, जो यह प्रकट करता है कि संदर्भ-विशिष्ट संकेतों पर निर्भरता और अपर्याप्त मजबूती परीक्षण वास्तविक दुनिया के परिनियोजन में महत्वपूर्ण प्रदर्शन गिरावट का कारण बन सकते हैं।

Leutrim Uka, Severino Pinto, Gundula Hoffmann, Marina M. -C. Höhne2026-06-25
🤖 machine learning

Uncertainty-aware reinforcement learning for chemical language models

यह शोध पत्र दो अनिश्चितता-जागरूक सुदृढीकरण शिक्षण (अनसर्टेन्टी-अवेयर रीइन्फोर्समेंट लर्निंग) ढांचों का प्रस्ताव और मूल्यांकन करता है जो रासायनिक भाषा मॉडलों के लिए अविश्वसनीय रासायनिक स्थान की खोज के जोखिमों को कम करते हैं, या तो अनिश्चितता को एक अनुकूलन उद्देश्य के रूप में मानकर या नीति अपडेट को नियंत्रित करके, जो अंततः काफी उच्च वास्तविक हिट दर के साथ अधिक सुदृढ़ आणविक डिजाइन प्राप्त करता है।

Borja Medina, Jon Paul Janet2026-06-25
🤖 machine learning

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

एक्स्ट्रा (ExTra) एक GRPO-संगत फ्रेमवर्क है जो विविध सही समाधानों के लिए नवीनता पुरस्कारों (novelty rewards) और आसान एवं कठिन रीजनिंग कार्यों पर मानक RLVR की सीमाओं को दूर करने के लिए एंट्रॉपी-निर्देशित प्रीफिक्स पुनर्जनन (entropy-guided prefix regeneration) को जोड़कर भाषा मॉडल सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है, जिससे सटीकता और इन्फरेंस-टाइम कवरेज में महत्वपूर्ण सुधार होता है।

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low2026-06-25
🤖 machine learning

Internal Data Repetition Destroys Language Models

यह शोध पत्र यह प्रदर्शित करता है कि चिनचिला-युग के स्केलिंग प्रतिमान (scaling paradigm) में, डेटा पुनरावृत्ति व्यवस्थित रूप से भाषा मॉडल के प्रदर्शन को नुकसान पहुँचाती है, क्योंकि यह एक मध्यवर्ती पुनरावृत्ति संख्या पर एक कंप्यूट-तुल्य हानि शिखर (compute-equivalent loss peak) उत्पन्न करती है जो मॉडल के आकार के साथ बढ़ता है, एक ऐसी घटना जिसे विश्लेषणात्मक रूप से स्मृति (memorization) और सामान्यीकरण (generalization) के बीच एक सांख्यिकीय समझौते के रूप में समझाया गया है।

Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo (…)2026-06-25
🤖 machine learning

Do Thinking Tokens Help with Safety?

यह शोध पत्र इस धारणा को चुनौती देता है कि रीजनिंग मॉडल्स में थिंकिंग टोकन्स वास्तविक सुरक्षा विचार-विमर्श को सक्षम करते हैं, बल्कि यह प्रकट करता है कि इनकार या अनुपालन के परिणाम दृश्यमान सोच शुरू होने से पहले ही काफी हद तक निर्धारित हो जाते हैं, जिसमें सोचने की प्रक्रिया अक्सर वास्तविक संशोधन के बजाय केवल प्रीफिक्स पूर्णता (prefix completion) के रूप में कार्य करती है।

Narutatsu Ri, Abhishek Panigrahi, Sanjeev Arora2026-06-25
🤖 AI

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

यह शोध पत्र युवियन वीएल (Yuvion VL) को प्रस्तुत करता है, जो कंटेंट और एआई सुरक्षा के लिए विशेष रूप से निर्मित मल्टीमॉडल फाउंडेशन मॉडल्स का एक परिवार है, जो वास्तविक दुनिया के मल्टीमॉडल जोखिमों की पहचान करने में उद्योग-अग्रणी मजबूती और प्रदर्शन प्राप्त करने के लिए एक एडवर्सरियल-अवेयर डेटा पाइपलाइन, एक तीन-चरणीय प्रशिक्षण रणनीति और एक नवीन कन्फ्यूज-देन-कॉन्ट्रास्ट फाइन-ट्यूनिंग फ्रेमवर्क का लाभ उठाता है।

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian (…)2026-06-25
🤖 machine learning

LLM-ACES: Closed-Loop Discovery of Dynamical Systems with LLM-Guided Adaptive Search

यह शोध पत्र LLM-ACES प्रस्तुत करता है, जो एक क्लोज्ड-लूप फ्रेमवर्क है जो अनुकूलन योग्य डेटा अधिग्रहण और प्रतीकात्मक परिकल्पना निर्माण को निर्देशित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो सीमित, शोर वाले डेटा से शासन करने वाले साधारण साधारण अवकल समीकरणों (ordinary differential equations) को सटीक रूप से और कुशलतापूर्वक पुनर्प्राप्त करने में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Nikhil Abhyankar, Sha Li, Sanchit Kabra, Naren Ramakrishnan, Yulia Gel, Chandan K. Reddy2026-06-25
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।

Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang (…)2026-06-25