🤖 machine learning

SuperThoughts: Reasoning Tokens in Superposition

यह शोधपत्र SuperThoughts को प्रस्तुत करता है, जो एक ऐसी विधि है जो निरंतर चेन-ऑफ-थॉट (Chain-of-Thought) टोकन को सिंगल लेटेंट रिप्रेजेंटेशन (latent representations) में संकुचित करती है जिसे मल्टी-टोकन प्रेडिक्शन मॉड्यूल के माध्यम से डिकोड किया जाता है, ताकि जटिल गणित और रीजनिंग बेंचमार्क पर प्रतिस्पर्धी सटीकता बनाए रखते हुए रीजनिंग की लंबाई में 20-30% की कमी और इन्फरेंस थ्रूपुट में दोगुनी वृद्धि प्राप्त की जा सके।

Zheyang Xiong, Shivam Garg, Max Yu, Vaishnavi Shrivastava, Haoyu Zhao, Anastasios Kyrillidis, Dimitris Papailiopoulos2026-06-15
🤖 machine learning

Muonp^p: Muon with Fractional Spectral Powers

यह शोध पत्र Muonp^p को प्रस्तुत करता है, जो एक नवीन ऑप्टिमाइज़र है जो ग्रेडिएंट के सिंगुलर मानों (singular values) पर भिन्नात्मक स्पेक्ट्रल शक्तियों (fractional spectral powers) को लागू करके Muon और ग्रेडिएंट डिसेंट के बीच इंटरपोलेशन करता है, इन अपडेट्स को अनुमानित करने के लिए कुशल द्वै चर पुनरावृत्तियों (bivariate recurrences) का उपयोग करता है और मूल्यवान सिंगुलर स्पेक्ट्रम जानकारी को संरक्षित करते हुए बिलियन-स्केल मॉडलों की फाइनट्यूनिंग में बेहतर प्रदर्शन प्रदर्शित करता है।

Yihe Dong, Will Sawin2026-06-15
🤖 AI

Mirage Probes: How Vision Models Fake Visual Understanding

यह शोध पत्र "मिराज प्रोब्स" (Mirage Probes) को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि विजन-लैंग्वेज मॉडल दो अलग-अलग प्रकार के विजुअल मतिभ्रम (visual hallucination)—टेक्स्टुअल बायस (textual biases) और स्प्यूरियस इमेजेस (spurious images)—प्रदर्शित करते हैं, जिन्हें उनके आंतरिक एक्टिवेशन पैटर्न द्वारा अलग किया जा सकता है, जिससे यह स्पष्ट होता है कि प्रभावी शमन के लिए केवल टेक्स्ट वितरण को साफ करने के बजाय प्रतिनिधित्व-स्तर (representational-level) के हस्तक्षेप की आवश्यकता है।

Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao, Raz Lapid, Amit LeVi, Allen G. Roush, Ravid Shwartz-Ziv, Hod Lipson2026-06-15
🤖 machine learning

Natively Unlearnable Large Language Models

यह शोध पत्र NULLs (Natively Unlearnable LLMs) को प्रस्तुत करता है, जो एक ऐसा मॉडल आर्किटेक्चर है जो साझा बैकबोन न्यूरॉन्स और विरल रूप से सक्रिय स्रोत-विशिष्ट सिंक्स (source-specific sinks) का उपयोग करता है ताकि संयुक्त शिक्षण और सामान्य भाषा क्षमताओं के लाभों को संरक्षित करते हुए व्यक्तिगत प्रशिक्षण स्रोतों के कुशल, सुदृढ़ और डेटा-मुक्त अनलर्निंग (unlearning) को सक्षम बनाया जा सके।

Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan2026-06-15
💻 computer science

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

PhysVLA एक हल्का, प्लग-एंड-प्ले इन्फरेंस-टाइम फ्रेमवर्क पेश करता है जो भौतिक सिद्धांतों को लागू करने के लिए एक चरण-जागरूक परिमित-अवस्था मशीन (phase-aware finite-state machine) और एक चयनात्मक यूलर-लैग्रेंज गेट (selective Euler-Lagrange gate) को एकीकृत करके रोबोटिक हेरफेर के लिए फ्रोजन विजन-लैंग्वेज-एक्शन (VLA) मॉडल को बढ़ाता है, जिससे बिना मॉडल पुनप्रशिक्षण के सिमुलेशन और वास्तविक हार्डवेयर दोनों में सफलता दर, स्थिरता और प्रक्षेपवक्र दक्षता में उल्लेखनीय सुधार होता है।

Namai Chandra, Shriram Damodaran, Lin Wang2026-06-15
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

यह शोध पत्र Gefen को प्रस्तुत करता है, जो एक मेमोरी-कुशल ऑप्टिमाइज़र है जो ऑटोमैटिक सेकंड-मोमेंट शेयरिंग और लर्नड फर्स्ट-मोमेंट क्वांटाइजेशन के माध्यम से AdamW के मेमोरी फुटप्रिंट को लगभग 8 गुना कम कर देता है, जिससे समान प्रदर्शन बनाए रखते हुए बड़े बैच साइज और बेहतर थ्रूपुट सक्षम होता है।

Nadav Benedek, Tomer Koren, Ohad Fried2026-06-15
🤖 machine learning

Smoothing Dark Areas in Molecular Latent Diffusion

यह शोध पत्र TopVAE को प्रस्तुत करता है, जो एक टोपोलॉजी-अनुकूलित वेरिएशनल ऑटोएन्कोडर है जो प्रशिक्षण के दौरान संरचनात्मक बाधाओं को आंतरिक रूप से समाहित करके आणविक लेटेंट स्पेस में "डार्क एरियाज" को समाप्त करता है, जिससे टेस्ट-टाइम केमिकल करेक्शन की आवश्यकता के बिना लेटेंट डिफ्यूजन के माध्यम से सुदृढ़, वैध 3D मॉलिक्यूलर जनरेशन सक्षम होता है।

Xi Wang, Jiahan Li, Yuxuan Xia, Yingcheng Wu, Shaoyi Zheng, Shengjie Wang2026-06-15
📊 statistics

Adaptive Nucleus Truncation for Long-Form Reasoning

यह शोध पत्र एडेप्टिव न्यूक्लियस ट्रंकेशन सैंपलिंग (ANTS) प्रस्तुत करता है, जो एक एंट्रॉपी-कंडीशन्ड तंत्र है जो विविध कार्यों और जनरेशन बजटों में लॉन्ग-फॉर्म रीजनिंग मॉडल्स को स्थिर करने और उनके प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए टोकन ट्रंकेशन थ्रेशोल्ड्स को गतिशील रूप से समायोजित करता है।

Ousmane Amadou Dia2026-06-15
🤖 AI

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

यह शोध पत्र DeCompBench प्रस्तुत करता है, जो डीकंपोज़िशन हमलों (decomposition attacks) के विरुद्ध LLM-आधारित एजेंटों की सुरक्षा का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि जबकि एजेंट अखंड हानिकारक कार्यों को प्रभावी ढंग से अस्वीकार करते हैं, वे अक्सर तब दुर्भावनापूर्ण इरादों का पता लगाने और उन्हें रोकने में विफल रहते हैं जब उन कार्यों को व्यक्तिगत रूप से निर्दोष उप-कार्यों में विभाजित किया जाता है।

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav2026-06-15