💬 NLP

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

यह शोध पत्र डीप डेंस एक्सप्लोरेशन (DDE) का प्रस्ताव करता है, जो DEEP-GRPO के रूप में स्थापित एक नवीन रणनीति है जो असफल प्रक्षेप पथों (trajectories) के भीतर "पिवट" अवस्थाओं की पहचान करके और उन्हें सघन रूप से पुन: नमूनाकरण (resampling) करके LLM सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि उच्च गुणवत्ता वाले समाधानों को कुशलतापूर्वक खोजा जा सके, जिससे यह गणितीय तर्क संबंधी बेंचमार्क पर मौजूदा GRPO और ट्री-आधारित विधियों से बेहतर प्रदर्शन करती है।

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu2026-06-15
💬 NLP

Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark

यह शोध पत्र 1.1 मिलियन से अधिक स्टेप्स के एक बड़े पैमाने के, अंतर-संगठनात्मक बेंचमार्क को जारी करके और एक पैराफ्रेज़-रोबस्ट (paraphrase-robust) डिटेक्टर पेश करके, बिहेवियर-ड्रिवन डेवलपमेंट (BDD) में डुप्लिकेट गेरकिन (Gherkin) स्टेप्स की रखरखाव लागतों को संबोधित करता है जो महत्वपूर्ण रूप से समाप्त करने योग्य अतिरेक (redundancy) की पहचान करने और उसे मापने के लिए सटीक, लेक्सिकल और सिमेंटिक विधियों को जोड़ता है।

Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal2026-06-15
💻 computer science

Indirect Computing Model with Indirect Formal Method

यह शोध पत्र एक अप्रत्यक्ष कंप्यूटिंग मॉडल और अप्रत्यक्ष औपचारिक पद्धति का प्रस्ताव करता है, जो बड़े और छोटे स्ट्रिंग्स दोनों के अनुकूल है, ताकि एक सहयोगात्मक बुद्धिमान कंप्यूटिंग प्रणाली के भीतर डेटा केंद्रों से ज्ञान केंद्रों तक क्लाउड कंप्यूटिंग को अनुकूलित किया जा सके, जिसे चीनी सूचना डेटा का उपयोग करते हुए एक प्रोटोटाइप डिज़ाइन के माध्यम से स्पष्ट किया गया है।

Xiaohui Zou2026-06-15
🤖 AI

Orchestra-o1: Omnimodal Agent Orchestration

यह शोध पत्र Orchestra-o1 को प्रस्तुत करता है, जो एक ओम्नीमोडल एजेंट ऑर्केस्ट्रेशन फ्रेमवर्क है जो एक एकीकृत ऑर्केस्ट्रेशन तंत्र और डिसीजन-अलाइन्ड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (DA-GRPO) के माध्यम से टेक्स्ट, इमेज, ऑडियो और वीडियो जैसे विविध इनपुट्स के बीच कुशल मल्टी-एजेंट सहयोग को सक्षम बनाता है, जिससे OmniGAIA बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu, Donghao Zhou, Zhihong Zhu, Zheng Lian, Xin Wang, P (…)2026-06-15
💻 computer science

Multimodal Speaker Identification in Classroom Environments

यह अध्ययन प्रदर्शित करता है कि LLM-व्युत्पन्न सिमेंटिक संदर्भ को ध्वनिक एम्बेडिंग के साथ एकीकृत करने से शोर वाले K-12 कक्षाओं में स्वचालित वक्ता पहचान में महत्वपूर्ण सुधार होता है, जिससे छात्र पहचान की सटीकता 39.0% से बढ़कर 50.3% हो जाती है और स्केलेबल, न्यायसंगत निर्देशात्मक फीडबैक सक्षम होता है।

Michael L. Chrzan, Meghavarshini Krishnaswamy, Robert Gibboni, Katie Wetstone, Wei Ai, Jing Liu2026-06-15
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

यह शोध पत्र वर्कबेंच (WorkBench) बेंचमार्क का इसके प्रारंभिक मूल्यांकन के दो वर्ष बाद पुनरावलोकन करता है, जो यह प्रदर्शित करता है कि क्लॉड ओपस 4.8 (Claude Opus 4.8) जैसे फ्रंटियर एजेंटों ने काफी उच्च कार्य पूर्णता दर (89% बनाम 43%) और नाटकीय रूप से कम हानिकारक त्रुटियां (2.5% बनाम 26%) प्राप्त कर ली हैं, जबकि यह भी दिखाता है कि क्षमता और सुरक्षा एक साथ सुधरते हैं, ओपन-वेट मॉडलों ने उच्च-प्रदर्शन पहुंच का लोकतंत्रीकरण किया है, और कुछ बुनियादी त्रुट के प्रकार जो अपूरणीय क्षति की ओर ले जाते हैं, अभी भी बने हुए हैं।

Olly Styles2026-06-15
💬 NLP

The Culture Funnel: You Can't Align What isn't in the Data

यह शोध पत्र तर्क देता है कि वर्तमान सांस्कृतिक संरेखण विफलताएं एक "सांस्कृतिक डेटा फनल" (cultural data funnel) से उत्पन्न होती हैं जहाँ भौगोलिक रूप से केंद्रित डेटा के कारण पोस्ट-ट्रेनिंग के दौरान स्पष्ट सांस्कृतिक संकेत कम हो जाते हैं, और यह प्रदर्शित करता है कि सांस्कृतिक रूप से टैग किए गए प्रशिक्षण पाइपलाइनों पर ध्यान केंद्रित करने से डाउनस्ट्रीम प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee2026-06-15
🤖 machine learning

SuperThoughts: Reasoning Tokens in Superposition

यह शोधपत्र SuperThoughts को प्रस्तुत करता है, जो एक ऐसी विधि है जो निरंतर चेन-ऑफ-थॉट (Chain-of-Thought) टोकन को सिंगल लेटेंट रिप्रेजेंटेशन (latent representations) में संकुचित करती है जिसे मल्टी-टोकन प्रेडिक्शन मॉड्यूल के माध्यम से डिकोड किया जाता है, ताकि जटिल गणित और रीजनिंग बेंचमार्क पर प्रतिस्पर्धी सटीकता बनाए रखते हुए रीजनिंग की लंबाई में 20-30% की कमी और इन्फरेंस थ्रूपुट में दोगुनी वृद्धि प्राप्त की जा सके।

Zheyang Xiong, Shivam Garg, Max Yu, Vaishnavi Shrivastava, Haoyu Zhao, Anastasios Kyrillidis, Dimitris Papailiopoulos2026-06-15
🤖 machine learning

Natively Unlearnable Large Language Models

यह शोध पत्र NULLs (Natively Unlearnable LLMs) को प्रस्तुत करता है, जो एक ऐसा मॉडल आर्किटेक्चर है जो साझा बैकबोन न्यूरॉन्स और विरल रूप से सक्रिय स्रोत-विशिष्ट सिंक्स (source-specific sinks) का उपयोग करता है ताकि संयुक्त शिक्षण और सामान्य भाषा क्षमताओं के लाभों को संरक्षित करते हुए व्यक्तिगत प्रशिक्षण स्रोतों के कुशल, सुदृढ़ और डेटा-मुक्त अनलर्निंग (unlearning) को सक्षम बनाया जा सके।

Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan2026-06-15
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

यह शोध पत्र Gefen को प्रस्तुत करता है, जो एक मेमोरी-कुशल ऑप्टिमाइज़र है जो ऑटोमैटिक सेकंड-मोमेंट शेयरिंग और लर्नड फर्स्ट-मोमेंट क्वांटाइजेशन के माध्यम से AdamW के मेमोरी फुटप्रिंट को लगभग 8 गुना कम कर देता है, जिससे समान प्रदर्शन बनाए रखते हुए बड़े बैच साइज और बेहतर थ्रूपुट सक्षम होता है।

Nadav Benedek, Tomer Koren, Ohad Fried2026-06-15