🤖 machine learning

From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

यह शोध पत्र MetaFlow को प्रस्तुत करता है, जो एक दो-चरणीय प्रशिक्षण ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग को सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के साथ जोड़ता है ताकि बड़े भाषा मॉडलों को बिना किसी मैनुअल डिज़ाइन की आवश्यकता के विविध कार्यों के लिए मजबूत, पुन: प्रयोज्य और सामान्यीकरण योग्य ज़ीरो-शॉट वर्कफ़्लो उत्पन्न करने में सक्षम बनाया जा सके।

Gan Luo, Zihan Qin, Bin Dong, Wotao Yin2026-07-01
🤖 machine learning

Why Do Few-Step Text Latents Fail When Image Latents Work? Non-Commitment at Sharp Categorical Readouts

यह शोधपत्र यह प्रदर्शित करता है कि निरंतर टेक्स्ट लेटेंट्स (continuous text latents) पर नियतात्मक अल्प-चरणीय पीढ़ी (deterministic few-step generation) की विफलता, इमेज लेटेंट्स के विपरीत, स्मूथ मैप्स (smooth maps) की उस ज्यामितीय अक्षमता से उत्पन्न होती है जहाँ वे शार्प कैटेगोरिकल रीडआउट्स (sharp categorical readouts) से पहले डिस्क्रीट टोकन चॉइस को हल करने में असमर्थ होते हैं, जो एक ऐसी सीमा है जिसे डिकोडर शार्पनेस मेट्रिक्स द्वारा मापा गया है और यह सिद्ध किया गया है कि इसे दूर करने के लिए या तो ऑटोरेग्रेसिव कमिटमेंट (autoregressive commitment) या स्टोकेस्टिक री-इंजेक्शन (stochastic re-injection) की आवश्यकता होती है।

Zhongyao Wang2026-07-01
🤖 machine learning

Hierarchical Global Attention (HGA)

Hierarchical Global Attention (HGA) लंबे-संदर्भ वाले ट्रांसफॉर्मर्स के लिए एक ड्रॉप-इन, रिट्रेनिंग-मुक्त विधि है जो होस्ट स्टोरेज से टोकन के एक विरल उपसमुच्चय (sparse subset) को पुनः प्राप्त करने और उन पर ध्यान केंद्रित करने के लिए दो-स्तरीय रूटिंग तंत्र का उपयोग करके सीमित हार्डवेयर पर कुशल अनुमान (inference) सक्षम करती है, जिससे न्यूनतम GPU मेमोरी ओवरहेड के साथ लगभग सघन अटेंशन (dense attention) की गुणवत्ता प्राप्त होती है।

Woernle Frank, Fedosov Vladimir, Grinenko Artemiy2026-07-01
🤖 AI

What Drives Interactive Improvement from Feedback?

यह शोध पत्र विविध तर्क कार्यों (reasoning tasks) में एक नियंत्रित छात्र-शिक्षक मूल्यांकन ढांचे को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि बहु-चरण सुधार अक्सर फीडबैक उपयोगिता के बजाय अतिरिक्त गणना से उत्पन्न होते हैं, जो यह प्रकट करता है कि उच्च गुणवत्ता वाले बाहरी मार्गदर्शन पर प्रभावी ढंग से कार्य करने की छात्र की क्षमता ही वास्तविक संवादात्मक सुधार के लिए प्राथमिक बाधा है।

Bartłomiej Cupiał, Jan Łojek, Mikołaj Garstecki, Szymon Pobłocki, Alicja Ziarko, Piotr Miłoś2026-07-01
💬 NLP

A Single Rewrite Suffices: Empirical Lessons from Production Skill Description Optimization

यह शोधपत्र प्रदर्शित करता है कि केवल कुछ फॉल्स-पॉजिटिव और फॉल्स-नेगेटिव मामलों के मार्गदर्शन में, कौशल विवरणों (skill descriptions) का एक एकल LLM रीराइट, मैनुअल इंजीनियरिंग के समान रूटिंग सटीकता प्राप्त कर सकता है, जबकि प्रयास को नाटकीय रूप से कम करता है, हालांकि यह वास्तव में ओवरलैपिंग कौशल स्कोप के कारण होने वाले टकरावों को हल नहीं कर सकता है।

Yangqiaoyu Zhou, Mohammad Alqudah, Kwei-Herng Lai, Aaron Halfaker, Yingqi Xiong, Yaar Harari2026-07-01
⚡ electrical engineering

Detecting Audio Deepfakes on the Edge:Lightweight SSL-Based Detection in a Browser Plugin

यह शोध पत्र एक लाइटवेट, सेल्फ-सुपरवाइज्ड ऑन-डिवाइस ऑडियो डीपफेक डिटेक्शन मॉडल प्रस्तुत करता है जो एक ब्राउज़र प्लगइन में एकीकृत है, जो पत्रकारों और तथ्य-जांचकर्ताओं (फैक्ट-चेकर्स) को एक गोपनीयता-संरक्षित उपकरण प्रदान करता है जो सटीकता में AASIST बेसलाइन से 10% और इन्फरेंस स्पीड में 40% बेहतर प्रदर्शन करता है।

Octavian Pascu, Dan Oneata, Horia Cucu, Nicolas M. Muller2026-07-01
💻 computer science

Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

यह शोध पत्र अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन के विरुद्ध LLMs की रक्षा करने में एक मौलिक सुरक्षा-फिडेलिटी (security-fidelity) ट्रेडऑफ को उजागर करने के लिए SecFid बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि वर्तमान बचाव या तो सुरक्षा सुनिश्चित करने के लिए सौहार्दपूर्ण सामग्री को दबा देते हैं या इंजेक्शन को रोकने में विफल रहते हैं, जिससे यह सिद्ध होता है कि मजबूती के लिए केवल सुरक्षा मेट्रिक्स के बजाय संदर्भ-जागरूक तैनाती निर्णयों की आवश्यकता होती है।

Mitchell Hermon, Rahul Gupta, Weitong Ruan, Ekraam Sabir, Haohan Wang2026-07-01
🤖 machine learning

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

यह शोध पत्र "ग्रेडिएंट स्मूथिंग" (Gradient Smoothing) का परिचय देता है, जो एक गणनात्मक रूप से कुशल अनुकूलन ढांचा है जो मॉडल आर्किटेक्चर या प्रशिक्षण उद्देश्यों को संशोधित किए बिना, आर्किटेक्चरल ब्लॉक्स के बीच संरचनात्मक संबंधों का लाभ उठाते हुए, लेयर-वार अपडेट पर डेप्थ-वाइज स्मूथिंग लागू करके डीप न्यूरल नेटवर्क के प्रशिक्षण और सामान्यीकरण (generalization) में सुधार करता है।

Haoming Meng, Anton Sugolov, Vardan Papyan2026-07-01
🤖 AI

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

यह शोध पत्र BayesBench प्रस्तुत करता है, जो सिमुलेशन वातावरणों का एक समूह है जो यह मूल्यांकन करता है कि बड़े भाषा मॉडल (LLMs) बहु-चरण (multi-turn) बातचीत के दौरान तर्कसंगत बेयसियन विश्वास अपडेट (Bayesian belief updates) के कितने करीब अनुमान लगाते हैं, जिससे यह पता चलता है कि हालांकि स्केलिंग से लेटेंट इन्फरेंस (latent inference) में सुधार होता है, लेकिन यह सटीक डाउनस्ट्रीम भविष्यवाणियों में विश्वसनीय रूप से परिवर्तित नहीं होता है।

Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel (…)2026-07-01
💬 NLP

Test-Time Verification for Text-to-SQL via Outcome Reward Models

यह शोध पत्र GradeSQL प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो Text-to-SQL विश्वसनीयता को बढ़ाने के लिए सीखे गए सिमेंटिक स्कोरर्स के रूप में Outcome Reward Models (ORMs) का लाभ उठाता है, यह प्रदर्शित करते हुए कि ORM-आधारित सत्यापन BIRD और Spider बेंचमार्क पर पारंपरिक ह्यूरिस्टिक विधियों जैसे कि execution-based Best-of-N और Majority Voting की तुलना में काफी बेहतर प्रदर्शन करता है।

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommas (…)2026-07-01