🤖 AI

Test-Time Compute Games

यह शोध पत्र LLM-as-a-service बाजारों में सामाजिक अक्षमता की पहचान करता है जहाँ प्रदाता महंगी टेस्ट-टाइम कंप्यूट का अत्यधिक उपयोग करने के लिए प्रोत्साहित होते हैं, और मूल्य निर्धारण को सीमांत मूल्य (marginal value) के साथ संरेखित करने के लिए एक रिवर्स सेकंड-प्राइस ऑक्शन तंत्र का प्रस्ताव करता है, जिसे गणित और विज्ञान बेंचमार्क पर विभिन्न मॉडल परिवारों के माध्यम से प्रयोगों द्वारा सत्यापित किया गया है।

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez2026-05-11
🤖 AI

Supervised sparse auto-encoders for interpretable and compositional representations

यह शोधपत्र एक सुपरवाइज्ड स्पार्स ऑटो-एनकोडर फ्रेमवर्क प्रस्तुत करता है जो पारंपरिक L1L_1 दंडों की नॉन-स्मूथनेस (non-smoothness) को दूर करने और सीखे गए फीचर्स को मानवीय अर्थों के साथ संरेखित करने के लिए अनकन्स्ट्रेंड फीचर मॉडल्स का लाभ उठाता है, जो स्टेबल डिफ्यूजन 3.5 पर सफल कंपोजिशनल जनरलाइजेशन और फीचर-लेवल इमेज एडिटिंग का प्रदर्शन करता है।

Ouns El Harzli, Hugo Wallner, Yoonsoo Nam, Haixuan Xavier Tao2026-05-11
🤖 AI

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

यह शोध पत्र ESSAM को पेश करता है, जो एक मेमोरी-कुशल फुल पैरामीटर फाइन-ट्यूनिंग फ्रेमवर्क है जो इवोल्यूशन स्ट्रेटजीज (Evolution Strategies) को शार्पनेस-अवेयर मैक्सिमाइजेशन (Sharpness-Aware Maximization) के साथ जोड़ता है ताकि पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) विधियों जैसे कि PPO और GRPO की तुलना में GPU मेमोरी के उपयोग को काफी कम करते हुए LLMs पर प्रतिस्पर्धी गणितीय तर्क प्रदर्शन प्राप्त किया जा सके।

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye2026-05-11
📊 statistics

The Effect of Mini-Batch Noise on the Implicit Bias of Adam

यह शोध पत्र एक सैद्धांतिक ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि मिनी-बैच शोर (mini-batch noise) एडम (Adam) के मोमेंटम हाइपरपैरामीटर्स के निहित पूर्वाग्रह (implicit bias) को मौलिक रूप से बदल देता है, जिससे यह स्पष्ट होता है कि जबकि मानक (β1,0.999)(\beta_1, 0.999) विन्यास छोटे बैचों के लिए इष्टतम है, बड़े बैचों के लिए एंटी-रेगुलराइजेशन (anti-regularization) से बचने और सामान्यीकरण (generalization) में सुधार करने के लिए β1\beta_1 को β2\beta_2 के करीब समायोजित करने की आवश्यकता होती है।

Matias D. Cattaneo, Boris Shigida2026-05-11
🧬 biology

Latent-Space Causal Discovery from Indirect Neuroimaging Observations

यह शोध पत्र INCAMA को प्रस्तुत करता है, जो एक भौतिकी-जागरूक (physics-aware) ढांचा है जो विकृत न्यूरोइमेजिंग संकेतों से निर्देशित तंत्रिका कारण संरचनाओं (directed neural causal structures) को पुनर्प्राप्त करने के लिए लेटेंट-स्पेस इन्वर्जन को डिले-अवेयर माम्बा एनकोडर के साथ जोड़ता है, जो सिमुलेशन और वास्तविक दुनिया के fMRI डेटा दोनों में बेसलाइन्स की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Sangyoon Bae, Miruna Oprescu, David Keetae Park, Shinjae Yoo, Jiook Cha2026-05-11✓ Author reviewed
💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

यह शोध पत्र एक नवीन डायनेमिक क्लिपिंग तंत्र का प्रस्ताव देकर 'वेरिफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) में एंट्रॉपी कोलैप्स को संबोधित करता है, जो पॉलिसी एंट्रॉपी को सटीक रूप से नियंत्रित करने के लिए एक ग्रेडिएंट-प्रिजर्विंग परिप्रेक्ष्य का लाभ उठाता है, जिससे समयपूर्व अति-आत्मविश्वास को रोका जा सके और एलएलएम (LLM) तर्क प्रदर्शन को बढ़ाया जा सके।

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao2026-05-11
🤖 AI

WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning

यह शोध पत्र WebClipper प्रस्तुत करता है, जो एक ऐसा ढांचा है जो खोज प्रक्रियाओं को स्टेट ग्राफ के रूप में मॉडल करके वेब एजेंट की दक्षता को अनुकूलित करता है ताकि अनावश्यक चरणों को न्यूनतम-आवश्यक DAGs में छाँटा जा सके, जिससे टूल-कॉल राउंड में लगभग 20% की कमी आती है और सटीकता में सुधार होता है तथा प्रदर्शन और दक्षता को संतुलित करने के लिए एक नया F-AE मेट्रिक पेश किया जाता है।

Junjie Wang, Zequn Xie, Dan Yang, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, Yihan Jiao, Zhehao Tan, Jian Wang, Peng W (…)2026-05-11
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

यह शोध पत्र ScrapeGraphAI-100k को प्रस्तुत करता है, जो व्यावहारिक टेलीमेट्री से प्राप्त 93,695 स्कीमा-प्रतिबंधित निष्कर्षण घटनाओं का एक बड़े पैमाने का, वास्तविक दुनिया का डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को उन संरचित पीढ़ी कार्यों पर प्रशिक्षित करने और उनका बेंचमार्किंग करने में सक्षम बनाता है जहाँ पूर्व सिंथेटिक या केवल टेक्स्ट कॉर्पोरा अपर्याप्त थे।

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan2026-05-11
🤖 AI

Discovering Multiagent Learning Algorithms with Large Language Models

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) अपूर्ण-सूचना वाले खेलों (imperfect-information games) के लिए प्रतिस्पर्धी मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (Multi-Agent Reinforcement Learning) एल्गोरिदम की खोज को स्वचालित कर सकते हैं, और यह दर्शाता है कि इन जटिल, पर्यावरण-विशिष्ट निष्कर्षों को न्यूनतम एल्गोरिद्मिक मुख्य संरचनाओं (minimal algorithmic cores) में संकुचित करने से बेहतर सामान्यीकरण और कम संरचनात्मक जटिलता प्राप्त होती है।

Zun Li, John Schultz, Daniel Hennes, Marc Lanctot2026-05-11
🤖 AI

SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis

यह शोध पत्र SteelDefectX प्रस्तुत करता है, जो एक व्यापक विजन-लैंग्वेज डेटासेट और बेंचमार्क है जिसमें 7,778 स्टील सतह दोष छवियों के लिए बहु-रूप टेक्स्ट एनोटेशन शामिल हैं, जो औद्योगिक विजन-लैंग्वेज मॉडलों में सिमेंटिक अलाइनमेंट और सामान्यीकरण के व्यवस्थित मूल्यांकन को सक्षम बनाता है और संरचित गुणों तथा प्राकृतिक भाषा विवरणों के बीच के समझौतों (trade-offs) को प्रकट करता है।

Shuxian Zhao, Jie Gui, Baosheng Yu, Dacheng Tao2026-05-11