🤖 AI

SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents

SkillCenter स्वायत्त AI एजेंटों के लिए 216,000 से अधिक संरचित कौशलों (skills) वाली एक विशाल, ओपन-सोर्स लाइब्रेरी पेश करता है, जिसमें एक कठोर पाइपलाइन शामिल है जो आउटपुट को सही, सुरक्षित और पता लगाने योग्य सुनिश्चित करने के लिए सहकर्मी-समीक्षित जर्नल्स और तकनीकी रिपॉजिटरी से स्रोत-आधारित कौशलों को सामुदायिक योगदान के साथ एकीकृत करती है।

Tianming Sha, Yue Zhao, Lichao Sun, Yushun Dong2026-07-09
💬 NLP

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

अगन (Agon) एक प्रतिस्पर्धी क्रॉस-मॉडल सुदृढीकरण लर्निंग (reinforcement learning) ढांचे को पेश करता है जहाँ दो मॉडल एक-दूसरे के विरुद्ध समस्याओं का मसौदा तैयार करने और उन्हें हल करने के माध्यम से परस्पर ग्रेडर के रूप में कार्य करते हैं, जो बिना प्रोसेस लेबल के श्रेष्ठ तर्क को अंतर्निहित रूप से पुरस्कृत करता है और जटिल तर्क कार्यों पर मानक सिंगल-मॉडल आरएल (RL) दृष्टिकोणों से काफी बेहतर प्रदर्शन करता है।

Vladislav Beliaev2026-07-09
🤖 AI

Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass

यह शोध पत्र "Jailbreak" को पेश करता है, जो एक LLM-सहायता प्राप्त दृष्टिकोण है जो पारंपरिक डेटाबेस ड्राइवरों को बायपास करते हुए स्टोरेज फाइलों को सीधे इन-मेमोरी कॉलमर बफ़र्स में पढ़ने और डिकोड करने के माध्यम से विश्लेषणात्मक वर्कलोड में 27 गुना तक प्रदर्शन सुधार प्राप्त करता है और डेटा लॉक-इन को तोड़ता है।

Victor Giannakouris, Immanuel Trummer2026-07-09
💬 NLP

Co-LMLM: Continuous-Query Limited Memory Language Models

यह शोध पत्र Co-LMLM को प्रस्तुत करता है, जो एक निरंतर-क्वेरी सीमित स्मृति भाषा मॉडल (continuous-query limited memory language model) है जो एक स्केलेबल एनोटेशन पाइपलाइन के माध्यम से एक लचीले वेक्टर-आधारित ज्ञान आधार (knowledge base) के लिए तथ्यात्मक ज्ञान को बाह्य रूप में प्रस्तुत करता है, और कई पैमानों पर पूर्ववर्ती LMLMs और वैनिला LLMs दोनों की तुलना में बेहतर परप्लेक्सिटी (perplexity) और तथ्यात्मक सटीकता प्राप्त करता है।

Yair Feldman, Linxi Zhao, Nathan Godey, Dongyoung Go, Yilun Hua, Kilian Q. Weinberger, Jennifer J. Sun, Yoav Artzi2026-07-09
🤖 AI

Empirical Computation: Prompting versus Programming

यह विजन पेपर "एम्पिरिकल कंप्यूटेशन" (अनुभवजन्य गणना) को एक नए प्रतिमान के रूप में प्रस्तावित करता है जहाँ लार्ज लैंग्वेज मॉडल्स पारंपरिक प्रोग्रामिंग के बजाय प्रॉम्प्टिंग के माध्यम से कम्प्यूटेशनल समस्याओं को हल करते हैं, और यह तर्क देता है कि इसकी अनूठी क्षमताओं और सीमाओं के लिए सॉफ्टवेयर इंजीनियरिंग समुदाय को शुद्धता और मौलिक सीमाओं का विश्लेषण करने के लिए नए मौलिक सिद्धांतों और तकनीकों को विकसित करने की आवश्यकता है।

Eric Tang, Jing Liu, Marcel Böhme2026-07-08
🤖 AI

Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?

यह शोध पत्र एक मल्टीमॉडल फ्रेमवर्क प्रस्तावित करता है जो अफ्रीकी पड़ोस में घरेलू संपत्ति की भविष्यवाणी करने के लिए उपग्रह इमेजरी को LLM-जनित और एजेंट-प्राप्त टेक्स्ट के साथ संलयित (fuse) करता है, यह प्रदर्शित करते हुए कि विजन और लैंग्वेज मोडैलिटीज का संयोजन भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार करता है और प्लेटोनिक रिप्रेजेंटेशन हाइपोथेसिस के अनुरूप आंशिक प्रतिनिधित्व संरेखण (representational alignment) को प्रकट करता है, साथ ही भविष्य के अनुसंधान में सहायता के लिए 60,000 क्लस्टर्स का एक बड़े पैमाने का डेटासेट भी जारी करता है।

Satiyabooshan Murugaboopathy, Connor T. Jerzak, Adel Daoud2026-07-08
💬 NLP

Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders

यह शोध पत्र यह प्रदर्शित करता है कि स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders) में स्पर्सिटी हाइपरपैरामीटर L0 एक स्वतंत्र पैरामीटर नहीं है, बल्कि एक महत्वपूर्ण सेटिंग है जिसे फीचर मिक्सिंग को रोकने और LLMs से मोनोसेमेंटिक (monosemantic), व्याख्या योग्य अवधारणाओं के निष्कर्षण को सुनिश्चित करने के लिए सही ढंग से ट्यून किया जाना चाहिए।

David Chanin, Adrià Garriga-Alonso2026-07-08
📊 statistics

Medix: Out-of-Distribution Detection from Unlabeled Wild Data via Robust Gradient Statistics

यह शोधपत्र मेडिक्स (Medix) का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो अनलेबल वाइल्ड डेटा से आउटलेयर्स की पहचान करने के लिए मीडियन-आधारित रोबस्ट ग्रेडिएंट सांख्यिकी का लाभ उठाता है, जिससे एक उच्च-प्रदर्शन वाले आउट-ऑफ-डिस्ट्रीब्यूशन क्लासिफायर को प्रशिक्षित करना सक्षम होता है जो ओपन-वर्ल्ड सेटिंग्स में मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Momin Abbas, Ali Falahati, Hossein Goli, Mohammad Mohammadi Amiri2026-07-08
🤖 AI

Base Models Know How to Reason, Thinking Models Learn When

यह शोध पत्र यह प्रकट करता है कि जहाँ बेस मॉडल्स में तर्क करने के लिए अंतर्निहित तंत्र पहले से ही मौजूद होते हैं, वहीं रिइन्फोर्समेंट लर्निंग (Reinforcement Learning) के माध्यम से प्रशिक्षित "थिंकिंग" मॉडल्स मुख्य रूप से इन पूर्व-विद्यमान क्षमताओं को व्यवस्थित करने के लिए ह्यूरिस्टिक्स (heuristics) सीखते हैं, जबकि SFT-डिस्टिलेशन (SFT-distillation) के माध्यम से प्रशिक्षित मॉडल पूरी तरह से नए तर्क तंत्र (reasoning mechanisms) प्राप्त करते हैं।

Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda2026-07-08
🤖 AI

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

यह शोध पत्र PROBE को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो LLM एजेंटों का मूल्यांकन करने के लिए सक्रियता (proactivity) को खोजने, पहचानने और अनिर्दिष्ट मुद्दों को हल करने में विभाजित करता है, जिससे यह पता चलता है कि GPT-5 और Claude Opus-4.1 जैसे अत्याधुनिक मॉडल भी उच्च स्वायत्त प्रदर्शन प्राप्त करने में संघर्ष करते हैं, जिनका सर्वोत्तम स्कोर केवल 40% है।

Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis2026-07-08