🤖 AI

Empirical Computation: Prompting versus Programming

यह विजन पेपर "एम्पिरिकल कंप्यूटेशन" (अनुभवजन्य गणना) को एक नए प्रतिमान के रूप में प्रस्तावित करता है जहाँ लार्ज लैंग्वेज मॉडल्स पारंपरिक प्रोग्रामिंग के बजाय प्रॉम्प्टिंग के माध्यम से कम्प्यूटेशनल समस्याओं को हल करते हैं, और यह तर्क देता है कि इसकी अनूठी क्षमताओं और सीमाओं के लिए सॉफ्टवेयर इंजीनियरिंग समुदाय को शुद्धता और मौलिक सीमाओं का विश्लेषण करने के लिए नए मौलिक सिद्धांतों और तकनीकों को विकसित करने की आवश्यकता है।

Eric Tang, Jing Liu, Marcel Böhme2026-07-08
🤖 AI

Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?

यह शोध पत्र एक मल्टीमॉडल फ्रेमवर्क प्रस्तावित करता है जो अफ्रीकी पड़ोस में घरेलू संपत्ति की भविष्यवाणी करने के लिए उपग्रह इमेजरी को LLM-जनित और एजेंट-प्राप्त टेक्स्ट के साथ संलयित (fuse) करता है, यह प्रदर्शित करते हुए कि विजन और लैंग्वेज मोडैलिटीज का संयोजन भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार करता है और प्लेटोनिक रिप्रेजेंटेशन हाइपोथेसिस के अनुरूप आंशिक प्रतिनिधित्व संरेखण (representational alignment) को प्रकट करता है, साथ ही भविष्य के अनुसंधान में सहायता के लिए 60,000 क्लस्टर्स का एक बड़े पैमाने का डेटासेट भी जारी करता है।

Satiyabooshan Murugaboopathy, Connor T. Jerzak, Adel Daoud2026-07-08
💬 NLP

Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders

यह शोध पत्र यह प्रदर्शित करता है कि स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders) में स्पर्सिटी हाइपरपैरामीटर L0 एक स्वतंत्र पैरामीटर नहीं है, बल्कि एक महत्वपूर्ण सेटिंग है जिसे फीचर मिक्सिंग को रोकने और LLMs से मोनोसेमेंटिक (monosemantic), व्याख्या योग्य अवधारणाओं के निष्कर्षण को सुनिश्चित करने के लिए सही ढंग से ट्यून किया जाना चाहिए।

David Chanin, Adrià Garriga-Alonso2026-07-08
📊 statistics

Medix: Out-of-Distribution Detection from Unlabeled Wild Data via Robust Gradient Statistics

यह शोधपत्र मेडिक्स (Medix) का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो अनलेबल वाइल्ड डेटा से आउटलेयर्स की पहचान करने के लिए मीडियन-आधारित रोबस्ट ग्रेडिएंट सांख्यिकी का लाभ उठाता है, जिससे एक उच्च-प्रदर्शन वाले आउट-ऑफ-डिस्ट्रीब्यूशन क्लासिफायर को प्रशिक्षित करना सक्षम होता है जो ओपन-वर्ल्ड सेटिंग्स में मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Momin Abbas, Ali Falahati, Hossein Goli, Mohammad Mohammadi Amiri2026-07-08
🤖 AI

Base Models Know How to Reason, Thinking Models Learn When

यह शोध पत्र यह प्रकट करता है कि जहाँ बेस मॉडल्स में तर्क करने के लिए अंतर्निहित तंत्र पहले से ही मौजूद होते हैं, वहीं रिइन्फोर्समेंट लर्निंग (Reinforcement Learning) के माध्यम से प्रशिक्षित "थिंकिंग" मॉडल्स मुख्य रूप से इन पूर्व-विद्यमान क्षमताओं को व्यवस्थित करने के लिए ह्यूरिस्टिक्स (heuristics) सीखते हैं, जबकि SFT-डिस्टिलेशन (SFT-distillation) के माध्यम से प्रशिक्षित मॉडल पूरी तरह से नए तर्क तंत्र (reasoning mechanisms) प्राप्त करते हैं।

Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda2026-07-08
🤖 AI

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

यह शोध पत्र PROBE को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो LLM एजेंटों का मूल्यांकन करने के लिए सक्रियता (proactivity) को खोजने, पहचानने और अनिर्दिष्ट मुद्दों को हल करने में विभाजित करता है, जिससे यह पता चलता है कि GPT-5 और Claude Opus-4.1 जैसे अत्याधुनिक मॉडल भी उच्च स्वायत्त प्रदर्शन प्राप्त करने में संघर्ष करते हैं, जिनका सर्वोत्तम स्कोर केवल 40% है।

Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis2026-07-08
🔬 materials science

VASP Agent: An Agentic Framework for Autonomous First-principles Calculations

यह शोध पत्र VASP Agent को प्रस्तुत करता है, जो एक कोडिंग-एजेंट फ्रेमवर्क है जो डोमेन कौशल, नियतात्मक उपकरणों (deterministic tools) और वैज्ञानिक सुरक्षा घेरों (scientific guardrails) को एकीकृत करता है ताकि मौजूदा LLM-आधारित वर्कफ़्लो की तुलना में बेहतर पैरामीटर सटीकता और त्रुटि सुधार के साथ जटिल, बहु-चरणीय प्रथम-सिद्धांत (first-principles) VASP गणनाओं को स्वायत्त रूप से निष्पादित किया जा सके।

Zeyu Xia, Jinzhe Ma, Congjie Zheng, Zhongyao Wang, Shufei Zhang, Yuqiang Li, Hang Su, P. Hu, Changshui Zhang, Xingao Gon (…)2026-07-08
🤖 machine learning

KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

KernelEvolve एक एजेंटिक फ्रेमवर्क है जो विविध डीप लर्निंग रिकमेंडेशन मॉडल्स के लिए विभिन्न हेट्रोजेनियस AI एक्सीलरेटरों पर उच्च-प्रदर्शन वाले कर्नेल के जनरेशन और ऑप्टिमाइज़ेशन को स्वचालित करता है, जो मौजूदा बेसलाइन्स की तुलना में पर्याप्त प्रदर्शन लाभ प्रदान करते हुए और शुद्धता सुनिश्चित करते हुए विकास के समय को काफी कम कर देता है।

Gang Liao, Hongsen Qin, Ying Wang, Alicia Golden, Michael Kuchnik, Yavuz Yetim, Jia Jiunn Ang, Chunli Fu, Yihan He, Samu (…)2026-07-08
🤖 AI

Implementing Metric Temporal Answer Set Programming

यह शोध पत्र मेट्रिक आंसर सेट प्रोग्रामिंग के लिए एक स्केलेबल कम्प्यूटेशनल दृष्टिकोण प्रस्तुत करता है जो मात्रात्मक बाधाओं को बाहरी रूप से संभालने के लिए डिफरेंस कंस्ट्रेंट्स (difference constraints) का लाभ उठाकर टेम्पोरल रीजनिंग को टाइम ग्रैनुलैरिटी (time granularity) से अलग करता है, जिससे फाइन-ग्रेन्ड टाइमिंग से जुड़ी ग्राउंडिंग बॉटलनेक (grounding bottleneck) की समस्या दूर हो जाती है।

Arvid Becker, Pedro Cabalar, Martin Diéguez, Susana Hahn, Javier Romero, Torsten Schaub2026-07-08
🤖 AI

StepShield: When, Not Whether to Intervene on Rogue Agents

StepShield एक नया बेंचमार्क और अर्ली इंटरवेंशन रेट (EIR) मेट्रिक पेश करता है ताकि यह उजागर किया जा सके कि जबकि मौजूदा पैटर्न-आधारित मॉनिटर्स उच्च रिकॉल प्राप्त करते हैं, वे समयपूर्व अलर्ट के "फोरेंसिक्स ट्रैप" के कारण वास्तविक समय में हस्तक्षेप करने में विफल रहते हैं, जो यह सिद्ध करता है कि वर्तमान विधियाँ उच्च रिकॉल, कम फाल्स पॉजिटिव और रोगी एजेंटों के समय पर पता लगाने को एक साथ सुनिश्चित नहीं कर सकती हैं।

Gloria Felicia, Zitha Sasindran, Jinfeng He, Michael Eniolade, Hemant Kumar, Milan Hussain Angati2026-07-08