💻 computer science

Toward Trustworthy Autonomous Science: A Two-Year Community Roadmap

यह शोध पत्र स्वायत्त विज्ञान (autonomous science) में तीव्र प्रगति और सत्यापन की बढ़ती चुनौती के बीच के महत्वपूर्ण तनाव को संबोधित करने के लिए AISLE समुदाय के रोडमैप को अपडेट करता है, जो एक दो-वर्षीय योजना प्रस्तावित करता है जो पृथक पहलों को जोड़ने के लिए एक जमीनी नेटवर्क को बढ़ावा देने के साथ-साथ विश्वास, सुरक्षा और शासन को प्रथम-श्रेणी के दर्जा प्रदान करती है।

Rafael Ferreira da Silva, Milad Abolhasani, Peter Beaucage, Laura Biven, Michael Bussmann, Kyle Chard, Ryan Coffee, Step (…)2026-07-15
💻 computer science

GaitSpan: Growing Humanoid Locomotion from Walking to Running

GaitSpan एक नवीन ढांचा है जो लय निर्माण (rhythm generation), स्ट्राइड शेपिंग (stride shaping) और अवशिष्ट अनुकूलन (residual adaptation) का लाभ उठाकर, बिना शून्य से पुन: सीखने की आवश्यकता के, एक पूर्व-प्रशिक्षित वॉकिंग पॉलिसी को विविध रूपात्मकताओं (morphologies) और भू-भागों में चलने, जॉगिंग करने और दौड़ने में सक्षम एक एकल, निरंतर-गति वाले लोकोमोशन कंट्रोलर में कुशलतापूर्वक विस्तारित करता है।

Kwan-Yee Lin, Zilin Wang, Janelle J. Liu, Stella X. Yu2026-07-15
💻 computer science

Connected by Construction: Learning Tractable Near-Tour Marginals for Traveling Salesman Problems

यह शोध पत्र C2TSP का प्रस्ताव करता है, जो एक एंड-टू-एंड अनसुपरवाइज्ड लर्निंग पाइपलाइन है जो सीधे तौर पर एक 'कनेक्टेड-बाय-कंस्ट्रक्शन रूटेड 1-ट्री गिब्स फैमिली' के माध्यम से ट्रैवलिंग सेल्समैन प्रॉब्लम के लिए व्याख्यात्मक हैमिल्टोनियन संरचनाओं को सीखता है, जो अवशिष्ट किनारा गड़बड़ी (residual edge perturbations) और प्रमाणन-निर्देशित तीक्ष्णता (certificate-guided sharpening) के माध्यम से संरचनात्मक जानकारी को संरक्षित करते हुए मजबूत टूर प्रदर्शन प्राप्त करता है।

Ke Sun, Xinyuan Zhang, Xinwu Qian2026-07-15
💻 computer science

From Reconstruction to Interpretation: Zero-Setup Multi-Phase Segmentation of X-ray Tomography Data

यह शोध पत्र एक शून्य-सेटअप (zero-setup) ढांचे को प्रस्तुत करता है जो सिंक्रोट्रॉन एक्स-रे टोमोग्राफी डेटा के तीव्र, स्वचालित और व्याख्या योग्य मल्टी-फेज सेगमेंटेशन को सक्षम करने के लिए एक सामग्री-अज्ञेय (material-agnostic) मास्क तैयारी रणनीति को एक पूर्व-प्रशिक्षित सिमेंटिक सेगमेंटेशन नेटवर्क के साथ जोड़ता है, जिसके लिए किसी मैनुअल इनपुट, पुनर्रशिक्षण या डेटासेट-विशिष्ट एनोटेशन की आवश्यकता नहीं होती है।

Pradyumna Elavarthi, Arun J. Bhattacharjee, Harrison Lisabeth, Anca Ralescu, Petrus H. Zwart, Dilworth Parkinson, Elizab (…)2026-07-15
💬 NLP

Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

यह अध्ययन प्रकट करता है कि मानव अर्थ संबंधी स्मृति पुनर्प्राप्ति (semantic memory retrieval), वर्तमान लार्ज लैंग्वेज मॉडल्स की तुलना में अधिक परिवर्तनशील और अन्वेषणात्मक खोज पैटर्न प्रदर्शित करती है, जैसा कि मौखिक प्रवाह कार्यों (verbal fluency tasks) में उच्च एंट्रॉपी, बड़े अर्थ संबंधी चरणों और व्यापक फैलाव से सिद्ध होता है, जिसे कोई भी टेम्परेचर ट्यूनिंग कॉन्फ़िगरेशन पूरी तरह से पुनरुत्पादित नहीं कर सका।

Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández2026-07-15
💻 computer science

A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

यह शोध पत्र यह मूल्यांकन करने के लिए एक मानकीकृत थ्रेशोल्ड एक्सीडेंस क्राइटेरिया (TEC) ढांचे को प्रस्तुत करता है कि क्या सीमांत भाषा मॉडल उच्च-परिणाम वाले CBRN हमलों की योजना बनाने में गैर-विशेषज्ञ क्षमताओं को भौतिक रूप से बढ़ाते हैं, और इसे एक बड़े पैमाने के अध्ययन पर लागू करता है जो यह प्रकट करता है कि हालांकि मॉडल-सहायता प्राप्त योजनाएं विशेषज्ञ निर्देशात्मक स्तर तक पहुंच सकती हैं, पुष्टि किया गया भौतिक उत्थान वर्तमान में रेडियोलॉजिकल डोमेन तक सीमित है।

Rahul Gupta, Abhinav Mohanty, Payal Motwani, Venkatesh Saligrama, Satyapriya Krishna, Connor Harris, Gary Anthony Ackerm (…)2026-07-15
📊 statistics

The Benjamini--Hochberg Procedure Can Fail to Control the FDR for Correlated Two-Sided Gaussian Tests

यह शोधपत्र यह प्रदर्शित करके एक लंबे समय से चले आ रहे अनुमान का खंडन करता है कि बेंजामिनी-होचबर्ग प्रक्रिया सहसंबद्ध द्वि-पक्षीय गाऊसी परीक्षणों के लिए अपने नाममात्र स्तर पर गलत खोज दर (फॉल्स डिस्कवरी रेट) को नियंत्रित करने में विफल रहती है, जो अंतराल अंकगणित (इंटरवल अरिथमेटिक) के माध्यम से कठोरता से सिद्ध किया गया है और लेखक द्वारा सत्यापित किया गया है।

Edgar Dobriban2026-07-15
💬 NLP

RCWT: Measuring Task-Budget Displacement from Coordination Content in LLM Calls

यह शोध पत्र राउंडटेबल कॉन्टेक्स्ट विंडो टेस्ट (RCWT) को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि निश्चित कॉन्टेक्स्ट बजट के तहत LLMs में प्रदर्शन में गिरावट मुख्य रूप से समन्वय सामग्री (coordination content) द्वारा कार्य-महत्वपूर्ण साक्ष्यों के विस्थापन के कारण होती है, न कि केवल समन्वय की मात्रा के कारण, जैसा कि इंटैक्ट-टास्क एब्लेशन्स (intact-task ablations) से प्रमाणित होता है जहाँ मॉडल उच्च समन्वय अनुपातों के साथ भी अपनी सटीकता बनाए रखते हैं।

Brenda Lelis, Rodrigo Cabral-Carvalho2026-07-15
💻 computer science

Rethinking the Evaluation of Harness Evolution for Agents

यह शोध पत्र समान बजट के तहत सरल टेस्ट-टाइम स्केलिंग के विरुद्ध निष्पक्ष रूप से तुलना करने पर यह प्रदर्शित करते हुए एलएलएम (LLM) एजेंटों में स्वचालित हार्नेस विकास (automatic harness evolution) के वर्तमान मूल्यांकन प्रोटोकॉल की आलोचना करता है कि हार्नेस विकास कोई निरंतर प्रदर्शन लाभ प्रदान नहीं करता है और सीमित सामान्यीकरण प्रदर्शित करता है।

Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Prad (…)2026-07-15
💬 NLP

Fin-Analyst at FinMMEval 2026 Task 3: A Live Hybrid Trading Agent with LLM Specialists and Rule-Based Signals

फिन-एनालिस्ट (Fin-Analyst), जिसमें टेस्ला के लिए आठ-विशेषज्ञों वाले एलएलएम (LLM) पाइपलाइन और बिटकॉइन के लिए एक नियम-आधारित सिग्नल सिस्टम वाला एक हाइब्रिड ट्रेडिंग एजेंट शामिल है, ने 13.51% रिटर्न के साथ फिनएमएमइवल (FinMMEval) 2026 टास्क 3 लीडरबोर्ड पर शीर्ष रैंकिंग हासिल की, जो मेमोरीलेस मॉडल्स और फिक्स्ड थ्रेशोल्ड्स की तुलना में इवेंट-ड्रिवन एलएलएम विश्लेषण की श्रेष्ठता को प्रदर्शित करता है और अल्पकालिक लाइव ट्रेडिंग मूल्यांकनों की अस्थिरता संवेदनशीलता को उजागर करता है।

Mohotarema Rashid, Lingzi Hong, Junhua Ding, K. S. M. Tozammel Hossain2026-07-15