💬 NLP

Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark

यह शोध पत्र सामान्य अभ्यास (जनरल प्रैक्टिस) के लिए एक नवीन क्षमता-आधारित बेंचमार्क, GPBench को प्रस्तुत करता है, जो दस अत्याधुनिक लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और यह निष्कर्ष निकालता है कि वर्तमान मॉडल अभी स्वायत्त नैदानिक तैनाती के लिए उपयुक्त नहीं हैं, जिसके लिए निरंतर मानवीय पर्यवेक्षण और आगे के अनुकूलन की आवश्यकता है।

Zheqing Li, Yiying Yang, Jiping Lang, Wenhao Jiang, Junrong Chen, Yuhang Zhao, Shuang Li, Dingqian Wang, Zhu Lin, Xuanna (…)2026-05-22
🤖 AI

PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving

यह शोध पत्र PHYSICS को प्रस्तुत करता है, जो 1,297 विशेषज्ञ-एनोटेटेड विश्वविद्यालय-स्तरीय भौतिकी समस्याओं का एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि विभिन्न अनुकूलन रणनीतियों के बावजूद, o3-mini जैसे सबसे उन्नत फाउंडेशन मॉडल भी उच्च-स्तरीय वैज्ञानिक तर्क करने में संघर्ष करते हैं और केवल 59.9% सटीकता प्राप्त करते हैं।

Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan2026-05-22
💻 computer science

When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

यह शोध पत्र कंस्ट्रेंड डिकोडिंग अटैक (CDA) को प्रस्तुत करता है, जो एक नवीन जेलब्रेक तकनीक है जो संरचित आउटपुट स्कीमा के माध्यम से दुर्भावनापूर्ण पेलोड को इंजेक्ट करके सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) को बायपास करने के लिए लार्ज लैंग्वेज मॉडल्स में ग्रामर-गाइडेड डिकोडिंग का लाभ उठाता है, जिससे अत्याधुनिक मॉडल्स और गार्डरेल्स के विरुद्ध लगभग पूर्ण सफलता दर प्राप्त होती है।

Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia (…)2026-05-22
🧬 biology

Self-orthogonalizing attractor neural networks emerging from the free energy principle

यह शोधपत्र प्रदर्शित करता है कि स्व-ऑर्थोगोनलाइज़िंग (self-orthogonalizing) अट्रैक्टर न्यूरल नेटवर्क रैंडम डायनेमिकल सिस्टम्स पर लागू फ्री एनर्जी प्रिंसिपल से स्वाभाविक रूप से उभरते हैं, जो स्पष्ट रूप से आरोपित लर्निंग रूल्स की आवश्यकता के बिना, प्रेडिक्टिव एक्यूरेसी और मॉडल कॉम्प्लेक्सिटी को अनुकूलित करने वाले जैविक रूप से प्रशंसनीय, मल्टी-लेवल बेयसियन एक्टिव इन्फरेंस डायनेमिक्स प्रदान करते हैं।

Tamas Spisak, Karl Friston2026-05-22
💬 NLP

STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking

यह शोधपत्र स्ट्रक्टसेंस (StructSense) को प्रस्तुत करता है, जो एक मॉड्यूलर, कार्य-अज्ञेय (task-agnostic), ओपन-सोर्स फ्रेमवर्क है जो विविध वैज्ञानिक डोमेन में सुदृढ़, सामान्यीकरण योग्य संरचित सूचना निष्कर्षण प्राप्त करने के लिए ऑन्टोलॉजी-निर्देशित प्रतीकात्मक ज्ञान, एजेंटिक स्व-मूल्यांकन और मानव-इन-द-लूप सत्यापन को संयोजित करता है।

Tek Raj Chhetri, Yibei Chen, Puja Trivedi, Dorota Jarecka, Saif Haobsh, Patrick Ray, Lydia Ng, Satrajit S. Ghosh2026-05-22
💻 computer science

Exploring How Audio Effects Alter Emotion with Foundation Models

यह शोध पत्र इस बात की जांच करता है कि कैसे मल्टीमॉडल डेटा पर प्रीट्रेन किए गए फाउंडेशन मॉडल्स का उपयोग ऑडियो प्रभावों और भावनात्मक धारणा के बीच जटिल, गैर-रेखीय संबंधों का व्यवस्थित रूप से विश्लेषण करने के लिए किया जा सकता है, जिससे संगीत संज्ञान और अफेक्टिव कंप्यूटिंग पर साउंड डिज़ाइन के प्रभाव की समझ को आगे बढ़ाया जा सके।

Stelios Katsis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou2026-05-22
💻 computer science

DecepChain: Inducing Deceptive Reasoning in Large Language Models

यह शोध पत्र DecepChain को प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जो बड़े भाषा मॉडलों (Large Language Models) को ऐसी गुप्त, सुसंगत, फिर भी गलत 'चेन-ऑफ-थॉट' तर्क उत्पन्न करने के लिए फाइन-ट्यून करता है जो सौम्य व्यवहार की नकल करता है, जिससे एक महत्वपूर्ण भेद्यता उजागर होती है जहाँ मानव और मॉडल दोनों ही भ्रामक तर्क का पता लगाने में संघर्ष करते हैं।

Wei Shen, Han Wang, Haoyu Li, Huan Zhang2026-05-22
⚡ electrical engineering

Go witheFlow: Real-time Emotion Driven Audio Effects Modulation

यह शोध पत्र witheFlow को प्रस्तुत करता है, जो एक हल्का, ओपन-सोर्स सिस्टम है जो बायोसिग्नल्स और स्वयं ऑडियो से निकाले गए फीचर्स के आधार पर ऑडियो प्रभावों को स्वचालित रूप से संशोधित करके वास्तविक समय के संगीत प्रदर्शन को बढ़ाता है ताकि मानवीय भावनात्मक अभिव्यक्ति और मशीन सहयोग के बीच के अंतर को पाटा जा सके।

Edmund Dervakos, Spyridon Kantarelis, Vassilis Lyberatos, Jason Liartis, Giorgos Stamou2026-05-22
💻 computer science

Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary

यह शोध पत्र लार्ज लैंग्वेज मॉडल (Large Language Model) के निर्णय सीमाओं (decision boundaries) को चित्रित करने के लिए एक सैद्धांतिक ढांचे के रूप में डिसीजन पोटेंशियल सरफेस (Decision Potential Surface - DPS) को प्रस्तुत करता है और K-DPS का प्रस्ताव करता है, जो एक व्यावहारिक एल्गोरिदम है जो केवल सीमित संख्या में नमूनों (samples) का उपयोग करके इन सीमाओं का अनुमान लगाता है और जिसका त्रुटि स्तर प्रमाणित रूप से नगण्य है।

Zi Liang, Zhiyao Wu, Haoyang Shang, Yulin Jin, Qingqing Ye, Huadi Zheng, Peizhao Hu, Haibo Hu2026-05-22
💻 computer science

A KL-regularization Framework for Learning to Plan with Adaptive Priors

यह शोध पत्र PO-MPC को प्रस्तुत करता है, जो एक एकीकृत KL-नियमितीकरण ढांचा (framework) है जो मॉडल-प्रेडिक्टिव प्लानर्स को प्रायर्स (priors) के रूप में पॉलिसी ऑप्टिमाइज़ेशन में एकीकृत करता है ताकि सैंपलिंग पॉलिसियों को प्लानर डिस्ट्रीब्यूशन के साथ संरेखित किया जा सके, जिससे उच्च-आयामी मॉडल-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में सैंपल दक्षता और प्रदर्शन में सुधार होता है।

Álvaro Serra-Gomez, Daniel Jarne Ornia, Dhruva Tirumala, Thomas Moerland2026-05-22