🤖 AI

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench यह प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स 4x4 मैट्रिक्स आयामों पर एक संरचनात्मक व्यवहार संबंधी दहलीज (structural behavioral threshold) प्रदर्शित करते हैं, जहाँ वे छोटे कार्यों में निष्पादन त्रुटियों (execution errors) से बड़े कार्यों में व्यवस्थित कम्प्यूटेशनल परित्याग (systematic computational abandonment) और संरचित मतिभ्रम (structured hallucination) की ओर स्थानांतरित हो जाते हैं, जो ज्ञान की कमी के बजाय एक मौलिक वर्किंग मेमोरी सीमा का संकेत देता है।

Shradha Agarwal, Deepak Rajbhar, Tariq J2026-05-19
🤖 AI

Enhancing Metacognitive AI: Knowledge-Graph Population with Graph-Theoretic LLM Enrichment

यह शोधपत्र MetaKGEnrich प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो नॉलेज ग्राफ बनाकर, ग्राफ मेट्रिक्स के माध्यम से विरल (sparse) क्षेत्रों की पहचान करके और लक्षित वेब रिट्रीवल के साथ उन्हें पुनरावृत्ति से समृद्ध करके LLM मेटाकॉग्निशन को बढ़ाता है, जिससे कई बेंचमार्क डेटासेट में उत्तर की गुणवत्ता में उल्लेखनीय सुधार होता है।

Deniz Askin, Gal Hadar, Brendan Conway-Smith2026-05-19
🤖 machine learning

EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control

EfficientTDMPC एक सैंपल-कुशल (sample-efficient) मॉडल-आधारित सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम है जो औसत रिटर्न अनुमानों और अनिश्चितता दंडों (uncertainty penalties) के साथ डायनेमिक्स मॉडल्स के एक समूह (ensemble) का उपयोग करके TD-MPC परिवार को उन्नत करता है ताकि कम-डेटा वाले निरंतर नियंत्रण (continuous control) बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Thomas Evers, Cristian Meo, Wendelin Bohmer, Justin Dauwels, Yaniv Oren2026-05-19
🤖 AI

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

GeoWorld-VLM फ्रोजन कैमरा-कंडीशन्ड वीडियो वर्ल्ड मॉडल्स से 3D ज्यामितीय संकेतों को विजुअल पाथवे में डिस्टिल करके विजन-लैंग्वेज मॉडल्स की स्थानिक तर्क संबंधी सीमाओं को संबोधित करता है, जिससे मूल मॉडल की भाषाई क्षमताओं को सुरक्षित रखते हुए स्थानिक बेंचमार्क पर निरंतर प्रदर्शन सुधार प्राप्त होता है।

Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang2026-05-19
🤖 AI

GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction

यह शोध पत्र GRID प्रस्तुत करता है, जो एक एंड-टू-एंड फ्रेमवर्क है जो ट्रेस करने योग्य आर्टिकल-ग्राफ संरेखण (article-graph alignments) और एक स्क्रिप्टेड टास्क-बैंक रिवॉर्ड सिस्टम का लाभ उठाकर साइबर थ्रेट इंटेलिजेंस से सुरक्षा ज्ञान ग्राफ (security knowledge graphs) का निर्माण करता है, ताकि कुशल 4B-पैरामीटर वाले एक्सट्रैक्टर्स को प्रशिक्षित किया जा सके जो पारंपरिक LLM-आधारित मूल्यांकन विधियों की तुलना में बेहतर परिशुद्धता (precision), रिकॉल (recall) और लागत-प्रभावशीलता प्राप्त करते हैं।

Liangyi Huang, Zichen Liu, Fei Shao, Shang Ma, Mengshi Zhang, Zihao Chen, Yanfang Ye, Xusheng Xiao2026-05-19
🤖 AI

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

PopuLoRA एक जनसंख्या-आधारित असममित स्व-खेल (asymmetric self-play) ढांचा है जो एकल-एजेंट RLVR की स्व-अंशांकन (self-calibration) सीमाओं को दूर करने के लिए सह-विकसित (co-evolving) LoRA एडेप्टरों का लाभ उठाता है, जिससे समस्या-प्रस्तावित शिक्षकों और समाधान करने वाले छात्रों के बीच एक ऐसी प्रतिस्पर्धा सक्षम होती है जो कम प्रशिक्षण-समय पुरस्कारों के बावजूद विविध गणित और कोड बेंचमार्क पर बेहतर प्रदर्शन प्रदान करती है।

Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf, Maxwill Lin, Augustine N. Mavor-Parker, Matthew James Sargent2026-05-19
🧬 biology

EmoMind: Decoding Affective Captions from Human Brain fMRI

EmoMind एक नवीन एंड-टू-एंड पाइपलाइन है जो अर्थपूर्ण रूप से आधारित दृश्य विवरणों को निरंतर 34-आयामी भावना वेक्टर्स के साथ संयोजित करके fMRI संकेतों से सीधे भावनात्मक कैप्शन डिकोड करती है, जो व्यक्तिगत, व्यक्ति-विशिष्ट भावनात्मक आख्यानों को उत्पन्न करने में डिस्क्रीट लेबल-आधारित बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करती है।

Bilal A. Mohammed, Lin Gu, Ruogo Fang2026-05-19
🤖 machine learning

State Contamination in Memory-Augmented LLM Agents

यह शोध पत्र "मेमोरी लॉन्ड्रिंग" (memory laundering) की पहचान और मात्रा निर्धारण करता है, जो मेमोरी-ऑगमेंटेड LLM एजेंटों में एक सुरक्षा विफलता है जहाँ विषाक्त संदर्भ (toxic context) को ऐसे दिखने में सुरक्षित सारांशों में संकुचित कर दिया जाता है जो फिर भी गुप्त रूप से भविष्य के जनरेशन को प्रभावित करते हैं, यह प्रदर्शित करते हुए कि प्रभावी शमन के लिए केवल अंतिम आउटपुट को साफ करने के बजाय सारांश बनाने से पहले स्टेट (state) को सैनिटाइज करना आवश्यक है।

Yian Wang, Agam Goyal, Yuen Chen, Hari Sundaram2026-05-19
🤖 machine learning

Learning Unbiased Permutations via Flow Matching

यह शोध पत्र PermFlow को प्रस्तुत करता है, जो एक कंडीशनल फ्लो मैचिंग फ्रेमवर्क है जो बहुविध (multimodal) वितरणों को कैप्चर करने और अस्पष्टता को हल करने के लिए क्रमपरिवर्तन मैट्रिसेस (permutation matrices) के एफ़ाइन सबस्पेस पर सीधे कार्य करता है, जो मौजूदा सिंकहॉर्न-आधारित विभेद्य (differentiable) विधियों की मोड-कोलैप्सिंग सीमाओं को दूर करता है।

Yimeng Min, Carla P. Gomes2026-05-19
💬 NLP

Exploring Lightweight Large Language Models for Court View Generation

यह शोध पत्र क्रिमिनल कोर्ट व्यू जनरेशन और आरोप पूर्वानुमान के लिए हल्के वजन वाले बड़े भाषा मॉडलों (2B पैरामीटर्स से कम) की क्षमताओं की व्यवस्थित रूप से जांच करता है, जो मॉडल आर्किटेक्चर, आकार और कार्य अंतर्निर्भरताओं के बीच के समझौतों का विश्लेषण करने के लिए CVGEvalKit मूल्यांकन ढांचे को पेश करता है और न्यायिक एआई में इन मॉडलों की क्षमता को प्रदर्शित करता है।

Zhitian Hou, Tianyong Hao, Nanli Zeng, Zhixiong Chao, Kun Zeng2026-05-19