🤖 AI

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

यह शोधपत्र QD-LLM को प्रस्तुत करता है, जो एक पैरामीटर-कुशल न्यूरोइवोल्यूशन फ्रेमवर्क है जो फ्रोजन लार्ज लैंग्वेज मॉडल्स को विविध, उच्च-गुणवत्ता वाले आउटपुट की ओर निर्देशित करने के लिए क्वालिटी-डाइवर्सिटी ऑप्टिमाइज़ेशन स्कीम के भीतर कॉम्पैक्ट प्रॉम्प्ट एम्बेडिंग्स को विकसित करता है, जो मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना कवरेज और डाउनस्ट्रीम उपयोगिता में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-12
🤖 AI

Insight: Enhancing Mobile Accessibility for Blind and Visually Impaired Users with LLMs

यह शोध पत्र 'इंसाइट' (Insight) का परिचय देता है, जो एक एंड्रॉइड एक्सेसिबिलिटी सर्विस है जो प्राकृतिक भाषा संवाद और वास्तविक समय में स्क्रीन सारांश प्रदान करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाती है, जिसे एक उपयोगकर्ता अध्ययन यह प्रदर्शित करता है कि यह टॉकबैक (TalkBack) जैसे पारंपरिक जेस्चर-आधारित उपकरणों की तुलना में मानसिक प्रयास और कार्य समय को महत्वपूर्ण रूप से कम करता है, साथ ही समावेशी मोबाइल डिज़ाइन के लिए हाइब्रिड डायलॉग-जेस्चर इंटरफेस की क्षमता को भी उजागर करता है।

Joshua Owusu Ansah, Anuj Kapoor, Ayush Khanna, Manvika Vinod, Precious Njeck, Shuai Gao2026-05-12
🤖 machine learning

LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

यह शोध पत्र LEAD को प्रस्तुत करता है, जो एक नवीन विधि है जो सुदृढीकरण शिक्षण (reinforcement learning) के दौरान शुद्धता और दक्षता को गतिशील रूप से संतुलित करने के लिए ऑनलाइन, स्व-अनुकूली तंत्रों का उपयोग करती है, जिससे बड़े रीजनिंग मॉडल को विविध गणितीय बेंचमार्क में सटीकता से समझौता किए बिना काफी छोटे चेन-ऑफ-थॉट (Chain-of-Thought) आउटपुट उत्पन्न करने में सक्षम बनाया जा सके।

Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li2026-05-12
🤖 AI

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

यह शोध पत्र "ओरेकल पॉइज़निंग" (Oracle Poisoning) को प्रस्तुत और अनुभवजन्य रूप से मान्य करता है, जो एक नया हमला वेक्टर है जहाँ हमलावर संरचित ज्ञान ग्राफ (knowledge graphs) को दूषित करते हैं ताकि एआई एजेंटों को अन्यथा तर्कसंगत तर्क के माध्यम से गलत निष्कर्ष निकालने के लिए मजबूर किया जा सके, जो यह प्रदर्शित करता है कि वर्तमान मॉडल टूल-यूज़ प्रोटोकॉल के माध्यम से एक्सेस किए जाने पर सार्वभौमिक रूप से दूषित डेटा पर भरोसा करते हैं और इनलाइन टेस्टिंग में महत्वपूर्ण मूल्यांकन अंतराल को उजागर करते हैं।

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar2026-05-12
🤖 AI

CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs

CalBench मल्टी-एजेंट LLMs के लिए एक नियंत्रित मूल्यांकन वातावरण है जो समन्वय गुणवत्ता, संचार दक्षता, निष्पक्षता और गोपनीयता रिसाव को इष्टतम और बेसलाइन समाधानों के विरुद्ध सटीक रूप से मापने के लिए निजी जानकारी के साथ एक विकेंद्रीकृत कैलेंडर शेड्यूलिंग कार्य का उपयोग करता है।

Chelsea Zou, Yiheng Yao, Selena She, Robert D. Hawkins2026-05-12
🤖 machine learning

Pretraining large language models with MXFP4

यह शोध पत्र यह पहचान करता है कि वेट ग्रेडिएंट्स (Wgrad) का क्वांटाइजेशन बड़े भाषा मॉडलों के फुल-पाइपलाइन FP4 प्रशिक्षण में अस्थिरता का प्राथमिक कारण है और यह प्रदर्शित करता है कि अभिसरण स्थिरता (convergence stability) को बहाल करने के लिए स्टोकेस्टिक राउंडिंग के बजाय डिटरमिनिस्टिक हेडामार्ड रोटेशन आवश्यक हैं।

Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir2026-05-12
🤖 AI

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

यह शोधपत्र EnactToM को प्रस्तुत करता है, जो 300 एम्बोडीड मल्टी-एजेंट कार्यों का एक कठोरता से सत्यापित और विकसित होने वाला बेंचमार्क है, जो वर्तमान फ्रंटियर एआई मॉडल्स में एक महत्वपूर्ण अंतराल को उजागर करता है, जो शाब्दिक विश्वास संबंधी प्रश्नों में तो उत्कृष्ट हैं लेकिन जटिल, आंशिक रूप से अवलोकन योग्य वातावरण में निहित विश्वासों पर कार्य करने के लिए आवश्यक कार्यात्मक थ्योरी ऑफ माइंड (Theory of Mind) में पूरी तरह से विफल (0.0% सफलता) रहते हैं।

Gurusha Juneja, Dylan Lu, Saaket Agashe, Parth Diwane, Edward Gunn, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Ya (…)2026-05-12
🤖 machine learning

Free Energy Manifold: Score-Based Inference for Hybrid Bayesian Networks

यह शोधपत्र फ्री एनर्जी मैनिफोल्ड (FEM) को प्रस्तुत करता है, जो एक स्कोर-प्रशिक्षित कंडीशनल एनर्जी मॉडल है जो कंडीशनल फैक्टर्स को एनर्जी लैंडस्केप के रूप में निरूपित करके और मल्टीमॉडल एवं कंपोजिशनल सेटिंग्स में पोस्टीरियर सटीकता में उल्लेखनीय सुधार करने के लिए वैली रेगुलराइजेशन के माध्यम से "मोड-ब्रिज आर्टिफैक्ट" को संबोधित करके हाइब्रिड बायेसियन नेटवर्क में प्रभावी इन्फरेंस को सक्षम बनाता है।

Cheol Young Park, Shou Matsumoto2026-05-12
🤖 AI

Yield Curve Forecasting using Machine Learning and Econometrics: A Comparative Analysis

यह शोध पत्र 47 वर्षों के दौरान अमेरिकी ट्रेजरी यील्ड कर्व (U.S. Treasury yield curve) के पूर्वानुमान के लिए विभिन्न अर्थमितीय (econometric), शास्त्रीय मशीन लर्निंग और डीप लर्निंग मॉडलों की तुलना करता है, जिसमें यह पाया गया है कि पारंपरिक ARIMA और नैव बेंचमार्क (naive benchmarks) आम तौर पर उन्नत एल्गोरिदम से बेहतर प्रदर्शन करते हैं, जिसमें TimeGPT, LGBM और RNNs शीर्ष प्रदर्शन करने वाले मशीन लर्निंग तरीके रहे हैं।

Aman Singh, Tokunbo Ogunfunmi, Sanjiv Das2026-05-12
🤖 AI

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

यह शोध पत्र 'मेटाकॉग्निटिव प्रोब' (Metacognitive Probe) को प्रस्तुत करता है, जो एक पांच-कार्य वाला नैदानिक उपकरण है जो पांच अलग-अलग आयामों में LLMs के आत्मविश्वास व्यवहारों का मूल्यांकन करता है ताकि अति-आत्मविश्वास के उन छिपे हुए क्षेत्रों को उजागर किया जा सके जिन्हें एग्रीगेट बेंचमार्क छोड़ देते हैं, जो एक मॉडल की कार्य-विशिष्ट अंशांकन (calibration) और उसकी क्रॉस-टास्क कठिनाई भविष्यवाणी क्षमताओं के बीच 47-अंकों का महत्वपूर्ण विचलन प्रदर्शित करता है।

Rafael C. T. Oliveira2026-05-12