🤖 AI

Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models

यह अध्ययन प्रदर्शित करता है कि Llama-3.3-70B-Instruct में डार्क ट्रायड (Dark Triad) लक्षणों को बढ़ाने के लिए स्पार्स ऑटोएनकोडर फीचर स्टीयरिंग (sparse autoencoder feature-steering) का उपयोग करने से रणनीतिक धोखे और संज्ञानात्मक सहानुभूति को अक्षुण्ण रखते हुए शोषणकारी और निष्ठुर व्यवहारों में चयनात्मक रूप से वृद्धि होती है, जो यह प्रकट करता है कि बड़े भाषा मॉडलों में असामाजिक प्रवृत्तियाँ एक एकीकृत संरचना के बजाय विच्छेदित (dissociable) कम्प्यूटेशनल पथों से बनी हैं।

Cameron Berg, Roshni Lulla2026-05-12
🤖 AI

EvoPref: Multi-Objective Evolutionary Optimization Discovers Diverse LLM Alignments Beyond Gradient Descent

EvoPref, ग्रेडिएंट-आधारित विधियों के प्रेफरेंस कोलैप्स (preference collapse) को दूर करने के लिए NSGA-II और LoRA एडेप्टर का उपयोग करते हुए एक मल्टी-ऑब्जेक्टिव इवोल्यूशनरी एल्गोरिदम पेश करता है, जो मानक बेंचमार्क पर प्रतिस्पर्धी गुणवत्ता बनाए रखते हुए काफी अधिक विविध LLM अलाइनमेंट प्राप्त करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-12
🤖 AI

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

यह शोधपत्र QD-LLM को प्रस्तुत करता है, जो एक पैरामीटर-कुशल न्यूरोइवोल्यूशन फ्रेमवर्क है जो फ्रोजन लार्ज लैंग्वेज मॉडल्स को विविध, उच्च-गुणवत्ता वाले आउटपुट की ओर निर्देशित करने के लिए क्वालिटी-डाइवर्सिटी ऑप्टिमाइज़ेशन स्कीम के भीतर कॉम्पैक्ट प्रॉम्प्ट एम्बेडिंग्स को विकसित करता है, जो मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना कवरेज और डाउनस्ट्रीम उपयोगिता में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-12
🤖 AI

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

यह शोध पत्र 'मेटाकॉग्निटिव प्रोब' (Metacognitive Probe) को प्रस्तुत करता है, जो एक पांच-कार्य वाला नैदानिक उपकरण है जो पांच अलग-अलग आयामों में LLMs के आत्मविश्वास व्यवहारों का मूल्यांकन करता है ताकि अति-आत्मविश्वास के उन छिपे हुए क्षेत्रों को उजागर किया जा सके जिन्हें एग्रीगेट बेंचमार्क छोड़ देते हैं, जो एक मॉडल की कार्य-विशिष्ट अंशांकन (calibration) और उसकी क्रॉस-टास्क कठिनाई भविष्यवाणी क्षमताओं के बीच 47-अंकों का महत्वपूर्ण विचलन प्रदर्शित करता है।

Rafael C. T. Oliveira2026-05-12
🤖 AI

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

यह शोधपत्र EgoMemReason प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसे एंटिटी (entity), इवेंट (event) और बिहेवियर (behavior) प्रकारों के माध्यम से मेमोरी-ड्रिवन रीजनिंग का परीक्षण करके लॉन्ग-होरिज़न इगोसेंट्रिक वीडियो समझ का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मल्टीमॉडल मॉडल मल्टी-डे टेम्पोरल स्पैन (multi-day temporal spans) में स्पार्स एविडेंस (sparse evidence) को एकीकृत करने में काफी संघर्ष करते हैं।

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal2026-05-12
🤖 machine learning

Key-Value Means

यह शोध पत्र की-वैल्यू मीन्स (KVM) को प्रस्तुत करता है, जो अटेंशन के लिए एक नवीन ब्लॉक-रिकरेंस तंत्र है जो ट्रांसफॉर्मर्स और लीनियर RNNs के लाभों को एकीकृत करता है, जिससे मानक ऑपरेशन्स और न्यूनतम अतिरिक्त पैरामीटर्स का उपयोग करते हुए कुशल, चंक-पैरेललाइज़ेबल ट्रेनिंग के साथ लचीले स्टेट ग्रोथ और सबक्वाड्रेटिक प्रीफिल टाइम को सक्षम बनाया जा सके।

Daniel Goldstein, Eugene Cheah2026-05-12✓ Author reviewed
🤖 AI

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

यह शोध पत्र "स्यूडो-डेलिब्रेशन" (Pseudo-Deliberation) की अवधारणा प्रस्तुत करता है ताकि तर्क प्रक्रिया की उपस्थिति के बावजूद बड़े भाषा मॉडलों के घोषित मूल्यों और उनके वास्तविक कार्यों के बीच निरंतर विसंगति का वर्णन किया जा सके, और इस मूल्य-क्रिया अंतराल को व्यवस्थित रूप से मापने और संबोधित करने के लिए VALDI फ्रेमवर्क और VIVALDI हस्तक्षेप प्रणाली का प्रस्ताव करता है।

Sushrita Rakshit, Hanwen Zhang, Hua Shen2026-05-12
🤖 AI

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

KnotBench लगभग 860,000 गांठ आरेखों (knot diagrams) का उपयोग करते हुए एक कठोर बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान विजन-लैंग्वेज मॉडल, "सोचने" वाले मोड के साथ बेहतर प्रदर्शन के बावजूद, दृश्य गांठ संरचनाओं को क्रियाशील प्रतीकात्मक तर्क में अनुवादित करने में मौलिक रूप से संघर्ष करते हैं, और अक्सर आरेखीय हेरफेर (diagrammatic manipulation) की आवश्यकता वाले कार्यों में रैंडम बेसलाइन से बेहतर प्रदर्शन करने में विफल रहते हैं।

Hao Liu, Jicheng Liu2026-05-12
🤖 AI

Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents

यह स्थिति पत्र चेतावनी देता है कि शीर्ष एआई (AI) सम्मेलनों को "एजेंटिक डिनोमिनेटर गेमिंग" (Agentic Denominator Gaming) नामक एक प्रणालीगत भेद्यता का सामना करना पड़ रहा है, जहाँ दुर्भावनापूर्ण अभिनेता लक्षित वैध कार्यों के लिए स्वीकृति दरों को कृत्रिम रूप से बढ़ाने हेतु निम्न-गुणवत्ता वाले शोध पत्रों के साथ सबमिशन पूल्स को भरने के लिए स्वचालित एजेंटों का उपयोग करते हैं, जिससे होने वाली समीक्षक थकान और समीक्षा की गुणवत्ता में गिरावट को कम करने के लिए केवल तकनीकी पहचान के बजाय संरचनात्मक नीतिगत सुधारों की आवश्यकता है।

Rong Shan, Te Gao, Hang Zheng, Yunjia Xi, Jiachen Zhu, Zeyu Zheng, Yong Yu, Weinan Zhang, Jianghao Lin2026-05-12
🤖 AI

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

यह शोध पत्र टीम-आधारित डुअल एडेप्टिव वेटिंग के साथ सेल्फ-प्ले (TPAW) को प्रस्तुत करता है, जो एक नवीन स्व-पर्यवेक्षित (self-supervised) एल्गोरिदम है जो मौजूदा स्व-प्रशिक्षण दृष्टिकोणों की अस्थिरता और अनुकूलन सीमाओं को दूर करने के लिए ऐतिहासिक चेकपॉइंट्स और डुअल एडेप्टिव वेटिंग तंत्र के साथ एक सहयोगात्मक-प्रतिस्पर्धी टीम ढांचे का उपयोग करके LLM संरेखण (alignment) को बढ़ाता है।

Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li2026-05-12