💬 NLP

Small Experiments, Cheaper Decisions: A Case Study in Staged Promotion for Micro-Pretraining

यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि लघु, विषम माइक्रो-प्रीट्रेनिंग (micro-pretraining) रन का उपयोग करने वाला एक चरणबद्ध पदोन्नति प्रोटोकॉल (staged promotion protocol) हाइपरपैरामीटर कॉन्फ़िगरेशनों को प्रभावी ढंग से फ़िल्टर कर सकता है और अनफ़िल्टर्ड निरंतरता रणनीतियों की तुलना में कुल प्रयोगात्मक लागत को 12% से 56% तक कम कर सकता है, जबकि यह स्वीकार करता है कि परिणाम वैश्विक इष्टतमता (global optimality) के दावे के बजाय एक सीमित लागत-आवंटन निष्कर्ष का प्रतिनिधित्व करते हैं।

Felipe Chavarro Polania2026-06-11
💬 NLP

AI Coding Agents Can Reproduce Social Science Findings

यह शोध पत्र SocSci-Repro-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जो यह प्रदर्शित करता है कि Claude Code जैसे अत्याधुनिक AI कोडिंग एजेंट सामाजिक विज्ञान के निष्कर्षों के एक महत्वपूर्ण हिस्से को सफलतापूर्वक पुनरुत्पादित कर सकते हैं, जिससे वैज्ञानिक वर्कफ़्लो के विश्वसनीय निष्पादक के रूप में उनकी क्षमता प्रमाणित होती है और साथ ही पूर्वाग्रहों को कम करने के लिए सावधानीपूर्वक बेंचमार्किंग और प्रॉम्प्ट डिज़ाइन की महत्वपूर्ण आवश्यकता पर प्रकाश डाला जाता है।

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker2026-06-11
💬 NLP

AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable

यह अध्ययन पाता है कि जबकि एआई कोडिंग एजेंट मानवीय पद्धतिगत विविधता के बराबर या उससे अधिक हो सकते हैं और अनुभवजन्य रूप से सुसंगत अनुमान उत्पन्न कर सकते हैं, वे व्याख्यात्मक पूर्वाग्रह के प्रति विशिष्ट रूप से संवेदनशील बने रहते हैं, जहाँ स्पष्ट प्रॉम्प्ट अंतर्निहित डेटा विश्लेषण को बदले बिना उनके अंतिम निष्कर्षों को नाटकीय रूप से बदल सकते हैं।

Meysam Alizadeh, Fabrizio Gilardi, Mohsen Mosleh, Enkelejda Kasneci2026-06-11
💬 NLP

Building Social World Models with Large Language Models

यह शोध पत्र सोशल वर्ल्ड मॉडल (SWM) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो स्पष्ट एनोटेशन के बिना घटनाओं के जवाब में सामाजिक विश्वासों के विकास की भविष्यवाणी करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, और कलशी (Kalshi) और पॉलीमार्केट (Polymarket) जैसे वास्तविक दुनिया के प्रेडिक्शन मार्केट्स से प्राप्त एक नए बेंचमार्क पर अत्याधुनिक प्रदर्शन प्रदर्शित करता है।

Haofei Yu, Yining Zhao, Guanyu Lin, Jiaxuan You2026-06-11
💬 NLP

When Roleplaying, Do Models Believe What They Say?

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ ऐतिहासिक पात्रों की भूमिका निभाना मुख्य रूप से एक भाषा मॉडल के आउटपुट को बदलता है बिना उसके सत्य के आंतरिक प्रतिनिधित्व को महत्वपूर्ण रूप से बदले, वहीं हानिकारक सलाह पर प्रशिक्षण देने से "उभरता हुआ मिसअलाइनमेंट" (Emergent Misalignment) उत्पन्न होता है, जो मॉडल के आंतरिक विश्वासों को असत्यता की ओर पर्याप्त रूप से स्थानांतरित कर देता है।

Benjamin Sturgeon, David Africa, Sid Black2026-06-11
💬 NLP

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

यह शोध पत्र SAGE का प्रस्ताव करता है, जो एक सिमेंटिक-आंसर गाइडेड एंट्रॉपी टारगेट और ग्रुप-अनसर्टेन्टी प्रेफरेंस ऑप्टिमाइजेशन (GUPO) का संयोजन है, ताकि बड़े भाषा मॉडलों (LLMs) की मौखिक अनिश्चितता अभिव्यक्तियों को उनके वास्तविक सैम्पल्ड व्यवहार के साथ संरेखित किया जा सके, जिससे विविध तर्क कार्यों में अंशांकन (कैलिब्रेशन) में सुधार हो सके और अति-आत्मविश्वास को कम किया जा सके।

Kaiwen Shi, Zheyuan Zhang, Yanfang Ye2026-06-11
💬 NLP

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

यह शोध पत्र ISE को प्रस्तुत करता है, जो एक तीन-चरणीय संश्लेषण प्रतिमान (three-stage synthesis paradigm) है जो उच्च-गुणवत्ता वाले, निष्पादन-आधारित (execution-grounded) मल्टी-टर्न OS-एजेंट प्रक्षेपवक्र (trajectories) उत्पन्न करता है ताकि फाइन-ट्यून किए गए मॉडलों में टूल-उपयोग प्रदर्शन को महत्वपूर्ण रूप से सुधारा जा सके, जो बड़े ज़ीरो-शॉट बेसलाइनों से बेहतर प्रदर्शन करता है।

Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu2026-06-11
🤖 machine learning

GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

यह शोधपत्र GraphInfer-Bench को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें छह वास्तविक दुनिया के ग्राफों के माध्यम से 42,000 नमूने शामिल हैं ताकि बड़े भाषा मॉडल (LLMs) की उन ओपन-एंडेड ग्राफ इन्फरेंस कार्यों को करने की क्षमता का मूल्यांकन किया जा सके जिन्हें एकल नोड्स या पथों को पुनर्प्राप्त करके हल नहीं किया जा सकता है, जिससे यह पता चलता है कि वर्तमान LLM-आधारित विधियाँ इस क्षमता में अभी भी साधारण GNNs से पीछे हैं।

Zhuoyi Peng, Jingzhou Jiang, Hanlin Gu, Lixin Fan, Yi Yang2026-06-11
🌀 nonlinear sciences

Kuramoto Attention: Synchronizing Self-Attention on the Torus

यह शोध पत्र कुरामोतो अटेंशन (Kuramoto Attention) का परिचय देता है, जो एक ऐसा सेल्फ-अटेंशन तंत्र है जो गेटेड कोसाइन समानता (gated cosine similarity) और सर्कुलर मीन अपडेट्स (circular mean updates) का उपयोग करके टोकन इंटरैक्शन को एक टॉरस (torus) पर फेज सिंक्रोनाइज़ेशन के रूप में मॉडल करता है, यह प्रदर्शित करते हुए कि यह ज्यामितीय रूप से बाधित आर्किटेक्चर मानक RoPE-आधारित ट्रांसफॉर्मर के तुलनीय लैंग्वेज मॉडलिंग प्रदर्शन प्राप्त करता है और साथ ही अटेंशन और फेज कपलिंग के बीच एक नया सैद्धांतिक सेतु भी प्रदान करता है।

Joshua Nunley2026-06-11
💬 NLP

Multi-Agent Reasoning with Adaptive Worker Allocation for Stance Detection

यह शोध पत्र एक अनुकूलन योग्य कार्यकर्ता आवंटन (adaptive worker allocation) के साथ एक मल्टी-एजेंट रीजनिंग फ्रेमवर्क प्रस्तुत करता है जो सरल लेबल-स्तरीय वोटिंग पर निर्भर रहने के बजाय कई एजेंटों से विविध तर्क संबंधी स्पष्टीकरणों को संश्लेषित करके स्टैंड डिटेक्शन (stance detection) में सुधार करता है, विशेष रूप से निहित और संदर्भ-निर्भर मामलों के लिए।

Meysam Sabbaghan, Arman Zareian Jahromi, Doina Caragea2026-06-11