💻 computer science

Uncertainty Quantification for LLM Function-Calling

यह शोध पत्र LLM फंक्शन-कॉलिंग के लिए अनिश्चितता परिमाणीकरण (Uncertainty Quantification - UQ) विधियों का पहला मूल्यांकन प्रस्तुत करता है, जिसमें यह पाया गया है कि हालांकि इस सेटिंग में मल्टी-सैंपल विधियां सिंगल-सैंपल विधियों की तुलना में बहुत कम लाभ प्रदान करती हैं, लेकिन फंक्शन-कॉल आउटपुट की संरचनात्मक और अर्थ संबंधी विशिष्टताओं का लाभ उठाकर उनके प्रदर्शन में महत्वपूर्ण सुधार किया जा सकता है।

Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski2026-04-28
💻 computer science

FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean

यह शोध पत्र **FormalScience** को प्रस्तुत करता है, जो एक मानव-इन-द-लूप एजेंटिक पाइपलाइन है जिसे डोमेन विशेषज्ञों को वैज्ञानिक तर्क को Lean4 कोड में कुशलतापूर्वक ऑटोफॉर्मलाइज़ करने में मदद करने के लिए डिज़ाइन किया गया है, जिसे विश्वविद्यालय स्तर की भौतिकी की समस्याओं के एक उच्च-गुणवत्ता वाले डेटासेट, **FormalPhysics** के निर्माण के माध्यम से प्रदर्शित किया गया है जो LLM-आधारित फॉर्मलाइज़ेशन में सिमेंटिक ड्रिफ्ट (semantic drift) का एक व्यवस्थित विश्लेषण प्रदान करता है।

Jordan Meadows, Lan Zhang, Andre Freitas2026-04-28
🤖 machine learning

Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning

Mixture-of-Experts (MoE) फाइन-ट्यूनिंग में राउटर की नाजुकता और सूचना की हानि की समस्या को संबोधित करने के लिए, यह शोध पत्र एक सहायक-लॉस-मुक्त (auxiliary-loss-free) ढांचे का प्रस्ताव करता है जो दुर्लभ रूप से सक्रिय होने वाले विशेषज्ञों से मूल्यवान ज्ञान को संरक्षित करने के साथ-साथ समग्र प्रदर्शन में सुधार करने के लिए बायस-ड्रिवन स्पार्सिफिकेशन (bias-driven sparsification) और हमेशा-सक्रिय "कन्डेन्सर विशेषज्ञों" (condenser experts) का उपयोग करता है।

Haoze He, Xingyuan Ding, Xuan Jiang, Xinkai Zou, Alex Cheng, Yibo Zhao, Juncheng Billy Li, Heather Miller2026-04-28
💻 computer science

Evaluating Temporal Consistency in Multi-Turn Language Models

यह शोध पत्र ChronoScope प्रस्तुत करता है, जो एक बड़े पैमाने का बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि क्या भाषा मॉडल मल्टी-टर्न संवादों में टेम्पोरल (सामयिक) संदर्भ को बनाए रख सकते हैं या अपडेट कर सकते हैं, जो यह प्रकट करता है कि मॉडल अक्सर टेम्पोरल निरंतरता बनाए रखने में विफल रहते हैं, भले ही उनके पास सही अंतर्निहित तथ्यात्मक ज्ञान मौजूद हो।

Yash Kumar Atri, Steven L. Johnson, Tom Hartvigsen2026-04-28
💻 computer science

DeepImagine: Learning Biomedical Reasoning via Successive Counterfactual Imagining

DeepImagine एक ऐसा फ्रेमवर्क है जो बड़े भाषा मॉडलों (large language models) को विभिन्न प्रयोगात्मक विक्षोभों (experimental perturbations) के तहत नैदानिक परीक्षण परिणामों (clinical trial outcomes) में होने वाले परिवर्तनों की भविष्यवाणी करने के लिए प्रशिक्षित करके उन्हें बायोमेडिकल तर्क सिखाता है, जो काउंटरफैक्चुअल पेयर्स (counterfactual pairs) पर सुपरवाइज्ड फाइन-ट्यूनिंग, सुदृढीकरण शिक्षण (reinforcement learning) और सिंथेटिक रीजनिंग ट्रेसेस (synthetic reasoning traces) के संयोजन के माध्यम से किया जाता है।

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christop (…)2026-04-28
💻 computer science

Implicit Framing in Obstetric Counseling Notes: A Grounded LLM Pipeline on a VBAC-Eligible Cohort

यह शोध पत्र प्रसूति संबंधी नैदानिक टिप्पणियों का विश्लेषण करने के लिए एक ग्राउंडेड एलएलएम-आधारित पाइपलाइन का उपयोग करता है, जिससे यह पता चलता है कि चिकित्सक वैजाइनल बर्थ आफ्टर सीसेरियन की तुलना में रिपीट सीसेरियन सेक्शन के लिए परामर्श को दस्तावेजीकृत करते समय काफी अधिक जोखिम-केंद्रित भाषा का उपयोग करते हैं।

Baris Karacan, Barbara Di Eugenio, Patrick Thornton, Joanna Tess, Subhash Kumar Kolar2026-04-28
💻 computer science

ContextWeaver: Selective and Dependency-Structured Memory Construction for LLM Agents

ContextWeaver एक मेमोरी फ्रेमवर्क है जो LLM एजेंटों के लिए है, जो इंटरेक्शन हिस्ट्री को रीजनिंग स्टेप्स के डिपेंडेंसी-स्ट्रक्चर्ड ग्राफ में व्यवस्थित करके लॉन्ग-कॉन्टेक्स्ट रीजनिंग को बेहतर बनाता है, जिससे चयनात्मक, सारांशित और वैलिडेटेड कॉन्टेक्स्ट रिट्रीवल संभव हो पाता है।

Yating Wu, Yuhao Zhang, Sayan Ghosh, Sourya Basu, Anoop Deoras, Jun Huan, Gaurav Gupta2026-04-28
💻 computer science

Code Broker: A Multi-Agent System for Automated Code Quality Assessment

यह शोध पत्र 'कोड ब्रोकर' (Code Broker) प्रस्तुत करता है, जो गूगल के 'एजेंट डेवलपमेंट किट' (Agent Development Kit) के साथ निर्मित एक मल्टी-एजेंट सिस्टम है, जो पायथन रिपॉजिटरीज़ के लिए कार्रवाई योग्य, बहु-आयामी कोड गुणवत्ता रिपोर्ट उत्पन्न करने के लिए विशिष्ट एलएलएम-आधारित (LLM-based) और स्टैटिक-एनालिसिस एजेंटों को ऑर्केस्ट्रेट करता है, जबकि यह डेवलपर-उन्मुख फीडबैक प्रदान करने में इसकी प्रभावशीलता और मूल्यांकन की गहराई एवं स्केलेबिलिटी में वर्तमान सीमाओं को भी रेखांकित करता है।

Samer Attrah2026-04-28
💻 computer science

Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings

स्पार्स ऑटोएनकोडर्स (SAEs) का उपयोग करके अवधारणा-संरेखित फीचर उपसमूहों (concept-aligned feature subgroups) की पहचान करने और उन्हें नियंत्रित करने के माध्यम से, यह अध्ययन प्रदर्शित करता है कि Gemma-2-2B में जेलब्रेक कमजोरियां मध्य-से-विलंबित परतों (mid-to-late layers) में विशिष्ट फीचर उपसमूहों के भीतर स्थित हैं, जो यह सुझाव देता है कि प्रॉम्प्ट-आधारित रक्षा उपायों की तुलना में लेयर-वाइज फीचर हस्तक्षेप (layer-wise feature intervention) मजबूती के लिए अधिक प्रभावी हो सकता है।

Nilanjana Das, Manas Gaur2026-04-28
💻 computer science

Measuring Temporal Linguistic Emergence in Diffusion Language Models

यह शोध पत्र विभिन्न प्रकार की भाषाई सूचनाओं—जैसे कि अर्थ संबंधी श्रेणियों (semantic categories), शब्द-भेद (part-of-speech), और सटीक टोकन पहचान (exact token identity)—के डीनॉइज़िंग प्रक्षेपवक्र (denoising trajectory) के दौरान उभरने और स्थिर होने का विश्लेषण करके डिफ्यूजन लैंग्वेज मॉडल्स की टेम्पोरल डायनेमिक्स की जांच करता है।

Harry Lu2026-04-28