🔬 physics

Stan: An LLM-based thermodynamics course assistant

यह शोध पत्र स्टैन (Stan) को प्रस्तुत करता है, जो स्नातक ऊष्मागतिकी (thermodynamics) पाठ्यक्रम के लिए एक स्थानीय रूप से तैनात, गोपनीयता-संरक्षित एआई प्रणाली है, जो लेक्चर ट्रांसक्रिप्ट और पाठ्यपुस्तक डेटा के साझा संग्रह का उपयोग करके छात्रों को एक साथ आधारित, संदर्भ-समर्थित ट्यूटरिंग प्रदान करने और प्रशिक्षकों के लिए कार्रवाई योग्य शिक्षण अंतर्दृष्टि उत्पन्न करने के लिए ओपन-वेट मॉडल्स का उपयोग करता है।

Eric M. Furst, Vasudevan Venkateshwaran2026-03-06
💻 computer science

Using Vision + Language Models to Predict Item Difficulty

यह अध्ययन प्रदर्शित करता है कि अमेरिकी वयस्कों के लिए डेटा साक्षरता परीक्षण मदों की कठिनाई का पूर्वानुमान लगाने के लिए विज़ुअलाइज़ेशन छवियों और टेक्स्ट विशेषताओं दोनों का विश्लेषण करने के लिए विज़न और लैंग्वेज मॉडल (GPT-4.1-nano) को संयोजित करने वाला एक मल्टीमॉडल दृष्टिकोण यूनिमोडल विधियों की तुलना में काफी बेहतर प्रदर्शन करता है, जो 0.224 की माध्य पूर्ण त्रुटि (mean absolute error) प्राप्त करता है।

Samin Khan2026-03-06
💻 computer science

Optimizing Language Models for Crosslingual Knowledge Consistency

यह शोध पत्र डायरेक्ट कंसिस्टेंसी ऑप्टिमाइज़ेशन (DCO) को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) से प्रेरित विधि है जो मॉडल से सीधे एक संरचित रिवॉर्ड फंक्शन प्राप्त करके बड़े भाषा मॉडलों में क्रॉसलिंगुअल ज्ञान की निरंतरता में महत्वपूर्ण सुधार करती है, जिससे एक स्पष्ट रिवॉर्ड मॉडल की आवश्यकता समाप्त हो जाती है और मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन होता है।

Tianyu Liu, Jirui Qi, Mrinmaya Sachan, Ryan Cotterell, Raquel Fernández, Arianna Bisazza2026-03-06
💻 computer science

AI-Assisted Moot Courts: Simulating Justice-Specific Questioning in Oral Arguments

यह शोध पत्र मूट कोर्ट में न्याय-विशिष्ट पूछताछ करने की एआई मॉडलों की क्षमता का आकलन करने के लिए एक द्वि-स्तरीय मूल्यांकन ढांचे का प्रस्ताव करता है, जिसमें यह पाया गया है कि हालांकि मॉडल प्रमुख कानूनी मुद्दों को कवर करने वाले यथार्थवादी प्रश्न उत्पन्न करते हैं, फिर भी वे विविधता और चापलूसी (sycophancy) के मामले में संघर्ष करते हैं—ऐसी कमियां जिन्हें सरल मूल्यांकन विधियां नहीं पकड़ पाएंगी।

Kylie Zhang, Nimra Nadeem, Lucia Zheng, Dominik Stammbach, Peter Henderson2026-03-06
💻 computer science

Model Medicine: A Clinical Framework for Understanding, Diagnosing, and Treating AI Models

यह शोध पत्र "मॉडल मेडिसिन" (Model Medicine) प्रस्तुत करता है, जो एक व्यापक नैदानिक अनुसंधान कार्यक्रम है जो उप-विषयों के वर्गीकरण, एक व्यवहारिक आनुवंशिकी ढांचे और 'न्यूरल एमआरआई' (Neural MRI) जैसे नवीन नैदानिक उपकरणों को स्थापित करके एआई मॉडलों को जैविक जीवों की तरह मानता है ताकि मॉडल विकारों को व्यवस्थित रूप से समझा, निदान और उपचार किया जा सके।

Jihoon Jeong2026-03-06
💻 computer science

Solving an Open Problem in Theoretical Physics using AI-Assisted Discovery

यह शोध पत्र एक न्यूरो-सिम्बोलिक एआई (AI) प्रणाली प्रस्तुत करता है जिसने कॉस्मिक स्ट्रिंग्स के गुरुत्वाकर्षण विकिरण शक्ति स्पेक्ट्रम (gravitational radiation power spectrum) के लिए नवीन, सटीक विश्लेषणात्मक समाधान व्युत्पन्न करके सैद्धांतिक भौतिकी की एक अनसुलझी समस्या को स्वायत्त रूप से हल किया है, जिससे पिछले आंशिक परिणामों से आगे बढ़ते हुए गणितीय खोज को गति देने में एआई की क्षमता का प्रदर्शन हुआ है।

Michael P. Brenner, Vincent Cohen-Addad, David Woodruff2026-03-06
💻 computer science

Interactive Benchmarks

यह शोध पत्र "इंटरएक्टिव बेंचमार्क" का प्रस्ताव करता है, जो एक एकीकृत मूल्यांकन प्रतिमान है जो इंटरैक्टिव प्रमाणों और खेलों में बजट संबंधी बाधाओं के तहत सक्रिय सूचना प्राप्ति और तर्क के माध्यम से मॉडल की बुद्धिमत्ता का आकलन करता है, यह प्रदर्शित करते हुए कि वर्तमान मॉडलों में इन गतिशील परिदृश्यों में अभी भी सुधार की काफी गुंजाइश है।

Baoqing Yue, Zihan Zhu, Yifan Zhang, Jichen Feng, Hufei Yang, Mengdi Wang2026-03-06
💻 computer science

HiMAP-Travel: Hierarchical Multi-Agent Planning for Long-Horizon Constrained Travel

HiMAP-Travel एक पदानुक्रमित मल्टी-एजेंट फ्रेमवर्क है जो एक कोऑर्डिनेटर और समानांतर डे एक्जीक्यूटर्स (Day Executors) को ट्रांसेक्शनल मॉनिटरिंग और बारगेनिंग प्रोटोकॉल के माध्यम से जोड़कर, कठिन बाधाओं के साथ दीर्घकालिक यात्रा नियोजन (long-horizon travel planning) को संबोधित करता है, जिससे TravelPlanner और FlexTravelBench बेंचमार्क पर अत्याधुनिक प्रदर्शन और कम विलंबता प्राप्त होती है।

The Viet Bui, Wenjun Li, Yong Liu2026-03-06
💻 computer science

Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction

यह शोध पत्र RLSTA को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो "कॉन्टेक्स्टुअल इनर्शिया" (Contextual Inertia) को दूर करने के लिए स्थिर एंकर के रूप में एकल-टर्न क्षमताओं का लाभ उठाता है, जिससे बड़े भाषा मॉडल (large language models) को बहु-टर्न इंटरैक्शन में नई जानकारी को प्रभावी ढंग से एकीकृत करने और मजबूत तर्क बनाए रखने में सक्षम बनाया जा सके।

Xingwu Chen, Zhanqiu Zhang, Yiwen Guo, Difan Zou2026-03-06
💬 NLP

Beyond the Context Window: A Cost-Performance Analysis of Fact-Based Memory vs. Long-Context LLMs for Persistent Agents

यह शोध पत्र निरंतर एजेंटों (persistent agents) के लिए तथ्य-आधारित मेमोरी सिस्टम की तुलना लॉन्ग-कॉन्टेक्स्ट एलएलएम (long-context LLMs) से करता है, जिसमें यह पाया गया है कि जहाँ लॉन्ग-कॉन्टेक्स्ट मॉडल आम तौर पर बेहतर तथ्यात्मक रिकॉल प्रदान करते हैं, वहीं तथ्य-आधारित मेमोरी एक प्रारंभिक राइट फेज (write phase) के बाद स्थिर प्रति-टर्न लागत बनाए रखकर दीर्घकालिक इंटरैक्शन के लिए अधिक लागत प्रभावी समाधान प्रदान करती है, जिसका एक विशिष्ट ब्रेक-इवन पॉइंट कॉन्टेक्स्ट लंबाई और इंटरैक्शन वॉल्यूम द्वारा निर्धारित होता है।

Natchanon Pollertlam, Witchayut Kornsuwannawit2026-03-06