💬 NLP

Structured Output Collapses Answer Diversity Across 44 Language Models

यह अध्ययन प्रदर्शित करता है कि स्कीमा प्रवर्तन (schema enforcement) के बिना भी, JSON जैसे संरचित आउटपुट प्रारूपों की मांग करना, 44 भाषा मॉडलों में उत्तरों की विविधता को काफी कम कर देता है और प्रमुख प्रतिक्रियाओं की ओर मॉडल अभिसरण (convergence) को बढ़ाता है, जो यह प्रकट करता है कि केवल प्रॉम्प्ट का रजिस्टर ही—न कि डिकोडिंग बाधाएं—मॉडल व्यवहार के मापने योग्य समरूपीकरण (homogenization) को संचालित करता है।

Tapan Parikh2026-07-22
🤖 AI

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

यह शोध पत्र हाई-परफॉर्मेंस कंप्यूटिंग में "हाइजैकड ऑथोराइज्ड एजेंट" (hijacked authorized agent) की समस्या की पहचान करता है, जहाँ विश्वसनीय उपयोगकर्ता क्रेडेंशियल्स के तहत कार्य करने वाले LLM एजेंटों को अनधिकृत कार्यों को करने के लिए प्रतिकूल इनपुट द्वारा पुनर्निर्देशित किया जा सकता है, और इन सुरक्षा अंतराल को दूर करने के लिए एक नए थ्रेट मॉडल और "टास्कबाउंड" (TaskBound) बेंचमार्क का प्रस्ताव करता है।

Jie Li2026-07-22
⚡ electrical engineering

The Open Ant: A Robot Platform for Reinforcement Learning Research

यह शोध पत्र ओपन एंट (Open Ant) को प्रस्तुत करता है, जो एक ओपन-सोर्स भौतिक रोबोट प्लेटफॉर्म है जिसे सुदृढीकरण अधिगम (रिनफोर्समेंट लर्निंग) अनुसंधान में सिमुलेशन और वास्तविकता के बीच के अंतर को पाटने के लिए डिज़ाइन किया गया है, ताकि शून्य से तीव्र नीति प्रशिक्षण और निर्बाध सिम-टू-रियल स्थानांतरण को सक्षम बनाया जा सके और एक सुलभ प्रायोगिक पारिस्थितिकी तंत्र का समर्थन किया जा सके।

Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil2026-07-22
🤖 machine learning

Now We Know? A Systematic Comparison of TerraMind and THOR

यह शोध पत्र दस विविध उपयोग के मामलों में दो यूरोपीय अंतरिक्ष एजेंसी के जियोस्पेशियल फाउंडेशन मॉडल्स, THOR और TerraMind का एक व्यवस्थित तुलनात्मक विश्लेषण प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि आर्किटेक्चरल डिज़ाइन विकल्प—विशेष रूप से पैच आकार और डिकोडर जटिलता—मॉडल की पहचान की तुलना में प्रदर्शन भिन्नता को अधिक स्पष्ट करते हैं, जो पूरक निवेश रणनीतियों को प्रकट करते हैं और भविष्य के GFM मूल्यांकन के लिए एक नैदानिक पद्धति स्थापित करते हैं।

Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling, Johannes Jakubik, Arnt-Børre Salberg, Theodor Forgaard, Ni (…)2026-07-22
🤖 machine learning

Automated Data Engineering and Feature Selection for the Case Study of Warpage Detection in Fused Deposition Modeling

यह शोध पत्र एक स्वचालित डेटा प्रसंस्करण ढांचे का प्रस्ताव करता है जो FDM वारपेज डिटेक्शन के लिए मशीन लर्निंग मॉडल-फीचर संयोजनों को पुनरावृत्ति रूप से अनुकूलित करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) और SHAP-आधारित फीचर चयन का उपयोग करता है, जिससे बेसलाइन फुल-फीचर कॉन्फ़िगरेशन की तुलना में भविष्य कहने वाली सटीकता और स्थिरता में महत्वपूर्ण सुधार प्राप्त होता है।

Saleh Valizadeh Sotubadi, Nazanin Mahjourian, Vinh Nguyen2026-07-22
🤖 AI

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel एक विश्वसनीय, रूब्रिक-आधारित, तीन-एजेंट एलएलएम (LLM) प्रणाली है जो शिक्षण वीडियो का मूल्यांकन करने के लिए शिक्षार्थी व्यक्तित्वों (learner personas) पर आधारित विशिष्ट एजेंटों के माध्यम से आकलन को विभाजित करती है, जिससे मानव-विशेषज्ञ स्तर की विश्वसनीयता प्राप्त होती है और यह मानव मूल्यांकनकर्ताओं के प्रतिस्थापन के बजाय एक प्रभावी, विश्वास-कैलिब्रेटेड सहायक के रूप में कार्य करती है।

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee2026-07-22
🤖 AI

MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning

MAGE एक मल्टीमॉडल मल्टी-एजेंट फ्रेमवर्क है जो प्राकृतिक भाषा निर्देशों और टूर्नामेंट-शैली मूल्यांकन के छह-चरणीय वर्कफ़्लो के माध्यम से मैक्रो प्लेसमेंट रिफाइनमेंट को स्वचालित करता है, जो डिज़ाइन-विशिष्ट रिट्रेनिंग की आवश्यकता के बिना वाणिज्यिक उपकरणों और मानव विशेषज्ञों दोनों की तुलना में टाइमिंग प्रदर्शन और मानव-समानता में महत्वपूर्ण सुधार प्राप्त करता है।

Andrew B. Kahng, Sayak Kundu, Bodhisatta Pramanik2026-07-22
🤖 machine learning

Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary

यह शोध पत्र प्रदर्शित करता है कि एक फ्रोजन (frozen) 2.6B लूप वाले भाषा मॉडल में "परिचालनात्मक प्रोटो-इंट्रोस्पेक्शन" (operational proto-introspection) होता है, जहाँ छिपी हुई अवस्थाएँ (hidden states) गणना की गुणवत्ता और शाखा परिणामों (branch outcomes) का सटीक पूर्वानुमान लगा सकती हैं, फिर भी बाहरी हस्तक्षेप इन रीडआउट्स को प्रमाणित क्षमता लाभों में बदलने में विफल रहते हैं।

Jan Kirin2026-07-22
💬 NLP

The Story Shapes the Agent: Narrative Priors in LLM Behavior

यह शोध पत्र प्रदर्शित करता है कि किसी कार्य की नैरेटिव फ्रेमिंग (कथात्मक ढांचा) का LLM एजेंट के व्यवहार पर सौंपे गए व्यक्तित्व (पर्सोना) की तुलना में काफी अधिक प्रभाव पड़ता है, जो यह प्रकट करता है कि "नैरेटिव प्रायर्स" (कथात्मक पूर्वधारणाएं) व्यवस्थित क्रिया प्रवृत्तियों को संचालित करती हैं, जबकि प्रभावी क्रॉस-नैरेटिव स्थानांतरण अमूर्त विवरणों के बजाय ठोस क्रियाओं में निर्देशों को निहित करने पर निर्भर करता है।

Yixuan Wang, James Lester, Shashank Srivastava2026-07-22
💬 NLP

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

यह शोध पत्र इस बात की जांच करता है कि कैसे निर्देश-ट्यून किए गए ट्रांसफॉर्मर मॉडल कारण (causation) और प्रतिपक्ष (antithesis) विमर्श संबंधों को एनकोड करते हैं, जो यह प्रकट करता है कि भविष्यवाणात्मक निर्णय परतों के विभिन्न चरणों में लिए जाते हैं और ये मॉडल विमर्श-आधारित तर्क के विषम प्रतिनिधित्व प्रदर्शित करते हैं।

Abhidip Bhattacharyya, Shira Wein2026-07-22