💻 computer science

The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust

यह शोध पत्र ACUTE प्रोटोकॉल प्रस्तुत करता है, जो एक कंप्यूट-कुशल एक्टिवेशन-आधारित फ्रेमवर्क है जो EURO नामक एक नवीन मीट्रिक के माध्यम से कैलिब्रेशन और सूचनात्मकता को संतुलित करके भाषा मॉडल की विश्वसनीयता में सुधार करता है, और कई कार्यों एवं मॉडल परिवारों में बेहतर प्रदर्शन प्रदर्शित करता है।

Nishant Subramani, Palash Goyal, Yiwen Song, Mani Malek, Yuan Xue, Tomas Pfister, Hamid Palangi2026-06-09
💻 computer science

Jas: AI-Paired Engineering as a Revival of N-Version Programming

यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि जब AI-युग्मित इंजीनियरिंग को एक सटीक निष्पादन योग्य विनिर्देश (executable specification) द्वारा अनुंयोजित और समानांतर N-वर्जन कार्यान्वयन के माध्यम से मान्य किया जाता है, तो यह एक एकल डेवलपर को लगभग 120 घंटों में पांच विशिष्ट सॉफ्टवेयर पोर्ट्स बनाने में सक्षम बनाता है, जो प्रभावी रूप से 1980 के दशक की लागत-प्रभावी N-वर्जन प्रोग्रामिंग पद्धति को पुनर्जीवित करता है।

Jason Hickey2026-06-09
🔬 materials science

Agentic multi-fidelity learning of quasiparticle and excitonic properties

यह शोध पत्र एक एजेंट-निर्देशित मल्टी-फिडेलिटी लर्निंग फ्रेमवर्क प्रस्तुत करता है जो GW-Bethe-Salpeter गणनाओं में संख्यात्मक अस्थिरताओं (numerical instabilities) को पहचानने के लिए एक स्ट्रक्चरल एजेंट का उपयोग करता है और स्ट्रेनयुक्त MoS2-WS2 द्विपरतों में क्वैसीपार्टिकल और एक्सिटोनिक गुणों की सटीक भविष्यवाणी करने के लिए मशीन लर्निंग सुधार लागू करता है, जो यह प्रदर्शित करता है कि उत्तेजित-अवस्था वाली सामग्रियों के विश्वसनीय सरोगेट मॉडलिंग के लिए संख्यात्मक भंगुरता (numerical fragility) का स्पष्ट पता लगाना आवश्यक है।

Arnab Neogi, Aaron Forde, Christopher A. Lane, Sergei Tretiak, Jian-Xin Zhu2026-06-09
💻 computer science

Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices

यह शोध पत्र एज डिवाइसेस पर छोटे लैंग्वेज मॉडल्स के सुरक्षित वितरित प्रशिक्षण (डिस्ट्रीब्यूटेड ट्रेनिंग) के लिए एक मॉडल मल्टीप्लिसिटी फ्रेमवर्क प्रस्तावित करता है, जो पारंपरिक सिंगल-मॉडल डिफेंस की तुलना में एडवर्सरियल पॉइजनिंग का अधिक प्रभावी ढंग से पता लगाने और उसे अलग करने के लिए समवर्ती रूप से प्रशिक्षित स्वतंत्र मॉडल्स के बीच विचलन (डाइवर्जेंस) का लाभ उठाता है।

Stefan Behfar, Richard Mortier2026-06-09
🤖 AI

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

यह शोधपत्र सुरक्षा मूल्यांकन में जज के रूप में LLMs की सीमाओं की जांच करता है, जो यह प्रकट करता है कि हालांकि वे नए संदर्भ से सीख सकते हैं, लेकिन वे विरोधाभासी जानकारी या परिभाषाओं के अनुकूल होने के बजाय अक्सर अपने आंतरिक सुरक्षा पूर्वाग्रहों (safety priors) का सख्ती से पालन करते हैं।

Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant2026-06-09
💻 computer science

The Cross-Architecture Substrate: A Domain-Transcendent, Calibration-Surviving Geometric Invariant of Modern Vision Encoders

यह शोध पत्र एक सार्वभौमिक, सोलह-आयामी ज्यामितीय अपरिवर्तनीय (invariant) को प्रकट करता है जिसे "क्रॉस-आर्किटेक्चर सबस्ट्रेट" कहा जाता है, जो विविध आधुनिक विज़न एनकोडर्स और डोमेन में प्रशिक्षण के शुरुआती चरणों में उभरता है, कैलिब्रेशन में भी जीवित रहता है और ट्रांसफर क्वालिटी या क्रॉस मोडैलिटीज की भविष्यवाणी करने में विफल होने के बावजूद बेहतर लेबल-मुक्त हस्तांतरणीयता फ़िल्टरिंग, डोमेन डिटेक्शन, लो-शॉट प्रोबिंग और टीचर-फ्री डिस्टिलेशन को सक्षम बनाता है।

Yousef Radwan2026-06-09
💻 computer science

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

यह शोध पत्र "स्ट्रेन्ड कोहेरेंस" (strained coherence) को पेश करता है, जो एक सुरक्षा-संबंधित विफलता मोड है जहाँ LLM-आधारित कोडिंग एजेंट तर्क संबंधी खामियों को स्वीकार करने के बावजूद आगे बढ़ते रहते हैं, और यह प्रदर्शित करता है कि इस पैटर्न की पहचान करने वाला एक विशेष डिटेक्टर उच्च सटीकता और व्याख्यात्मकता के साथ निष्पादन विफलताओं (execution failures) की महत्वपूर्ण भविष्यवाणी करता है।

Marut Pandya, Kasey Zhang, Baiqing Lyu2026-06-09
🤖 AI

The AI Epistemic Deference Index: A Continuous Measure of Sycophancy

यह शोध पत्र एआई एपिस्टेमिक डिफरेंस इंडेक्स (AEDI) प्रस्तुत करता है, जो एक निरंतर बेंचमार्क है जो यह मापता है कि भाषा मॉडल विविध प्रॉम्प्ट्स के माध्यम से श्रेणीबद्ध समर्थन में बदलाव को मापकर उपयोगकर्ता के दृष्टिकोण के प्रति कितने संवेदनशील हैं, जिससे प्रमुख एआई प्रदाताओं के बीच चाटुकारितापूर्ण व्यवहार में महत्वपूर्ण और व्यवस्थित भिन्नताओं का पता चलता है।

Alejandro Botas, Paul de Font-Reaulx, Luke Hewitt2026-06-09
🤖 AI

EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification

यह शोध पत्र EditSR का प्रस्ताव करता है, जो एक दो-परतीय ढांचा है जो एक पूर्व-प्रशिक्षित, एडिट-आधारित रेक्टिफायर (rectifier) का उपयोग करके न्यूरल सिम्बोलिक रिग्रेशन को बढ़ाता है ताकि शुरू में उत्पन्न अभिव्यक्तियों पर चरण-दर-चरण, सिंटैक्टिक रूप से वैध सुधार किए जा सकें, जिससे वैश्विक खोज पुनरारंभ (global search restarts) की दक्षता लागत के बिना जटिल परिदृश्यों में त्रुटि संचय को प्रभावी ढंग से कम किया जा सके।

Da Li, Xinxin Li, Xingyu Cui, Jin Xu, Juan Zhang, Junping Yin2026-06-09
💬 NLP

Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation

यह शोध पत्र लॉन्ग-फॉर्म टेक्स्ट जनरेशन अनुसंधान में मानव मूल्यांकन प्रोटोकॉल का एक बड़े पैमाने पर विश्लेषण प्रस्तुत करता है, जो हाल ही के सीएल (CL) सम्मेलन प्रकाशनों में महत्वपूर्ण पद्धतिगत विवरणों की व्यापक स्तर पर कम रिपोर्टिंग को प्रकट करता है और पारदर्शिता एवं पुनरुत्पादकता में सुधार के लिए कार्रवाई योग्य सिफारिशें प्रदान करता है।

Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi, Zongwan Cao, Chenjun Xu, Bingbing Wen, Su Lin Blodgett, Lucy Lu Wang2026-06-09