💬 NLP

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

यह शोध पत्र "फ्रैजिलिटी" (fragility) को पेश करता है, जो एक पूरक मीट्रिक है जो उस एक्टिवेशन-नॉइज़ स्तर को मापता है जिस पर लीनियर प्रोब सटीकता ढह जाती है, ताकि एलएलएम (LLM) प्री-ट्रेनिंग में विकसित होते प्रतिनिधि संरचनाओं और नैतिक एन्कोडिंग ग्रेडिएंट्स को प्रकट किया जा सके जो मानक प्रोब सटीकता संतृप्त होने के बाद अदृश्य हो जाते हैं।

Orion Reblitz-Richardson2026-06-11
💬 NLP

Small Experiments, Cheaper Decisions: A Case Study in Staged Promotion for Micro-Pretraining

यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि लघु, विषम माइक्रो-प्रीट्रेनिंग (micro-pretraining) रन का उपयोग करने वाला एक चरणबद्ध पदोन्नति प्रोटोकॉल (staged promotion protocol) हाइपरपैरामीटर कॉन्फ़िगरेशनों को प्रभावी ढंग से फ़िल्टर कर सकता है और अनफ़िल्टर्ड निरंतरता रणनीतियों की तुलना में कुल प्रयोगात्मक लागत को 12% से 56% तक कम कर सकता है, जबकि यह स्वीकार करता है कि परिणाम वैश्विक इष्टतमता (global optimality) के दावे के बजाय एक सीमित लागत-आवंटन निष्कर्ष का प्रतिनिधित्व करते हैं।

Felipe Chavarro Polania2026-06-11
🤖 machine learning

Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

यह शोध पत्र एक कंप्यूट-अवेयर (compute-aware) मूल्यांकन ढांचे का प्रस्ताव करता है जो निश्चित क्वेरी बजट के बजाय संचयी FLOPs का उपयोग करके प्रतिकूल जोखिम (adversarial risk) को मापता है, जिससे यह पता चलता है कि अलाइनमेंट ट्रेनिंग और मॉडल स्केलिंग का बड़े भाषा मॉडलों (LLMs) को जेलब्रेक करने के लिए आवश्यक कम्प्यूटेशनल प्रयास पर गैर-एकदिष्ट (non-monotonic) और श्रेणी-निर्भर प्रभाव पड़ता है।

Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik, Colin Raffel2026-06-11
🤖 AI

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

यह शोध पत्र MPC-Patch-Bench को प्रस्तुत करता है, जो एक नवीन रिपॉजिटरी-स्तरीय बेंचमार्क है जिसे एक विशेष डेटा क्यूरेशन फ्रेमवर्क और एक कठोर MPC वेरीफायर के माध्यम से क्रिप्टोग्राफिक सुरक्षा और संख्यात्मक निष्ठा (numerical fidelity) को लागू करके, मौजूदा बेंचमार्क की अद्वितीय संरचनात्मक और सुरक्षा सीमाओं को संबोधित करते हुए, सिक्योर मल्टी-पार्टी कंप्यूटेशन कोड रिपेयर पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Yukuan Zhang, Mengxin Zheng, Qian Lou2026-06-11
🤖 machine learning

Signed Compression Progress on a Sealed Audit is Goodhart-Resistant

यह शोध पत्र सिद्ध करता है कि हस्ताक्षरित संपीड़न प्रगति (signed compression progress), जिसे एक निश्चित सीलबंद ऑडिट पैनल पर हानि में कमी के रूप में परिभाषित किया गया है, एक क्षितिज-मुक्त (horizon-free), गुडहार्ट-प्रतिरोधी अंतर्निहित पुरस्कार प्रदान करती है जो यह गारंटी देती है कि संचयी पुरस्कार वास्तविक मॉडल सुधार के बजाय शोषण को दर्शाते हैं, जो कि औपचारिक लीन 4 (Lean 4) मशीनीकरण और विभिन्न हमले के वेक्टरों के विरुद्ध अनुभवजन्य सत्यापन द्वारा समर्थित है।

Ayush Mittal, Dhruv Gupta2026-06-11
🤖 AI

Towards a Bridge Layer Between Bibliographic and Formalized Mathematical Knowledge

यह शोध पत्र ग्रंथ सूची संबंधी मेटाडेटा को औपचारिक प्रमाण कलाकृतियों (formal proof artifacts) से जोड़ने के लिए एक रिलेशनल ब्रिज डेटाबेस और एक पेपर-स्तरीय औपचारिकीकरण स्कोर (paper-level formalization score) प्रस्तावित करता है, जिसका लक्ष्य गणितीय साहित्य और मशीन-सत्यापन योग्य प्रमाणों को एक स्केलेबल, मशीन-एक्शन करने योग्य ज्ञान ग्राफ में एकीकृत करना है।

A. Mayeux2026-06-11
🤖 AI

INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

INFRAMIND एक सुदृढीकरण शिक्षण (reinforcement learning) आधारित ढांचा है जो वास्तविक समय की बुनियादी ढांचा स्थितियों के अनुसार टोपोलॉजी योजना, मॉडल रूटिंग और अनुरोध शेड्यूलिंग को गतिशील रूप से अनुकूलित करके मल्टी-एजेंट LLM ऑर्केस्ट्रेशन को अनुकूलित करता है, जिससे उच्च समवर्ती भार (high concurrent loads) के तहत सटीकता में उल्लेखनीय सुधार होता है, विलंबता (latency) कम होती है और सख्त सेवा-स्तर उद्देश्यों (service-level objectives) को बनाए रखा जाता है।

Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou2026-06-11
🤖 AI

Forecasting Future Behavior as a Learning Task

यह शोध पत्र तर्कसंगत प्रक्षेप पथों (reasoning trajectories) से भविष्य के एआई मॉडल परिणामों की सीधे भविष्यवाणी करने के लिए विशिष्ट "व्यवहार पूर्वानुमानकर्ताओं" (Behavior Forecasters) को प्रशिक्षित करने का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण पारंपरिक, अक्सर अविश्वसनीय स्पष्टीकरणों की आवश्यकता को दरकिनार करते हुए सटीकता और दक्षता में उन्नत भाषा मॉडलों से बेहतर प्रदर्शन करता है।

Mosh Levy, Yoav Goldberg, Asa Cooper Stickland2026-06-11
💬 NLP

AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable

यह अध्ययन पाता है कि जबकि एआई कोडिंग एजेंट मानवीय पद्धतिगत विविधता के बराबर या उससे अधिक हो सकते हैं और अनुभवजन्य रूप से सुसंगत अनुमान उत्पन्न कर सकते हैं, वे व्याख्यात्मक पूर्वाग्रह के प्रति विशिष्ट रूप से संवेदनशील बने रहते हैं, जहाँ स्पष्ट प्रॉम्प्ट अंतर्निहित डेटा विश्लेषण को बदले बिना उनके अंतिम निष्कर्षों को नाटकीय रूप से बदल सकते हैं।

Meysam Alizadeh, Fabrizio Gilardi, Mohsen Mosleh, Enkelejda Kasneci2026-06-11
🤖 machine learning

LSTM-Based Detection of Structural Breaks in Property Insurance Loss Reserving: A Climate-Informed Approach

यह शोध पत्र संपत्ति बीमा हानि आरक्षण (property insurance loss reserving) में संरचनात्मक परिवर्तनों (structural breaks) का पता लगाने के लिए जलवायु-समृद्ध एलएसटीएम (LSTM) न्यूरल नेटवर्क का उपयोग करने वाले एक अनुसंधान कार्यक्रम का प्रस्ताव करता है, जिसका लक्ष्य पारंपरिक बीमांकिक विधियों की तुलना में सटीकता और अनुकूलन क्षमता में बेहतर प्रदर्शन करना है और साथ ही औपचारिक प्रदर्शन गारंटी के साथ एक सैद्धांतिक ढांचा प्रदान करना है।

Thomas Mbrice, Shashwat Panigrahi2026-06-11