🤖 machine learning

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

प्रतिनिधित्व लेंसों (representation lenses) को परतों के माध्यम से प्रेडिक्टिव रीडआउट सबस्पेस (predictive readout subspaces) के विकास को ट्रैक करने के लिए ज्यामितीय नैदानिक उपकरणों के रूप में पुनरुद्देश्यित करके, यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल अगले-टोकन भविष्यवाणी (next-token prediction) को तीन विशिष्ट ज्यामितीय चरणों—सीडिंग मल्टीप्लेक्सिंग (Seeding Multiplexing), होइस्टिंग ओवरराइडिंग (Hoisting Overriding), और फोकल कन्वर्जेंस (Focal Convergence)—के माध्यम से संसाधित करते हैं, जहाँ मॉडल की बढ़ती गहराई मुख्य रूप से प्रतिनिधित्व क्षमता का विस्तार करने के बजाय उम्मीदवार विसंयोजन (candidate disambiguation) को बढ़ाती है।

Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni2026-05-12
🤖 machine learning

LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language

यह शोध पत्र LLiMba को प्रस्तुत करता है, जो एक 3B-पैरामीटर वाला सार्डिनियन भाषा मॉडल है जिसे निरंतर प्रीट्रेनिंग और फाइन-ट्यूनिंग के माध्यम से एकल कंज्यूमर GPU पर अनुकूलित किया गया है, जो यह प्रदर्शित करता है कि एक हाई-रैंक rsLoRA कॉन्फ़िगरेशन अन्य अनुकूलन विधियों की तुलना में अनुवाद की गुणवत्ता में बेहतर प्रदर्शन करता है, साथ ही स्क्रिप्ट लीकेज और तथ्यात्मक मतिभ्रम (hallucinations) जैसी गुणात्मक विफलताओं को पकड़ने में मानक मेट्रिक्स की महत्वपूर्ण सीमाओं को भी उजागर करता है।

Luca Ballore2026-05-12
🤖 machine learning

GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives

यह शोध पत्र GAMBIT को प्रस्तुत करता है, जो मल्टी-एजेंट LLM कलेक्टिव्स में सह-विकसित अनुकूलनशील विरोधियों (co-evolving adaptive adversaries) को प्रदर्शित करने वाला एक नवीन बेंचमार्क और डेटासेट है, ताकि यह दर्शाया जा सके कि अनुकूलनशील खतरों के लिए ज़ीरो-शॉट मूल्यांकन भ्रामक है और मजबूत छद्म पहचान (imposter detection) के लिए फ्यू-शॉट पुनर्मूल्यांकन (few-shot recalibration) अत्यंत महत्वपूर्ण है।

Alexandre Le Mercier, Chris Develder, Thomas Demeester2026-05-12
🤖 machine learning

Spherical Boltzmann machines: a solvable theory of learning and generation in energy-based models

यह शोध पत्र स्फेरिकल बोल्ट्ज़मैन मशीन को एक समाधान योग्य उच्च-आयामी ऊर्जा-आधारित मॉडल के रूप में प्रस्तुत करता है जो रैंडम मैट्रिक्स थ्योरी और डायनेमिकल मीन-फील्ड थ्योरी का लाभ उठाकर प्रशिक्षण गतिकी, बायेसियन साक्ष्य और चरण संक्रमणों को सटीक रूप से अभिलक्षित करता है, जिससे यह प्रकट होता है कि कैसे ये सैद्धांतिक तंत्र डबल डिसेंट और मानक आर्किटेक्चर में देखे जाने वाले आउट-ऑफ-इक्विलिब्रियम बायस जैसी जटिल जनरेटिव घटनाओं को आधार प्रदान करते हैं।

Thomas Tulinski, Simona Cocco, Rémi Monasson, Jorge Fernandez-De-Cossio-Diaz2026-05-12
🤖 machine learning

Accelerating Zeroth-Order Spectral Optimization with Partial Orthogonalization from Power Iteration

यह शोध पत्र ZO-MOPI का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) को फाइन-ट्यून करने के लिए एक ज़ीरो-ऑर्डर ऑप्टिमाइज़ेशन विधि है, जो पूर्ण ऑर्थोगोनलाइज़ेशन (full orthogonalization) को पावर इटरेशन (power iteration) और मोमेंटम-आधारित सबस्पेस प्रोजेक्शन (momentum-based subspace projection) का उपयोग करके आंशिक ऑर्थोगोनलाइज़ेशन रणनीति से बदलकर अभिसरण (convergence) को तेज़ करता है, जिससे प्रतिस्पर्धी सटीकता बनाए रखते हुए अत्याधुनिक ZO-Muon की तुलना में 1.5x से 4x तेज़ अभिसरण प्राप्त होता है।

Jiahe Chen, Ziye Ma2026-05-12
🤖 machine learning

Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective

यह शोध पत्र सैद्धांतिक रूप से प्रदर्शित करता है कि मौजूदा प्लास्टिसिटी डायग्नोस्टिक्स जैसे कि रिप्रेजेंटेशन और न्यूरल टेंगेंट कर्नेल रैंक, ट्रेनैबिलिटी लॉस (trainability loss) की भविष्यवाणी करने में विफल हो सकते हैं, और एक नया मीट्रिक प्रस्तावित करता है जिसे "ऑप्टिमाइज़ेशन रेडीनेस" (optimization readiness) कहा जाता है जो भविष्य के ऑप्टिमाइज़ेशन गेन्स को अधिक सटीक रूप से अनुमान लगाने के लिए ग्रेडिएंट स्ट्रेंथ और रिलायबिलिटी को जोड़ता है, जो डीप कॉन्टिनुअल लर्निंग में सहायक है।

Jiuqi Wang, Jayanth Srinivasa, Claire Chen, Shuze Daniel Liu, Ali Payani, Shangtong Zhang2026-05-12
🔬 physics

Nonlinear GENERIC Informed Neural Networks (N-GINNs): learning GENERIC dynamics with non-quadratic dissipation potentials

यह शोध पत्र नॉनलीन GENERIC इन्फॉर्म्ड न्यूरल नेटवर्क्स (N-GINNs) प्रस्तुत करता है, जो एक ऐसा डीप लर्निंग फ्रेमवर्क है जो उन प्रणालियों के लिए विकास समीकरणों (evolution equations) को सटीक रूप से खोजने हेतु उत्तल विसर्जन क्षमताओं (convex dissipation potentials) के माध्यम से ऊष्मागतिक निरंतरता (thermodynamic consistency) लागू करता है, जिनमें संरक्षी गतिकी (conservative dynamics) और गैर-द्विघाती विसर्जन (non-quadratic dissipation) दोनों प्रदर्शित होते हैं।

Vojtěch Votruba, Zequn He, Weilun Qiu, Celia Reina, Michal Pavelka2026-05-12
💰 quantitative finance

A Market-Rule-Informed Neural Network for Efficient Imbalance Electricity Price Forecasting

यह शोध पत्र एक मार्केट-रूल-इन्फॉर्म्ड न्यूरल नेटवर्क फ्रेमवर्क प्रस्तावित करता है जो सटीक, कुशल और सुदृढ़ बिजली मूल्य पूर्वानुमान प्राप्त करने के लिए न्यूरल लेटेंट स्पेस में इम्बैलेंस प्राइस फॉर्मेशन नियमों को समाहित करता है, जो जेनेरिक डीप लर्निंग बेसलाइन्स की तुलना में कम मापदंडों और तेज़ प्रशिक्षण के साथ संपन्न है।

Runyao Yu, Julia Lin, Derek W. Bunn, Jochen Stiasny, Wentao Wang, Yujie Chen, Tara Esterl, Peter Palensky, Jochen L. Cre (…)2026-05-12
🤖 machine learning

Dependency-Aware Discrete Diffusion for Scene Graph Generation

यह शोध पत्र एक निर्भरता-जागरूक (dependency-aware), पदानुक्रमित रूप से बाधित (hierarchically constrained) डिस्क्रीट डिफ्यूजन मॉडल प्रस्तुत करता है जो संरचना और अर्थविज्ञान (semantics) को अलग करके प्राकृतिक भाषा से संरचित सीन ग्राफ उत्पन्न करता है, जिससे मौजूदा टेक्स्ट-टू-इमेज और ग्राफ जनरेशन बेसलाइन की तुलना में डाउनस्ट्रीम इमेज जनरेशन कार्यों में कंपोजिशनल फिडेलिटी (compositional fidelity) में सुधार होता है।

Rajalaxmi Rajagopalan, Romit Roy Choudhury2026-05-12
🤖 AI

Robust Multi-Agent LLMs under Byzantine Faults

यह शोध पत्र सेल्फ-एंकोर्ड कंसेंसस (SAC) को प्रस्तुत करता है, जो एक पूर्णतः विकेंद्रीकृत इटरेटिव फ़िल्टर-एंड-रिफ़ाइन प्रोटोकॉल है जो लार्ज लैंग्वेज मॉडल मल्टी-एजेंट सिस्टम को असुरक्षित लीडर-आधारित समन्वय या स्व-रिपोर्टेड कॉन्फिडेंस पर निर्भर रहे बिना, विविध संचार टोपोलॉजी में बायज़ेंटाइन दोषों का मजबूती से प्रतिरोध करने और विश्वसनीय प्रदर्शन बनाए रखने में सक्षम बनाता है।

Haejoon Lee, Vincent-Daniel Yun, Hyeonho Oh, Dimitra Panagou, Sai Praneeth Karimireddy2026-05-12