🤖 machine learning

The Quantization Benefits of Residual-Free Transformers

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर में रेसिडुअल कनेक्शन (residual connections) एक्टिवेशन की नॉन-गॉसियनता (non-Gaussianity) और क्वांटाइजेशन त्रुटियों को बढ़ाते हैं, लेकिन ऑर्थोगोनल इनिशियलाइजेशन (orthogonal initialization) और स्पेक्ट्रल ऑप्टिमाइजेशन (spectral optimization) के माध्यम से प्रशिक्षित रेसिडुअल-मुक्त आर्किटेक्चरों के साथ उन्हें बदलने से ऐसे मॉडल प्राप्त होते हैं जिनमें लगभग गॉसियन एक्टिवेशन होते हैं जो न्यूनतम फुल-प्रिसिजन प्रदर्शन हानि के साथ लो-बिट क्वांटाइजेशन के प्रति काफी अधिक सुदृढ़ होते हैं।

Yiping Ji, Mahalakshmi Sabanayagam, Peyman Moghadam, Hemanth Saratchandran, Simon Lucey2026-05-26
🤖 machine learning

Conformalised imprecise inference for robust extrapolation under limited data

यह शोध पत्र एक मॉडल-अज्ञेय (model-agnostic) कॉन्फॉर्मलाइज्ड इम्प्रेसिस इन्फरेंस फ्रेमवर्क प्रस्तावित करता है जो वितरण संबंधी बदलावों (distributional shifts) को मजबूती से संभालने और डेटा-दुर्लभ परिदृश्यों के दौरान विश्वसनीय कवरेज बनाए रखने के लिए वैध प्रोबेबिलिटी बॉक्स उत्पन्न करता है।

Yu Chen, Scott Ferson2026-05-26
🤖 machine learning

Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models

यह शोध पत्र एक सैद्धांतिक सूचना-सैद्धांतिक सीमा स्थापित करता है जो यह सिद्ध करता है कि विजन-लैंग्वेज-एक्शन मॉडल एक अंतर्निहित व्यापार-संबंध (trade-off) का सामना करते हैं जहाँ क्षमता और सुदृढ़ता (robustness) का योग कार्य एन्ट्रॉपी (task entropy) और प्रतिकूल चैनल क्षमता (adversarial channel capacity) द्वारा निर्धारित एक निश्चित बजट से अधिक नहीं हो सकता है, जिससे यह प्रदर्शित होता है कि एक आयाम में महत्वपूर्ण सुधार अनिवार्य रूप से दूसरे की कीमत पर आते हैं।

Jianwei Tai2026-05-26
🤖 machine learning

Merge-Bench: Resolve Merge Conflicts with Large Language Models

यह शोध पत्र Merge-Bench को पेश करता है, जो वास्तविक दुनिया के मर्ज संघर्षों (merge conflicts) का एक बड़े पैमाने का डेटासेट है, और LLMergeJ प्रस्तुत करता है, जो Group Relative Policy Optimization के साथ प्रशिक्षित एक जावा-विशिष्ट मॉडल है जो कई वाणिज्यिक LLMs से बेहतर प्रदर्शन करता है, हालांकि वर्तमान में सबसे अच्छे मॉडल भी 11 प्रोग्रामिंग भाषाओं में 60% से कम संघर्षों को हल करते हैं।

Benedikt Schesch, Michael D. Ernst2026-05-26
💰 quantitative finance

Predicting Stock Price Direction on Earnings Announcement Days using Multi-modal Deep Learning

यह अध्ययन प्रदर्शित करता है कि एक ट्रांसफॉर्मर-आधारित मल्टी-मोडल डीप लर्निंग मॉडल, जो फर्म के बुनियादी सिद्धांतों (फंडामेंटल्स), तकनीकी संकेतकों और FinBERT-व्युत्पन्न समाचार भावना को एकीकृत करता है, अर्निंग घोषणा के दिनों में स्टॉक की कीमत की दिशा की भविष्यवाणी करने में लॉजिस्टिक रिग्रेशन और LSTM बेसलाइन दोनों से बेहतर प्रदर्शन करता है, क्योंकि यह अस्थिर गतिविधियों के प्रति श्रेष्ठ संवेदनशीलता प्राप्त करता है।

Manuel Noseda, Nathan Soldati, Marco Paina2026-05-26
🤖 machine learning

Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

यह शोध पत्र कॉन्ट्रास्टिव डिकोडिंग डिफिंग (CDD) को प्रस्तुत करता है, जो एक ग्रे-बॉक्स विधि है जो केवल आउटपुट-लेवल लॉजिट डिस्ट्रीब्यूशन का उपयोग करके लैंग्वेज मॉडल्स से वर्बेटिम फाइनट्यूनिंग कंटेंट को रिकवर करती है, जो सटीकता और गति में मौजूदा व्हाइट-बॉक्स तकनीकों से बेहतर प्रदर्शन करते हुए मॉडल ट्रेनिंग डेटा और पाइपलाइन आर्टिफैक्ट्स में अभूतपूर्व पारदर्शिता सक्षम करती है।

Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano, Neo Christopher Chung2026-05-26
💬 NLP

Universal Activation Verbalizer: A Unified Framework for Cross-Model Activation Explanation

यह शोध पत्र यूनिवर्सल एक्टिवेशन वर्बलाइज़र (UAV) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो एक साझा डिकोडर और हल्के एडेप्टर का उपयोग करता है ताकि विषम डोनर मॉडलों के बीच क्रॉस-मॉडल एक्टिवेशन स्पष्टीकरण को सक्षम बनाया जा सके, जो स्वयं-स्पष्टीकरण (self-explanation) बेसलाइन के प्रतिस्पर्धी प्रदर्शन को प्राप्त करते हुए कुशल एडेप्टर-ओनली ट्रांसफर का समर्थन करता है।

Haiyan Zhao, Zirui He, Guanchu Wang, Ali Payani, Yingcong Li, Mengnan Du2026-05-26
🤖 machine learning

Multi-Agent Systems are Mixtures of Experts: Who Becomes an Influencer?

यह शोध पत्र मल्टी-एजेंट एलएलएम (LLM) विचार-विमर्श को इनपुट-निर्भर फ्राइडकिन-जॉनसन (Friedkin-Johnsen) ओपिनियन डायनेमिक्स द्वारा शासित 'मिक्सचर ऑफ एक्सपर्ट्स' के रूप में प्रस्तुत करता है, जो यह प्रदर्शित करता है कि प्रदर्शन में सुधार तब होता है जब प्रभाव को आत्मविश्वास और प्रारंभिक संरेखण जैसे गुप्त एजेंट सक्षमता के अवलोकन योग्य प्रॉक्सी के आधार पर रूट किया जाता है।

Franka Bause, Jonas Niederle, Martin Pawelczyk, Rebekka Burkholz2026-05-26
🤖 machine learning

Quantitative Evaluation of the Severity of Posttraumatic Stress Disorder through Transfer Learning from Specific Phobia Data

यह अध्ययन शारीरिक संकेतों (हृदय गति और गैल्वेनिक स्किन रिस्पांस) पर मल्टीवेरिएट कर्नेल डेंसिटी एस्टीमेशन का उपयोग करते हुए एक मशीन लर्निंग दृष्टिकोण प्रस्तावित करता है, जिसे एराक्नोफोबिया डेटा से ट्रांसफर लर्निंग के माध्यम से प्रशिक्षित किया गया है, ताकि 86% सटीकता के साथ पीटीएसडी (PTSD) स्थिति को वस्तुनिष्ठ रूप से वर्गीकृत किया जा सके और 5.6 के माध्य पूर्ण त्रुटि (mean absolute error) के साथ लक्षण की गंभीरता का अनुमान लगाया जा सके।

Nicolas Ricka, Gauthier Pellegrin, Denis A. Fompeyrine, Thomas Rohaly, Leah Enders, Heather Roy2026-05-26
🤖 machine learning

Building an Adversarial Malware Dataset by Family and Type: Generation, Evasion, and Poisoning Evaluation

यह शोध पत्र RawMal-TF संग्रह से प्राप्त 77,000 से अधिक एडवर्सरियल (adversarial) PE मालवेयर नमूनों के एक सार्वजनिक रूप से जारी किए गए डेटासेट को प्रस्तुत करता है, जो EMBER क्लासिफायर के विरुद्ध उनकी उच्च इवेजन (evasion) दरों और मशीन लर्निंग-आधारित डिटेक्शन सिस्टम को पॉइजन करने में उनके महत्वपूर्ण प्रभाव को प्रदर्शित करता है।

David Košťál, Martin Jureček2026-05-26