🤖 machine learning

REViT: Roto-reflection Equivariant Convolutional Vision Transformer

यह शोध पत्र REViT को प्रस्तुत करता है, जो एक नवीन डिस्क्रीट रोटो-रिफ्लेक्शन इक्विवैरिएंट विज़न ट्रांसफार्मर है जो रोटेशनल, फ्लिप और पोजीशनल सिमिट्रीज़ को प्रभावी ढंग से संरक्षित करने के लिए कन्वोल्यूशनल अटेंशन को शामिल करता है, जो मौजूदा इक्विवैरिएंट न्यूरल नेटवर्क दृष्टिकोणों की तुलना में इमेज क्लासिफिकेशन में बेहतर प्रदर्शन प्रदर्शित करता है।

Sheir A. Zaheer, Alexander C. Holston, Chan Y. Park2026-06-25
🤖 machine learning

Lifelong In-Context Learning with Transformers Requires Parametric Forms of Attention

यह शोध पत्र तर्क देता है कि इन-कॉन्टेक्स्ट लर्निंग (in-context learning) को आजीवन (lifelong) परिवेशों तक विस्तारित करने के लिए मानक ट्रांसफॉर्मर के मेमोरी-गहन, नॉनपैरामीट्रिक सॉफ्टमैक्स अटेंशन (nonparametric softmax attention) को पैरामीट्रिक अटेंशन तंत्रों से बदलने की आवश्यकता है जो निरंतर मेमोरी फुटप्रिंट बनाए रखने के लिए ऑनलाइन रिग्रेशन के माध्यम से की-वैल्यू (key-value) संबंधों को सीखते हैं, जबकि साथ ही वर्तमान सीमाओं की पहचान करता है और लॉन्ग-होराइजन (long-horizon) एआई एजेंटों के विकास को निर्देशित करने के लिए खुले प्रश्न प्रस्तावित करता है।

Luke McDermott, Robert W. Heath jr., Rahul Parhi2026-06-25
🔢 mathematics

Learning Optimization Proxies for Sequential Contextual Stochastic Programs: An Order Fulfillment Application

यह शोध पत्र एक लर्निंग-आधारित ऑप्टिमाइज़ेशन प्रॉक्सी प्रस्तावित करता है जो ओम्नीचैनल ऑर्डर पूर्ति के लिए अनुक्रमिक प्रासंगिक स्टोकेस्टिक प्रोग्राम्स को हल करने हेतु एक सिनेरियो-एम्बेडेड न्यूरल नेटवर्क को एक व्यवहार्यता-प्रवर्तक (फिजिबिलिटी-एनफोर्सिंग) डिकोडर के साथ जोड़ता है, जिससे पारंपरिक सॉल्वर्स और स्थापित नीतियों की तुलना में पूर्ति लागत और विलंब-वितरण दरों को महत्वपूर्ण रूप से कम करते हुए सब-सेकंड निर्णय विलंबता (डिसीजन लेटेंसी) प्राप्त होती है।

Tinghan Ye, Shuaicheng Tong, Changkun Guan, Beste Basciftci, Pascal Van Hentenryck2026-06-25
🤖 machine learning

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation

यह शोध पत्र तर्क देता है कि संक्षिप्तता उत्पन्न करने के लिए डेटा क्यूरेशन (data curation) VLM इन्फरेंस दक्षता में सुधार के लिए एक महत्वपूर्ण लीवर है, जो यह प्रदर्शित करता है कि संक्षिप्त और सटीक डेटा पर प्रशिक्षण, सटीकता से समझौता किए बिना, प्रति सही उत्तर की कम्प्यूटेशनल लागत (Cost-of-Pass) को काफी कम कर देता है, और अक्सर आउटपुट की लंबाई स्थिर होने पर भी प्रदर्शन में सुधार करता है।

DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab (…)2026-06-25
💬 NLP

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

यह शोध पत्र "रिक्लैम इवैल्यूएशन" (reclaim evaluation) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडल की स्मृति में उनके सहायक तर्क के बिना गलत निष्कर्षों को बनाए रखना, बिल्कुल भी स्मृति न होने की तुलना में अधिक हानिकारक है, और एक "सोर्स-फर्स्ट" (source-first) नीति का प्रस्ताव करता है जो गणना योग्य स्रोतों को सुरक्षित रखती है जबकि व्युत्पन्न निष्कर्षों को त्याग देती है ताकि सुधार क्षमता को बहाल किया जा सके और मेमोरी लूप्स में त्रुटि प्रसार को रोका जा सके।

Alex Kwon2026-06-25
🤖 machine learning

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

यह शोधपत्र 'जनरलाइजेशन स्पेक्ट्रम' (Generalization Spectrum) प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है कि विभिन्न स्थानांतरण दूरियों (transfer distances) के माध्यम से प्रति-नमूना सामान्यीकरण को मापता है, जिससे यह पता चलता है कि जबकि सुदृढीकरण शिक्षण (reinforcement learning), सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में रटने (memorization) को निकट-स्थानांतरण (near-transfer) में अधिक कुशलता से परिवर्तित करता है, विभिन्न अनुकूलन तकनीकें अक्सर सामान्यीकरण त्रिज्या (generalization radius) का विस्तार करने में विफल रहती हैं या दूर-स्थानांतरण (far-transfer) क्षमताओं को कम भी कर सकती हैं।

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai2026-06-25
⚡ electrical engineering

Blasto-Net: An Explainable Multi-Task Learning for Blastocyst Segmentation, Grading, and Implantation Prediction

यह शोध पत्र ब्लास्टो-नेट (Blasto-Net) को प्रस्तुत करता है, जो एक व्याख्यात्मक मल्टी-टास्क डीप लर्निंग मॉडल है जो IVF में नैदानिक निर्णय लेने में सहायता के लिए उच्च सटीकता और शारीरिक निरंतरता के साथ ब्लास्टोसिस्ट सेगमेंटेशन, मॉर्फोलॉजिकल ग्रेडिंग और इम्प्लांटेशन प्रेडिक्शन को एक साथ निष्पादित करता है।

Zahra Asghari Varzaneh, Reza Khoshkangini, Magnus Johnsson, Thomas Ebner, Lars Johansson2026-06-25
💬 NLP

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

यह शोध पत्र प्रकट करता है कि LLM जेलब्रेक सफलता दर को मापने के लिए उपयोग किए जाने वाले स्वचालित जज अत्यधिक अविश्वसनीय हैं, जिसमें समर्पित क्लासिफायर ओवर-फ्लैगिंग के प्रति प्रवृत्त होते हैं और LLM-एज़-जज अस्थिर रिकॉल तथा प्रतिकूल फ्रेमिंग (adversarial framing) के प्रति अत्यधिक संवेदनशील होते हैं, जिससे जज प्रदर्शन मेट्रिक्स और प्रतिकूल मजबूती (adversarial robustness) जांच के मानकीकृत रिपोर्टिंग की आवश्यकता उत्पन्न होती है।

Yang Gao (Veyon Solutions)2026-06-25
🤖 machine learning

Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning

यह शोध पत्र IF-Beta का प्रस्ताव करता है, जो एक कुशल नॉलेज डिस्टिलेशन फ्रेमवर्क है जो डेटा प्रूनिंग को अनुकूलित करने के लिए इन्फ्लुएंस फंक्शन्स और एक सीखने योग्य बीटा-डिस्ट्रीब्यूशन-आधारित सैंपलिंग पॉलिसी का लाभ उठाता है, जिससे छात्र मॉडल (स्टूडेंट मॉडल्स) जो काफी कम डेटा और कंप्यूट पर प्रशिक्षित किए गए हैं, उन मॉडल्स से बेहतर प्रदर्शन करने में सक्षम होते हैं जो पूर्ण डेटासेट पर डिस्टिल किए गए हैं।

Yifan Wu, Yiqi Wang, Xichen Ye, Wenjing Yan, Xiaoqiang Li, Cheng Jin, Xiangyu Yue, Weizhong Zhang2026-06-25