🤖 AI

Reasoning Structure Matters for Safety Alignment of Reasoning Models

यह शोध पत्र AltTrain का प्रस्ताव करता है, जो एक सरल पोस्ट-ट्रेनिंग विधि है जो हल्के सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से उनके रीजनिंग स्ट्रक्चर (तर्क संरचना) को स्पष्ट रूप से बदलकर बड़े रीजनिंग मॉडल्स में सुदृढ़ सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) प्राप्त करती है, जिससे जटिल सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) की आवश्यकता समाप्त हो जाती है।

Yeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung Park2026-04-22
💬 NLP

Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

यह शोध पत्र डेटा पूर्वाग्रह को कम करने और पुनरुत्पादनीय बेंचमार्क स्थापित करने के लिए एक नए एकत्रित ट्विटर डेटासेट का उपयोग करते हुए, तीन मुख्य सोशल मीडिया एनालिटिक्स कार्यों—लेखक सत्यापन (authorship verification), पोस्ट जनरेशन, और उपयोगकर्ता विशेषता अनुमान (user attribute inference)—में आधुनिक लार्ज लैंग्वेज मॉडल्स का पहला व्यापक मूल्यांकन प्रस्तुत करता है।

Ramtin Davoudi, Kartik Thakkar, Nazanin Donyapour, Tyler Derr, Hamid Karimi2026-04-22
🤖 machine learning

Self-Improving Tabular Language Models via Iterative Group Alignment

यह शोध पत्र TabGRAA को प्रस्तुत करता है, जो एक नवीन स्व-सुधार (self-improving) ढांचा है जो सिंथेटिक डेटा को उच्च-गुणवत्ता और निम्न-गुणवत्ता समूहों में विभाजित करने के लिए स्वचालित गुणवत्ता संकेतों का उपयोग करके टैबुलर लैंग्वेज मॉडल्स को पुनरावृत्ति (iteratively) के माध्यम से संरेखित करता है, जिससे बिना किसी मैनुअल रिवॉर्ड डिज़ाइन या अतिरिक्त वास्तविक डेटा एक्सपोज़र के जनरेशन फिडेलिटी, उपयोगिता और गोपनीयता में वृद्धि होती है।

Yunbo Long, Tejumade Afonja, Alexandra Brintrup, Mario Fritz2026-04-22
🤖 AI

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

SAVOIR एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो सामाजिक संवाद में क्रेडिट असाइनमेंट समस्या को हल करने के लिए शापली मानों (Shapley values) और अपेक्षित उपयोगिता (expected utility) का लाभ उठाता है, जिससे SOTOPIA बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और व्यक्तिगत कथनों की रणनीतिक क्षमता को प्रभावी ढंग से कैप्चर करके प्रोप्रायटरी मॉडलों से बेहतर प्रदर्शन किया जाता है।

Xiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Yuxuan Gu, Chonghan Qin (…)2026-04-22
🤖 AI

AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos

AutoAWG एक नियंत्रणीय प्रतिकूल मौसम वीडियो जनरेशन फ्रेमवर्क है स्वायत्त ड्राइविंग के लिए जो उच्च-निष्ठा (high-fidelity) और टेम्पोरल रूप से सुसंगत मौसम-प्रभावित वीडियो उत्पन्न करने के लिए सिमेंटिक्स-गाइडेड एडेप्टिव फ्यूजन, वैनिशिंग पॉइंट-एंकरड टेम्पोरल सिंथेसिस और मास्कड ट्रेनिंग का उपयोग करता है, जो दृश्य गुणवत्ता और एनोटेशन पुन: प्रयोज्यता में अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करता है।

Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun2026-04-22
🤖 machine learning

Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees

यह शोध पत्र DSR प्रस्तुत करता है, जो एक न्यूरो-सिम्बोलिक फ्रेमवर्क है जो गणितीय कथनों को सटीक त्रुटि सुधार के लिए संरचित ऑपरेटर पेड़ों में विघटित करके ऑटोफॉर्मलाइजेशन में सुधार करता है, और नए प्रस्तावित PRIME बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करता है।

Xiaoyang Liu, Zineng Dong, Yifan Bai, Yantao Li, Yuntian Liu, Tao Luo2026-04-22
🤖 machine learning

FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion

FedProxy एक ऐसे फ्रेमवर्क का उपयोग करके बौद्धिक संपदा की सुरक्षा, गोपनीयता सुनिश्चित करने और फेडरेटेड LLM फाइन-ट्यूनिंग में प्रदर्शन हानि को कम करने की चुनौतियों का समाधान करता है, जो सहयोगी प्रशिक्षण के लिए एक उच्च-सटीक सरोगेट के रूप में एक शक्तिशाली, संकुचित प्रॉक्सी स्मॉल लैंग्वेज मॉडल का उपयोग करता है, जिसके बाद केंद्रीकृत प्रदर्शन के करीब पहुँचने के लिए एक ट्रेनिंग-फ्री फ्यूजन तंत्र का उपयोग किया जाता है।

Tao Fan, Guoqiang Ma, Yuanfeng Song, Lixin Fan, Kai Chen, Qiang Yang2026-04-22
🤖 machine learning

Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

यह शोध पत्र एक क्लोज्ड-लूप एक्टिवेशन स्टीयरिंग पद्धति प्रस्तावित करता है जो LLMs की अनुभवजन्य रूप से देखी गई स्थानीय रैखिकता (local linearity) का लाभ उठाते हुए अनुमान (inference) को एक लीनियर टाइम-वेरिंग सिस्टम के रूप में मॉडल करती है, जिससे बिना ऑफलाइन ट्रेनिंग के मजबूत, सूक्ष्म और सैद्धांतिक रूप से गारंटीकृत व्यवहार मॉड्यूलेशन के लिए लीनियर क्वाड्रेटिक रेगुलेटर (LQR) कंट्रोल का उपयोग सक्षम होता है।

Julian Skifstad, Xinyue Annie Yang, Glen Chou2026-04-22
🤖 AI

On Accelerating Grounded Code Development for Research

यह शोध पत्र एक ओपन-सोर्स फ्रेमवर्क प्रस्तुत करता है जो कोडिंग एजेंटों को वास्तविक समय में अद्यतित अनुसंधान रिपॉजिटरी और तकनीकी दस्तावेज़ों तक पहुँचने में सक्षम बनाकर विशिष्ट वैज्ञानिक और तकनीकी क्षेत्रों के लिए ग्राउंडेड कोड विकास को गति देता है, जिससे विकसित होते क्षेत्रों में फाउंडेशनल मॉडल्स की सीमाओं को दूर किया जा सके।

Santosh Ganji2026-04-22
🤖 machine learning

Intentional Updates for Streaming Reinforcement Learning

यह शोधपत्र "इन्टेन्शनल अपडेट्स" (intentional updates) का प्रस्ताव करता है, जो एक ऐसी रणनीति है जो फंक्शन आउटपुट या पॉलिसी व्यवहार में विशिष्ट, पूर्व-निर्धारित परिवर्तनों को प्राप्त करने के लिए स्टेप साइज़ को गतिशील रूप से समायोजित करती है, जिससे स्ट्रीमिंग डीप रिइन्फोर्समेंट लर्निंग को स्थिर किया जाता है और बैच एवं रिप्ले-बफ़र विधियों के तुलनीय अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

Arsalan Sharifnassab, Mohamed Elsayed, Kris De Asis, A. Rupam Mahmood, Richard S. Sutton2026-04-22