🤖 machine learning

Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control

यह योगदान एंकोर्ड लर्निंग (Anchored Learning) को प्रस्तुत करता है, जो वितरण विचलन (distribution drift) को नियंत्रित करने के लिए एक गतिशील रूप से विकसित होते मूविंग एंकर (moving anchor) का उपयोग करके एलएलएम (LLM) के सुपरवाइज्ड फाइन-ट्यूनिंग में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करता है, जिससे मानक विधियों की तुलना में क्षमता क्षरण को काफी कम करते हुए लगभग इष्टतम प्रदर्शन लाभ प्राप्त होता है।

Xinyu Wang, Changzhi Sun, Yuanbin Wu, Xiaoling Wang2026-05-07
💬 NLP

SpecPL: Disentangling Spectral Granularity for Prompt Learning

SpecPL एक नवीन प्रॉम्प्ट-लर्निंग फ्रेमवर्क पेश करता है जो विजन-लैंग्वेज मॉडल्स में मोडैलिटी विषमता (modality asymmetry) को पाटने के लिए काउंटरफैक्चुअल ग्रैनुलैरिटी सुपरविजन के माध्यम से स्पेक्ट्रल ग्रैनुलैरिटी को डिकपल करता है, जो विजुअल गाइडेंस के साथ टेक्स्ट-ओरिएंटेड बेसलाइन मॉडल्स को पुनर्जीवित करके 11 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jingtao Zhou, Xirui Kang, Feiyang Huang, Lai-Man Po2026-05-07
💬 NLP

Distilling Bayesian Belief States into Language Models for Auditable Negotiation

यह शोध पत्र BOND को प्रस्तुत करता है, जो एक LLM-आधारित बेयसियन शिक्षक के स्पष्ट प्रतिद्वंद्वी-विश्वास अनुमान (opponent-belief inference) को एक छोटे 8B छात्र मॉडल में संकुचित (distill) करने वाला एक ढांचा है, जो अत्याधुनिक बेसलाइनों की तुलना में बेहतर बातचीत प्रदर्शन और ऑडिट करने योग्य विश्वास ट्रैकिंग प्राप्त करता है।

Zongqi Cui, Baihan Lin2026-05-07
💬 NLP

RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation

RaguTeam के SemEval-2026 टास्क 8 के लिए विजेता सिस्टम ने, जो सबसे अच्छे रिस्पॉन्स को चुनने के लिए GPT-4o-mini जज द्वारा ऑर्केस्ट्रेटेड सात LLMs के एक हेट्रोजेनियस एनसेम्बल का उपयोग करता है, सबसे मजबूत बेसलाइन से काफी बेहतर प्रदर्शन करते हुए और लागत प्रभावी Meno-Lite-0.1 मॉडल को पेश करते हुए और टास्क की एनोटेशन सीमाओं की आलोचना करते हुए प्रथम स्थान प्राप्त किया।

Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov2026-05-07
💬 NLP

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM एक हाइब्रिड-DPO ढांचे को पेश करके मानक डायरेक्ट प्रिफरेंस ऑप्टिमाइजेशन (Direct Preference Optimization) में वर्बोसिटी बायस (verbosity bias) और लॉजिकल एलाइनमेंट गैप्स (logical alignment gaps) को संबोधित करता है जो विविध शैक्षणिक डोमेन और मॉडल आर्किटेक्चर में लॉजिकल करेक्टनेस (logical correctness) और आंसर कवरेज (answer coverage) में महत्वपूर्ण सुधार प्राप्त करने के लिए NLI सिग्नल्स को वर्िफायर LLM स्कोर्स के साथ जोड़ता है और मानव एनोटेशन की आवश्यकता को समाप्त करता है।

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock2026-05-07
💬 NLP

The Newsworthiness of Brazilian Distress: A Peak Analysis on Time Series of International Media Attention to Disasters in Brazil

यह शोध पत्र 2000 से 2024 तक ब्राजील की आग और भूस्खलन के बारे में 2,000 जर्मन समाचार लेखों का विश्लेषण करने के लिए टाइम सीरीज़ सेगमेंटेशन का उपयोग करता है ताकि मीडिया ध्यान के शिखर की पहचान की जा सके और यह निर्धारित किया जा सके कि ये अंतर्राष्ट्रीय कवरेज स्पाइक्स राष्ट्रीय और वैश्विक आपदा रिकॉर्ड के साथ कितनी अच्छी तरह संरेखित होते हैं।

Brielen Madureira, Andreas Niekler, Marc Keuschnigg, Mariana Madruga de Brito2026-05-07
💬 NLP

Graph-Augmented LLMs for Swiss MP Ideology Prediction

यह शोध पत्र PG-RAG प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो टेक्स्टुअल सिमेंटिक्स और इंटर-एक्टर संबंधों दोनों का लाभ उठाकर स्विस संसद सदस्यों की वैचारिक स्थितियों के पूर्वानुमान की सटीकता में महत्वपूर्ण सुधार करने के लिए लार्ज लैंग्वेज मॉडल्स के साथ राजनीतिक नॉलेज ग्राफ्स को एकीकृत करता है।

Yifei Yuan, Luis Salamanca, Sophia Schlosser, Laurence Brandenberger2026-05-07
💬 NLP

FAAST: Forward-Only Associative Learning via Closed-Form Fast Weights for Test-Time Supervised Adaptation

FAAST एक विशेष रूप से फॉरवर्ड-डायरेक्टेड एसोसिएटिव लर्निंग पद्धति है जो एकल पास में लेबल किए गए उदाहरणों को फास्ट वेट्स में विश्लेषणात्मक रूप से संकलित करती है, जिससे टेस्ट टाइम पर निरंतर-समय (constant-time), मेमोरी-कुशल सुपरवाइज्ड अडैप्टेशन सक्षम होता है जो बैकप्रोपैगेशन के प्रदर्शन को प्राप्त करते हुए कम्प्यूटेशनल और मेमोरी ओवरहेड को महत्वपूर्ण रूप से कम करता है।

Guangsheng Bao, Hongbo Zhang, Han Cui, Yanbin Zhao, Yue Zhang2026-05-07
💬 NLP

Assessing Cognitive Effort in L2 Idiomatic Processing: An Eye-Tracking Dataset

यह शोध पत्र अंग्रेजी के सभी दक्षता स्तरों वाले पुर्तगाली L1 वक्ताओं के आई-ट्रैकिंग डेटासेट को प्रस्तुत और मान्य करता है, जो यह प्रदर्शित करता है कि यहाँ तक कि 60 हर्ट्ज का प्रवेश-स्तर का हार्डवेयर भी L2 मुहावरेदार प्रसंस्करण की संज्ञानात्मक लागतों को प्रभावी ढंग से पकड़ सकता है और मानव एवं कृत्रिम भाषा मॉडलों दोनों के मूल्यांकन के लिए एक बेंचमार्क प्रदान कर सकता है।

Eduardo Santos, Juliana Carvalho, César Rennó-Costa2026-05-07
💬 NLP

Anticipating Innovation Using Large Language Models

यह शोध पत्र टेकटोकन (TechToken) का परिचय देता है, जो एक ट्रांसफार्मर-आधारित मॉडल है जो दशकों पहले आगामी तकनीकी संयोजनों के शुरुआती संकेतों का पता लगाने के लिए पेटेंट भाषा में सामूहिक परिवर्तनों का विश्लेषण करता है, जिससे नवाचार के पूर्वानुमान में सुधार होता है और पेटेंट-संबंधित कार्यों में अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।

Enrico Maria Fenoaltea, Filippo Santoro, Giordano De Marzo, Segun Taofeek Aroyehun, Andrea Tacchella2026-05-07