💬 NLP

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

यह शोध पत्र **VideoBiasEval** प्रस्तुत करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो यह प्रकट करता है कि कैसे अलाइनमेंट ट्यूनिंग—वीडियो की गुणवत्ता में सुधार करने के बावजूद—मानव प्राथमिकता डेटासेट से रिवॉर्ड मॉडल्स के माध्यम से वीडियो डिफ्यूजन मॉडल्स में रूढ़ियों को प्रसारित करके अनजाने में सामाजिक पूर्वाग्रहों को बढ़ाती और स्थिर करती है।

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu2026-02-12
💬 NLP

Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders

यह शोध पत्र RAGLens को प्रस्तुत करता है, जो एक हल्का और व्याख्या योग्य मतिभ्रम डिटेक्टर (hallucination detector) है जो अनैतिक रिट्रीवल-ऑगमेंटेड जनरेशन (unfaithful retrieval-augmented generation) का संकेत देने वाले LLMs के विशिष्ट आंतरिक सक्रियण फीचर्स (internal activation features) की पहचान करने के लिए स्पार्स ऑटोएनकोडर (SAEs) का उपयोग करता है।

Guangzhi Xiong, Zhenghao He, Bohan Liu, Sanchit Sinha, Aidong Zhang2026-02-12
💬 NLP

SegNSP: Revisiting Next Sentence Prediction for Linear Text Segmentation

यह शोध पत्र SegNSP को प्रस्तुत करता है, जो एक लेबल-अज्ञेय (label-agnostic) दृष्टिकोण है जो रैखिक टेक्स्ट सेगमेंटेशन को नेक्स्ट सेंटेंस प्रेडिक्शन कार्य के रूप में फ्रेम करता है, और स्पष्ट विषय पर्यवेक्षण (topic supervision) की आवश्यकता के बिना प्रभावी ढंग से विषय सीमाओं का पता लगाने के लिए एक सेगमेंटेशन-अवेयर लॉस और हार्ड नेगेटिव सैंपलिंग का उपयोग करता है।

José Isidro, Filipe Cunha, Purificação Silvano, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, Ricardo Campos2026-02-12
💬 NLP

A.X K1 Technical Report

A.X K1 एक 519B-पैरामीटर वाला Mixture-of-Experts (MoE) लैंग्वेज मॉडल है जिसे 10T टोकन पर प्रशिक्षित किया गया है और इसमें एक अनूठा "Think-Fusion" प्रशिक्षण नुस्खा (recipe) है, जो उपयोगकर्ताओं को कुशल, नियंत्रणीय परिनियोजन (deployment) के लिए रीजनिंग और नॉन-रीजनिंग मोड के बीच स्विच करने की अनुमति देता है।

Sung Jun Cheon, Jaekyung Cho, Seongho Choi, Hyunjun Eun, Seokhwan Jo, Jaehyun Jun, Minsoo Kang, Jin Kim, Jiwon Kim, Mins (…)2026-02-12
💬 NLP

Building Production-Ready Probes For Gemini

यह शोध पत्र नए प्रोब आर्किटेक्चर प्रस्तावित करता है जिन्हें वितरण बदलावों (distribution shifts)—विशेष रूप से लंबी-संदर्भ इनपुट (long-context inputs)—की चुनौती को दूर करके मॉडल के दुरुपयोग को कम करने के लिए डिज़ाइन किया गया है, और गूगल के जेमिनी (Gemini) में मजबूत, कुशल और सामान्यीकरण योग्य सुरक्षा निगरानी प्रदान करने के लिए उनकी सफल तैनाती का प्रदर्शन करता है।

János Kramár, Joshua Engels, Zheng Wang, Bilal Chughtai, Rohin Shah, Neel Nanda, Arthur Conmy2026-02-12
💬 NLP

Polymer-Agent: Large Language Model Agent for Polymer Design

पॉलिमर-एजेंट (Polymer-Agent) एक क्लोज्ड-लूप फ्रेमवर्क है जो प्रयोगशाला शोधकर्ताओं को सिंथेटिक रूप से व्यवहार्य पॉलिमर संरचनाओं के गुण पूर्वानुमान, संरचना निर्माण और संशोधन के लिए एक सुलभ इंटरफेस प्रदान करने हेतु लार्ज लैंग्वेज मॉडल (Large Language Model) तर्क का लाभ उठाता है।

Vani Nigam, Achuth Chandrasekhar, Amir Barati Farimani2026-02-12
💬 NLP

MRAG: Benchmarking Retrieval-Augmented Generation for Bio-medicine

यह शोध पत्र MRAG को प्रस्तुत करता है, जो एक नया द्विभाषी (अंग्रेजी और चीनी) बेंचमार्क और टूलकिट है जिसे बायोमेडिकल डोमेन के भीतर रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम के मूल्यांकन और विकास को व्यवस्थित रूप से सुगम बनाने के लिए डिज़ाइन किया गया है।

Liz Li, Wei Zhu2026-02-12
💬 NLP

Scaling Embeddings Outperforms Scaling Experts in Language Models

यह शोध पत्र यह प्रदर्शित करता है कि एम्बेडिंग आयामों (embedding dimensions) को स्केल करना, मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) को स्केल करने की तुलना में स्पर्सिटी (sparsity) और प्रदर्शन लाभ प्राप्त करने का एक अधिक कुशल तरीका हो सकता है, एक ऐसा निष्कर्ष जिसे लॉन्गकैट-फ्लैश-लाइट (LongCat-Flash-Lite) के परिचय द्वारा मान्य किया गया है, जो न्यूनतम एक्टिवेशन लागत वाला एक उच्च-प्रदर्शन वाला 68.5B पैरामीटर मॉडल है।

Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong (…)2026-02-12
💬 NLP

Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond

यह शोध पत्र चार चिकित्सा सूचना निष्कर्षण कार्यों में ChatGPT के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि यह उच्च गुणवत्ता वाले स्पष्टीकरण प्रदान करता है और स्रोत ग्रंथों के प्रति वफादार रहता है, लेकिन यह फाइन-ट्यून्ड मॉडलों की तुलना में कम प्रदर्शन करता है और अति-आत्मविश्वास एवं जनरेशन अनिश्चितता से ग्रस्त है।

Liz Li, Wei Zhu2026-02-12
💬 NLP

Industrialized Deception: The Collateral Effects of LLM-Generated Misinformation on Digital Ecosystems

यह शोध पत्र दो नए उपकरणों, जजजीपीटी (JudgeGPT) और रोगजीपीटी (RogueGPT) से युक्त एक प्रयोगात्मक पाइपलाइन प्रस्तुत करता है, जिसका उद्देश्य एआई-जनित दुष्प्रचार के प्रति मानवीय धारणा का अध्ययन करना और जनरेटिव मॉडल्स एवं डिटेक्शन रणनीतियों के बीच चल रही हथियारों की दौड़ का मूल्यांकन करना है।

Alexander Loth, Martin Kappes, Marc-Oliver Pahl2026-02-12