🧬 biology

GENERator: A Long-Context Generative Genomic Foundation Model

यह शोध पत्र GENERator को प्रस्तुत करता है, जो कि 386 बिलियन न्यूक्लियोटाइड्स पर प्री-ट्रेन किया गया एक अत्यधिक कुशल, दीर्घ-संदर्भ (98k) वाला जनरेटिव जीनोमिक फाउंडेशन मॉडल है, जो वेरिएंट प्रेडिक्शन और फाइलोगेनेटिक विश्लेषण के लिए मजबूत ज़ीरो-शॉट क्षमताओं का प्रदर्शन करता है, जबकि फाइन-ट्यून्ड बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त करता है और कार्यात्मक प्रोटीन-कोडिंग अनुक्रमों तथा सिंथेटिक नियामक तत्वों के व्यावहारिक डिज़ाइन को सक्षम बनाता है।

Wei Wu, Qiuyi Li, Yuanyuan Zhang, Zhihao Zhan, Ruipu Chen, Mingyang Li, Kun Fu, Junyan Qi, Yongzhou Bao, Chao Wang, Yihe (…)2026-02-03
💬 NLP

Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

यह शोध पत्र AdaRFT प्रस्तुत करता है, जो एक अनुकूली पाठ्यक्रम शिक्षण (adaptive curriculum learning) विधि है जो रिवॉर्ड सिग्नल्स के आधार पर समस्या की कठिनाई को गतिशील रूप से समायोजित करके लार्ज लैंग्वेज मॉडल्स के सुदृढीकरण फाइनट्यूनिंग (reinforcement finetuning) की दक्षता और सटीकता को महत्वपूर्ण रूप से बढ़ाता है, जिससे गणितीय तर्क प्रदर्शन में सुधार करते हुए प्रशिक्षण समय को 2 गुना तक कम किया जा सकता है।

Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao2026-02-03
💬 NLP

Can Reasoning LLMs Enhance Clinical Document Classification?

यह अध्ययन MIMIC-IV डेटासेट पर आठ लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और पाता है कि जहाँ रीजनिंग मॉडल्स, नॉन-रीजनिंग मॉडल्स की तुलना में क्लिनिकल डॉक्यूमेंट क्लासिफिकेशन में उच्च सटीकता और F1 स्कोर प्राप्त करते हैं, वहीं बाद वाले अधिक निरंतरता प्रदान करते हैं, जो यह सुझाव देता है कि वास्तविक दुनिया की क्लिनिकल कोडिंग को अनुकूलित करने के लिए एक हाइब्रिड दृष्टिकोण सबसे अच्छा हो सकता है।

Akram Mustafa, Usman Naseem, Mostafa Rahimi Azghadi2026-02-03
💬 NLP

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

यह शोध पत्र APE-Bench प्रस्तुत करता है, जो वास्तविक दुनिया के रिपॉजिटरी-स्केल कार्यों को निकालने और विविध एजेंट कार्यान्वयनों में सिंटैक्टिक संकलन (syntactic compilation) और सिमेंटिक शुद्धता (semantic correctness) दोनों को मान्य करने के लिए एक एकीकृत हार्नेस प्रदान करके औपचारिक गणित पुस्तकालयों में स्वचालित प्रमाण इंजीनियरिंग (automated proof engineering) के मूल्यांकन के लिए पहला व्यवस्थित ढांचा और बेंचमार्क है।

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li2026-02-03
💬 NLP

Conflicts in Texts: Data, Implications and Challenges

यह सर्वेक्षण प्राकृतिक ग्रंथों, मानव-एनोटेटेड डेटा और मॉडल इंटरैक्शन के माध्यम से एनएलपी (NLP) में विरोधाभासी सूचना की अवधारणा को एकीकृत करता है, उनके मॉडल विश्वसनीयता पर प्रभावों का विश्लेषण करता है और संघर्ष-जागरूक प्रणालियों को विकसित करने के लिए शमन रणनीतियों का प्रस्ताव करता है।

Siyi Liu, Dan Roth2026-02-03
💬 NLP

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

यह शोध पत्र यह प्रदर्शित करता है कि पूर्व-प्रशिक्षित बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को फाइन-ट्यून करने के लिए परिणाम-आधारित पुरस्कारों के साथ सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) का उपयोग करने से वे दोहरे उद्देश्य वाले संज्ञानात्मक मॉडल के रूप में कार्य करने में सक्षम होते हैं जो मानव जोखिम भरे विकल्पों के लिए मजबूत भविष्य कहने वाली सटीकता और व्याख्या योग्य प्राकृतिक भाषा स्पष्टीकरण दोनों एक साथ उत्पन्न करते हैं।

Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths2026-02-03
💬 NLP

ARC: Argument Representation and Coverage Analysis for Zero-Shot Long Document Summarization with Instruction Following LLMs

यह शोधपत्र आर्गुमेंट रिप्रेजेंटेशन कवरेज (ARC) प्रस्तुत करता है, जो एक बॉटम-अप मूल्यांकन ढांचा है जो यह प्रकट करता है कि कैसे इंस्ट्रक्शन-फॉलोइंग लार्ज लैंग्वेज मॉडल्स ज़ीरो-शॉट लॉन्ग डॉक्यूमेंट समराइजेशन में महत्वपूर्ण तर्कों को अक्सर छोड़ देते हैं, विशेष रूप से कानून और विज्ञान जैसे उच्च-दांव वाले डोमेन में, और साथ ही कॉन्टेक्स्ट विंडोज़ और आर्गुमेंट रोल्स से संबंधित व्यवस्थित पूर्वाग्रहों की पहचान करता है।

Mohamed Elaraby, Diane Litman2026-02-03
💬 NLP

A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems

यह शोध पत्र एक नवीन मल्टी-एजेंट फ्रेमवर्क प्रस्तावित करता है जो एक बोली अनुवाद एजेंट (dialect translation agent) और एक डोमेन विशेषज्ञ एजेंट को एकीकृत करके गोपनीयता नीति प्रश्न-उत्तर प्रणालियों में बोली संबंधी पूर्वाग्रहों को कम करता है, जिससे मॉडल पुनर्रचना या बोली-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता के बिना विविध डेटासेट्स पर महत्वपूर्ण सटीकता सुधार प्राप्त होता है।

Đorđe Klisura, Astrid R Bernaga Torres, Anna Karen Gárate-Escamilla, Rajesh Roshan Biswal, Ke Yang, Hilal Pataci, Anthon (…)2026-02-03
⚡ electrical engineering

PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs

यह शोध पत्र PAL को प्रस्तुत करता है, जो एक हाइब्रिड फ्रेमवर्क है जो समृद्ध ऑडियो सिमेंटिक्स को LLMs में कुशलतापूर्वक स्थानांतरित करने के लिए एक कॉम्पैक्ट PLITS प्रोजेक्शन को एक लाइटवेट LAL इंजेक्शन मैकेनिज्म के साथ जोड़ता है, जिससे मौजूदा इंटीग्रेशन प्रतिमानों की तुलना में बेहतर प्रदर्शन और काफी कम कम्प्यूटेशनल ओवरहेड प्राप्त होता है।

Tony Alex, Wish Suharitdamrong, Sara Atito, Armin Mustafa, Philip J. B. Jackson, Imran Razzak, Muhammad Awais2026-02-03
💬 NLP

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

यह शोध पत्र DP-Fusion का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक टोकन-स्तरीय डिफरेंशियल प्राइवेट इन्फरेंस तंत्र है, जो आउटपुट पर संवेदनशील संदर्भ टोकनों के प्रभाव को प्रमाणित रूप से सीमित करता है ताकि मौजूदा विधियों की तुलना में काफी बेहतर गोपनीयता और उपयोगिता ट्रेड-ऑफ के साथ उच्च-गुणवत्ता वाली दस्तावेज़ गोपनीयता सक्षम की जा सके।

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas2026-02-03