💬 NLP

Federated Co-tuning Framework for Large and Small Language Models

यह शोध पत्र FedCoLLM को प्रस्तुत करता है, जो एक पैरामीटर-कुशल फेडरेटेड फ्रेमवर्क है जो हल्के एडेप्टर के माध्यम से सर्वर-साइड लार्ज लैंग्वेज मॉडल्स और क्लाइंट-साइड स्मॉल लैंग्वेज मॉडल्स के बीच पारस्परिक ज्ञान संवर्धन को सक्षम बनाता है, जिससे डेटा गोपनीयता बनाए रखते हुए और कम्प्यूटेशनल ओवरहेड को न्यूनतम करते हुए दोनों के लिए महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Tao Fan, Yan Kang, Guoqiang Ma, Lixin Fan, Shuoling Liu, Kai Chen, Qiang Yang2026-04-24
💬 NLP

SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging

SafeMERGE एक हल्का, पोस्ट-फाइन-ट्यूनिंग फ्रेमवर्क है जो डाउनस्ट्रीम टास्क उपयोगिता को बनाए रखते हुए सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) को बहाल करने के लिए कोसाइन सिमिलैरिटी मानदंड के आधार पर सेफ्टी-अलाइन्ड मॉडल्स से फाइन-ट्यून्ड LLMs के लेयर्स को चुनिंदा रूप से मर्ज करता है।

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Holger Boche2026-04-24
💬 NLP

An Ontology-Driven Graph RAG for Legal Norms: A Structural, Temporal, and Deterministic Approach

यह शोध पत्र SAT-Graph RAG प्रस्तुत करता है, जो एक ऑन्टोलॉजी-संचालित ढांचा है जो जटिल कानूनी प्रश्नों के लिए नियत (deterministic), ऑडिट योग्य और सामयिक रूप से सटीक रिट्रिवल-ऑगमेंटेड जनरेशन को सक्षम करने के लिए स्पष्ट पदानुक्रमित, टेम्पोरल और कारण संरचनाओं के साथ कानूनी मानदंडों को मॉडल करता है।

Hudson de Martim2026-04-24
💬 NLP

XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration

XtraGPT ओपन-सोर्स, संदर्भ-जागरूक लार्ज लैंग्वेज मॉडल्स का एक सुइट है जो विशेष रूप से पुनरावृत्ति आधारित शैक्षणिक शोध पत्रों के संशोधन के लिए फाइन-ट्यून किया गया है, जो वैचारिक सुसंगतता बनाए रखने और वैज्ञानिक ड्राफ्ट्स में सुधार करने के लिए एक नवीन मानव-एआई सहयोग ढांचे और 1,40,000 निर्देश-प्रतिक्रिया युग्मों के क्यूरेटेड डेटासेट का लाभ उठाते हुए मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Nuo Chen, Andre Lin HuiKai, Jiaying Wu, Junyi Hou, Zining Zhang, Qian Wang, Xidong Wang, Bingsheng He2026-04-24
🤖 machine learning

Secure LLM Fine-Tuning via Safety-Aware Probing

यह शोध पत्र सेफ्टी-अवेयर प्रोबिंग (SAP) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो हिडन स्टेट्स में सुरक्षा-सहसंबंधित दिशाओं की पहचान करके और उन्हें विचलित करके LLM फाइन-ट्यूनिंग के दौरान सुरक्षा क्षरण को कम करता है, ताकि कार्य प्रदर्शन को सुरक्षित रखते हुए पैरामीटर अपडेट को हानिकारक प्रक्षेपवक्रों से दूर ले जाया जा सके।

Chengcan Wu, Zhixin Zhang, Zeming Wei, Yihao Zhang, Xiaokun Luan, Meng Sun2026-04-24
💬 NLP

It's High Time: A Survey of Temporal Question Answering

यह शोध पत्र टेम्पोरल क्वेश्चन एनswering (TQA) का एक व्यापक सर्वेक्षण प्रस्तुत करता है, जो कॉर्पस और प्रश्न की टेम्पोरलिटी के बीच के अंतर्संबंधों का परीक्षण करने वाले एक एकीकृत ढांचे के माध्यम से मौजूदा शोध को व्यवस्थित करता है और न्यूरल आर्किटेक्चर एवं लार्ज लैंग्वेज मॉडल्स द्वारा संचालित हालिया प्रगति की समीक्षा करता है।

Bhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Avishek Anand, Adam Jatowt2026-04-24
💬 NLP

RewardBench 2: Advancing Reward Model Evaluation

यह शोध पत्र RewardBench 2 को प्रस्तुत करता है, जो नए मानव प्रॉम्प्ट्स से निर्मित एक कठोर नया बहु-कौशल बेंचमार्क है जो रिवॉर्ड मॉडल्स के लिए अधिक चुनौतीपूर्ण मूल्यांकन प्रदान करता है और साथ ही इन्फरेंस-टाइम स्केलिंग और RLHF ट्रेनिंग दोनों में उनके डाउनस्ट्रीम प्रदर्शन के साथ मजबूत सहसंबंध प्रदर्शित करता है।

Saumya Malik, Valentina Pyatkin, Sander Land, Jacob Morrison, Noah A. Smith, Hannaneh Hajishirzi, Nathan Lambert2026-04-24
📊 statistics

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

यह शोध पत्र अनुकूलनशील टेस्ट-टाइम कंप्यूट आवंटन के लिए एक नवीन बैंडिट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो समाधान योग्य चुनौतीपूर्ण उदाहरणों पर संसाधनों को प्राथमिकता देने के लिए क्वेरी की कठिनाई का गतिशील रूप से अनुमान लगाता है, जिससे गणित और कोड बेंचमार्क पर समान आवंटन की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Bowen Zuo, Yinglun Zhu2026-04-24
💬 NLP

Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs

यह स्थिति पत्र तर्क देता है कि बहुभाषी लार्ज लैंग्वेज मॉडल्स, विशेष रूप से 'मॉडल कोलैप्स' के रूप में ज्ञात स्व-उपभोग प्रशिक्षण लूपों के माध्यम से, दुर्लभ व्याकरणिक विशेषताओं और सांस्कृतिक बारीकियों को धीरे-धीरे नष्ट करके भाषाई विविधता के लिए एक सूक्ष्म खतरा पैदा करते हैं, जिससे प्राकृतिक भाषा प्रसंस्करण (NLP) को बहुभाषी रचनात्मकता की सक्रिय रूप से रक्षा करने और उसे महत्व देने की ओर स्थानांतरित होने की आवश्यकता है।

Eva Vanmassenhove2026-04-24
💬 NLP

Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models

यह शोध पत्र LLMThinkBench प्रस्तुत करता है, जो 53 LLMs का एक व्यापक बेंचमार्क और अनुभवजन्य अध्ययन है जो एक महत्वपूर्ण सटीकता-दक्षता ट्रेडऑफ़ (accuracy-efficiency tradeoff) को प्रकट करता है, यह प्रदर्शित करते हुए कि मॉडल अक्सर बुनियादी गणितीय समस्याओं के लिए अत्यधिक टोकन उत्पन्न करके "ओवरथिंक" (overthink) करते हैं जिससे सटीकता में सुधार नहीं होता है और कभी-कभी तर्क बजट (reasoning budgets) सीमित होने पर प्रदर्शन में महत्वपूर्ण गिरावट आती है।

Gaurav Srivastava, Aafiya Hussain, Sriram Srinivasan, Xuan Wang2026-04-24