cs.CL
11683 पेपर
English K_Quantization of LLMs Does Not Disproportionately Diminish Multilingual Performance
MedSimAI: Simulation and Formative Feedback Generation to Enhance Deliberate Practice in Medical Education
Introducing Verification Task of Set Consistency with Set-Consistency Energy Networks
Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data
RADLADS: Rapid Attention Distillation to Linear Attention Decoders at Scale
NLP for Social Good: A Survey and Outlook of Challenges, Opportunities, and Responsible Deployment
यह शोध पत्र नौ वैश्विक विकास डोमेन में "सामाजिक भलाई के लिए एनएलपी" (NLP for the Social Good) की वर्तमान स्थिति का सर्वेक्षण करता है, उन महत्वपूर्ण अनुसंधान असंतुलनों की पहचान करता है जहाँ समावेश और एआई (AI) संबंधी हानियों का अत्यधिक प्रतिनिधित्व है जबकि गरीबी और पर्यावरण संरक्षण जैसे महत्वपूर्ण क्षेत्र कम खोजे गए हैं, और जनहित के लिए एनएलपी प्रौद्योगिकियों की जिम्मेदार और न्यायसंगत तैनाती सुनिश्चित करने हेतु अंतर-विषयक, मानव-केंद्रित दृष्टिकोणों का समर्थन करता है।
SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
यह शोध पत्र SciArena को प्रस्तुत करता है, जो एक समुदाय-संचालित मूल्यांकन मंच है जो ओपन-एंडेड, साहित्य-आधारित वैज्ञानिक कार्यों पर फाउंडेशन मॉडलों को रैंक करने के लिए मानव शोधकर्ता मतदान का लाभ उठाता है, साथ ही SciArena-Eval को भी जारी करता है, जो मानव प्राथमिकताओं के विरुद्ध स्वचालित मूल्यांकन प्रणालियों की सटीकता का आकलन करने के लिए डिज़ाइन किया गया एक मेटा-बेंचमार्क है।
Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes
यह शोध पत्र इस बात की जांच करता है कि कैसे विभिन्न संरेखण (alignment) विधियाँ बहु-चरण, बहु-पक्षीय अंतःक्रियाओं में सहयोगात्मक भागीदारों के रूप में LLMs की प्रभावशीलता को प्रभावित करती हैं, और नवीन रोलप्ले सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि क्रिया संशोधन (action modification) के प्रति सुदृढ़ हस्तक्षेप एजेंट, समूहों को सही विचारोन्मुख परिणामों की ओर निर्देशित करने में मानक संरेखण बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं।
Can LLM Infer Risk Information From MCP Server System Logs?
यह शोध पत्र मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) सर्वर सिस्टम लॉग में सुरक्षा जोखिमों का पता लगाने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए पहला सिंथेटिक बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि GRPO जैसी सुदृढीकरण शिक्षण (reinforcement learning) तकनीकें उच्च सटीकता और संतुलित प्रिसिजन-रिकॉल प्राप्त करने में सुपरवाइज्ड फाइन-ट्यूनिंग और छोटे मॉडलों की तुलना में काफी बेहतर प्रदर्शन करती हैं।