💬 NLP

NLP for Social Good: A Survey and Outlook of Challenges, Opportunities, and Responsible Deployment

यह शोध पत्र नौ वैश्विक विकास डोमेन में "सामाजिक भलाई के लिए एनएलपी" (NLP for the Social Good) की वर्तमान स्थिति का सर्वेक्षण करता है, उन महत्वपूर्ण अनुसंधान असंतुलनों की पहचान करता है जहाँ समावेश और एआई (AI) संबंधी हानियों का अत्यधिक प्रतिनिधित्व है जबकि गरीबी और पर्यावरण संरक्षण जैसे महत्वपूर्ण क्षेत्र कम खोजे गए हैं, और जनहित के लिए एनएलपी प्रौद्योगिकियों की जिम्मेदार और न्यायसंगत तैनाती सुनिश्चित करने हेतु अंतर-विषयक, मानव-केंद्रित दृष्टिकोणों का समर्थन करता है।

Antonia Karamolegkou, Angana Borah, Eunjung Cho, Sagnik Ray Choudhury, Martina Galletti, Pranav Gupta, Oana Ignat, Priya (…)2026-01-23
💬 NLP

SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks

यह शोध पत्र SciArena को प्रस्तुत करता है, जो एक समुदाय-संचालित मूल्यांकन मंच है जो ओपन-एंडेड, साहित्य-आधारित वैज्ञानिक कार्यों पर फाउंडेशन मॉडलों को रैंक करने के लिए मानव शोधकर्ता मतदान का लाभ उठाता है, साथ ही SciArena-Eval को भी जारी करता है, जो मानव प्राथमिकताओं के विरुद्ध स्वचालित मूल्यांकन प्रणालियों की सटीकता का आकलन करने के लिए डिज़ाइन किया गया एक मेटा-बेंचमार्क है।

Yilun Zhao, Kaiyan Zhang, Tiansheng Hu, Sihong Wu, Ronan Le Bras, Charles McGrady, Taira Anderson, Jonathan Bragg, Josep (…)2026-01-23
💬 NLP

Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes

यह शोध पत्र इस बात की जांच करता है कि कैसे विभिन्न संरेखण (alignment) विधियाँ बहु-चरण, बहु-पक्षीय अंतःक्रियाओं में सहयोगात्मक भागीदारों के रूप में LLMs की प्रभावशीलता को प्रभावित करती हैं, और नवीन रोलप्ले सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि क्रिया संशोधन (action modification) के प्रति सुदृढ़ हस्तक्षेप एजेंट, समूहों को सही विचारोन्मुख परिणामों की ओर निर्देशित करने में मानक संरेखण बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy2026-01-23
💬 NLP

Can LLM Infer Risk Information From MCP Server System Logs?

यह शोध पत्र मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) सर्वर सिस्टम लॉग में सुरक्षा जोखिमों का पता लगाने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए पहला सिंथेटिक बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि GRPO जैसी सुदृढीकरण शिक्षण (reinforcement learning) तकनीकें उच्च सटीकता और संतुलित प्रिसिजन-रिकॉल प्राप्त करने में सुपरवाइज्ड फाइन-ट्यूनिंग और छोटे मॉडलों की तुलना में काफी बेहतर प्रदर्शन करती हैं।

Jiayi Fu, Yuansen Zhang, Yinggui Wang2026-01-23