💬 NLP

DarwinLM: Evolutionary Structured Pruning of Large Language Models

डार्विनएलएम (DarwinLM) एक प्रशिक्षण-जागरूक संरचित प्रूनिंग विधि है जो इष्टतम गैर-समान मॉडल उप-संरचनाओं की पहचान करने के लिए हल्के मल्टीस्टेप प्रशिक्षण के साथ एक विकासवादी खोज प्रक्रिया का उपयोग करती है, जिससे विभिन्न बड़े भाषा मॉडलों पर अत्याधुनिक प्रदर्शन प्राप्त होता है और संपीड़न के बाद प्रशिक्षण डेटा की आवश्यकताओं में महत्वपूर्ण रूप से कमी आती है।

Shengkun Tang, Oliver Sieberling, Eldar Kurtic, Zhiqiang Shen, Dan Alistarh2026-07-16
💬 NLP

Overcoming Language Barriers: Multilingual Analysis of the 2023 Swiss Privacy Law's Impact

यह शोध पत्र अनुवाद किए बिना बहुभाषी गोपनीयता नीतियों का विश्लेषण करने के लिए एक LLM-आधारित पाइपलाइन प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि स्विट्जरलैंड के 2023 के गोपनीयता कानून संशोधन ने डेटा विषय अधिकारों के खुलासे को महत्वपूर्ण रूप से बढ़ा दिया है, जो स्वचालित नीति जनरेटरों के व्यापक प्रसार द्वारा और अधिक बढ़ाया गया एक रुझान है।

Luka Nenadic, David Rodriguez, Joseph A. Calandrino2026-07-16
💬 NLP

Value Drifts: Tracing Value Alignment During LLM Post-Training

यह शोध पत्र LLM पोस्ट-ट्रेनिंग के दौरान वैल्यू अलाइनमेंट (मूल्य संरेखण) की गतिशीलता की जांच करता है, जो यह प्रकट करता है कि सुपरवाइज्ड फाइन-ट्यूनिंग मुख्य रूप से एक मॉडल के मूल्यों को स्थापित करती है जबकि बाद का प्रेफरेंस ऑप्टिमाइज़ेशन शायद ही कभी उन्हें पुन: संरेखित करता है, जिसमें अलग-अलग एल्गोरिदम समान डेटासेट पर भी भिन्न परिणाम देते हैं।

Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy2026-07-16
💬 NLP

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट एलएलएम (LLMs) का मूल्यांकन करने के लिए एक स्केलेबल "नीडल-इन-ए-हेस्टैक" (needle-in-a-haystack) बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि प्रदर्शन "डिस्ट्रीब्यूशनल कोलैप्स" (Distributional Collapse) के कारण काफी बाधित होता है जब साक्ष्य बिखरे हुए होते हैं और एक "सेफ्टी टैक्स" (Safety Tax) के कारण होता है जहाँ एंटी-हैलुसिनेशन प्रॉम्प्ट्स मॉडल्स को वैध जानकारी को अत्यधिक रूढ़िवादी रूप से अस्वीकार करने के लिए प्रेरित करते हैं।

Amirali Ebrahimzadeh, Seyyed M. Salili2026-07-16
💬 NLP

Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection

यह शोध पत्र CiteTracer को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो वैज्ञानिक संदर्भों के उच्च-सटीक सत्यापन को प्राप्त करने के लिए संरचित निष्कर्षण (structured extraction), बहु-स्रोत साक्ष्य पुनर्प्राप्ति (multi-source evidence retrieval) और विशिष्ट एजेंट तर्क (specialized agent reasoning) के माध्यम से साइटेशन मतिभ्रम (citation hallucination) का पता लगाने को एक वर्गीकरण-संरेखित क्षेत्र-स्तरीय अधिनिर्णय कार्य (taxonomy-aligned field-level adjudication task) के रूप में पुनर्गठित करता है।

Mingzhe Li, Zhiqiang Lin, Shiqing Ma2026-07-16
💬 NLP

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

यह शोध पत्र GameEngineBench को प्रस्तुत करता है, जो नौ गेम रिपॉजिटरी से प्राप्त अनरियल इंजन 5 (Unreal Engine 5) प्रोजेक्ट्स के भीतर 110 वास्तविक-विश्व C++ कार्यों वाला एक बेंचमार्क है, जो जटिल, स्टेटफुल रियल-टाइम सिस्टम में कार्यात्मक परिवर्तनों को लागू करने और संकलित (compile) करने की कोडिंग एजेंटों की क्षमता का मूल्यांकन करता है और यह प्रकट करता है कि सबसे शक्तिशाली मॉडल भी गहराई से एकीकृत गेम इंजन विकास के साथ संघर्ष करते हैं।

Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal2026-07-16
💬 NLP

FixItFlow: Automated Troubleshooting Guide Generation from Cloud Incidents

FixItFlow एक स्वचालित प्रणाली है जो ऐतिहासिक क्लाउड इंसिडेंट डेटा से सत्यापित ट्रबलशूटिंग गाइड तैयार करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाती है, जिससे इंजीनियरिंग टीमों के लिए इंसिडेंट रिस्पॉन्स समय में काफी सुधार होता है और दस्तावेज़ीकरण का बोझ कम होता है।

Srihari Unnikrishnan, Jaskaran Singh Walia, Drishti Goel, Supriyo Ghosh2026-07-16
💬 NLP

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

यह शोध पत्र Safe-Psych को प्रस्तुत करता है, जो 1,000 से अधिक वास्तविक मनोरोग संबंधी नोट्स का उपयोग करने वाला एक अनुक्रमिक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स भी अपूर्ण नैदानिक जानकारी को पहचानने में संघर्ष करते हैं, और सुरक्षा-जागरूक प्रॉम्प्टिंग के बावजूद अक्सर समयपूर्व निदान करते हैं या स्पष्टीकरण मांगने में विफल रहते हैं।

Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ion (…)2026-07-16
🤖 AI

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

यह शोध पत्र "इंटरवेंशनल ग्राउंडिंग ऑडिट्स" (interventional grounding audits) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स विधि है जो नए प्रतीकों के साथ आधारों (premises) को प्रतिस्थापित करके लार्ज लैंग्वेज मॉडल की चेन-ऑफ-थॉट रीजनिंग की तार्किक निर्भरता को मान्य करती है, और प्रोंटोक्यूए (ProntoQA) बेंचमार्क पर सेल्फ-कंसिस्टेंसी बेसलाइन की तुलना में "सही उत्तर, गलत तर्क" वाली खामियों का पता लगाने की अपनी श्रेष्ठ क्षमता प्रदर्शित करती है।

Hironao Nakamura2026-07-16
💻 computer science

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

स्लॉगगार्ड-एनएसएफए (SlogGuard-NSFA) एक विस्तार योग्य गार्डरेल फ्रेमवर्क है जो एक व्यापक जोखिम वर्गीकरण, एक बड़े पैमाने के बहुभाषी बेंचमार्क और जनरेटिव रीजनिंग के साथ रीयल-टाइम क्लासिफिकेशन को संयोजित करने वाले दोहरे मोड डिटेक्शन दृष्टिकोण को पेश करके एजेंटिक एआई सिस्टम को परिचालन संबंधी खतरों से सुरक्षित करता है, जिससे कई मॉडल आकारों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

SingGuard Team2026-07-16