💬 NLP

Automated Extraction of Techno-Economic Data from 76,000 Energy System Studies

यह शोध पत्र एक अत्यधिक सटीक स्वचालित प्रणाली प्रस्तुत करता है जो मॉडलिंग धारणाओं का विश्लेषण करने, शैक्षणिक और अनुभवजन्य डेटा के बीच अंतराल की पहचान करने और भविष्य की अनुसंधान प्राथमिकताओं को निर्देशित करने के लिए एक व्यापक, FAIR डेटाबेस और इंटरैक्टिव डैशबोर्ड बनाने हेतु 76,000 ऊर्जा प्रणाली अध्ययनों से 3.2 मिलियन संरचित मात्रात्मक डेटा बिंदु और 20 मिलियन मेटाडेटा प्रविष्टियाँ निकालता है।

Maxime Gorres, Jan Göpfert, Patrick Kuckertz, Noor Titan Putri Hartono, Heidi Heinrichs, Jochen Linßen, Iain Staffel, Ja (…)2026-07-22
💬 NLP

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

यह शोध पत्र स्विस कानूनी मशीन अनुवाद में छोटे भाषा मॉडलों को बेहतर बनाने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) सहित विभिन्न पुन: प्रशिक्षण प्रतिमानों का मूल्यांकन और तुलना करता है, जिसमें यह पाया गया है कि हालांकि सुदृढीकरण शिक्षण फाइन-ट्यूनिंग से बेहतर प्रदर्शन करता है और फ्रंटियर रीजनिंग मॉडलों के साथ अंतर को कम करता है, फिर भी यह उनके प्रदर्शन से पीछे रह जाता है और मॉडल का आकार बढ़ने के साथ घटते प्रतिफल (डिमिमिनिशिंग रिटर्न्स) देता है।

Aixiu An, Michael Jungo, Eloi Eynard, Mark Drenhaus, Andreas Fischer, Jean Hennebert, Sébastien Rumley2026-07-22
💬 NLP

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

यह शोध पत्र न्यूरल मशीन ट्रांसलेशन के लिए 'वेरिफिएबल रिवॉर्ड्स' (सत्यापनीय पुरस्कारों) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) में लागत-गुणवत्ता के बीच के संतुलन की जांच करता है, जो यह प्रदर्शित करता है कि अतिरिक्त आउटपुट टोकन उत्पन्न करने की बढ़ी हुई कम्प्यूटेशनल लागत के बावजूद, अनुमान (inference) के दौरान रीजनिंग ट्रेसेस (तर्क पथों) को शामिल करने से अनुवाद की गुणवत्ता में महत्वपूर्ण सुधार होता है।

Michael Jungo, Aixiu An2026-07-22
💬 NLP

Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models

यह शोध पत्र पांच मॉडलों में सिंथेटिक "बुक ऑफ वेरा" कॉर्पस का उपयोग करते हुए एक नियंत्रित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि प्रारूप की परवाह किए बिना जब नियमों की संख्या 80 से अधिक हो जाती है तो निर्देश पालन (इंस्ट्रक्शन एडहेरेंस) ढह जाता है, जबकि दीर्घ-संदर्भ प्रदर्शन (लॉन्ग-कॉन्टेक्स्ट परफॉरमेंस) भ्रम (हैलुसिनेशन) के बजाय तीव्र रिकॉल गिरावट और इनकार की दरों द्वारा अभिलक्षित है, और मार्कडाउन के लिए प्लेन टेक्स्ट की तुलना में कोई सुसंगत लाभ नहीं है।

Netanel Eliav2026-07-22
💬 NLP

Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness

यह शोध पत्र GAMUT को प्रस्तुत करता है, जो एक नवीन बेंचमार्क और दो-स्तरीय मेटा-रूब्रिक ढांचा है जिसे संरचित सामग्री आवश्यकताओं को मशीन-योग्य चेकलिस्ट में परिवर्तित करके दीर्घ-रूप मुक्त-अंत वाली पीढ़ों की तथ्यात्मक पूर्णता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान सीमावर्ती मॉडल विविध, साक्ष्य-आधारित डोमेन में व्यापक कवरेज प्राप्त करने में संघर्ष करते हैं।

Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih, Pinar Donmez, Babak Damavandi, Luna Dong2026-07-22
🤖 AI

Agents in the Wild: Where Research Meets Deployment

यह ट्यूटोरियल फार्मास्युटिकल और वित्तीय डोमेन में वास्तविक केस स्टडीज के माध्यम से डिज़ाइन पैटर्न, मूल्यांकन रणनीतियों और सुरक्षा शमन (safety mitigations) का विश्लेषण करके, एलएलएम-आधारित एजेंटिक सिस्टम के अकादमिक अनुसंधान और औद्योगिक परिनियोजन (industrial deployment) के बीच के अंतर को पाटता है।

Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini2026-07-22
💬 NLP

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

यह शोध पत्र "रिपिटिटिव कॉपीइंग" (दोहराव वाली नकल) को लॉन्ग-कॉन्टेक्स्ट रीजनिंग में एक महत्वपूर्ण विफलता मोड के रूप में पहचानता है जहाँ मॉडल मुख्य साक्ष्य पर ध्यान केंद्रित करने के बजाय इनपुट टेक्स्ट की अंधाधुंध नकल करते हैं, और GEAR का प्रस्ताव करता है, जो एक एविडेंस-अवेयर रिइन्फोर्समेंट लर्निंग पद्धति है जो प्रासंगिक जानकारी में ग्राउंडिंग को पुरस्कृत करके और अप्रासंगिक डिस्ट्रैक्टर्स पर निर्भरता को दंडित करके प्रदर्शन में सुधार करती है।

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang2026-07-22
🧬 biology

The Illusion-Illusion: Vision Language Models See Illusions Where There Are None

यह शोध पत्र प्रकट करता है कि वर्तमान विजन-लैंग्वेज मॉडल "इल्यूजन-इल्यूशन्स" (भ्रम-भ्रम) से ग्रस्त हैं, जो गैर-भ्रामक छवियों (जैसे कि वास्तव में टेढ़ी रेखाएं या अलग आकार के वृत्त) को ऑप्टिकल इल्यूजन के रूप में गलत तरीके से देखते हैं, जिससे उनके विजुअल रीजनिंग में मौलिक प्रसंस्करण त्रुटियां उजागर होती हैं।

Tomer Ullman2026-07-21
💬 NLP

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

यह शोध पत्र G-Vendi प्रस्तुत करता है, जो एक ग्रेडिएंट-आधारित विविधता मीट्रिक (diversity metric) है जो आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण (out-of-distribution generalization) की भविष्यवाणी करता है, और विविध सिंथेटिक डेटा उत्पन्न करने के लिए इसका लाभ उठाते हुए प्रिजमैटिक सिंथेसिस (Prismatic Synthesis) विकसित करता है, जो अनसीन बेंचमार्क पर LLM रीजनिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और विशाल प्रोप्राइटरी डेटासेट्स पर प्रशिक्षित मॉडलों से बेहतर प्रदर्शन करता है।

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi (…)2026-07-21
💬 NLP

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

यह शोधपत्र LEGO Co-builder प्रस्तुत करता है, जो एक हाइब्रिड बेंचमार्क और एकीकृत ढांचा है जिसे मल्टीमॉडल LEGO असेंबली कार्यों में विजन-लैंग्वेज मॉडल्स की सूक्ष्म दृश्य समझ और अवस्था पहचान क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ ऑब्जेक्ट डिटेक्शन अच्छा प्रदर्शन करता है, वहीं वर्तमान मॉडल अभी भी सटीक दृश्य बोध और असेंबली अवस्था तर्क के साथ काफी संघर्ष करते हैं।

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowsk (…)2026-07-21