💬 NLP

Beyond Math: Stories as a Testbed for Memorization-Constrained Reasoning in LLMs

यह शोधपत्र 'जिस्ट' (gist) और 'वर्बेटिम' (verbatim) स्मृति के बीच अंतर करके लार्ज लैंग्वेज मॉडल्स में रटने (memorization) की प्रवृत्ति को कम करने की एक विधि प्रस्तुत करता है, जो यह प्रकट करता है कि लोकप्रिय काल्पनिक कृतियों पर आधारित मौजूदा बेंचमार्क डेटा कंटैमिनेशन (data contamination) के कारण पात्रों की वास्तविक समझ का अतिरंजित अनुमान लगाते हैं।

Yuxuan Jiang, Francis Ferraro2026-04-28
💬 NLP

CLIX: Cross-Lingual Explanations of Idiomatic Expressions

यह शोध पत्र CLIX को प्रस्तुत करता है, जो भाषा सीखने वालों की सहायता के लिए मुहावरेदार अभिव्यक्तियों के लिए क्रॉस-लिंगुअल स्पष्टीकरण उत्पन्न करने पर केंद्रित एक कार्य है, जो त्रुटि विश्लेषण के माध्यम से प्रमुख चुनौतियों की पहचान करते हुए बड़े भाषा मॉडलों (large language models) की क्षमता को प्रदर्शित करता है।

Aaron Gluck, Katharina von der Wense, Maria Leonor Pacheco2026-04-28
💻 computer science

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

यह शोधपत्र CodeSim को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट फ्रेमवर्क है जो सात चुनौतीपूर्ण बेंचमार्क में योजना सत्यापन (plan verification) और आंतरिक डिबगिंग के लिए एक मानव-समान, सिमुलेशन-संचालित दृष्टिकोण का उपयोग करके अत्याधुनिक कोड जनरेशन प्रदर्शन प्राप्त करता है।

Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez2026-04-28
💻 computer science

Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization

यह शोध पत्र Speech-FT का प्रस्ताव करता है, जो एक नवीन दो-चरणीय फाइन-ट्यूनिंग फ्रेमवर्क है जो मौजूदा रेगुलराइजेशन विधियों की तुलना में क्रॉस-टास्क जनरलाइजेशन को संरक्षित करने और यहाँ तक कि सुधारने के साथ-साथ कार्य-विशिष्ट प्रदर्शन को बढ़ाने के लिए रिप्रेजेंटेशनल ड्रिफ्ट रिडक्शन को वेट-स्पेस इंटरपोलेशन के साथ जोड़ता है।

Tzu-Quan Lin, Wei-Ping Huang, Hao Tang, Hung-yi Lee2026-04-28
💬 NLP

Can LLMs Interpret and Leverage Structured Linguistic Representations? A Case Study with AMRs

यह शोध पत्र यह प्रदर्शित करता है कि जबकि एब्स्ट्रैक्ट मीनिंग रिप्रेजेंटेशन (AMR) संरचनाओं के साथ प्रॉम्प्ट्स को बढ़ाना सामान्यतः लघु-संदर्भ कार्यों (short-context tasks) पर प्रदर्शन को कम करता है, यह संवाद सारांश (dialogue summarization) जैसे दीर्घ-संदर्भ परिदृश्यों में नए, बड़े LLMs की क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है और रैखिककृत (linearized) AMRs से प्रभावी पाठ पुनर्निर्माण को सक्षम बनाता है।

Ankush Raut, Xiaofeng Zhu, Maria Leonor Pacheco2026-04-28
🤖 machine learning

Always Tell Me The Odds: Fine-grained Conditional Probability Estimation

यह शोध पत्र मानव और सिंथेटिक डेटा, स्केलिंग और बेहतर पर्यवेक्षण के संयोजन का उपयोग करके बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) में सूक्ष्म-स्तरीय सशर्त संभाव्यता अनुमान (फाइन-ग्रेन्ड कंडिशनल प्रोबेबिलिटी एस्टिमेशन) के लिए एक नया अत्याधुनिक दृष्टिकोण प्रस्तावित करता है ताकि मोटे और पक्षपाती संभाव्य भविष्यवाणियों से जुड़ी मौजूदा समस्याओं को दूर किया जा सके।

Liaoyaqi Wang, Zhengping Jiang, Anqi Liu, Benjamin Van Durme2026-04-28
💻 computer science

What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts

यह शोध पत्र LLMs में प्रॉम्प्ट अंडरस्पेसिफिकेशन (prompt underspecification) की नाजुकता का विश्लेषण करता है, यह प्रदर्शित करते हुए कि हालांकि मॉडल अक्सर लुप्त आवश्यकताओं का अनुमान लगा लेते हैं, लेकिन इससे अस्थिर प्रदर्शन होता है जिसे सरल विशिष्टता या मानक ऑप्टिमाइज़र द्वारा विश्वसनीय रूप से ठीक नहीं किया जा सकता है, जो लेखकों को आवश्यकताओं-जागरूक अनुकूलन तंत्र (requirements-aware optimization mechanisms) और सक्रिय आवश्यकता प्रबंधन के लिए एक व्यवस्थित प्रक्रिया प्रस्तावित करने के लिए प्रेरित करता है।

Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu2026-04-28
💻 computer science

DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models

यह शोध पत्र डिस्टिल्ड रीजनिंग प्रूनिंग (DRP) का प्रस्ताव करता है, जो एक हाइब्रिड फ्रेमवर्क है जो जटिल गणितीय तर्क कार्यों पर सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए, स्किल-अवेयर स्टेप डिकम्पोजिशन और डिस्टिलेशन के साथ इन्फरेंस-टाइम प्रूनिंग को जोड़कर लार्ज रीजनिंग मॉडल्स में टोकन के उपयोग को महत्वपूर्ण रूप से कम करता है।

Yuxuan Jiang, Dawei Li, Francis Ferraro2026-04-28
⚡ electrical engineering

Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey

यह शोध पत्र लार्ज ऑडियो-लैंग्वेज मॉडल (LALM) मूल्यांकन का पहला व्यापक सर्वेक्षण प्रदान करता है, जो बेंचमार्किंग में वर्तमान विखंडन को संबोधित करने के लिए एक व्यवस्थित चार-आयामी वर्गीकरण प्रस्तावित करता है और भविष्य के अनुसंधान के लिए मार्गदर्शन प्रदान करता है।

Chih-Kai Yang, Neo S. Ho, Hung-yi Lee2026-04-28
💬 NLP

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

यह अन्वेषणात्मक अध्ययन 6x6 सुडोकू पहेलियों पर पांच लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और पाता है कि जबकि एक मॉडल सीमित समाधान क्षमता प्रदर्शित करता है, कोई भी रणनीतिक तर्क या सहज समस्या-समाधान को दर्शाने वाले स्पष्टीकरण प्रदान नहीं कर सकता है, जो प्रभावी मानव-एआई सहयोगात्मक निर्णय लेने में महत्वपूर्ण बाधाओं को रेखांकित करता है।

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi2026-04-28