💬 NLP

Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

यह शोध पत्र CORE को प्रस्तुत करता है, जो एक हल्का, दो-चरणीय प्रॉम्प्ट संपीड़न (compression) तरीका है जो सहायक छोटे भाषा मॉडलों की आवश्यकता को समाप्त करता है ताकि संसाधन-सीमित एज उपकरणों पर रिट्रीवल-ऑगमेंटेड क्वेश्चन आंसरिंग के लिए सटीकता में उल्लेखनीय सुधार, मेमोरी उपयोग में कमी और इन्फरेंस की गति बढ़ाई जा सके।

Zihuai Xu, Ruofei Hou, Yang Xu, Hongli Xu, Yunming Liao, Ying Zhu2026-06-23
💬 NLP

Investigating Linguistic Steering: An Analysis of Adjectival Effects Across Large Language Model Architectures

यह शोध पत्र एक शापली वैल्यू (Shapley value) आधारित ढांचे को प्रस्तुत करता है जो यह मात्रा निर्धारित करता है कि विशेषण (adjectives) लार्ज लैंग्वेज मॉडल्स को कैसे निर्देशित करते हैं, जिससे यह पता चलता है कि स्टीयरिंग प्रभाव सार्वभौमिक नहीं हैं, बल्कि मॉडल आर्किटेक्चर और सिंटैक्टिक संदर्भ पर अत्यधिक निर्भर हैं, और बड़े मॉडल्स में अधिक जटिल और गैर-योगात्मक (non-additive) होते जा रहे हैं, जिससे वे 'वन-साइज-फिट्स-ऑल' प्रॉम्प्टिंग रणनीतियों को चुनौती देते हैं।

Lars Malmqvist2026-06-23
🤖 AI

PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate

यह शोध पत्र PEAR को प्रस्तुत करता है, जो मल्टी-एजेंट बहसों के लिए एक क्रम-तुल्य (permutation-equivariant) अनुकूली रूटिंग प्रोटोकॉल है जो स्थितिजन्य पूर्वाग्रहों को समाप्त करने और विविध लार्ज लैंग्वेज मॉडल्स में तर्क की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए एजेंटों की भूमिकाओं और विरल टोपोलॉजी (sparse topologies) को गतिशील रूप से पुनर्गठित करता है।

Yang Feng, Ziwei Xu, Xia Hu, Fengxiang He2026-06-23
🤖 AI

In LLM Reasoning, there is Irrationality on top of Value Misalignment

यह शोध पत्र "तर्कसंगत मूल्य जोखिम" (rational value risk) को एक एलएलएम (LLM) की तैनात तर्क रणनीति और उसके इष्टतम तर्कसंगत समकक्ष के बीच उपयोगिता अंतराल के रूप में प्रस्तुत और औपचारिक रूप देता है, जो कई मॉडलों और बेंचमार्क के माध्यम से व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि अच्छी तरह से संरेखित (aligned) मॉडल भी अनुमान-समय तर्क सीमाओं, सीमित डेटा बाधाओं और अपूर्ण सत्यापन के कारण अपेक्षित उपयोगिता को अधिकतम करने में अक्सर विफल रहते हैं।

Kejiang Qian, Fengxiang He2026-06-23
🤖 AI

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

अल्फामेमो (AlphaMemo) अल्फा माइनिंग के लिए एक स्व-विकसित (self-evolving) एलएलएम (LLM) एजेंट है जो पुन: प्रयोज्य एडिट मोटिफ्स (reusable edit motifs), कॉन्फिडेंस-गेटेड रेसिडुअल्स (confidence-gated residuals) और विफलता पैटर्न के विरुद्ध एसिमेट्रिक वीटो कंट्रोल्स (asymmetric veto controls) को रिकॉर्ड करने और लाभ उठाने के लिए एक संरचित खोज-प्रक्रिया मेमोरी का उपयोग करके खोज दक्षता और आउट-ऑफ-सैंपल प्रदर्शन को बढ़ाता है।

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He2026-06-23
💬 NLP

Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

यह शोध पत्र यह प्रदर्शित करता है कि इंटरैक्टिव मल्टी-एलएलएम (multi-LLM) प्रणालियों में, पोस्ट-ट्रेनिंग रेसिपीज़ मॉडल फैमिली लेबल की तुलना में हेजिंग (hedging) जैसे संवादात्मक व्यवहारों को अधिक महत्वपूर्ण रूप से प्रभावित करती हैं, जो यह सुझाव देता है कि मल्टी-एजेंट पैनलों में विविधता के लिए केवल विभिन्न परिवारों के मॉडलों का चयन करने के बजाय प्रशिक्षण पद्धतियों को प्राथमिकता दी जानी चाहिए।

Luyang Zhang, Jialu Wang, Fei Xue, Yi-Yun Chu2026-06-23
💬 NLP

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

यह शोध पत्र VOIR DIRE बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि सांस्कृतिक रूप से संदिग्ध सामग्री का मूल्यांकन करते समय MLLM-as-a-Judge सिस्टम विशिष्ट अंशांकन (कैलिब्रेशन) और ओरिएंटेशन विफलताओं से ग्रस्त होते हैं, जो यह प्रकट करता है कि विशिष्ट सांस्कृतिक मानदंडों के प्रति मॉडल के पूर्वाग्रह स्केल कंप्रेशन को ठीक करने के बाद भी बने रहते हैं और इन्हें पर्सोना प्रॉम्प्टिंग या इन-कॉन्टेक्स्ट प्रदर्शनों द्वारा पूरी तरह से हल नहीं किया जा सकता है।

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Jot (…)2026-06-23
🤖 AI

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

यह सर्वेक्षण एलएलएम-आधारित एजेंटों के लिए एक मॉडल-हार्नेस फ्रेमवर्क प्रस्तावित करता है जो निष्क्रिय प्रश्न-उत्तर से सक्रिय कार्य पूर्णता की ओर ध्यान केंद्रित करता है, और यह विश्लेषण करता है कि फाउंडेशन मॉडल और निष्पादन रनटाइम के बीच का युग्मन—जिसमें छह प्रमुख उत्तरदायित्व शामिल हैं—सिस्टम के प्रदर्शन, विश्वसनीयता और सामान्यीकरण को कैसे निर्धारित करता है।

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Ro (…)2026-06-23
🤖 AI

Simulated Customers Never Walk Away: Decision Fidelity of LLM User Simulators Measured Against Real Purchase Outcomes

यह शोध पत्र "डिसीजन फिडेलिटी" (decision fidelity) को पेश करता है ताकि यह उजागर किया जा सके कि एलएलएम (LLM) यूजर सिम्युलेटर एक व्यवस्थित "डिसएंगेजमेंट डेफिसिट" (disengagement deficit) से ग्रस्त होते हैं, जहाँ वे वास्तविक ग्राहकों की छोड़कर जाने की इच्छा को दोहराने में विफल रहते हैं और इसके बजाय गैर-खरीदारों की खरीदारी करने की रुचि को कृत्रिम रूप से बढ़ा देते हैं, जिससे सेल्स और पर्सुएशन एजेंटों का मूल्यांकन भ्रामक हो जाता है।

Liang Chen2026-06-23
💬 NLP

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

यह शोध पत्र यू-नेट (U-Net) और स्टेबल डिफ्यूजन 1.5 (Stable Diffusion 1.5) दोनों आर्किटेक्चर में CLIP मार्गदर्शन को एकीकृत करके यह प्रदर्शित करते हुए ग्रेस्केल-से-रंग अनुवाद (grayscale-to-color translation) पर टेक्स्ट कंडीशनिंग के प्रभाव को परिमाणित करता है कि यह बिना टेक्स्ट इनपुट वाले मॉडलों की तुलना में पिक्सेल-स्तरीय सटीकता, संवेदी समानता और रंगत में निरंतर सुधार करता है।

Colten Reissmann, Hugo Garrido-Lestache Belinchon2026-06-23