💻 computer science

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

यह शोध पत्र S3Mem को प्रस्तुत करता है, जो एक संरचित दृश्य-घटना आधारित एपिसोडिक मेमोरी फ्रेमवर्क है, जो एजेंट प्रक्षेप पथों (trajectories) को संरचित, एंकर-संवेदनशील साक्ष्य इकाइयों में परिवर्तित करके लॉन्ग-होरिज़ोन इंटरैक्टिव प्रश्नोत्तर में मानक रिट्रीवल-ऑगमेंटेड जनरेशन और अन्य बेसलाइनों से बेहतर प्रदर्शन करता है, जिससे सटीकता और टोकन दक्षता में महत्वपूर्ण सुधार होता है।

Encheng Su, Jinouwen Zhang, Jianyu Wu, Qiucheng Yu, Chen Tang, Pengze Li, Lintao Wang, Yizhou Wang, Xinzhu Ma, Shixiang (…)2026-05-29
💻 computer science

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

यह शोध पत्र GenesisFunc को पेश करता है, जो एक मल्टी-एजेंट स्वचालित पाइपलाइन है जो एक 8B LLM को प्रशिक्षित करने के लिए उच्च-गुणवत्ता वाला, विविध सिंथेटिक फंक्शन-कॉलिंग डेटा उत्पन्न करता है, जो समान आकार के ओपन-सोर्स मॉडलों की तुलना में बेहतर इन-डोमेन प्रदर्शन और आउट-ऑफ-डोमेन सामान्यीकरण प्राप्त करता है और उन्नत API-आधारित प्रणालियों का मुकाबला करता है।

Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling2026-05-29
💻 computer science

Specialty-Specific Medical Language Model for Immune-Mediated Diseases

यह शोध पत्र एक विशिष्ट ट्रांसफॉर्मर-आधारित नामित इकाई पहचान (नेमड एंटिटी रिकग्निशन) मॉडल प्रस्तुत करता है, जिसे विशेषज्ञ-एनोटेटेड क्लिनिकल डेटा पर प्रशिक्षित किया गया है, जो सामान्य-उद्देश्य और ज़ीरो-शॉट दृष्टिकोणों की तुलना में मुक्त-पाठ चिकित्सा आख्यानों से सूक्ष्म प्रतिरक्षा-मध्यस्थ और संक्रामक रोग संस्थाओं को निकालने में बेहतर प्रदर्शन (0.89 का F1 स्कोर) प्राप्त करता है।

Veysel Kocaman, Gursev Pirge, Yigit Gul, Ace Vo, Zhenya Nargizyan, David Talby2026-05-29
💻 computer science

Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning

यह शोध पत्र "थॉट्स-एज़-प्लानिंग" (Thoughts-as-Planning) प्रस्तुत करता है, जो एक नवीन ढांचा है जो LLM को आंशिक रूप से दृश्यमान वातावरण के रूप में मॉडल करके और ग्रेडिएंट डिसेंट या सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से कुशल, व्याख्यात्मक और बहु-स्तरीय नियोजन सक्षम करने के लिए एक लेटेंट वर्ल्ड मॉडल सीखने के द्वारा तर्क श्रृंखलाओं (reasoning chains) को अनुकूलित करता है।

Dong Liu, Yanxuan Yu, Ying Nian Wu2026-05-29
💻 computer science

GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

यह शोध पत्र GPF-LiveNews प्रस्तुत करता है, जो एक स्ट्रीमिंग मूल्यांकन प्रोटोकॉल और बेंचमार्क है जो गतिशील, वास्तविक दुनिया के इनपुट के माध्यम से अर्थ संबंधी और संवेग संबंधी विविधताओं का विश्लेषण करके यह ऑडिट करता है कि बड़े भाषा मॉडल (large language models) विभिन्न पहचान समूहों के लिए उभरती समाचार घटनाओं को कैसे रूपायित करते हैं।

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Roy George2026-05-29
🤖 machine learning

Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

यह शोध पत्र 'डिफरेंशियल सर्किट वल्नरेबिलिटी' नामक एक हेड-लेवल मीट्रिक प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि सुपरवाइज्ड फाइन-ट्यूनिंग मॉडल्स को नए कार्यों के अनुकूल बनाने में तेज़ होता है, सुदृढीकरण सीखना (रीइन्फोर्समेंट लर्निंग) आंतरिक कम्प्यूटेशनल सर्किट्स को बेहतर ढंग से संरक्षित करता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग के प्रति इसके बेहतर प्रतिरोध का एक यांत्रिक स्पष्टीकरण मिलता है।

Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen, Nomgondalai Amgalanbaatar, Yannis Zongo, Vasu Sharma, Maheep Chaudhary2026-05-29
💻 computer science

From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization

यह शोध पत्र एक ज़ीरो-शॉट प्रोग्राम-ऑफ़-थॉट प्रॉम्प्टिंग रणनीति पेश करता है जो सटीक और कुशल चार्ट सारांशीकरण के लिए पायथन कोड उत्पन्न करने हेतु हल्के विज़ुअल लैंग्वेज मॉडल्स और एक नवीन चार्ट-टू-डिक्शनरी ऑक्सिलरी टास्क का लाभ उठाता है, जो मौजूदा विधियों के तुलनीय प्रदर्शन प्राप्त करते हुए तथ्यात्मक शुद्धता में सुधार करता है।

Yutong Qu, Wei Zhang2026-05-29
💻 computer science

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

यह शोध पत्र GrowLoop का प्रस्ताव करता है, जो एक स्व-विकसित (self-evolving) संवदात्मक मूल्यांकन प्रणाली है जो न्यूनतम मानवीय सीड एनोटेशन और निरंतर विकसित होते मॉडलों एवं बदलते परिदृश्यों के अनुकूल होने के लिए पुनरावृत्तीय LLM-संचालित रूब्रिक शोधन का उपयोग करती है, जिससे यह मानव-समानता के आकलन में स्थिर बेंचमार्क की सीमाओं को दूर करती है।

Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu2026-05-29
💻 computer science

Hallucination Detection-Guided Preference Optimization for Clinical Summarization

यह शोध पत्र एक इन्फरेंस-टाइम विधि और एक संबंधित प्राथमिकता शिक्षण ढांचे (preference learning framework) को प्रस्तुत करता है जो बड़े भाषा मॉडलों (large language models) को पुनरावृत्ति रूप से परिष्कृत और फाइन-ट्यून करने के लिए मतिभ्रम डिटेक्टरों (hallucination detectors) का लाभ उठाते हैं, जिससे प्रवाह और सुसंगतता को बनाए रखते हुए नैदानिक सारांश (clinical summarization) में तथ्यात्मक मतिभ्रम को काफी कम किया जाता है।

Shamanth Kuthpadi Seethakantha, Dung Ngoc Thai, Vara Prasad Gudi, Simran Tiwari, Rami Matar, Avijit Mitra, Wenlong Zhao (…)2026-05-29
💻 computer science

The Trust Paradox: How CS Researchers Engage LLM Leaderboards

आठ सीएस (CS) शोधकर्ताओं के साक्षात्कार के माध्यम से, यह शोध पत्र एक विरोधाभास को उजागर करता है जहाँ अभ्यासी एलएलएम (LLM) लीडरबोर्ड पर अविश्वास करते हैं फिर भी उन्हें मोटे तौर पर मार्गदर्शक के रूप में उपयोग करते हैं, और अंततः यह पाता है कि मॉडल चयन के लिए स्थिर बेंचमार्क की तुलना में पीयर नेटवर्क और एरिना-आधारित रैंकिंग अधिक महत्वपूर्ण भूमिका निभाते हैं, जबकि लागत पारदर्शिता की महत्वपूर्ण मांग पर भी प्रकाश डालता है।

Pouya Sadeghi, Anamaria Crisan, Jimmy Lin2026-05-29