💻 computer science

Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

यह शोध पत्र G-Frame को प्रस्तुत करता है, जो एक गेम थ्योरी-संचालित मल्टी-एजेंट फ्रेमवर्क है जो विशेष प्रशिक्षण डेटा को संश्लेषित करके OmniChem बनाता है, जो एक 7B लैंग्वेज मॉडल है और वैज्ञानिक डोमेन में GPT-4o mini-स्तर का प्रदर्शन प्राप्त करते हुए संरचित, स्वयंसिद्ध तर्क (axiomatic reasoning) के माध्यम से मतिभ्रम (hallucinations) को काफी कम करता है।

Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao2026-07-10
💬 NLP

When Synthetic Speech Is All You Have: Better Call GRPO

यह शोध पत्र प्रदर्शित करता है कि ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO), केवल सिंथेटिक स्पीच का उपयोग करके विनियमित डोमेन में लार्ज लैंग्वेज मॉडल-आधारित ऑटोमैटिक स्पीच रिकग्निशन को अनुकूलित करने में सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे शुरुआती-परत के निरूपण (early-layer representations) को बदलने के बजाय स्टॉपिंग कैलिब्रेशन और अटेंशन अलाइनमेंट जैसे व्यवहार संबंधी पहलुओं में सुधार करके वर्ड एरर रेट में 45% की सापेक्ष कमी प्राप्त होती है।

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, And (…)2026-07-10
💻 computer science

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

यह शोध पत्र OmniFood-Bench को प्रस्तुत करता है, जो खाद्य-संबंधी कार्यों में अत्याधुनिक विजन-लैंग्वेज मॉडल्स (Vision-Language Models) की क्षमताओं का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो एक महत्वपूर्ण "सिमेंटिक-फिजिकल गैप" (Semantic-Physical Gap) को उजागर करता है जहाँ मॉडल व्यंजन की पहचान करने में तो उत्कृष्ट हैं लेकिन मात्रा के अनुमान और सुरक्षा-महत्वपूर्ण चिकित्सा सलाह देने में बुरी तरह विफल हो जाते हैं।

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang2026-07-10
🤖 machine learning

Predicting Male Fertility Using Machine Learning: A Semen Parameters Based Analysis with the VISEM Dataset

यह अध्ययन प्रदर्शित करता है कि मशीन लर्निंग मॉडल, विशेष रूप से 94.2% सटीकता प्राप्त करने वाला नियरएस्ट सेंट्रॉइड (Nearest Centroid) क्लासिफायर, VISEM डेटासेट से प्रमुख वीर्य मापदंडों का विश्लेषण करके पुरुष प्रजनन क्षमता की स्थिति की प्रभावी ढंग से भविष्यवाणी कर सकता है, जो वस्तुनिष्ठ नैदानिक निदान के लिए एक आशाजनक उपकरण प्रदान करता है।

Shahnawaz Qureshi, Raja Khurram Shahzad, Muhammad Fozan, Emal Kawal, Syed Aziz Shah, Sattam Al-Anazi, Syed MuhammadZeesh (…)2026-07-10
💻 computer science

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM यह प्रदर्शित करता है कि इन-द-वाइल्ड (in-the-wild) एगोसेंट्रिक मानव डेटा का उपयोग करके वर्ल्ड एक्शन मॉडल्स (World Action Models) के साथ रोबोट नीतियों को प्रशिक्षित करना पारंपरिक बिहेवियर क्लोनिंग (behavior cloning) की तुलना में काफी बेहतर प्रदर्शन करता है, क्योंकि यह हस्तांतरणीय भौतिक प्रभावों को गैर-हस्तांतरणीय मानव-विशिष्ट कारकों से बेहतर तरीके से अलग करने के लिए DINO फीचर्स और 3D मोशन फ्लो जैसे अमूर्त विश्व निरूपणों (abstract world representations) का लाभ उठाता है।

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu2026-07-10
💻 computer science

Applying JEPA-Style Predictive Learning to JA4-Derived Network Fingerprints

यह शोध पत्र JA4-JEPA प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-आधारित मॉडल है जो JA4-व्युत्पन्न फिंगरप्रिंट्स से उच्च-गुणवत्ता वाले नेटवर्क एम्बेडिंग्स उत्पन्न करने के लिए JEPA-शैली की प्रेडिक्टिव लर्निंग को सफलतापूर्वक लागू करता है, जो प्रशिक्षण स्रोतों में अपूर्ण व्यू ओवरलैप के बावजूद मजबूत प्रोटोकॉल-फैमिली वर्गीकरण सटीकता प्राप्त करता है।

Javier Izquierdo, Aygul Zagidullina2026-07-10
💻 computer science

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

यह शोध पत्र VEGAS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), क्रॉस-मोडल मीट्रिक है जो व्यक्तिगत दर्शकों के ध्यान के साथ बेहतर तालमेल बिठाने वाले वीडियो कैप्शन का मूल्यांकन और चयन करने के लिए सिंक्रोनाइज़्ड गेज़ डेटा (synchronized gaze data) का लाभ उठाता है, जिससे बिना मॉडल रिट्रेनिंग के कैप्शन की गुणवत्ता और डाउनस्ट्रीम रिट्रीवल कार्यों में सुधार होता है।

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu2026-07-10
💬 NLP

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

यह शोध पत्र एक संज्ञानात्मक-संरचित बहुविध एजेंट (Cognitive-structured Multimodal Agent) प्रस्तुत करता है जो संरचित अमूर्तीकरण और पुनर्प्राप्ति के साथ एक एपिसोडिक मेमोरी में दृश्य सूचना को बाह्य करके दीर्घ-अवधि वाले कार्यों में मोनोलिथिक एकीकृत मॉडलों की सीमाओं को दूर करता है, जो बड़े बेसलाइन की तुलना में बेहतर सटीकता और दक्षता प्राप्त करते हुए एक स्केलेबल टूल-ऑगमेंटेड परिनियोजन ढांचा प्रदान करता है।

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li2026-07-10
💻 computer science

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

यह शोध पत्र HCC-STAR को प्रस्तुत करता है, जो एक नैदानिक रूप से संरेखित लार्ज लैंग्वेज मॉडल है जो हेपेटोसेल्यूलर कार्सिनोमा रोगियों के लिए सटीक जोखिम स्तरीकरण, साक्ष्य-आधारित उपचार अनुशंसाएँ और उत्तरजीविता अनुमान प्रदान करने के लिए इलेक्ट्रॉनिक मेडिकल रिकॉर्ड का विश्लेषण करता है, और स्वचालित बेंचमार्क एवं चिकित्सक मूल्यांकन दोनों में वर्तमान दिशानिर्देशों और मौजूदा एआई मॉडलों पर श्रेष्ठ प्रदर्शन प्रदर्शित करता है।

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Y (…)2026-07-10
🤖 machine learning

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

यह शोध पत्र स्ट्रक्चर्ड स्पार्स ऑटोएनकोडर्स (S2AES^2AE) का प्रस्ताव करता है, जो एक नवीन विधि है जो इमेज पैचेस को समूहीकृत करके और स्ट्रक्चर्ड स्पैरसिटी रेगुलराइजेशन लागू करके विजन-लैंग्वेज मॉडल्स में सिमेंटिक और स्पेशियल कंसिस्टेंसी को लागू करती है, जिससे वैनिला SAEs की तुलना में कॉन्सेप्ट डिसेंटैंगलमेंट, सिमेंटिक अलाइनमेंट और रिप्रेजेंटेशनल एफिशिएंसी में महत्वपूर्ण सुधार प्राप्त होता है।

Weiduo Liao, Yunqiao Yang, Ying Wei2026-07-10