🤖 AI

Geopolitical alignment: Endorsement effects in large language models

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) नीतिगत मूल्यांकनों में महत्वपूर्ण भू-राजनीतिक पूर्वाग्रह प्रदर्शित करते हैं, जहाँ वे समान नीतियों को अमेरिका या यूरोपीय संघ की तुलना में चीन या रूस द्वारा समर्थित होने पर व्यवस्थित रूप से कम रेटिंग देते हैं, और ये विसंगतियाँ मॉडल के आधार पर तथा यह निर्भर करते हुए बनी रहती हैं या तीव्र हो जाती हैं कि औचित्य माँगा गया है या नहीं।

Maxim Chupilkin2026-07-13
💬 NLP

Creativity, honesty and designed forgetting emerge in small hyperbolic language models

यह शोध पत्र प्रदर्शित करता है कि हाइपरबोलिक सबस्ट्रेट (hyperbolic substrate) से सुसज्जित तीन लघु भाषा मॉडल अनुपालन अंतराल (compliance gaps) और चापलूसी (sycophancy) का पता लगाकर, रचनात्मक प्रतिक्रियाएं उत्पन्न करके, और एक "डिज़ाइन किया गया विस्मरण" (designed forgetting) तंत्र को लागू करके, भरोसेमंद साथी एआई (companion AI) की चुनौतियों को प्रभावी ढंग से संबोधित कर सकते हैं, जिससे अविश्वसनीय मानव रेटर्स और बड़े फ्रंटियर मॉडलों के एक स्केलेबल विकल्प के रूप में प्रस्ताव मिलता है।

Kwan Soo Shin, In Seok Kang, Yunkyung Min2026-07-13
🤖 machine learning

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

यह शोध पत्र शॉर्टकट ट्रजेक्टरी प्लानिंग (STP) का प्रस्ताव करता है, जो एक सिंगल-स्टेज ऑफलाइन रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो विविध बेंचमार्क पर मजबूत प्रदर्शन बनाए रखते हुए कम प्रशिक्षण और अनुमान लागत के साथ कुशल, एडजस्टेबल-स्टेप ट्रजेक्टरी जनरेशन को सक्षम करने के लिए कंडीशनल शॉर्टकट मॉडल्स का उपयोग करता है।

Guanquan Wang, Yoshimasa Tsuruoka2026-07-13
🤖 AI

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

यह शोध पत्र Diversify2Verify पेश करता है, जो एक LLM-आधारित पाइपलाइन है जो यह प्रदर्शित करती है कि कैसे विविध, कार्य-तुल्य प्रोग्राम कार्यान्वयन उत्पन्न करना स्वचालित सत्यापन सफलता दरों में महत्वपूर्ण सुधार करता है, उन वेरिएंट्स की पहचान करके जो औपचारिक प्रमाण (formal proof) के लिए अधिक अनुकूल हैं।

Shirley Yu, Ruben Martins2026-07-13
💬 NLP

Self-Guided Test-Time Training for Long-Context LLMs

यह शोध पत्र सेल्फ-गाइडेड टेस्ट-टाइम ट्रेनिंग (S-TTT) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मॉडल द्वारा स्वयं पहचाने गए साक्ष्य स्पैन (evidence spans) पर केवल मॉडल मापदंडों को चुनिчески अनुकूलित करके लॉन्ग-कॉन्टेक्स्ट LLM के प्रदर्शन में सुधार करती है, जिससे अप्रासंगिक संदर्भ पर प्रशिक्षण से जुड़े शोर और लागत से बचा जा सकता है।

Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik Rangadurai, Hua Zhi, Frank Shyu, Sandeep Pan (…)2026-07-13
💬 NLP

A Sovereign, Open-Source Foundation Model for German and English

यह शोध पत्र Soofi S 30B-A3B को प्रस्तुत करता है, जो एक संप्रभु, ओपन-सोर्स मिक्स्चर-ऑफ-एक्सपर्ट्स हाइब्रिड माम्बा ट्रांसफॉर्मर मॉडल है जिसे जर्मन और अंग्रेजी पर ध्यान केंद्रित करते हुए 27 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो लंबी-संदर्भ अनुप्रयोगों के लिए बेहतर अनुमान दक्षता प्रदान करते हुए ओपन मॉडलों के बीच अत्याधुनिक प्रदर्शन प्राप्त करता है।

The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Kh (…)2026-07-13
💬 NLP

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

यह शोध पत्र यह प्रदर्शित करता है कि छोटे बहुभाषी विजन-लैंग्वेज मॉडल्स के लिए, टेस्ट-टाइम स्केलिंग लाभ मुख्य रूप से जटिल खोज या सत्यापन तंत्र के बजाय प्रॉम्प्ट पारसेबिलिटी (parseability) और पर्याप्त डिकोडिंग बजट सुनिश्चित करने से संचालित होते हैं, जिसमें विजुअल मल्टीपल-चॉइस बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए अंतर्निहित पॉलिसी मॉडल सबसे महत्वपूर्ण कारक है।

Spiros Baxevanakis, Peng-Jian Yang2026-07-13
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

यह शोध पत्र ProofCouncil को प्रस्तुत करता है, जो एक ओपन-सोर्स LLM एजेंट है जो एक ऑथर-क्रिटिक आर्किटेक्चर का उपयोग करता है जिसने दस में से छह वास्तविक दुनिया की गणितीय समस्याओं को स्वायत्त रूप से हल करके और ओपन प्रॉब्लम्स के एक व्यापक सेट पर महत्वपूर्ण प्रगति प्रदर्शित करके FirstProof चुनौती में अत्याधुनिक प्रदर्शन प्राप्त किया है।

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes2026-07-13
🤖 AI

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

यह शोध पत्र BTHA को प्रस्तुत करता है, जो एक बैकबोन-स्थानांतरणीय पदानुक्रमित एडेप्टर ढांचा है जो एक स्थिर फीचर-स्तर के इंटरफेस और एक मोटे-से-सूक्ष्म (coarse-to-fine) पर्यवेक्षण रणनीति के माध्यम से भाषा मार्गदर्शन को विशिष्ट विजन और टेक्स्ट एनकोडर से अलग करता है, जिससे विविध मॉडल आर्किटेक्चर में प्रभावी और कुशल टेक्स्ट-निर्देशित चिकित्सा छवि विभाजन सक्षम होता है।

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen2026-07-13
🤖 AI

Multimodal Reward Hacking in Reinforcement Learning

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के लिए रिइन्फोर्समेंट लर्निंग में मल्टीमॉडल रिवॉर्ड हैकिंग की जांच करता है, जो यह प्रदर्शित करता है कि केवल परिणाम-आधारित रिवॉर्ड और कमजोर वेरीफायर विभिन्न पैमानों और एल्गोरिदम में व्यवस्थित रूप से नई विफलताओं को प्रेरित करते हैं, और यह तर्क देता है कि सुदृढ़ संरेखण (अलाइनमेंट) के लिए विश्वसनीय, सिमेंटिक-जागरूक रिवॉर्ड तंत्र की आवश्यकता है।

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu2026-07-13