💬 NLP

Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models

यह शोध पत्र प्रदर्शित करता है कि प्रशिक्षण डेटा में रूपक (metaphors), लेटेंट फीचर्स (latent features) को सक्रिय करके बड़े रीजनिंग मॉडल्स में क्रॉस-डोमेन मिसअलाइनमेंट (cross-domain misalignment) में योगदान देते हैं, जो एक ऐसा तंत्र है जिसका उपयोग मिसअलाइन्ड कंटेंट के लिए उच्च-सटीकता वाले डिटेक्टरों को डिजाइन करने के लिए किया जा सकता है।

Zhibo Hu, Chen Wang, Yanfeng Shu, Hye-young Paik, Liming Zhu2026-06-26
🤖 AI

SciFig: Towards Automating Editable Figure Generation for Scientific Papers

यह शोध पत्र SciFig को प्रस्तुत करता है, जो एक एंड-टू-एंड मल्टी-एजेंट फ्रेमवर्क है जो वैज्ञानिक पाठ से उच्च गुणवत्ता वाले, पूर्णतः संपादन योग्य कार्यप्रणाली आकृतियों (methodology figures) को स्वचालित रूप से उत्पन्न करके दृश्य गुणवत्ता और संeditability के बीच के समझौते को दूर करता है, साथ ही इसके बेहतर प्रदर्शन को मान्य करने के लिए एक नए बेंचमार्क (SciFig-Bench) और मूल्यांकन प्रोटोकॉल (SciFig-Eval) को भी प्रस्तुत करता है।

Siyuan Huang, Yifan Zhou, Yutong Gao, Zi Yin, Juyang Bai, Xinxin Liu, Rama Chellappa, Chun Pong Lau, Cheng Peng, Sayan N (…)2026-06-26
🤖 AI

Surrogate models for Rock-Fluid Interaction: A Grid-Size-Invariant Approach

यह शोध पत्र पोरस मीडिया (छिद्रयुक्त माध्यम) में रॉक-फ्लुइड इंटरैक्शन के सरोगेट मॉडलिंग के लिए एक ग्रिड-साइज-इनवेरिएंट न्यूरल नेटवर्क फ्रेमवर्क पेश करता है, जो यह प्रदर्शित करता है कि UNet++ आर्किटेक्चर फ्लूइड फ्लो की भविष्यवाणी करने में पारंपरिक रिड्यूस्ड-ऑर्डर मॉडल्स और मानक UNets दोनों से बेहतर प्रदर्शन करता है, साथ ही मेमोरी खपत को काफी कम करता है और प्रशिक्षण के लिए उपयोग किए गए डोमेन से बड़े डोमेन पर इन्फरेंस (inference) सक्षम बनाता है।

Nathalie C. Pinheiro, Donghu Guo, Hannah P. Menke, Aniket C. Joshi, Claire E. Heaney, Ahmed H. ElSheikh, Christopher C. (…)2026-06-26
💻 computer science

Benchmarking Open-Weight Foundation Models for Global AI Technical Governance

यह अध्ययन एक परिष्कृत पांच-श्रेणी वाली प्रतिक्रिया वर्गीकरण योजना का उपयोग करके, 227 देशों में मॉडल प्रदर्शन के बीच असमानताओं को सटीक रूप से मापने और विश्लेषण करने के लिए एक सत्यापित ग्राउंड-ट्रुथ डेटासेट (GAID v2) के विरुद्ध चार ओपन-वेट फाउंडेशन मॉडलों का बेंचमार्किंग करके, एआई में भौगोलिक पूर्वाग्रह पर मौजूदा शोध में पद्धतिगत सीमाओं को संबोधित करता है।

Jason Hung2026-06-26
💬 NLP

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

यह शोधपत्र Know2Guess प्रस्तुत करता है, जो एक संदूषण-जागरूक (contamination-aware) मल्टी-ज़ोन बेंचमार्क है जिसे समर्थित उत्तरों और अज्ञात विषयों पर परहेज (abstentions) के बीच अंतर करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल्स में चयनात्मक परहेज की कुछ क्षमता दिखाई देती है, फिर भी वे अंशांकन (calibration) और सौम्य-वस्तु अस्वीकृति (benign-item refusal) के मामले में संघर्ष करते हैं।

Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang2026-06-26
💬 NLP

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

यह शोध पत्र प्रदर्शित करता है कि सहायक डेटा (helpfulness data) पर भाषा मॉडलों को पोस्ट-ट्रेनिंग देना, कोडिंग-केंद्रित प्रशिक्षण की तुलना में मिड-ट्रेन्ड पशु करुणा मूल्यों और सामान्य नैतिक तर्क को महत्वपूर्ण रूप से कम कर देता है, जबकि यह भी प्रकट करता है कि ये करुणा मूल्य डोमेन-विशिष्ट पोस्ट-ट्रेनिंग से प्राप्त तर्क सुधारों की तुलना में भाषाओं के बीच अधिक मजबूती से एनकोडेड हैं।

Jasmine Brazilek, Juliana Seawell2026-06-26
💬 NLP

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

यह अध्ययन मॉडल डिस्टिलेशन दृष्टिकोण के माध्यम से स्टेटिक्स (स्थिरता) की समस्याओं को हल करने में लार्ज लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि वे केवल टेक्स्ट वाले प्रश्नों पर अच्छा प्रदर्शन करते हैं, जब आरेखों और बहु-चरणीय तर्क की आवश्यकता होती है तो उनकी सटीकता काफी घट जाती है क्योंकि वे इमेज रिकग्निशन (छवि पहचान) की सीमाओं के बजाय विजुअल जानकारी को लगातार लागू करने में चुनौतियों का सामना करते हैं।

Tanner Culleton, Hung-Fu Chang2026-06-26
💬 NLP

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

यह शोध पत्र प्रदर्शित करता है कि जब पशु-कल्याण संबंधी ग्रंथों का उपयोग भाषा मॉडलों को फाइन-ट्यून करने के लिए किया जाता है, तो मुखर भाषाई विशेषताएं (जैसे कि निश्चितता, नैतिक शब्दावली और भावना) मॉडल के पशु-कल्याण समर्थक तर्क को महत्वपूर्ण रूप से सुदृढ़ करती हैं, जबकि वर्णनात्मक या संदेहात्मक भाषा इस रुख को कमजोर कर देती है।

Jasmine Brazilek, Harper Dunn2026-06-26
💬 NLP

Context Recycling for Long-Horizon LLM Inference

यह शोध पत्र ContextForge को प्रस्तुत करता है, जो एक ऐसी प्रणाली है जो संरचित क्वेरी जनरेशन, बाहरी मेमोरी रिट्रीवल और नियंत्रित सिंथेसिस के माध्यम से कार्य-प्रासंगिक जानकारी को पुनर्चक्रित (recycle) करके लॉन्ग-होरिज़न LLM इन्फरेंस को बेहतर बनाती है, जिससे बड़े कॉन्टेक्स्ट विंडो या मॉडल रिट्रेनिंग की आवश्यकता के बिना टोकन खपत को कम किया जाता है और सटीकता बनाए रखी जाती है।

Derek Thomas2026-06-26