💬 NLP

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

تقدم الورقة البحثية VisTIRA، وهو إطار عمل استدلالي متكامل الأدوات يعالج فجوة الأداء بين الاستدلال الرياضي القائم على النصوص والمنظم على الصور في النماذج اللغوية البصرية، وذلك من خلال تفكيك المشكلات البصرية إلى مسوغات باللغة الطبيعية وخطوات برمجية بلغة بايثون قابلة للتنفيذ، مدعومة بمجموعة بيانات اصطناعية ومسار تدريب جديد.

Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra2026-03-18
💬 NLP

Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models

تقدم هذه الورقة استراتيجية أخذ عينات الاضطراب الملدن زمنياً (TAPS)، وهي استراتيجية استدلال خالية من التدريب تستفيد من تقسيم العمل الزمني في نماذج اللغة الانتشارية لتعزيز تنوع المخرجات عبر تطبيق التفرع الدلالي في وقت مبكر من عملية التوليد مع تقليل الاضطرابات تدريجياً للحفاظ على الطلاقة والالتزام بالتعليمات.

Jingxuan Wu, Zhenglin Wan, Xingrui Yu, Yuzhe Yang, Yiqiao Huang, Ivor Tsang, Yang You2026-03-18
💬 NLP

LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations

تُثبت هذه الورقة أن المجسات الخطية (linear probes) المدربة على تنشيطات ما قبل التوليد يمكنها بدقة التنبؤ باحتمالية نجاح النموذج اللغوي الكبير في مهام الرياضيات والبرمجة، مما يتيح توجيهاً فعالاً من حيث التكلفة للاستعلامات عبر مجموعات النماذج يتفوق على أفضل نموذج منفرد مع تقليل تكاليف الاستدلال بنسبة تصل إلى 70%.

William Lugoloobi, Thomas Foster, William Bankes, Chris Russell2026-03-18
🤖 machine learning

Tokenization Tradeoffs in Structured EHR Foundation Models

تُثبت هذه الورقة أن تحسين استراتيجيات الترميز (tokenization)—وتحديداً من خلال دمج ترميزات الوقت الحدثية والموضعية في رموز موحدة—يُحسّن بشكل كبير كلاً من الأداء التنبئي والكفاءة الحسابية لنماذج التأسيس الخاصة بالسجلات الصحية الإلكترونية عبر مختلف المهام السريرية.

Lin Lawrence Guo, Santiago Eduardo Arciniegas, Joseph Jihyung Lee, Adam Paul Yan, George Tomlinson, Jason Fries, Lillian (…)2026-03-18
🤖 machine learning

Alternating Reinforcement Learning with Contextual Rubric Rewards

تقدم هذه الورقة البحثية "التعلم التعزيزي التناوبي مع مكافآت المعايير" (ARL-RR)، وهو إطار عمل يعمل على تحسين الأساليب الحالية من خلال التحسين الديناميكي لفئة وصفية فرعية دلالية واحدة في كل مرة بدلاً من استخدام التسكير الثابت، مما يؤدي إلى التقاط ارتباطات المكافآت وتحقيق أداء وكفاءة متفوقين على مجموعة بيانات HealthBench.

Guangchen Lan2026-03-18
💬 NLP

Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context

تقدم هذه الورقة إطار عمل SRLM، وهو إطار عمل ذاتي التأمل ومدرك لعدم اليقين يتفوق على النماذج اللغوية التكرارية التقليدية عبر استخدام إشارات جوهرية مثل الاتساق الذاتي والثقة اللفظية لاختيار برامج التفاعل مع السياق ديناميكيًا، مما يحقق مكاسب أداء كبيرة عبر مهام متنوعة وأطوال سياقية مختلفة دون الاعتماد على آليات تكرارية صريحة.

Keivan Alizadeh, Parshin Shojaee, Minsik Cho, Mehrdad Farajtabar2026-03-18
🤖 AI

Did You Check the Right Pocket? Cost-Sensitive Store Routing for Memory-Augmented Agents

تقترح هذه الورقة صياغة استرجاع الذاكرة كمسألة "تخزين-توجيه" حساسة للتكلفة لتمكين الوكلاء المعززين بالذاكرة من الاستعلام بشكل انتقائي من مخازن متخصصة، مما يؤدي إلى تحسين كل من دقة الإجابة وكفاءة الرموز (tokens) مقارنة بالاسترجاع الموحد.

Madhava Gaikwad2026-03-18
🤖 AI

Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1

تُظهر هذه الدراسة أن نموذج GPT-4.1، عند تعيين شخصيات اجتماعية واقتصادية مختلفة له في بيئة قمار محاكية، يُظهر تلقائياً سلوكيات مخاطرة تتوافق مع نظرية التوقعات — مثل لعب شخصية "الفقير" لعدد جولات أكثر بكثير من شخصية "الغني" — مما يشير إلى أن الانحيازات الاقتصادية المعرفية الكلاسيكية قد تكون مشفرة ضمن النماذج اللغوية الكبيرة بشكل ضمني بدلاً من مجرد محاكاتها.

Sankalp Dubedy2026-03-18
💬 NLP

Temporal Fact Conflicts in LLMs: Reproducibility Insights from Unifying DYNAMICQA and MULAN

تحل دراسة إعادة الإنتاج هذه الاستنتاجات المتضاربة حول قدرة النماذج اللغوية الكبيرة على تحديث الحقائق الزمنية من خلال توحيد معيارَي DYNAMICQA وMULAN، كاشفةً أن النتائج تعتمد بشكل كبير على تصميم مجموعة البيانات، ومقاييس التقييم، وحجم النموذج، مع إثبات أن نتائج MULAN أكثر قابلية للتعميم عبر الأطر المنهجية.

Ritajit Dey, Iadh Ounis, Graham McDonald, Yashar Moshfeghi2026-03-18
💬 NLP

CTG-DB: An Ontology-Based Transformation of ClinicalTrials.gov to Enable Cross-Trial Drug Safety Analyses

تقدم الورقة البحثية CTG-DB، وهو مسار عمل مفتوح المصدر يحول بيانات الأحداث الضائرة غير المتجانسة والقائمة على النصوص من موقع ClinicalTrials.gov إلى قاعدة بيانات علاقية معيارية متوافقة مع مصطلحات MedDRA لتمكين تحليلات سلامة الأدوية عبر التجارب السريرية بشكل قابل للتوسع والتكرار.

Jeffery L. Painter, François Haguinet, Andrew Bate2026-03-18