💻 computer science

AIPsy-Affect: A Keyword-Free Clinical Stimulus Battery for Mechanistic Interpretability of Emotion in Language Models

تقدم هذه الورقة AIPsy-Affect، وهي بطارية محفزات سريرية مكونة من 480 بنداً تتميز بمواقف عاطفية خالية من الكلمات المفتاحية وضوابط محايدة متطابقة لتمكين التفسير الآلي الصارم للعاطفة في النماذج اللغوية الكبيرة من خلال إزالة الارتباك الناتج عن المفردات الخاصة بالعاطفة.

Michael Keeman2026-04-28
💻 computer science

Multimodal QUD: Inquisitive Questions from Scientific Figures

تقدم هذه الورقة البحثية MQUD، وهي مجموعة بيانات وإطار عمل جديد يوسع النظرية اللغوية للأسئلة قيد المناقشة (QUD) إلى المجال متعدد الوسائط من خلال توليد أسئلة استقصائية واعية بالسياق من الأشكال العلمية والنصوص المصاحبة لها، مما يمكّن نماذج الرؤية واللغة من أداء استدلال عالي المستوى يتجاوز مجرد الاستخراج البصري البسيط.

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li2026-04-28
🤖 machine learning

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

تُظهر الورقة البحثية أن مسار (SFT-then-RL) القياسي يتفوق في الواقع على أساليب السياسة المختلطة الحديثة، مما يكشف أن الادعاءات السابقة بخلاف ذلك كانت مبنية على خطوط أساس معيبة ناتجة عن أخطاء برمجية محددة في DeepSpeed وOpenRLHF.

Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin2026-04-28
💻 computer science

Domain Fine-Tuning vs. Retrieval-Augmented Generation for Medical Multiple-Choice Question Answering: A Controlled Comparison at the 4B-Parameter Scale

تُظهر هذه الدراسة أنه بالنسبة للنماذج اللغوية الطبية ذات الـ 4 مليارات معلمة، يتفوق الضبط الدقيق المتخصص بشكل كبير على التوليد المعزز بالاسترجاع (RAG) في معيار MedQA-USMLE، مما يشير إلى أن ترميز المعرفة الطبية مباشرة في أوزان النموذج أكثر فعالية من حقنها عبر السياق عند هذا النطاق.

Avi-ad Avraam Buskila2026-04-28
💻 computer science

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

تقدم هذه الورقة ShredBench، وهو معيار مرجعي جديد يتميز بمسار توليد مؤتمت لتقييم النماذج اللغوية الكبيرة متعددة الوسائط في المهمة الصعبة المتمثلة في إعادة بناء المستندات الممزقة، مما يكشف أن النماذج الحالية تعاني بشكل كبير من صعوبة في الاستدلال الدقيق عبر الوسائط المطلوب لسد الفجوات البصرية مقارنة بأدائها على المستندات السليمة.

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma2026-04-28
💻 computer science

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

تقدم هذه الورقة DRACULA، وهي أول مجموعة بيانات تلتقط ملاحظات المستخدم الخبير حول الإجراءات الوسيطة لوكلاء البحث العلمي العميق، مما يكشف أن الاستفادة من سجل اختيار المستخدم يحسن بشكل كبير من التنبؤ بالإجراءات المفضلة ويسلط الضوء على التحدي الحاسم المتمثل في تقرير أي الإجراءات يجب تنفيذها بدلاً من مجرد كيفية تنفيذها.

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Ra (…)2026-04-28
💻 computer science

Resource-Lean Lexicon Induction for German Dialects

تُثبت هذه الورقة أن النماذج الإحصائية قليلة الموارد، وتحديداً الغابات العشوائية المدربة على سمات تشابه السلاسل النصية، تتفوق على النماذج اللغوية الكبيرة في استنباط معاجم اللهجات الألمانية عالية الجودة، مما يؤدي إلى تحسين أداء نقل المعرفة بين اللهجات واسترجاع المعلومات بشكل كبير رغم ندرة البيانات.

Robert Litschko, Barbara Plank, Diego Frassinelli2026-04-28
🤖 machine learning

One Size Fits None: Heuristic Collapse in LLM Investment Advice

تتقصى الورقة البحثية ظاهرة "الانهيار الاستدلالي" في النماذج اللغوية الكبيرة الرائدة، حيث وجدت أن هذه النماذج، عند تقديم نصائح استثمارية، تعتمد بشكل منهجي ومفرط على عامل واحد (القدرة على تحمل المخاطر) مع تجاهل المعلومات السياقية الأخرى بالغة الأهمية، وهي مشكلة تستمر رغم زيادة حجم النموذج أو تعزيزه بالبحث عبر الويب.

Jillian Ross, Andrew W. Lo2026-04-28
💻 computer science

Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms

تقيم هذه الدراسة كيفية مساعدة أدوات دعم الذكاء الاصطناعي المختلفة لغير الناطقين بها في تعلم واستخدام المصطلحات الجديدة في اللغة الإنجليزية، حيث وجدت أن التفسيرات التي يولدها الذكاء الاصطناعي تحسن الكفاءة التواصلية بشكل كبير مقارنة بالأساليب الأخرى، رغم وجود فجوة بين الأداء المتصور والفعلي للمتعلمين، وكذلك بين كتابة المتعلم وكتابة المتحدث الأصلي للغة.

Dayeon Ki, Yu Hou, Rachel Rudinger, Hal Daumé III, Marine Carpuat, Fumeng Yang2026-04-28
💻 computer science

Translate or Simplify First: An Analysis of Cross-lingual Text Simplification in English and French

تقيم هذه الدراسة استراتيجيات التلقين المختلفة لتبسيط النصوص عبر اللغات بين الإنجليزية والفرنسية باستخدام النماذج اللغوية الكبيرة، حيث وجدت أنه في حين يؤدي التلقين المباشر إلى أعلى دقة في المعنى، فإن نهج "الترجمة ثم التبسيط" ينتج المخرج الأكثر تبسيطاً.

Ido Dahan, Omer Toledano, Roey J. Gafter, Sharon Pardo, Oren Tsur, Hila Zahavi, Elior Sulem2026-04-28