💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

تقدم هذه الورقة امتداداً مترجماً باحترافية لمعيار TruthfulQA للغات الباسكية، والكتالونية، والجاليكية، والإسبانية لتقييم 12 نموذجاً من نماذج اللغات الكبيرة المتطورة، كاشفةً أنه بينما يتباين الأداء حسب مستوى الموارد، فإن التفاوتات في الصدق عبر اللغات أصغر مما هو متوقع، وأن الترجمة الآلية تقدم بديلاً قابلاً للتوسع لتقييم الصدق عبر اللغات.

Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri2026-01-15
💻 computer science

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

يُعد AutoToM إطار عمل مؤتمتًا يعزز الاستدلال بنظرية العقل من خلال صقل نماذج الوكلاء بشكل تكراري عبر التخطيط العكسي البايزي الموجه باستدلال عدم اليقين، مما يحقق استدلالًا ذهنيًا قابلًا للتوسع ومتينًا وقابلًا للتفسير يتفوق على الأساليب الحالية عبر مختلف المعايير المرجعية.

Zhining Zhang, Chuanyang Jin, Mung Yao Jia, Shunchi Zhang, Tianmin Shu2026-01-15
💻 computer science

A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models

تقدم هذه الورقة معياراً لتقييم استخراج العلاقات الطبية الحيوية من الطرف إلى الطرف بنمط الصفر-تلقائي باستخدام نماذج OpenAI، مظهرةً أنه بينما تقترب هذه النماذج اللغوية الكبيرة من أداء التعلم الخاضع للإشراف في مجموعات بيانات معينة، إلا أنها لا تزال تواجه صعوبة في المدخلات المعقدة التي تتضمن علاقات متعددة.

Aviv Brokman, Xuguang Ai, Yuhang Jiang, Shashank Gupta, Ramakanth Kavuluru2026-01-15
💻 computer science

Quiet Feature Learning in Algorithmic Tasks

تكشف هذه الورقة أن نماذج "ترانسفورمر" المدربة على المهام الخوارزمية تمر بمرحلة "تعلم الميزات الصامت"، حيث يتم اكتساب الحسابات الوسيطة الحرجة خلال فترات ركود الخسارة، مما يتحدى موثوقية "الاعتلاج المتقاطع" كمؤشر وحيد لتقدم التعلم.

Prudhviraj Naidu, Zixian Wang, Leon Bergen, Ramamohan Paturi2026-01-15
💻 computer science

Development and Evaluation of HopeBot: an LLM-based chatbot for structured and interactive PHQ-9 depression screening

تُظهر هذه الدراسة أن "هوب بوت" (HopeBot)، وهو روبوت محادثة مدعوم بنماذج اللغات الكبيرة ومصمم لإجراء استبيان PHQ-9 بشكل تفاعلي، يحقق توافقاً قوياً في النتائج مع الطرق التقليدية، بينما يكسب ثقة المستخدم وراحته واستعداده لإعادة الاستخدام بمستويات عالية، مما يؤكد إمكاناته كأداة مساعدة قابلة للتوسع لفحص الاكتئاب.

Zhijun Guo, Alvina Lai, Julia Ive, Alexandru Petcu, Yutong Wang, Luyuan Qi, Johan H Thygesen, Kezhi Li2026-01-15
💻 computer science

LingVarBench: Benchmarking LLMs on Entity Recognitions and Linguistic Verbalization Patterns in Phone-Call Transcripts

تقدم الورقة البحثية LingVarBench، وهو معيار وخط إنتاج لتوليد البيانات الاصطناعية يستفيد من الأنماط المتنوعة لغويًا والقيم التي يتم أخذ عينات منها بواسطة النماذج اللغوية الكبيرة (LLM) لتحسين مطالبات الاستخراج تلقائيًا، محققًا أداءً يضاهي النماذج التي تم ضبطها بشريًا في التعرف على الكيانات المهيكلة في نصوص المكالمات الهاتفية، مع التغلب على تحديات خصوصية البيانات وتكاليف التوسيم.

Seyedali Mohammadi, Manas Paldhe, Amit Chhabra, Youngseo Son, Vishal Seshagiri2026-01-15
💻 computer science

Where to Begin: Efficient Pretraining via Subnetwork Selection and Distillation

تقدم هذه الورقة إطار عمل فعال للتدريب المسبق لنماذج اللغات الصغيرة (SLMs) يجمع بين البحث التطوري لتحديد تهيئات الشبكات الفرعية المتناثرة هيكلياً وبين تقطير المعرفة من النماذج الأكبر، محققاً أداءً مقارباً للمعايير المرجعية القياسية مع تقليل التكاليف الحسابية بشكل كبير.

Arjun Krishnakumar, Rhea Sanjay Sukthanker, Hannan Javed Mahadik, Gabriela Kadlecová, Vladyslav Moroshan, Timur Carstens (…)2026-01-15
💻 computer science

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

تقدم الورقة البحثية SOP-Maze، وهو معيار مرجعي جديد مستمد من بيانات أعمال واقعية، والذي يقيم النماذج اللغوية الكبيرة في إجراءات التشغيل القياسية المعقدة عبر تصنيف المهام إلى تحديات استدلال جانبي وعميق، مما يكشف عن معاناة كبيرة في حالات "العمى المساري"، و"الهشاشة الحوارية"، و"أخطاء الحساب" عبر النماذج المتطورة.

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao2026-01-15
💻 computer science

Structured yet Bounded Temporal Understanding in Large Language Models

تتقصى هذه الورقة كيف تتباين أحكام نماذج اللغات الكبيرة في الفهم الزمني وأحكام التشابه بين أطر المرجعية الإشارية (ماضٍ-حاضر-مستقبل) والأطر التتابعية (قبل-بعد)، مما يكشف عن أنماط بنيوية متميزة تتأثر بالمسافة الزمنية، وعلاقات الفترات، ومدة الحدث.

Damin Zhang, Julia Rayz2026-01-15
💻 computer science

Head Pursuit: Probing Attention Specialization in Multimodal Transformers

تقدم هذه الورقة طريقة استقصاء قائمة على معالجة الإشارات لتحديد وتصنيف رؤوس الانتباه المتخصصة في نماذج المحولات متعددة الوسائط، مما يثبت أن تعديل ما لا يزيد عن 1% من هذه الرؤوس يمكن أن يتحكم بفعالية في مفاهيم دلالية أو بصرية محددة في مخرجات النموذج.

Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello, Alberto Cazzaniga2026-01-15