💬 NLP

Ebisu: Benchmarking Large Language Models in Japanese Finance

تقدم هذه الورقة Ebisu، وهو معيار مرجعي جديد يتكون من مهمتين تم تعليمهما من قبل خبراء، صُممتا لتقييم التحديات التي تواجهها النماذج اللغوية الكبيرة في فهم الفروق اللغوية والثقافية المعقدة للتمويل الياباني، مما يكشف أن حتى النماذج المتطورة تعاني في استخراج الالتزامات الضمنية والمصطلحات الهرمية رغم الحجم أو التكيف.

Xueqing Peng, Ruoyu Xiang, Fan Zhang, Mingzi Song, Mingyang Jiang, Yan Wang, Lingfei Qian, Taiki Hara, Yuqing Guo, Jimin (…)2026-02-03
💬 NLP

A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning

تقترح هذه الورقة نظرية الميزانية النسبية للتعلم التعزيزي في استدلال النماذج اللغوية الكبيرة، حيث تُعرّف كمية رئيسية ξ\xi تحكم كفاءة العينات عبر الأنظمة الناقصة والمتوازنة والوفيرة، وتثبت تجريبياً أن الميزانية النسبية بين 1.5 و2.0 ترفع أداء التعلم إلى حده الأقصى.

Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki2026-02-03
💬 NLP

CoDiQ: Test-Time Scaling for Controllable Difficult Question Generation

تقدم هذه الورقة إطار عمل CoDiQ، الذي يستفيد من توسيع نطاق وقت الاختبار لتمكين التحكم الدقيق في صعوبة وقابلية حل الأسئلة المولدة بمستوى المسابقات، مما ينتج عنه مجموعة بيانات CoDiQ-Corpus التي تعزز بشكل كبير أداء نماذج الاستدلال الكبيرة عند استخدامها للتدريب.

Zhongyuan Peng, Caijun Xu, Changyi Xiao, Shibo Hong, Eli Zhang, Stephen Huang, Yixin Cao2026-02-03
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

تقدم هذه الورقة أداة Prompting4Debugging (P4D)، وهي أداة اختبار اختراق مؤتمتة تكشف عن ثغرات أمنية جسيمة في آليات السلامة لنماذج الانتشار من نوع نص-إلى-صورة عبر إثبات أن العديد من المطالبات التي كانت تُعتبر سابقاً "آمنة" يمكن التلاعب بها لتجاوز الحمايات الحالية، مما يتحدى موثوقية معايير التقييم الحالية.

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu2026-01-15
💻 computer science

Word Synchronization Challenge: A Benchmark for Word Association Responses for Large Language Models

تقدم هذه الورقة "تحدي التزامن اللفظي"، وهو معيار مرجعي جديد يقيم قدرة النماذج اللغوية الكبيرة على محاكاة العمليات الإدراكية البشرية والتوافق مع أنماط الفكر البشري من خلال مهام الترابط اللفظي الديناميكي، مما يساهم في تطوير تعاون أكثر تعاطفاً ودقة بين الإنسان والآلة.

Tanguy Cazalets, Joni Dambre2026-01-15
💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

تقدم هذه الورقة امتداداً مترجماً باحترافية لمعيار TruthfulQA للغات الباسكية، والكتالونية، والجاليكية، والإسبانية لتقييم 12 نموذجاً من نماذج اللغات الكبيرة المتطورة، كاشفةً أنه بينما يتباين الأداء حسب مستوى الموارد، فإن التفاوتات في الصدق عبر اللغات أصغر مما هو متوقع، وأن الترجمة الآلية تقدم بديلاً قابلاً للتوسع لتقييم الصدق عبر اللغات.

Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri2026-01-15
💻 computer science

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

يُعد AutoToM إطار عمل مؤتمتًا يعزز الاستدلال بنظرية العقل من خلال صقل نماذج الوكلاء بشكل تكراري عبر التخطيط العكسي البايزي الموجه باستدلال عدم اليقين، مما يحقق استدلالًا ذهنيًا قابلًا للتوسع ومتينًا وقابلًا للتفسير يتفوق على الأساليب الحالية عبر مختلف المعايير المرجعية.

Zhining Zhang, Chuanyang Jin, Mung Yao Jia, Shunchi Zhang, Tianmin Shu2026-01-15
💻 computer science

A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models

تقدم هذه الورقة معياراً لتقييم استخراج العلاقات الطبية الحيوية من الطرف إلى الطرف بنمط الصفر-تلقائي باستخدام نماذج OpenAI، مظهرةً أنه بينما تقترب هذه النماذج اللغوية الكبيرة من أداء التعلم الخاضع للإشراف في مجموعات بيانات معينة، إلا أنها لا تزال تواجه صعوبة في المدخلات المعقدة التي تتضمن علاقات متعددة.

Aviv Brokman, Xuguang Ai, Yuhang Jiang, Shashank Gupta, Ramakanth Kavuluru2026-01-15
💻 computer science

Quiet Feature Learning in Algorithmic Tasks

تكشف هذه الورقة أن نماذج "ترانسفورمر" المدربة على المهام الخوارزمية تمر بمرحلة "تعلم الميزات الصامت"، حيث يتم اكتساب الحسابات الوسيطة الحرجة خلال فترات ركود الخسارة، مما يتحدى موثوقية "الاعتلاج المتقاطع" كمؤشر وحيد لتقدم التعلم.

Prudhviraj Naidu, Zixian Wang, Leon Bergen, Ramamohan Paturi2026-01-15
💻 computer science

Development and Evaluation of HopeBot: an LLM-based chatbot for structured and interactive PHQ-9 depression screening

تُظهر هذه الدراسة أن "هوب بوت" (HopeBot)، وهو روبوت محادثة مدعوم بنماذج اللغات الكبيرة ومصمم لإجراء استبيان PHQ-9 بشكل تفاعلي، يحقق توافقاً قوياً في النتائج مع الطرق التقليدية، بينما يكسب ثقة المستخدم وراحته واستعداده لإعادة الاستخدام بمستويات عالية، مما يؤكد إمكاناته كأداة مساعدة قابلة للتوسع لفحص الاكتئاب.

Zhijun Guo, Alvina Lai, Julia Ive, Alexandru Petcu, Yutong Wang, Luyuan Qi, Johan H Thygesen, Kezhi Li2026-01-15