💬 NLP

Anticipatory Evaluation of Language Models

تقدم هذه الورقة PRECOG، وهو متن من أوصاف المهام ومقاييس الأداء، لتوضيح أن النماذج اللغوية الكبيرة يمكنها التنبؤ بنتائج التقييم بناءً فقط على أوصاف المهام والتكوينات التجريبية، مما يوفر مساراً للتغلب على عنق الزجاجة الحالي في تقييم أبحاث الذكاء الاصطناعي.

Jungsoo Park, Ethan Mendes, Gabriel Stanovsky, Alan Ritter2026-02-05
💬 NLP

Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions

تحدد هذه الورقة وتعالج عدم التوافق بين المعرفة الداخلية وسلوك المخرجات في النماذج اللغوية الكبيرة في الأسئلة متعددة الخيارات من خلال التحليل الهندسي للتمثيلات الخفية وتقديم KAPPA، وهو تدخل خفيف الوزن أثناء الاستدلال يعمل على محاذاة فضاءات المعرفة والتنبؤ لتحسين الدقة.

Yoonah Park, Haesung Pyun, Yohan Jo2026-02-05
💬 NLP

Scaling Agents for Computer Use

تقدم الورقة البحثية "Behavior Judge" (BJudge)، وهو إطار عمل يعمل على تحسين موثوقية وكلاء استخدام الكمبيوتر من خلال تقييم واختيار أفضل النتائج من بين عدة عمليات تنفيذ باستخدام السرد السلوكي، محققاً أداءً هو الأفضل في فئته على منصة OSWorld بما يتجاوز القدرات البشرية.

Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang2026-02-05
💬 NLP

Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models

تقترح هذه الورقة إطار عمل فعال من حيث التكلفة يعمل على تعزيز اللغات غير الممثلة كفاية في النماذج اللغوية الكبيرة من خلال تحديد وضبط الشبكات الفرعية المتفرقة والخاصة بكل لغة باستخدام احتمالية إنتروبيا تنشيط اللغة (LAPE)، مما يحقق أداءً فائقاً مع حد أدنى من تحديثات المعلمات مع الحفاظ على القدرات العامة ومنع النسيان الكارثي.

Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Simon Ostermann2026-02-05
💬 NLP

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

تقدم هذه الورقة تصنيفاً شاملاً وموجهاً نحو الآليات لاستراتيجيات كسر الحماية (jailbreak) تم تطويره من خلال تحدي اختبار اختراق (red-teaming) مهيكل، والذي يُستخدم لتحليل مدى انتشار الهجمات، واختبار نموذج GPT-5 ككاشف موجه بالتصنيف، وتقديم مجموعة بيانات إيطالية جديدة متعددة الجولات من الهجمات العدائية لتعزيز أبحاث كشف كسر الحماية.

Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi2026-02-05
💬 NLP

EvasionBench: A Large-Scale Benchmark for Detecting Managerial Evasion in Earnings Call Q&A

تقدم هذه الورقة البحثية EvasionBench، وهو معيار وتصنيف واسع النطاق للكشف عن التهرب الإداري في مكالمات الأرباح، ويتميز بمجموعة بيانات مشروحة بدقة ومصنف متخصص بـ 4 مليارات معلمة يتفوق على النماذج التجارية الرائدة.

Shijian Ma, Yan Lin, Yi Yang2026-02-05
💬 NLP

SpeechMapper: Speech-to-text Embedding Projector for LLMs

يقدم SpeechMapper إطار تدريب فعال حاسبياً يتكون من مرحلتين، حيث يقوم بالتدريب المسبق لجهاز عرض الكلام إلى نص بشكل مستقل قبل تطبيق ضبط تعليمات طفيف، مما يحقق تعميماً وأداءً فائقين في دمج النماذج اللغوية الكبيرة مع الكلام، مع تجنب الإفراط في التخصيص والتكاليف العالية المرتبطة بتدريب جميع المكونات بشكل مشترك على بيانات تعليمات واسعة النطاق.

Biswesh Mohapatra, Marcely Zanon Boito, Ioan Calapodescu2026-02-05
💬 NLP

Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization

تقدم هذه الورقة إطار عمل PLaT، الذي يفصل بين الاستنتاج والصياغة اللفظية عبر نمذجة الاستنتاج الكامن كمسار تخطيط حتمي، مما يتيح إنهاءً ديناميكياً وقابلية توسع فائقة في تنوع الحلول رغم وجود مقايضة في دقة الاختيار الجشع.

Jiecong Wang, Hao Peng, Chunyang Liu2026-02-05
💬 NLP

Scaling Multiagent Systems with Process Rewards

تقدم هذه الورقة البحثية MAPPA، وهي طريقة للضبط الدقيق تستفيد من مكافآت العمليات لكل إجراء من التغذية الراجعة للذكاء الاصطناًعي لحل تحديات تخصيص الائتمان وكفاءة العينات في الأنظمة متعددة الوكلاء، مما يظهر تحسينات كبيرة في الأداء في مهام الرياضيات وتحليل البيانات المعقدة.

Ed Li, Junyu Ren, Cat Yan2026-02-05
💬 NLP

Linguistic Blind Spots in Clinical Decision Extraction

تكشف هذه الدراسة أن نماذج استخراج القرارات السريرية تعاني مع الامتدادات ذات الأسلوب السردي التي تحتوي على التحوط، والنفي، ونسب عالية من كلمات التوقف —وهي أمور شائعة في فئات النصائح والتحذيرات— مما يسلط الض {على} الحاجة إلى استراتيجيات تقييم تتحمل حدود النصوص لمعالجة هذه النقاط اللغوية العمياء.

Mohamed Elgaar, Hadi Amiri2026-02-05