🤖 machine learning

Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective

تتحدى هذه الورقة المفهوم السائد بوجود فجوة قدرة عالمية في تقطير "سلسلة الأفكار" (Chain-of-Thought) من خلال إثبات أن تدهور الأداء ينجم غالباً عن بروتوكولات تقييم معيبة بدلاً من القيود الجوهرية للنماذج، وبذلك تقدم إرشادات عملية لاختيار أزواج المعلم والطالب الفعالة.

Tokio Kajitsuka, Ukyo Honda, Sho Takase2026-04-13
💬 NLP

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

تقدم الورقة البحثية TaxPraBen، وهو أول معيار قابل للتوسع مصمم لتقييم النماذج اللغوية الكبيرة في 13 مهمة من مهام الممارسة الضريبية الصينية — بما في ذلك سيناريوهات واقعية مثل الوقاية من المخاطر وتخطيط الاستراتيجيات — مما يكشف عن تفاوتات كبيرة في الأداء بين النماذج ويسلط الضوء على الحاجة إلى تقييم متخصص في المجالات المنظمة قانونياً.

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yu2026-04-13
💬 NLP

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

تقدم هذه الورقة البحثية Litmus (Re)Agent، وهو نظام وكيل مُدار بواسطة رسم بياني موجه غير حلقي (DAG) ومعيار ضبط يتكون من 1,500 سؤال مصمم للتنبؤ بأداء النماذج متعددة اللغات في اللغات المستهدفة من خلال تركيب أدلة غير مكتملة عبر استدلال مهيكل، مما يظهر دقة فائقة في السيناريوهات التي تكون فيها بيانات التقييم المباشر شحيحة.

Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury2026-04-13
💬 NLP

Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning

تبحث هذه الورقة في كيفية تسبب الضبط الدقيق الخاضع للإشراف في إضعاف الارتباط بين درجات الثقة وجودة المخرجات في النماذج اللغوية، مما يثبت أن هذه المقاييس تصبح غير موثوقة عند استخدامها مباشرة بسبب عوامل مثل تشابه توزيع التدريب، وتسلط الضوء على الحاجة الملحة لطرق أكثر قوة لتقدير عدم اليقين.

Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Jackie Chi Kit Cheung2026-04-13
💬 NLP

Quantisation Reshapes the Metacognitive Geometry of Language Models

تُثبت هذه الورقة أن تكميم النموذج يعيد تشكيل ملامح كفاءة الميتا-معرفية (ما وراء المعرفة) على مستوى النطاق في النماذج اللغوية الكبيرة من خلال تغيير عمليات تطبيع نسبة M دون التأثير على إشارات التمييز الأساسية، مما يكشف عن تبعية حرجة للتشخيصات القائمة على الثقة لنمط الاستدلال لا يمكن معالجتها من خلال التدريب المشروط بالنطاق.

Jon-Paul Cacioli2026-04-13
💬 NLP

Testing the Assumptions of Active Learning for Translation Tasks with Few Samples

تتحدى هذه الورقة الافتراضات الجوهرية للتعلم النشط لمهام الترجمة باستخدام عينات قليلة، وذلك من خلال إثبات أن غزارة المعلومات وتنوع البيانات المختارة لا يرتبطان بالأداء، بينما يعد ترتيب العينات والتفاعلات مع بيانات ما قبل التدريب هما المحركان الأساسيان للنجاح.

Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Ori Ernst, David Ifeoluwa Adelani, Jackie Chi Kit Cheung2026-04-13
💬 NLP

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

تقترح الورقة البحثية PerMix-RLVR، وهي استراتيجية تدريب تجمع بين خلط الشخصيات والتعلم المعزز باستخدام مكافآت قابلة للتحقق لتعزيز متانة النموذج ضد تغيرات الشخصية الضارة وفي الوقت ذاته الحفاظ على التعبير العالي الدقة عن الشخصية في مهام لعب الأدوار.

Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun2026-04-13
💬 NLP

Towards Linguistically-informed Representations for English as a Second or Foreign Language: Review, Construction and Application

تتناول هذه الورقة الحاجة إلى تمثيلات مخصصة للغة الإنجليزية كلغة ثانية أو لغة أجنبية من خلال بناء مورد نحوي-دلالي جديد قائم على النظرية البنائية يتكون من 1,643 جملة مشروحة، يصور اللغة الإنجليزية كلغة ثانية أو أجنبية كنظام لغوي متميز، ويوضح فائدتها في أبحاث اكتساب اللغة الثانية من خلال دراسة استطلاعية لفرضية الحيز اللغوي.

Wenxi Li, Xihao Wang, Weiwei Sun2026-04-13
💬 NLP

Regime-Conditional Retrieval: Theory and a Transferable Router for Two-Hop QA

تُصوّغ هذه الورقة البحثية التمييز النظري بين أنظمة هيمنة الاستعلام (Q-dominant) وهيمنة الإجابة (B-dominant) في استرجاع الأسئلة والأجوبة ثنائي القفزة، وتُقدم RegimeRouter، وهو موجه خفيف الوزن وقابل للنقل دون تدريب مسبق (zero-shot) يستفيد من محمولات النص السطحية لاختيار استراتيجيات الاسترجاع المثلى ديناميكيًا، مما يحسن الاستدعاء بشكل كبير في مجموعات البيانات المرجعية.

Andre Bacellar2026-04-13
💬 NLP

SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos

تقدم الورقة البحثية SiMing-Bench، وهو أول معيار لتقييم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على الحكم على الصحة الإجرائية من خلال تتبع كيفية تحديث التفاعلات المستمرة لحالات المهارات السريرية، مما يكشف أن النماذج الحالية تعاني بشكل كبير من هذا التقييم الدقيق القائم على المعايير رغم ظهورها بمظهر الكفاءة في التقييمات العالمية العامة.

Xiyang Huang, Jiawei Lin, Keying Wu, Jiaxin Huang, Kailai Yang, Renxiong Wei, Cheng zeng, Jiayi Xiang, Ziyan Kuang, Min (…)2026-04-13