🤖 machine learning

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

تحدد هذه الورقة ثغرة "قابلية تحقق غير متماثلة" هيكلية في عملية نقل أجهزة الترميز (tokenizer transplantation) عبر النماذج اللغوية الكبيرة، حيث يمكن هندسة ناقلات معاملات محددة كـ "رموز كاسرة" (breaker tokens) تظل خاملة في النموذج المانح ولكنها تُحفز عمليات إعادة بناء عالية البروز في النموذج الأساسي، مما يؤدي إلى التهرب من فحوصات دمج الأوزان القياسية وتدابير التخفيف القائمة على تقنية (LoRA).

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao2026-05-29
💻 computer science

Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

تقدم هذه الورقة إطار تقييم جديد لتقدير ثقة النماذج اللغوية يقيم المتانة والاستقرار والحساسية للتغيرات اللغوية، كاشفاً أن الأساليب الحالية غالباً ما تفشل في التمييز بين الإجابات المختلفة دلالياً رغم توافقها مع الصحة.

Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth2026-05-29
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

تقدم الورقة البحثية "Rulers"، وهو إطار عمل ثلاثي المراحل أثناء الاستنتاج يعمل على تحويل المعايير البشرية إلى مواصفات مغلقة، ويفرض استناداً هيكلياً للأدلة، ويطبق معايرة لاحقة للتغلب على أوضاع الفشل الشائعة وتحقيق تقييم أكثر موثوقية ومواءمة للبشر من قبل النماذج اللغوية الكبيرة عبر مهام تقييم النصوص المتنوعة.

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong2026-05-29
🤖 AI

Steering Language Models Before They Speak: Logit-Level Interventions

تقدم الورقة البحثية SWAI، وهي طريقة خالية من التدريب تُستخدم أثناء الاستنتاج لتوجيه مخرجات النماذج اللغوية نحو خصائص محددة مثل اللباقة أو سهولة القراءة عبر تطبيق انحيازات إحصائية مستمدة من المتون مباشرة على أفضل (K) من مرشحي اللوغاريتم (top-K logit candidates)، مما يحقق تحكماً فائقاً دون تعديل معلمات النموذج أو الحاجة إلى نماذج مساعدة.

Hyeseon An, Shinwoo Park, Hyundong Jin, Yo-Sub Han2026-05-29
💻 computer science

Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction

تقترح الورقة البحثية إطار عمل "ThinkTwice"، الذي يعمل على تحسين استخراج المعلومات على مستوى المستند من خلال الاستفادة من أخذ العينات لتوليد مخرجات متعددة مرشحة واختيار الأفضل منها عبر الاتفاق غير الخاضع للإشراف أو نماذج المكافأة الخاضعة للإشراف، مما يتفوق بذلك على طرق فك التشفين الجشعة التقليدية.

Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre2026-05-29
🤖 machine learning

Procedural Pretraining: Warming Up Language Models with Abstract Data

تُثبت هذه الورقة أن "التدريب المسبق الإجرائي"، الذي يتضمن تعريض النماذج اللغوية في البداية لنسبة ضئيلة من البيانات الهيكلية المجردة الناتجة عن اللغات والخوارزميات الصورية، يعزز قدراتها على الاستنتاج بشكل كبير، ويسرع التقارب، ويقلل التكاليف الحسابية مقارنة بالتدريب المسبق القياسي باستخدام اللغة الطبيعية.

Liangze Jiang, Zachary Shinnick, Anton van den Hengel, Hemanth Saratchandran, Damien Teney2026-05-29
🤖 AI

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

تقترح هذه الورقة إطار عمل للتدريب اللاحق متوافقاً معرفياً يسمى "سلسلة التفكير الميتافيزيقي" (CoMT) و"التعلم المعزز المعاير للثقة" (CCRL)، والذي يفصل بين اكتساب الاستراتيجية المجردة والتنفيذ المحدد لتحسين قابلية التعميم والموثوقية في استدلال النماذج اللغوية الكبيرة، محققاً مكاسب أداء كبيرة مقارنة بالطرق القياسية.

Shaojie Wang, Liang Zhang2026-05-29
🤖 AI

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

تقدم هذه الورقة البحثية "الاستنتاج التفاعلي الاستباقي" (PIR)، وهو نموذج جديد يحول نماذج اللغات الكبيرة الاستنتاجية من مجرد حلال للمشكلات بشكل سلبي إلى مستقصٍ استباقي عبر دمج الاستنتاج الداخلي مع استيضاحات المستخدم لمعالجة عدم اليقين في المقدمات والقصد، مما يؤدي إلى تحسين الدقة والكفاءة بشكل كبير مع تقليل التكاليف الحسابية.

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang2026-05-29
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

تقدم الورقة البحثية طريقة PEAR، وهي طريقة في مرحلة الضبط الدقيق الموجه (SFT) تستخدم أخذ العينات بالأهمية لإعادة وزن خسائر التدريب بناءً على عدم التطابق بين البيانات غير المتصلة (offline data) وسياسات التعلم المعزز المستقبلية، مما يحسن بشكل كبير أداء التعلم المعزز في المهام اللاحقة على مهام الاستدلال مقارنة بالضبط الدقيق الموجه القياسي.

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng2026-05-29
💻 computer science

"Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs

تقدم هذه الورقة البحثية "Be My Cheese?"، وهو أول معيار واسع النطاق مُصنف بشرياً لتقييم التوطين الثقافي في النماذج اللغوية الكبيرة متعددة اللغات، والذي يكشف أنه بينما تحقق النماذج الحديثة جودة قواعدية متواضعة، فإنها تعاني بشكل كبير مع العناصر ذات الدلالات الثقافية الدقيقة مثل الأمثال والكلمات المزدوجة مقارنة بالعطلات والمفاهيم الثقافية.

Madison Van Doren, Casey Ford, Jennifer Barajas, Riley VanMeter, Cory Holland2026-05-29