💬 NLP

Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

تقدم هذه الورقة AdaRFT، وهي طريقة تعلم منهجي تكيفي تعزز بشكل كبير كفاءة ودقة الضبط الدقيق بالتعزيز للنماذج اللغوية الكبيرة من خلال تعديل صعوبة المشكلات ديناميكيًا بناءً على إشارات المكافأة، مما يقلل وقت التدريب بمقدار يصل إلى ضعفين مع تحسين أداء الاستدلال الرياضي.

Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao2026-02-03
💬 NLP

Can Reasoning LLMs Enhance Clinical Document Classification?

تقيم هذه الدراسة ثمانية نماذج لغوية كبيرة على مجموعة بيانات MIMIC-IV وتجد أنه بينما تحقق نماذج الاستدلال دقة ودرجات F1 أعلى في تصنيف الوثائق السريرية مقارنة بالنماذج غير المستندة إلى الاستدلال، فإن الأخيرة توفر اتساقاً أكبر، مما يشير إلى أن النهج الهجين قد يكون الأفضل لتحسين الترميز السريري في العالم الحقيقي.

Akram Mustafa, Usman Naseem, Mostafa Rahimi Azghadi2026-02-03
💬 NLP

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

تقدم هذه الورقة APE-Bench، وهو أول إطار عمل ومعيار منهجي لتقييم هندسة الإثبات الآلية في مكتبات الرياضيات الرسمية من خلال استخراج مهام واقعية على نطاق المستودعات وتوفير هيكل موحد للتحقق من كل من التصحيح النحوي والصحة الدلالية عبر مختلف تنفيذات الوكلاء.

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li2026-02-03
💬 NLP

Conflicts in Texts: Data, Implications and Challenges

توحد هذه الدراسة المسحية مفهوم المعلومات المتضاربة في معالجة اللغات الطبيعية عبر النصوص الطبيعية، والبيانات المشروحة بشرياً، وتفاعلات النماذج، مع تحليل آثارها على موثوقية النماذج واقتراح استراتيجيات تخفيف لتطوير أنظمة واعية بالتضارب.

Siyi Liu, Dan Roth2026-02-03
💬 NLP

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

تُثبت هذه الورقة أن توظيف التعلم التعزيزي مع المكافآت القائمة على النتائج لضبط النماذج اللغوية الكبيرة مسبقة التدريب يُمكّنها من العمل كنماذج معرفية مزدوجة الغرض، تحقق في آن واحد دقة تنبؤية قوية وتولّد تفسيرات لغوية طبيعية قابلة للتفسير للخيارات البشرية المحفوفة بالمخاطر.

Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths2026-02-03
💬 NLP

ARC: Argument Representation and Coverage Analysis for Zero-Shot Long Document Summarization with Instruction Following LLMs

تقدم هذه الورقة "تغطية تمثيل الحجج" (ARC)، وهو إطار تقييم من أسفل إلى أعلى يكشف كيف تغفل نماذج اللغات الكبيرة المتبعة للتعليمات بشكل متكرر الحجج الجوهرية في تلخيص المستندات الطويلة بنمط الصفر-محاولة، لا سيما في المجالات عالية المخاطر مثل القانون والعلوم، مع تحديد الانحيازات المنهجية المتعلقة بنوافذ السياق وأدوار الحجج.

Mohamed Elaraby, Diane Litman2026-02-03
💬 NLP

A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems

تقترح هذه الورقة إطار عمل جديداً متعدد الوكلاء يعمل على تخفيف التحيزات اللهجوية في أنظمة الإجابة على الأسئلة المتعلقة بسياسات الخصوصية من خلال دمج وكيل ترجمة لهجي ووكيل خبير في المجال، مما يحقق تحسينات كبيرة في الدقة على مجموعات بيانات متنوعة دون الحاجة إلى إعادة تدريب النموذج أو الضبط الدقيق الخاص باللهجة.

Đorđe Klisura, Astrid R Bernaga Torres, Anna Karen Gárate-Escamilla, Rajesh Roshan Biswal, Ke Yang, Hilal Pataci, Anthon (…)2026-02-03
⚡ electrical engineering

PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs

تقدم هذه الورقة PAL، وهو إطار عمل هجين يجمع بين إسقاط PLITS المدمج وآلية حقن LAL خفيفة الوزن لنقل الدلالات الصوتية الغنية بكفاءة إلى النماذج اللغوية الكبيرة (LLMs)، محققاً أداءً فائقاً وتقليلاً كبيراً في التكاليف الحسابية مقارنة بنماذج التكامل القائمة.

Tony Alex, Wish Suharitdamrong, Sara Atito, Armin Mustafa, Philip J. B. Jackson, Imran Razzak, Muhammad Awais2026-02-03
💬 NLP

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

تقترح الورقة البحثية DP-Fusion، وهي آلية استدلال ذات خصوصية تفاضلية على مستوى الرمز (token-level) للنماذج اللغوية الكبيرة، تضع حدوداً مثبتة لتأثير رموز السياق الحساسة على المخرجات لتمكين تعمية المستندات بجودة عالية مع تحسين مقايضات الخصوصية والمنفعة بشكل كبير مقارنة بالطرق الحالية.

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas2026-02-03
💬 NLP

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

تقدم هذه الورقة RabakBench، وهو معيار سلامة متعدد اللغات تم التحقق منه من خلال العنصر البشري للمشهد اللغوي في سنغافورة، والذي يكشف عن فجوات أداء كبيرة في حواجز الحماية للنماذج اللغوية الكبيرة الحديثة عند التعامل مع اللغات ذات الموارد المنخفضة مثل "سينغليش" والصينية والمالاي والتاميلية.

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee2026-02-03