💬 NLP

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

يُعد BARRED إطار عمل يُنشئ بيانات تدريب اصطناعية عالية الدقة من خلال تفكيك أبعاد المجال والمناظرة بين الوكلاء المتعددين، مما يُمكّن النماذج اللغوية الصغيرة من التفوق على النماذج اللغوية الكبيرة المملوكة والأكثر تطوراً والأنظمة المخصصة للحماية في فرض السياسات المخصصة دون الحاجة إلى تعليق بشري مكثف.

Arnon Mazza, Elad Levi2026-04-29
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

تقدم الورقة البحثية DRAGON، وهي مجموعة بيانات معيارية وإطار تقييم مصمم لتقييم قدرة نماذج الرؤية واللغة على ربط إجاباتها بأدلة بصرية محددة داخل المخططات، مما يعالج قصور الدقة العالية دون تبرير استدلالي موثوق.

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur (…)2026-04-29
📊 statistics

VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

تقدم هذه المساهمة إطار عمل للتنبؤ المطابق لقياس موثوقية أحكام نماذج الرؤية واللغة عبر تحويل التقديرات النقطية إلى فترات مُعايرة، وتُظهر أن عدم اليقين في التقييم يعتمد بشكل كبير على المهمة، وتكشف عن نمط فشل حرج يتمثل في "انفصال التصنيف عن التقييم"، حيث يمكن للنماذج ترتيب الاستجابات بشكل صحيح ولكنها تفشل في تقديم درجات مطلقة موثوقة.

Divake Kumar, Sina Tayebati, Devashri Naik, Ranganath Krishnan, Amit Ranjan Trivedi2026-04-29
💬 NLP

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

تُثبت هذه الورقة أن توجيه النماذج اللغوية الكبيرة الصغيرة المضبوطة بالتعليمات (7-9 مليارات معلمة) لتعمد الأداء الضعيف يفشل في إنتاج دقة أقل من مستوى الصدفة لأن النماذج إما تتجاهل التعليمات أو تتبنى انحيازاً موضعياً نحو الخيارات ذات الحروف المتوسطة في الأبجدية، مما يشير إلى أن اكتشاف عملية "التظاهر بالغباء" (sandbagging) هذه يتطلب مراقبة التحولات في التوزيع بدلاً من الاعتماد على الأداء الأقل من مستوى الصدفة كعلامة عليها.

Jon-Paul Cacioli2026-04-29
💬 NLP

LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model

تقدم هذه الورقة LegalMidm، وهو نموذج لغوي كبير في المجال القانوني الكوري تم تطويره من خلال إطار تدريب منهجي قائم على حالات الاستخدام، يمنح الأولوية للتعاون مع المتخصصين في القانون والتقييم الصارم للبيانات لتعزيز الدقة والمنفعة العملية في التطبيقات القانونية الواقعية.

Youngjoon Jang, Chanhee Park, Hyeonseok Moon, Young-kyoung Ham, Jiwon Moon, Jinhyeon Kim, JuKyung Jung, Heuiseok Lim2026-04-29
💬 NLP

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

تقدم هذه الورقة البحثية Faithfulness-QA، وهي مجموعة بيانات واسعة النطاق تضم ما يقرب من 100,000 عينة من أسئلة وأجوبة معدلة بشكل مضاد للواقع، صُممت لتدريب وتقييم نماذج التوليد المعزز بالاسترجاع (RAG) لإعطاء الأولوية للسياق المسترجع على الذاكرة البارامترية الداخلية، وذلك لمعالجة المشكلة الحرجة المتمثلة في التوليد غير الأمين.

Li Ju, Junzhe Wang, Qi Zhang2026-04-29
💬 NLP

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

تقدم هذه الورقة "Cutscene Agent"، وهو إطار عمل للنماذج اللغوية الكبيرة متعددة الوكلاء يعمل على أتمتة توليد المشاهد السينمائية ثلاثية الأبعاد من البداية إلى النهاية من خلال التكامل ثنائي الاتجاه مع محركات الألعاب، ونظام تنسيق هرمي مزود بالتغذية الراجعة المرئية، ومعيار هرمي جديد (CutsceneBench) مصمم لتقييم تنسيق الأدوات المعقد وطويل المدى.

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan (…)2026-04-29
💬 NLP

R3^3-SQL: Ranking Reward and Resampling for Text-to-SQL

يُعد R³-SQL إطار عمل جديد لتحويل النص إلى لغة SQL، حيث يعمل على تحسين دقة التنفيذ من خلال تقديم آلية مكافأة موحدة للتصنيف المتسق لمجموعات SQL المتكافئة وظيفياً واستراتيجية إعادة أخذ عينات وكيلية لاستعادة الاستعلامات الصحيحة عندما تكون مفقودة في البداية من مجموعة المرشحين، محققاً بذلك أداءً هو الأفضل في فئته على مقياس BIRD-dev.

Hojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He2026-04-29
💬 NLP

Wiki Dumps to Training Corpora: South Slavic Case

تقدم هذه الورقة منهجية غير مرتبطة بلغة معينة لتحويل ملفات ويكيميديا الخام إلى مجموعات بيانات تدريبية عالية الجودة وغنية لغوياً لسبع لغات سلافية جنوبية، وذلك من خلال استخراج النصوص بشكل منهجي من مشاريع ويكي متعددة وتوظيف التصفية القائمة على الـ n-gram لإزالة المقالات منخفضة الجودة والمتكررة.

Mihailo Škorić2026-04-29
💬 NLP

Benchmarking PyCaret AutoML Against IndoBERT Fine-Tuning for Sentiment Analysis on Indonesian IKN Twitter Data

تُثبت هذه الورقة أن الضبط الدقيق لنموذج IndoBERT يتفوق بشكل كبير على نهج PyCaret AutoML الكلاسيكي، حيث حقق دقة بلغت 89.59% مقارنة بـ 77.57%، وذلك لتحليل المشاعر الثنائي لتعليقات تويتر الإندونيسية غير الرسمية المتعلقة بالعاصمة الجديدة إيكن (IKN).

Mutia Alfi Mayzaroh, Dwi Fitria Ningsih, Nindi Destriani, Martin C. T. Manullang2026-04-29