💬 NLP

The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation

تشخّص هذه الورقة الإخفاقات التركيبية في نماذج تحويل النص إلى صورة المعززة بالاستدلال عبر إثبات أن فك التشفير ينفذ الخطة المولدة بأمانة بينما يمثل المخطط نفسه عنق الزجاجة بسبب الانحيازات المعتمدة على الصياغة والازدحام الهندسي، مما يثبت أن تعديل الخطة الصريحة بدلاً من إعادة تدريب النموذج يحل هذه الأخطاء بفعالية.

Ashritha Gonuguntla2026-08-25
💬 NLP

LëtzCross: A Cross-Lingual Page-Level Benchmark for Multimodal Retrieval over Luxembourgish Documents

تقدم الورقة البحثية LëtzCross، وهو معيار مرجعي عابر للغات على مستوى الصفحة لملفات PDF باللغة اللوكسمبورغية، والذي يظهر أن مسترجعي صور الصفحات بأسلوب ColPali يتفوقون على الطرق القائمة على النصوص فقط والمستندة إلى التعرف الضوئي على الحروف (OCR)، ويكشف أن الضبط الدقيق متعدد اللغات الذي يتضمن اللغة اللوكسمبورغية يعزز أداء الاسترجاع بشكل كبير.

Omar El Bachyr, Fred Philippy, Laura Maria Bernardy, Saad Ezzini, Jacques Klein, Tegawende Bissyande2026-08-25
💬 NLP

FCPRAG: Fusion-Controller Parametric Retrieval-Augmented Generation for Stable Multi-Passage LoRA Injection

تقترح الورقة البحثية إطار عمل FCPRAG، وهو إطار عمل جديد لتوليد مدعم بالاسترجاع البارامتري يستخدم متحكمًا خفيف الوزن لدمج عدة محولات LoRA مخصصة لكل فقرة ديناميكيًا مع معايرة على مستوى العينة، مما يتغلب على اختناقات مستوى الأدلة ويحسن الأداء والمتانة بشكل كبير عبر مختلف اختبارات القياس للأسئلة والأجوبة متعددة القفزات.

Jinchang Zhu, Jindong Li, Yi Ding, Xiaojian Nie, Rong Fu, Shuangyong Song, Haowei He, Menglin Yang2026-08-25
💬 NLP

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

تقترح الورقة البحثية GapSight، وهو إطار عمل يدرب موجِّهًا خفيف الوزن لتمكين نماذج الرؤية واللغة من إعادة فحص مناطق صور حرة التنسيق بشكل انتقائي بناءً على إشارات الفشل الخاصة بها (الإشراف بفجوة الخسارة)، مما يحسن الأداء بشكل كبير في المهام التي تركز على التفاصيل دون زيادة تكاليف الحوسبة بشكل عشوائي.

Jinchang Zhu, Rong Fu, Yi Ding, Chenghao Wu, Ying Liu, Menglin Yang2026-08-25
💬 NLP

More Computational Resources Do Not Ensure Higher Scholarly Impact: Evidence from Leading NLP Conference Papers

يكشف تحليل لما يقرب من 14,000 ورقة بحثية من أوراق مؤتمرات معالجة اللغات الطبيعية الرائدة من عام 2020 إلى عام 2025 أنه في حين ترتبط الموارد الحسابية المُبلغ عنها إيجابياً بالتأثير الأكاديمي، إلا أنها تفسر جزءاً ضئيلاً جداً من التباين في الاستشهادات والجوائز، مما يشير إلى أن القدرة العالية لوحدات معالجة الرسومات لا تضمن تأثيراً بحثياً أكبر.

Shuai Chen, Tong Bao, Jitong Peng, Chengzhi Zhang2026-08-25
💬 NLP

MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning

تقترح الورقة البحثية MCite-RL، وهو إطار عمل للتعلم التعزيزي الوكيل المعزز بالاستشهادات، والذي يعمل على تحسين موثوقية أنظمة التوليد المعزز بالاسترجاع (RAG) متعددة الوسائط من خلال إدخال وحدة صقل وكيلية تكرارية للاستشهاد البصري الديناميكي وآلية مكافأة ثنائية المستوى لتحسين دقة الإجابة وقابلية تتبع المصدر بشكل مشترك.

Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li2026-08-25
💬 NLP

PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models

يُعد PatchGate إطار عمل لا يتطلب تدريباً يعمل على تضييق فجوة التعبير اللفظي في النماذج البصرية-اللغوية المجمدة عبر استخراج أدلة موضوعاتية ذاتية على مستوى الرقعة (patch-level) وخالية من المطالبات من طبقات فك التشفير واستخدامها لمعايرة لوغاريتمات فك التشفير، مما يؤدي في آن واحد إلى تحسين تغطية الموضوعات المرئية وتقليل الهلوسة دون الحاجة إلى كواشف خارجية أو ضبط دقيق.

Jihyung Ko, Eunji Jung, Hyeongsub Kim, Ziseok Lee, Jae Won Cho, Sanghyun Jo, Kyungsu Kim2026-08-25
💬 NLP

Convergence in Science, Divergence in Religion: Calibrated Framing Differences Across Wikipedia's Language Editions

تقدم هذه الورقة مقياس مسافة تأطير مُعاير لتوضيح أنه في حين تُوصف المفاهيم العلمية باتساق عالٍ عبر طبعات ويكيبيديا اللغوية المختلفة، فإن المفاهيم الدينية تظهر أكبر قدر من التباين، حتى بعد مراعاة الاختلافات في محاذاة العائلات اللغوية وانحيازات أجهزة الترميز.

Hung-Hsuan Chen2026-08-25
💬 NLP

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

تقدم هذه الورقة البحثية "Peony"، وهو أول معيار تصميم لتقييم "المنطق الشعري" للشعر الصيني الحديث عبر مستويات المقطع، والسطر، والصورة الشعرية، مما يكشف عن قصور كبير في قدرة النماذج اللغوية الكبيرة الحالية على استيعاب مثل هذه النصوص من خلال الاستدلال الشمولي.

Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su2026-08-25
💬 NLP

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

تقدم الورقة البحثية GUI-Primitives، وهو معيار مرجعي يكشف أن نماذج الرؤية واللغة تفشل أساساً في تحديد مواقع عناصر الواجهة المرشحة بدلاً من فهم العلاقات المكانية، كما يتضح من دقتها العالية عندما تقتصر على المناطق الصحيحة ولكن أداءها الضعيف في التنبؤ بالإحداثيات غير المقيدة.

Md Abrar Jahin, Md Rizwan Parvez2026-08-25