💬 NLP

The Automatic Verification of Image-Text Claims (AVerImaTeC) Shared Task

تقدم هذه الورقة المهمة المشتركة AVerImaTeC، التي ركزت على تطوير أنظمة التحقق من الادعاءات في الصور والنصوص، مع تفصيل منهجية التقييم، والإفادة بأن جميع المشاركات الست في مرحلة الاختبار قد تفوقت على النموذج المرجعي مع تحقيق الفريق الفائز HUMANE لدرجة قدرها 0.5455، ومناقشة الرؤى الرئيسية المستخلصة من النتائج.

Rui Cao, Zhenyun Deng, Yulong Chen, Michael Schlichtkrull, Andreas Vlachos2026-02-27
💬 NLP

Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

تقدم هذه الورقة البحثية "التقطير العام داخل السياسة" (G-OPD)، وهو إطار عمل يوسع عملية التقطير القياسي داخل السياسة من خلال تمكين نماذج مرجعية مرنة وتوسيع نطاق المكافأة، مما يثبت أن استقراء المكافأة (ExOPD) يسمح للنماذج الطلاب بتجاوز أداء النموذج المعلم، وأن استخدام النموذج الأساسي للمعلم قبل مرحلة التعلم المعزز كمرجع يعزز عملية التقطير بشكل أكبر في حالات الانتقال من النموذج القوي إلى الضعيف.

Wenkai Yang, Weijie Liu, Ruobing Xie, Kai Yang, Saiyong Yang, Yankai Lin2026-02-27
💬 NLP

GPT-4o Lacks Core Features of Theory of Mind

على الرغم من إظهار الكفاءة الاجتماعية في المعايير المرجعية القياسية، إلا أن GPT-4o يفتقر إلى نظرية عقل متماسكة، وعامة في جميع المجالات، ومتسقة، كما يتضح من فشله في الحفاظ على الاتساق المنطقي بين استنتاجات الحالة الذهنية وتوقعات السلوك.

John Muchovej, Amanda Royka, Shane Lee, Julian Jara-Ettinger2026-02-27
💬 NLP

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

تقترح هذه الورقة إطار عمل "الاستيعاب البصري المؤجل" (DVI)، الذي يستبدل عملية التضمين المسبق للمحتوى البصري ذات الفقد العالي باستراتيجية فهرسة هرمية قائمة على البنية وتحليل مؤجل عبر النماذج اللغوية البصرية الكبيرة (VLM)، محققاً دقة أعلى بكثير في مهام الأسئلة والأجوبة الخاصة بالوثائق الهندسية كثيفة المحتوى البصري من خلال التغلب على قيود الاسترجاع وفقدان التفاصيل التي تعاني منها طرق "الاستيعاب المسبق" الحالية.

Tao Xu2026-02-27
💬 NLP

BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios

تقدم هذه الورقة البحثية BankMathBench، وهو معيار متخصص مصمم لتقييم وتحسين قدرات الاستدلال العددي للنماذج اللغوية الكبيرة في سيناريوهات مصرفية واقعية، مما يثبت أن التدريب على هذه المجموعة من البيانات يعزز بشكل كبير الدقة في المهام التي تتراوح بين حسابات المنتج الواحد والمقارنات المعقدة متعددة الشروط.

Yunseung Lee, Subin Kim, Youngjun Kwak, Jaegul Choo2026-02-27
💬 NLP

Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences

تقدم الورقة البحثية "Duel-Evolve"، وهي طريقة لتوسيع النطاق في وقت الاختبار خالية من المكافآت، تستفيد من التفضيلات الذاتية الثنائية للنموذج اللغوي الكبير ضمن إطار تطوري بايزي لتتفوق بشكل كبير على النماذج المرجعية الحالية في اختبارات الرياضيات والبرمجة دون الحاجة إلى نماذج مكافأة خارجية أو تسميات صحيحة.

Sweta Karlekar, Carolina Zheng, Magnus Saebo, Nicolas Beltran-Velez, Shuyang Yu, John Bowlan, Michal Kucer, David Blei2026-02-27
💬 NLP

Graph Your Way to Inspiration: Integrating Co-Author Graphs with Retrieval-Augmented Generation for Large Language Model Based Scientific Idea Generation

تقدم هذه الورقة نظام GYWI، الذي يدمج الرسوم البيانية للمعرفة الخاصة بالمؤلفين المشاركين مع التوليد المعزز بالاسترجاع الهجين والتحسين القائم على التعلم التعزيزي للمطالبات لتعزيز قدرة النماذج اللغوية الكبيرة على توليد أفكار علمية قابلة للضبط والتتبع والابتكار، مما يظهر أداءً فائقًا عبر مقاييس تقييم متعددة مقارنة بالنماذج السائدة.

Pengzhen Xie, Huizhi Liang2026-02-27
💬 NLP

Comparative Analysis of Neural Retriever-Reranker Pipelines for Retrieval-Augmented Generation over Knowledge Graphs in E-commerce Applications

تقدم هذه الورقة تحليلاً مقارناً لمسارات الاسترجاع وإعادة التصنيف العصبية لعمليات التوليد المعزز بالاسترجاع (RAG) عبر الرسوم البيانية للمعرفة الخاصة بالتجارة الإلكترونية، حيث تُثبت أن التكوينات المُحسّنة على مجموعة بيانات STaRK تتفوق بشكل كبير على المعايير المرجعية الحالية في دقة الاسترجاع، وتضع إطار عمل عملياً لأنظمة RAG المتخصصة والمعدة للإنتاج.

Teri Rumble, Zbyněk Gazdík, Javad Zarrin, Jagdeep Ahluwalia2026-02-27
💬 NLP

Misinformation Exposure in the Chinese Web: A Cross-System Evaluation of Search Engines, LLMs, and AI Overviews

تقيم هذه الورقة الموثوقية الواقعية لمحركات البحث التقليدية، والنماذج اللغوية الكبيرة المستقلة، ونظرات الذكاء الاصطناعي العامة في الويب الصيني من خلال تقديم مجموعة بيانات استعلامات من العالم الحقيقي، مما يكشف عن تفاوتات كبيرة في الدقة ويقدر التعرض الإقليمي الناتج للمستخدمين الصينيين للمعلومات المضللة.

Geng Liu, Junjie Mu, Li Feng, Mengxiao Zhu, Francesco Pierri2026-02-27
💬 NLP

Scaling In, Not Up? Testing Thick Citation Context Analysis with GPT-5 and Fragile Prompts

تُظهر هذه الورقة أنه بينما يمكن لـ GPT-5 أن يعمل كمحلل مساعد مستقر لتحليل سياق الاستشهاد الكثيف من خلال توليد فرضيات تفسيرية متنوعة، فإن قراءاته ومفرداته المحددة تتشكل بشكل منهجي بواسطة هيكلة المطالبات، مما يؤدي غالباً إلى تحويل التركيز من التوبيخ إلى النسب مقارنة بإعادة البناء التي يقوم بها الخبراء البشر.

Arno Simons2026-02-27