💻 computer science

FrontierChallenge: Evaluating Scientific Workflow Completion

يُقيّم اختبار FrontierChallenge أوجه القصور في النماذج الأمامية للذكاء الاصطناعي الحالية في تنفيذ سير العمل العلمي من البداية إلى النهاية عبر ستة مجالات، كاشفاً أن حتى الوكلاء عاليي الأداء يحققون معدلات منخفضة في الإكمال الكامل وغالباً ما يدعون نجاح المهمة رغم عدم اكتمال المخرجات.

Liangcai Su, Zhaopeng Feng, Zhuo Chen, Zhen Zhang, Xiang Lin, Ruilin Li, Handuo Zhang, Ning Wang, Kailong Wen, Yueqi Guo (…)2026-08-27
💻 computer science

Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs

تقدم هذه الورقة نظاماً لربط المنتجات يتسم بالقابلية للتوسع وكفاءة التكلفة، حيث يستخدم بنية متتالية (cascade architecture) يقوم فيها مشفر تقاطعي مُقطّر (distilled cross-encoder) بحل المطابقات عالية الثقة، بينما يتولى نموذج رؤية-لغة وكيلِيّ (agentic vision-language model) معالجة الحالات الغامضة، مما يؤدي إلى تعظيم التغطية مع تقليل التكاليف الحسابية ومتطلبات التوسيم البشري إلى أدنى حد.

Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald2026-08-27
💬 NLP

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

تُظهر هذه الورقة أن المقاييس المعيارية المستخدمة على نطاق واسع لتقييم النماذج اللغوية عبر اللغات تُدخل تحيزات ناتجة عن الاختلافات في التقطيع (tokenization) والخصائص الكتابية، وتقترح أن حساب لوغاريتم الاحتمال السالب على مستوى الجملة عبر المتواليات المتكافئة دلالياً يقدم بديلاً أكثر اتساقاً وإنصافاً لمقارنة النماذج عبر اللغات.

Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett2026-08-27
💬 NLP

SelfGraphRAG: Bridging the Supervision Gap in Graph-Based RAG with Synthetic QA Generation

يعالج SelfGraphRAG ندرة البيانات المصنفة للاسترجاع القائم على الرسوم البيانية من خلال توليد أزواج أسئلة وأجوبة اصطناعية مباشرة من هياكل الرسوم البيانية للمعرفة لتدريب مسترجع مشروط بالاستعلام، مما يؤدي إلى تحسين الاستدلال متعدد الخطوات ودقة الاسترجاع دون الحاجة إلى تصنيف يدوي.

Ben Lagnese, Manas Gaur2026-08-27
💬 NLP

Belief Cascades Drive Persuasion in LLM Agent Networks

تقدم هذه الورقة بيئة اختبار منضبطة تُثبت أن الإقناع في شبكات النماذج اللغوية الكبيرة متعددة الوكلاء مدفوع بتفاعل معقد بين طوبولوجيا الشبكة، والمنافسة، والمنطلقات المسبقة للنماذج، مما يكشف أن التأثير يمتد إلى ما وراء التعرض المباشر عبر وسطاء الأقران وغالباً ما يكون محجوباً في النصوص المرئية، مما يستلي حتماً على التقييم عبر مجسات الاعتقاد وسجلات الأفعال لتتبع تحولات المواقف بدقة.

Haoyi Qiu, Genglin Liu, Pranav Narayanan Venkit, Kung-Hsiang Huang, Saadia Gabriel, Chien-Sheng Wu, Nanyun Peng2026-08-27
💬 NLP

The Changing Geometry of Grammar: Dimensionality and Neighborhood Reorganization across Transformer Layers

تتقصى هذه الورقة البحثية كيف تشكل الأدوار النحوية للرموز الهندسة المحلية لتمثيلات المحولات (transformer)، كاشفةً أن الأبعاد الجوهرية تتطور بشكل مختلف بين العناصر مغلقة ومفتوحة الفئة عبر الطبقات نتيجة لإعادة تنظيم الجوار، مع ملاحظة أنماط متباينة بين بنيات المشفر (encoder) وفك التشفير (decoder).

Samuele Vallisa, Federico Ravenda, Claudio Palominos, Rui He, Andrea Raballo, Antonietta Mira, Philipp Homan, Wolfram Hi (…)2026-08-27
💬 NLP

BanglaMamba: Exploring State Space Models for Bangla Fake News Detection

تقدم هذه الورقة BanglaMamba، وهو نموذج فضاء حالة قائم على Mamba للكشف عن الأخبار الزائفة باللغة البنغالية، والذي يقدم بديلاً فعالاً حوسبياً للنماذج القائمة على المحولات مثل BanglaBERT، محققاً أداءً مماثلاً مع تقليل زمن الاستجابة واستهلاك ذاكرة وحدة معالجة الرسومات بشكل كبير.

M. K. Khalidi Siam2026-08-27
🤖 machine learning

Learning Mixtures of Plackett-Luce Models for Multi-Objective Alignment

تقدم هذه الورقة MoPLEx، وهو خوارزمية تعظيم التوقع (expectation-maximization) فعالة تجمع بين تعزيز التصنيف عبر النماذج اللغوية الكبيرة والتقدير القائم على التدرج لتعلم نماذج "بلاكيت-لوس" المختلطة من التصنيفات متعددة الأوجه، مما يتغلب على حدود قابلية التحديد النظرية ويحسن بشكل كبير دقة التجميع والتصنيف في مهام محاذاة التفضيلات غير المتجانسة.

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang2026-08-27
🤖 machine learning

LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale

تقدم الورقة البحثية LibriBrain100، وهي مجموعة بيانات واسعة النطاق لتخطيط مغناطيسية الدماغ (MEG) تضم أكثر من 100 ساعة من التسجيلات العصبية من الكلام الطبيعي، والتي تجمع بين البيانات العميقة داخل الشخص الواحد وبين أخذ عينات واسعة النطاق لعدة أشخاص، وذلك بهدف إنشاء معيار مرجعي موحد ومنافسة مفتوحة للنهوض بفك تشفير الدماغ إلى نص بطرق غير جراحية.

Francesco Mantegna, Dulhan Jayalath, Gereon Elvers, Tasha Kim, Benjamin Ballyk, Alex Fung, SungJun Cho, Teyun Kwon, Luis (…)2026-08-27