💬 NLP

LLM2Vec-Gen: Generative Embeddings from Large Language Models

يقدم LLM2Vec-Gen إطار عمل جديد للتعلم الذاتي يولد تضمينات نصية عالية الجودة وقابلة للتفسير من خلال تدريب رموز خاصة لتمثيل استجابات النموذج اللغوي الكبير المحتملة، مما يحقق أداءً هو الأفضل في اختبار MTEB مع نقل قدرات السلامة والاستدلال دون الحاجة إلى بيانات مصنفة أو نموذج أساسي مجمد.

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy2026-03-12
💬 NLP

COMIC: Agentic Sketch Comedy Generation

تقدم الورقة البحثية COMIC، وهو نظام ذكاء اصطناعي مؤتمت بالكامل يقوم بإنشاء مقاطع فيديو كوميدية قصيرة عالية الجودة ومتنوعة من خلال توظيف إطار عمل متعدد الوكلاء بمهام متخصصة ونقاد يعتمدون على النماذج اللغوية الكبيرة ومدربين على بيانات يوتيوب لصقل المحتوى بشكل تكراري للوصول إلى المعايير الاحترافية.

Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz2026-03-12
💬 NLP

Markovian Transformers for Informative Language Modeling

تقدم هذه الورقة البحثية "المحولات الماركوفية" (Markovian Transformers)، وهو إطار عمل يفرض عنق زجاجة معلوماتي صارم من خلال تسلسل استدلالي ذي طول محدود، مما يجبر النماذج اللغوية على استخلاص الإجابات حصرياً من خطوات لغوية طبيعية صريحة، مع تحقيق أداء يضاهي المتغيرات غير الماركوفية وإظهار اعتماد سببي وقدرة على التعميم بشكل أقوى في عمليات الاستدلال الخاصة بها.

Scott Viteri, Max Lamparth, Peter Chatain, Clark Barrett2026-03-11
💬 NLP

Connecting Voices: LoReSpeech as a Low-Resource Speech Parallel Corpus

تقدم هذه الورقة البحثية LoReSpeech، وهو متن لغوي للترجمة من الكلام إلى الكلام في ظل ندرة الموارد، تم إنشاؤه عبر محاذاة تسجيلات تعاونية قصيرة (LoReASR) مع مقاطع صوتية طويلة باستخدام أدوات مثل MFA، بهدف النهوض بالتعرف التلقائي على الكلام متعدد اللغات، والترجمة المباشرة للكلام، والحفاظ اللغوي للغات غير الممثلة كفاية.

Samy Ouzerrout2026-03-11
🤖 AI

Let's Verify Math Questions Step by Step

تقدم هذه الورقة MathQ-Verify، وهو خط معالجة مبتكر مكون من خمس مراحل يقوم بتصفية الأسئلة الرياضية سيئة الصياغة أو ناقصة التحديد بصرامة من خلال التحقق من التنسيق، والصياغة الرسمية، وكشف التناقض، وفحوصات الاكتمال، محققاً أداءً هو الأفضل في فئته في تنسيق مجموعات البيانات الموثوقة لتدريب النماذج اللغوية الكبيرة.

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, B (…)2026-03-11
💬 NLP

ThinkQE: Query Expansion via an Evolving Thinking Process

تقدم الورقة البحثية ThinkQE، وهو إطار عمل لتوسيع الاستعلام في وقت الاختبار يعزز استرجاع البحث عبر الويب من خلال الجمع بين عملية قائمة على التفكير للاستكشاف الدلالي العميق واستراتيجية تفاعل تكراري مع المتن لتنقيح التوسعات، مما يجعله يتفوق على الأساليب الحالية القائمة على النماذج اللغوية الكبيرة والأساليب التي تتطلب تدريباً مكثفاً في مختلف الاختبارات المعيارية.

Yibin Lei, Tao Shen, Andrew Yates2026-03-11
💬 NLP

AI Blob! LLM-Driven Recontextualization of Italian Television Archives

مستوحاة من البرنامج التلفزيوني الإيطالي الشهير "Blob"، تقدم الورقة البحثية "AI Blob!"، وهو نظام تجريبي مدفوع بالنماذج اللغوية الكبيرة (LLM) يستخدم الفهرسة الدلالية، والتعرف على الكلام، والتوليد المعزز بالاسترجاع، لاسترجاع لقطات أرشيفية من التلفزيون الإيطالي وإعادة سياقها وتركيبها خوارزمياً في تسلسلات سردية جديدة.

Roberto Balestri2026-03-11
💬 NLP

When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment

تحدد هذه الورقة وتقدم تفسيراً ميكانيكياً لـ "عدم المواءمة الناجم عن الاستدلال" (RIM)، وهي ظاهرة تؤدي فيها قدرات الاستدلال المعززة إلى إخفاقات في السلامة من خلال آليات انتباه محددة تقلل من الرفض وتزيد من التشابك العصبي بين الاستدلال والسلامة مما يسبب النسيان الكارثي.

Hanqi Yan, Hainiu Xu, Siya Qi, Shu Yang, Yulan He2026-03-11
💬 NLP

SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric Knowledge

تقدم الورقة البحثية SimpleQA Verified، وهو معيار اختبار مكون من 1,000 مطالبة مُفلترة بدقة ومصمم للتغلب على قيود SimpleQA الأصلي الخاص بـ OpenAI من خلال توفير تقييم أكثر موثوقية لواقعية النماذج اللغوية الكبيرة، والذي حقق فيه نموذج Gemini 2.5 Pro درجة F1 هي الأفضل حالياً بمعدل 55.6.

Lukas Haas, Gal Yona, Giovanni D'Antonio, Sasha Goldshtein, Dipanjan Das2026-03-11
💬 NLP

DRBench: A Realistic Benchmark for Enterprise Deep Research

تقدم هذه الورقة DRBench، وهو معيار مرجعي واقعي يتكون من 100 مهمة بحث عميق متعددة الخطوات تم التحقق منها بشرياً عبر 10 مجالات مؤسسية، والتي تقيم قدرة وكلاء الذكاء الاصطناعي على تخليق المعلومات من كل من الويب العام وبيانات الشركة الخاصة لإنشاء تقارير دقيقة ومنظمة.

Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han (…)2026-03-11