💬 NLP

MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding

تقترح الورقة البحثية MUSEG، وهي طريقة تعتمد على التعلم المعزز تعمل على تعزيز الاستدلال الزمني دقيق التفاصيل للنماذج اللغوية الكبيرة متعددة الوسائط من خلال إدخال التأسيس متعدد القطع الواعي بالطوابع الزمنية واستراتيجية تدريب مكافأة مرحلية، مما يتفوق بشكل كبير على النهج الحالية في مهام التأسيس الزمني والأسئلة والأجوبة المرئية الحساسة للوقت.

Fuwen Luo, Shengfeng Lou, Chi Chen, Ziyue Wang, Chenliang Li, Weizhou Shen, Jiyue Guo, Peng Li, Ming Yan, Ji Zhang, Fei (…)2026-04-21
💬 NLP

CHIMERA: A Knowledge Base of Scientific Idea Recombinations for Research Analysis and Ideation

تقدم هذه الورقة CHIMERA، وهي أول قاعدة معرفية واسعة النطاق لإعادة دمج الأفكار العلمية المستخرجة آلياً من الأدبيات، والتي تتيح التحليل التجريبي لأنماط الابتكار عبر التخصصات وتدعم تدريب النماذج التي تولد فرضيات بحثية ملهمة.

Noy Sternlicht, Tom Hope2026-04-21
💬 NLP

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration

تقدم هذه الورقة البحثية **\ExtAgents**، وهو إطار عمل متعدد الوكلاء يتغلب على قيود نافذة السياق في النماذج اللغوية الكبيرة (LLMs) من خلال توزيع مدخلات المعرفة الخارجية الضخمة عبر وكلاء متوازيين، مما يعزز الأداء بشكل كبير في المهام المعقدة مثل الإجابة على الأسئلة متعددة الخطوات وتوليد الاستطلاعات الطويلة دون الحاجة إلى تدريب على سياق أطول.

Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu2026-04-21
💬 NLP

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

تكشف هذه الورقة أنه بينما تقترب النماذج اللغوية متعددة الوسائط من الأداء البشري في المفردات الأساسية، فإنها تعاني بشكل أكبر بكثير من البشر مع الكلمات المنظورية مثل ضمائر الملكية وأسماء الإشارة بسبب أوجه القصور في اتخاذ المنظور والاستدلال المكاني.

Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez2026-04-21
🤖 machine learning

LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning

تقترح الورقة البحثية طريقة LIFT، وهي طريقة ضبط دقيق موفرة للذاكرة تحدد وتحدث فقط أعلى 5% من "الأوزان الرئيسية" (تلك ذات المقدار الأكبر بعد التقريب منخفض الرتبة) لتحقيق أداء استدلال متفوق واحتفاظ أفضل بالمعرفة مقارنة بالضبط الدقيق الكامل وLoRA.

Zihang Liu, Tianyu Pang, Oleg Balabanov, Chaoqun Yang, Tianjin Huang, Lu Yin, Yaoqing Yang, Shiwei Liu2026-04-21
⚡ electrical engineering

Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection

تقدم هذه الورقة PodSarc، وهو مجموعة بيانات كلامية ساخرة واسعة النطاق تم إنشاؤها من خلال مسار تعليق توضيحي مدعوم بنماذج اللغات الكبيرة مع تحقق بشري، مما يعالج ندرة البيانات ويُمكّن من الكشف الفعال عن السخرية عبر الكلام فقط محققاً درجة F1 تبلغ 73.63%.

Zhu Li, Yuqing Zhang, Xiyuan Gao, Shekhar Nayak, Matt Coler2026-04-21
💬 NLP

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

تقدم هذه الورقة "Common Corpus"، وهي أكبر مجموعة بيانات مفتوحة لتدريب النماذج اللغوية الكبيرة المكونة من حوالي تريليوني توكن من المحتوى غير الخاضع لحقوق الطبع والنشر أو المرخص مفتوحاً عبر لغات ومجالات متنوعة، والتي تم التحقق من صحتها من خلال تدريب نماذج لغوية صغيرة تؤدي بشكل مماثل للنماذج الحالية ذات الحجم المماثل.

Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza, Mattia Nee, Eliot Krzystof Jones, Irène (…)2026-04-21
💬 NLP

Task Matters: Knowledge Requirements Shape LLM Responses to Context-Memory Conflict

تقدم هذه الورقة إطاراً تشخيصياً يكشف أن تأثير صراعات الذاكرة والسياق على أداء النماذج اللغوية الكبيرة يعتمد جوهرياً على المهمة، حيث يمكن لاستراتيجيات مثل التبريرات أن تحسن المهام المعتمدة على السياق فقط بينما تضر تلك التي تتطلب معرفة بارامترية، مما يتحدى في النهاية موثوقية طرق تقييم النماذج اللغوية الكبيرة الحالية.

Kaiser Sun, Fan Bai, Mark Dredze2026-04-21
💬 NLP

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

تقدم الورقة البحثية GeometryZero، وهي عائلة من نماذج الاستدلال الهندسي منخفضة التكلفة التي تستفيد من إطار عمل جديد لـ "تحسين سياسة التباين الجماعي" (GCPO) لتدريب النماذج الأصغر بفعالية على البناء المساعد والاستدلال الهندسي، متفوقة بذلك على النماذج المرجعية الحالية للتعلم التعزيزي في المعايير القياسية.

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang2026-04-21
💬 NLP

An Exploration of Mamba for Speech Self-Supervised Models

تستكشف هذه الورقة نماذج HuBERT القائمة على بنية Mamba كبدائل فعالة لهياكل المحولات (Transformer) في التعلم الذاتي الخاضع للإشراف للكلام، حيث تُظهر أداءً فائقاً في مهام التعرف التلقائي على الكلام ذات السياق الطويل والمهام المتدفقة، ونتائج تنافسية في اختبارات الاستقصاء، وقدرة معززة على التقاط سمات المتحدث والتمثيلات المكممة.

Tzu-Quan Lin, Heng-Cheng Kuo, Tzu-Chieh Wei, Hsi-Chun Cheng, Chun Wei Chen, Hsien-Fu Hsiao, Yu Tsao, Hung-yi Lee2026-04-21