💬 NLP

Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

توضح هذه الورقة أنه بينما تقوم نماذج التعلم الخاضع للإشراف الذاتي بترميز النغمة المعجمية في لغتي الماندرين واليوربا بطبيعتها، فإن عملية التكميم اللاحقة إلى وحدات كلامية منفصلة تعطي الأولوية للبنية الصوتية القطعية على الميزات فوق القطعية، مما يشير إلى الحاجة إلى نهج تجميع ثنائي المراحل على التمثيلات المتبقية لالتقاط النغمة والعروض بشكل أفضل.

Opeyemi Osakuade, Simon King2026-04-10
💬 NLP

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training

يُعد ConsistRM إطار عمل للتدريب الذاتي يعمل على تحسين نماذج المكافأة التوليدية من خلال تقديم مكافآت الإجابة والنقد المتوافقة لإنشاء تسميات مستعارة مستقرة والحد من اختراق المكافأة، مما يجعله يتفوق على الضبط الدقيق بالتعزيز التقليدي دون الاعتماد على التوضيحات البشرية المكلفة.

Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi2026-04-10
💬 NLP

Enabling Intrinsic Reasoning over Dense Geospatial Embeddings with DFR-Gemma

تقترح هذه الورقة إطار عمل DFR-Gemma، وهو إطار عمل مبتكر يُمكّن النماذج اللغوية الكبيرة من إجراء استدلال ذاتي وفعال ودقيق بنمط "الصفر محاولة" (zero-shot) مباشرة فوق التضمينات الجيومكانية الكثيفة عبر محاذاتها مع الفضاء الكامن للنموذج، مما يقضي على أوجه القصور وعدم الدقة في التمثيلات النصية الوسيطة.

Xuechen Zhang, Aviv Slobodkin, Joydeep Paul, Mandar Sharma, Samet Oymak, Shravya Shetty, Gautam Prasad2026-04-10
💬 NLP

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

تقترح الورقة البحثية إطار عمل "التفكيك، والنظر، والاستنتاج" (DLR)، وهو إطار استدلال كامن معزز يعمل على تفكيك الاستعلامات ديناميكيًا إلى مقدمات نصية واستخراج كامنات بصرية مستمرة مشروطة بالمقدمات لتحقيق أداء فائق في مهام الاستدلال البصري المعقدة مقارنة بالطرق الحالية.

Mengdan Zhu, Senhao Cheng, Liang Zhao2026-04-10
💬 NLP

TR-EduVSum: A Turkish-Focused Dataset and Consensus Framework for Educational Video Summarization

تقدم هذه الورقة TR-EduVSum، وهي مجموعة بيانات جديدة للفيديوهات التعليمية التركية تحتوي على 3281 ملخصاً بشرياً، وتقترح إطار عمل AutoMUP لتوليد ملخصات عالية الجودة قائمة على الإجماع ومعيارية ذهبية تلقائياً من خلال تجميع وتوزين الوحدات المعنوية، محققةً أداءً دلالياً يضاهي النماذج اللغوية الكبيرة المتقدمة.

Figen Eğin, Aytuğ Onan2026-04-10
💬 NLP

Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs

تقترح هذه الورقة إطار عمل قائماً على الاستنتاج يستفيد من النماذج اللغوية الكبيرة كأحكام دلالية للتحقق من مخرجات خوارزميات التجميع غير الخاضعة للإشراف التعسفية وتحسينها من خلال التحقق من التماسك، والفصل في التكرار، وتأصيل التسميات، مما يؤدي إلى تحسين جودة التجميع وقابليته للتفسير بشكل كبير دون الحاجة إلى بيانات مصنفة.

Tunazzina Islam2026-04-10
💬 NLP

Learning is Forgetting: LLM Training As Lossy Compression

تقترح هذه الورقة أن النماذج اللغوية الكبيرة تعمل كحالات من الضغط غير الكامل الذي يقترب من حد "عنق الزجاجة المعلوماتي" أثناء مرحلة ما قبل التدريب، مما يثبت أن مثالية الضغط والمحتوى المعلوماتي للنموذج يمكنهما التنبؤ بأدائه اللاحق عبر مختلف الاختبارات المعيارية.

Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina (…)2026-04-10
💬 NLP

CAMO: A Class-Aware Minority-Optimized Ensemble for Robust Language Model Evaluation on Imbalanced Data

تقدم الورقة البحثية CAMO، وهو إطار عمل تجميعي جديد يعتمد على تحسين الفئات الأقلية الواعية بالفئات، والذي يعزز أداء الفئة الأقلية ديناميكيًا من خلال توزيع التصويت الهرمي، ومعايرة الثقة، وعدم اليقين بين النماذج، مما يظهر تفوقًا في درجات F1 الكلية (macro F1-scores) على الطرق الحالية في معايير النماذج اللغوية غير المتوازنة.

Mohamed Ehab (Faculty of Computer Science, October University for Modern Science & Arts, Giza, Egypt), Ali Hamdi (Facult (…)2026-04-10
📊 statistics

From Ground Truth to Measurement: A Statistical Framework for Human Labeling

تقترح هذه الورقة إطاراً إحصائياً يعيد صياغة التوسيم البشري بوصفه عملية قياس لتفكيك مخرجات التوسيم إلى مصادر تفسيرية للتباين — مثل صعوبة الحالة، وتحيز الموّسم، والضجيج الموقفي، والتوافق العلاقاتي — مما يتجاوز المعالجة التبسيطية للاختلاف باعتباره مجرد ضجيج لتمكين علم أكثر منهجية لتوسيم البيانات.

Robert Chew, Stephanie Eckman, Christoph Kern, Frauke Kreuter2026-04-10
💬 NLP

Reasoning Graphs: Deterministic Agent Accuracy through Evidence-Centric Chain-of-Thought Feedback

تقدم هذه الورقة "رسوم الاستدلال البيانية"، وهي بنية مبتكرة تحافظ على تسلسل الأفكار القائم على الأدلة عبر الاستعلامات لتمكين دقة الوكيل ذاتية التحسين والحتمية دون إعادة تدريب، مما يقلل بشكل كبير من التباين في الإجابة على الأسئلة متعددة الخطوات.

Matthew Penaroza2026-04-10