⚡ electrical engineering

The Eloquence team submission for task 1 of MLC-SLM challenge

يقدم فريق Eloquence عملهم للمهمة الأولى من تحدي MLC-SLM، حيث يستكشف ثلاثة نهج للتعرف الآلي على الكلام (ASR) متعدد اللغات تتضمن تقييم البنيات الأساسية باستخدام أجهزة عرض (projectors) مختلفة، وتدريب جهاز عرض خطي مخصص عبر إطار عمل SLAM-ASR، والتحقيق في فوائد التعلم التبايني وسياق المحادثة الممتد.

Lorenzo Concina, Jordi Luque, Alessio Brutti, Marco Matassoni, Yuchen Zhang2026-08-05
⚡ electrical engineering

Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages

تبحث هذه الورقة في استخدام نماذج اللغات الكبيرة الصوتية (Speech LLMs) للتعرف التلقائي على الكلام في ظل ندرة الموارد عبر إطار عمل SLAM-ASR، حيث تُثبت أن الاستفادة من أجهزة الإسقاط (projectors) المدربة مسبقاً على لغات غنية بالموارد تخفف بشكل كبير من تحديات ندرة البيانات وتحسن الأداء مقارنة بالتدريب من الصفر.

Seraphina Fong, Marco Matassoni, Alessio Brutti2026-08-05
💬 NLP

HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

تقدم هذه الورقة البحثية HomeSafeBench، وهو أول معيار للوكلاء المجسدين لأداء فحص سلامة المنازل عبر الاستكشاف الحر من خلال وجهات نظر من منظور الشخص الأول، وتقترح CueBack، وهي طريقة لبناء البيانات تعمل على تحسين أداء النماذج اللغوية البصرية بشكل كبير من خلال الاستفادة من البنية الزمنية للكشف عن المخاطر لسد الفجوة بين الذكاء الاصطناه والمفتشين البشر.

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang2026-08-05
💬 NLP

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

تقدم الورقة البحثية MIDI-LLM، وهو إطار تدريب ثنائي المراحل يعمل على تكييف النماذج اللغوية الكبيرة لتوليد موسيقى MIDI متعددة المسارات ونوتات موسيقية (lead sheets) عالية الجودة وخاضعة للتحكم النصي، مما يظهر أداءً فائقاً وقبولاً لدى المستخدمين مقارنة بالنماذج المرجعية الحالية من خلال دراسات استئصال واسعة النطاق وتقييم أعمى واقعي كبير.

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang2026-08-05
💬 NLP

Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models

تقدم هذه الورقة دراسة ميكانيكية لتناقضات المعرفة داخل الذاكرة في النماذج اللغوية، كاشفةً أنه في حين يتم حل مثل هذه التناقضات عادةً في الطبقات النهائية عبر دوائر متميزة بدلاً من آلية عالمية، فإن التدخلات تكون أقل فعالية بشكل ملحوظ في التناقضات الواقعية مقارنة بالتناقضات الاصطناعية بسبب الاختلافات في توزيع رؤوس الانتباه المتخصصة.

Minh Vu Pham, Hsuvas Borkakoty, Yufang Hou2026-08-05
💬 NLP

Beyond Simulations: What 20,000 Real Conversations Reveal About Mental Health AI Safety

تجادل هذه الورقة بأن التدقيق الإيكولوجي للمحادثات في العالم الحقيقي أمر ضروري لتقييم سلامة الذكاء الاصطناعي في مجال الصحة النفسية، مبرهنةً على أن نظاماً مُصمماً لهذا الغرض يتفوق بشكل كبير على النماذج العامة الرائدة في منع المحتوى الضار وتقديم موارد الأزمات بشكل موثوق في سيناريوهات النشر الفعلية.

Caitlin A. Stamatis, Jonah Meyerhoff, Richard Zhang, Olivier Tieleman, Matteo Malgaroli, Thomas D. Hull2026-08-05
💬 NLP

Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service

تقترح الورقة البحثية GeoMark، وهو إطار عمل للعلامات المائية المحلية المدركة للهندسة لخدمة التضمين كخدمة (Embedding-as-a-Service)، والذي يحل مقايضة المتانة والمنفعة والقابلية للتحقق من خلال فصل التفعيل المحلي عن الإسناد المركزي لضمان حماية حقوق الطبع والنشر ضد الهجمات المختلفة مع الحفاظ على المنفعة اللاحقة.

Zhimin Chen, Xiaojie Liang, Wenbo Xu, Yuxuan Liu, Wei Lu2026-08-05
💬 NLP

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

تقدم هذه الورقة PersonaTrail، وهو معيار لتقييم قدرة وكلاء الويب المخصصين على استنتاج تفضيلات المستخدم من سجلات التصفح الخام، إلى جانب PACMem، وهو إطار عمل ينظم هذا السجل في ذكريات واقعية وتفضيلية لتحسين أداء التنقل بشكل كبير.

Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park2026-08-05
💬 NLP

TabletCraft: Bridging a 4,000-Year Cultural Gap with Bidirectional Akkadian NMT and Cuneiform Rendering

تُعد TabletCraft أول نظام مفتوح المصدر وثنائي الاتجاه يجسر الفجوة الثقافية التي بلغت 4,000 عام مع بلاد ما بين النهرين القديمة، وذلك من خلال تمكين المستخدمين من الترجمة بين الأكادية والإنجليزية وتجسيد الرسائل الجديدة في شكل ألواح طينية مسمارية، محققةً درجات تنافسية في مقياس BLEU في كلا اتجاهي الترجمة.

Zhaohui Wang2026-08-05
💬 NLP

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

تقدم MemArena معياراً ومحاكياً واسع النطاق، متمحوراً حول منظور المستخدم (ego-centric)، لتقييم المساعدات الشخصية للذاكرة على الأجهزة، مما يكشف أن اختيار خلفية الذاكرة يؤثر بشكل كبير على دقة المحتوى وموثوقيته مع تحمل حد أدنى من زمن بحث الاسترجاع على أجهزة الحافة.

Jiadong Zhang, Xiaosong Ma2026-08-05