💬 NLP

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings

تقدم هذه الورقة إطار عمل متعدد الوكلاء ومسار استدلال موجه يستفيدان من التضمينات الصوتية-الدلالية والتقييم التكراري لترجمة التورية اللغوية من الإنجليزية إلى الفرنسية بنجاح، محققةً مراكز متقدمة في مسابقة CLEF JOKER 2025 عبر إعطاء الأولوية للحفاظ على الفكاهة والإبداع اللغوي على المقاييس الدلالية التقليدية.

Russell Taylor, Benjamin Herbert, Michael Sana2026-08-06
🤖 machine learning

Right Reset: Chunking by Prefix Removal

تقدم الورقة البحثية تقنية "Right Reset"، وهي تقنية سبر تعتمد على إزالة البادئة تستفيد من النماذج اللغوية السببية للكشف عن حدود النصوص عبر قياس الحفاظ على مسارات الحالة الخفية، متفوقة بذلك على النماذج المرجعية التقليدية القائمة على التضمين في استعادة السجلات الأصلية من النصوص المسطحة دون الحاجة إلى تدريب خاص بالمهمة.

Mike Vegeto2026-08-06
💬 NLP

The Calibration Floor: Format Repair Can Masquerade as Self-Correction at Small-to-Mid Scale

تُظهر هذه الورقة أن مكاسب الدقة الملحوظة من المراجعة الذاتية للنماذج اللغوية مدفوعة في كثير من الأحيان باستعادة التنسيق عند حد استخراج الإجابة بدلاً من تحسينات حقيقية في الاستنتاج، وهي ظاهرة تشتد مع حجم النموذج وتجعل معظم ادعاءات التصحيح الذاتي ضئيلة عندما يتم عزلها سببيًا عن عيوب التحليل.

Mingguang Chen, Bo Qu, Licheng Wang2026-08-06
💬 NLP

NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap

تقدم الورقة البحثية NOLLI، وهو معيار مرجعي مُولَّد إجرائياً ومعاير الصعوبة يتكون من 7,500 مهمة ألغاز باللغتين الإنجليزية والكورية، يكشف أن نماذج اللغة الكورية تؤدي بشكل مماثل للإنجليزية في الترجمات المباشرة ولكنها تواجه فجوات كبيرة في المهام المكثفة المتعلقة بنظام الكتابة بسبب التحديات في التنفيذ متعدد الخطوات على مستوى ما دون المقطع اللفظي، بينما يوضح أيضاً أن حجم المهمة الهيكلي هو مؤشر غير موثوق للصعوبة التجريبية.

Dasol Choi, Joonyong Park, Daegon Yu, Soo Yong Kim, Youngsook Song, Seunghyeok Hong2026-08-06
🤖 machine learning

Training-Free Hashing-Based Attention via Binary Principal Components

تقدم هذه الورقة BinaryPC، وهي آلية انتباه متفرقة تعتمد على البيانات ولا تتطلب تدريباً، تستفيد من المكونات الرئيسية الثنائية لإنشاء أكواد هاش فعالة، مما يحسن بشكل كبير من إنتاجية فك التشفير في النماذج اللغوية الكبيرة ذات السياق الطويل مع الحفاظ على الدقة دون الحاجة إلى تدريب قائم على التدرج.

Daohai Yu, Zhanpeng Zeng, Keyu Chen, Wenhao Li, Zhifeng Shen, Luxi Lin, Ruizhi Qiao, Xing Sun, Rongrong Ji2026-08-06
🤖 machine learning

MESH: Memory-Efficient Sinkhorn Optimization for Mixture-of-Experts Training

تقدم هذه الورقة البحثية MESH، وهي طريقة تحسين Sinkhorn موفرة للذاكرة تتضمن تحديثات الزخم الخفي والتحضير المسبق الاختياري للكتل لتمكين التدريب منخفض الذاكرة لنماذج خليط الخبراء (Mixture-of-Experts) بنجاح عبر معالجة عدم الاستقرار الزمني لتدرجات الخبراء الموجهة التي تتسبب في فشل طرق Sinkhorn عديمة الحالة القياسية.

Masato Fujitake2026-08-06
💬 NLP

Social Pressure Breaks Majority Voting in LLM Safety Panels

تكشف هذه الدراسة أن لوحات سلامة النماذج اللغوية الكبيرة، التي تعمل عادةً على تحسين الدقة من خلال التصويت بالأغلبية، تصبح عرضة بشكل حرج للضغط الاجتماعي عند تعرضها لإجماع أقران مضلل، مما يؤدي بها إلى تصنيف المحتوى الآمن بالإجماع على أنه غير آمن، بينما تظل غير متأثرة إلى حد كبير بالدفع نحو السلامة.

Yibo Hu, Jiaming Qu2026-08-06
🤖 AI

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

تقدم الورقة البحثية MERaLiON-GR، وهو نموذج للتعرف على جنس الكلام يستفيد من الضبط الدقيق باستخدام تقنية LoRA لـ MERaLiON-SpeechEncoder-2 ومصنف ECAPA-TDNN متعدد المقاييس لتحقيق أداء رائد في تحديد المتحدثين الذكور والإناث عبر اللغة الإنجليزية وعدة لغات من جنوب شرق آسيا.

Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi (…)2026-08-06
🤖 AI

D2^2F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation

تقترح الورقة البحثية إطار عمل D2^2F-ReAG، وهو إطار عمل جديد للتوليد المعزز بالاسترجاع يعمل على تحسين دقة وكفاءة الاستدلال متعدد الخطوات من خلال اتخاذ قرار تكيفي بشأن ما إذا كان سيجيب مباشرة أو يقوم بتفكيك وتصفية الأسئلة الفرعية ديناميكيًا بناءً على موثوقية الاستدلال الأولي.

Jiaoyang Li, Junhao Ruan, Shengwei Tang, Kaiyan Chang, Zhengtao Yu, Tong Xiao, Jingbo Zhu2026-08-06
🤖 machine learning

DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models

تقدم هذه الورقة البحثية DeepInvert، وهو هجوم استرداد تمثيل شبه مُشرف يستغل البنية الدلالية المحفوظة في تمثيلات النماذج اللغوية المموّهة لاستعادة الرموز الأصلية بدقة أعلى بكثير من الطرق السابقة، مما يكشف أن دفاعات التمويه الحالية غالباً ما تفشل في تحقيق التوازن بين حماية الخصوصية وفائدة المهام.

Zhicong Huang, Cheng Hong, Tao Wei2026-08-06