💻 computer science

Draft-OPD: On-Policy Distillation for Speculative Draft Models

تقدم هذه الورقة البحثية Draft-OPD، وهو إطار عمل للتقطير القائم على السياسة (on-policy distillation) يتغلب على قيود الضبط الدقيق الخاضع للإشراف (supervised fine-tuning) لعملية فك التشفير التخميني (speculative decoding) عبر استخدام عمليات التدحرج بمساعدة الهدف (target-assisted rollouts) وإعادة تشغيل المسودة من مواضع الخطأ لتحقيق تسريع غير فاقد للمعلومات (lossless acceleration) يتجاوز 5 أضعاف لنماذج التفكير (thinking models).

Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu (…)2026-05-29
💻 computer science

Attention Asymmetry in AI Layoff Discourse on X: A Computational Analysis of Capital vs Labour Amplification

يكشف هذا التحليل الحسابي لخطاب منصة إكس (تويتر سابقاً) عن عدم تماثل كبير وقوي في التضخيم، حيث تحظى السرديات الصادرة عن التنفيذيين في قطاع التكنولوجيا وباحثي الذكاء الاصطناعي بشأن تسريحات العمال الناجمة عن الذكاء الاصطناعي بانتشار أكبر بكثير من تلك الصادرة عن العمال المسرحين، وهو تفاوت يستمر حتى بعد المعايرة بناءً على أعداد المتابعين ويبدو خاصاً ببنية منصة إكس.

Joy Bose2026-05-29
🤖 machine learning

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base

تقدم الورقة البحثية BrahmicTokenizer-131K، وهو بديل جاهز للاستخدام لـ o200k_base الخاص بـ OpenAI، والذي يحقق ضغطاً فائقاً للغات الهندية من خلال عملية تعديل جراحية للمفردات مع الحفاظ على أداء تنافسي في مهام اللغة الإنجليزية والبرمجة والرياضيات.

Rohan Shravan2026-05-29
🤖 AI

Latent Terms: Dense Retrievers Contain Trivially Extractable BM25-ready Zipfian Vocabularies

تقدم هذه الورقة "المصطلحات الكامنة" (Latent Terms)، وهي طريقة تثبت أن نماذج الاسترجاع الكثيف تتعلم بطبيعتها تمثيلات يمكن تفكيكها ببساطة عبر المشفّرات التلقائية المتفرقة إلى مفردات موزعة وفق قانون زيبف (Zipfian-distributed) مناسبة لتقييم BM25، مما يتيح استرجاعاً متفرقاً عالي الأداء دون الحاجة إلى إشراف إضافي أو أهداف توسيع.

Benjamin Clavié, Sean Lee, Aamir Shakir, Makoto P. Kato2026-05-29
🤖 AI

Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark

تقدم هذه الورقة معيار PiSAR لتوضيح أنه في حين أن الضبط الدقيق الخاضع للإشراف على مجموعة بيانات إجراءات مشروطة بالشاشة مكونة من 12,929-توبل يعزز الأداء بشكل كبير للنماذج الأصغر مثل Qwen3-VL-8B، فإن وصفة التدريب نفسها تفشل في تحسين النماذج الأكبر الموجهة للاستنتاج مثل Gemma-4-26B، مما يكشف عن عدم تطابق حرج حساس للبنية بين استراتيجيات الضبط الدقيق وقدرات النموذج.

Rahul Bissa, Abhishek Vyas, Yash Jain2026-05-29
🤖 AI

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

تقترح هذه الورقة البحثية "Agentic ASR"، وهو إطار عمل ذو حلقة مغلقة يحول التعرف على الكلام إلى مهمة تحسين تفاعلية متعددة الأدوار لتتوافق بشكل أفضل مع التواصل البشري، مقدمةً مقياس تقييم دلالي جديد (S2ERS^2ER) ومثبتةً تحسينات كبيرة في تصحيح الأخطاء الحرجة للمعنى مقارنة بالنهج التقليدي القائم على مستوى الرموز (token-level).

Zixuan Jiang, Yanqiao Zhu, Peng Wang, Qinyuan Chen, Xinjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Y (…)2026-05-29
🤖 AI

AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing

يُعد ™AliMark إطار عمل قوي للعلامات المائية على مستوى الجملة، حيث يعيد صياغة عملية الكشف كمسألة محاذاة لتسلسل البتات، ويستخدم استراتيجية مرحلية من مرحلتين مع متغيرات نصية مُعاد هيكلتها بشكل تكيفي لمقاومة الاضطرابات الهيكلية مثل تقسيم الجمل ودمجها بفعالية.

Yuexin Li, Wenjie Qu, Linyu Wu, Yulin Chen, Yufei He, Tri Cao, Bryan Hooi, Jiaheng Zhang2026-05-29
🤖 AI

Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment

تقترح هذه الورقة إطار عمل للمقابلة التكيفية يحسن قدرة النماذج اللغوية الكبيرة على محاكاة اتخاذ القرار الفردي في المعضلات الأخلاقية من خلال الجمع الديناميكي للأدلة الخاصة بالمستخدم، مما يثبت أن مكاسب الدقة تعتمد على قدرة النموذج على ترسيخ استدلاله في هذه الأدلة بدلاً من مجرد امتلاك سياق غني للشخصية.

Ruoxi Su, Yuhan Liu, Jingyu Hu2026-05-29
🤖 AI

MOOSE-Copilot: A Web-Based Interactive Assistant for Unified Exploratory and Fine-Grained Scientific Hypothesis Discovery

يُعد MOOSE-Copilot إطار عمل موحداً قائماً على الويب يسد الفجوة بين التفكير الاستكشافي والتحسين الدقيق في اكتشاف الفرضيات العلمية من خلال تمكين العلماء من توجيه العملية التوليدية بنشاط عبر بروتوكول تفاعل رسمي بين الإنسان والذكاء الاصطناعي، متفوقاً بذلك على النماذج المرجعية ذاتية التشغيل ومساهمًا في دمقرطة الوصول إلى الاختراقات العلمية المدفوعة بالذكاء الاصطناعي.

Hongran An, Zonglin Yang2026-05-29
💻 computer science

Comparative Evaluation of Machine Translation Systems on Images with Text

تقدم هذه الورقة تقييماً مقارناً لأنظمة الترجمة الآلية للصور التي تحتوي على نصوص، حيث تُظهر أن النماذج اللغوية الكبيرة متعددة الوسائط تتفوق على كل من المسارات القائمة على التعرف الضوئي على الحروف (OCR) والأساليب المتكاملة (end-to-end) من حيث جودة الترجمة والفهم السياقي.

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta2026-05-29