🤖 machine learning

G-Zero: Self-Play for Open-Ended Generation from Zero Data

إن G-Zero هو إطار عمل تطوري مشترك وخالٍ من المتحقق (verifier-free)، يتيح التحسين الذاتي مفتوح النهاية للنماذج اللغوية الكبيرة عبر استخدام مكافأة "تلميح-δ\delta" (Hint-δ\delta) جوهرية لتدريب نموذج "المقترح" (Proposer) على توليد استعلامات وتلميحات تحدّية، والتي يتعلم منها نموذج "المولد" (Generator) عبر خوارزمية التفضيل المباشر (DPO)، مما يتجاوز قيود الحكام الخارجيين.

Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin (…)2026-05-12
🧬 biology

Learning the Interaction Prior for Protein-Protein Interaction Prediction: A Model-Agnostic Approach

تقدم هذه الورقة البحثية L3-PPI، وهو أسلوب لتعلم المحفزات الرسومية (graph prompt learning) غير مرتبط بنموذج محدد وقابل للتوصيل والتشغيل، يعمل على تعزيز التنبؤ بالتفاعل بين البروتينات عن طريق إعادة صياغة التصنيف كمسألة على مستوى الرسم البياني مسترشدة بـ "قاعدة L3" ذات الدوافع البيولوجية لحقن أولويات التفاعل في المتنبئات الحالية.

Ziqi Gao, Chenyi Zi, Zijing Liu, Ziqiao Meng, Yu Li, Jia Li2026-05-12
🤖 AI

GLiNER2-PII: A Multilingual Model for Personally Identifiable Information Extraction

يقدم البحث نموذج GLiNER2-PII، وهو نموذج متعدد اللغات مدمج تم تدريبه على مجموعة نصوص اصطناعية للكشف بفعالية عن 42 نوعاً من معلومات الهوية الشخصية عبر لغات وتنسيقات متنوعة، محققاً أداءً هو الأفضل في فئته على مقياس SPY المرجعي.

Urchade Zaratiana, Ash Lewis, George Hurn-Maloney2026-05-12
🧬 biology

Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation

تقدم الورقة البحثية Yeti، وهو مرمز لبنية البروتين يتميز بكونه مدمجاً وتعبيرياً ويعتمد على التكميم الخالي من البحث ومطابقة التدفق، والذي يحقق دقة عالية في إعادة البناء وتنوعاً في الرموز، مما يمكّن من تدريب نماذج متعددة الوسائط صغيرة قادرة على توليد تسلسلات وبنيات بروتينية معقولة من الصفر.

Nabin Giri, Steven Farrell, Kristofer E. Bouchard2026-05-12
🤖 AI

Geometric 4D Stitching for Grounded 4D Generation

تقترح هذه الورقة البحثية "الخياطة الهندسية رباعية الأبعاد" (Geometric 4D Stitching)، وهي إطار عمل فعال يحدد بوضوح المناطق الهندسية المفقودة ويملؤها بغرز رباعية الأبعاد مستندة إلى معالم واقعية لمعالجة التناقضات في طرق التوليد رباعي الأبعاد الحالية، مما يتيح توسيع وتعديل المشاهد بسرعة وجودة عالية على وحدة معالجة رسوميات واحدة.

Sunwoo Park, Taesung Kwon, Jong Chul Ye2026-05-12
🤖 AI

Prospective Compression in Human Abstraction Learning

تقترح هذه الورقة وتثبت الفرضية القائلة بأن البشر يتعلمون تجريدات قابلة لإعادة الاستخدام في البيئات غير المستقرة من خلال "الضغط الاستشرافي" (prospective compression) من أجل التحسين للمهام المستقبلية، وهو سلوك تفشل الخوارزميات الاسترجاعية والنماذج القائمة على النماذج اللغوية الكبيرة في التقاطه.

Leonardo Hernandez Cano, Ivan Zareski, Luisa El Amouri, Pinzhe Zhao, Max Mascini, Emanuele Sansone, Yewen Pu, Bonan Zhao (…)2026-05-12
🤖 AI

Optimizer-Induced Mode Connectivity: From AdamW to Muon

تُثبت هذه الورقة أن المحسنات مثل AdamW وMuon تُحدث مجمعات حلول ذات فقد صفري متميزة، وغالباً ما تكون منفصلة، في الشبكات العصبية، مما يكشف أن اتصال الأنماط يعتمد بشكل أساسي على مُحسن محدد وعلى تنظيمه الضمني بدلاً من كونه خاصية عالمية لمشهد الفقد.

Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci2026-05-12
🤖 machine learning

Attention Drift: What Autoregressive Speculative Decoding Models Learn

تحدد هذه الورقة البحثية "انحراف الانتباه" كقصور رئيسي في نماذج فك التشفير التخميني ذات التوليد الذاتي، حيث ينزاح الانتباه من النص الأصلي (prompt) إلى الرموز المولدة بسبب المسارات المتبقية غير المعيرة، وتقترح إصلاحات معمارية مثل "التطبيع البعدي" (post-norm) و"تطبيع RMS لكل حالة مخفية" (per-hidden-state RMSNorm) والتي تحسن بشكل كبير أطوال القبول عبر مختلف المهام وأطوال السياق.

Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia2026-05-12
🤖 AI

Combining Mechanical and Agentic Specification Inference for Move

تقدم هذه الورقة أداة لاستنتاج المواصفات لـ Move Prover تعمل على دمج تحليل الشرط الأضعف السليم مع واجهة سطر أوامر برمجية وكيلية (agentic coding CLI) لتوليد وتحسين مواصفات التحقق تلقائياً، مما يقلل بفعالية من العمل الروتيني اليدوي مع التعامل مع الخصائص المعقدة مثل ثوابت الحلقات والثوابت الهيكلية.

Wolfgang Grieskamp, Teng Zhang, Vineeth Kashyap2026-05-12
📊 statistics

The two clocks and the innovation window: When and how generative models learn rules

تحدد هذه الورقة "نافذة ابتكار" حرجة في النماذج التوليدية تتمثل في الفجوة الزمنية بين تعلم القواعد المجردة (τrule\tau_{\mathrm{rule}}) وحفظ بيانات التدريب (τmem\tau_{\mathrm{mem}})، وتثبت أن وجود هذه النافذة ومدتها يعتمدان على حجم مجموعة البيانات، وتعقيد القواعد، وسعة النموذج عبر كل من بنيات الانتشار والنماذج ذات التوليد الذاتي.

Binxu Wang, Emma Lucia Byrnes Finn, Bingbin Liu2026-05-12