🤖 machine learning

Valid Per-Field Selective Risk Control for Document Extraction: Three Failure Modes, a Validity Ladder, and When Conditioning Pays

تشخص هذه الورقة ثلاثة أنماط فشل حرجة تتسبب في جعل التحكم الانتقائي في المخاطر لكل حقل على حدة في استخراج المستندات ينتهك ضمانات السلامة، وتقترح "سلم صلاحية" من الإصلاحات المتزايدة الصرامة — بما في ذلك تعلم "موندريان" ثم الاختبار وتصنيف صناديق الدعم — والتي تثبت في النهاية كيف يمكن أن يؤدي التكييف على المصدر في تحقيق تحكم صالح في المخاطر حيث تفشل العتبات المجمعة، وهو اكتشاف تم التحقق منه من خلال عمليات التدقيق البشري وإصداره كبرمجيات مفتوحة المصدر.

Bhaskar Gurram2026-08-18
🤖 machine learning

BDIP-Net: Dual-Interaction Graph Learning for Property Prediction of Bilayer Materials

تقترح هذه الورقة البحثية شبكة BDIP-Net، وهي إطار عمل للتعلم الآلي يجمع بين سير عمل تحسين هيكلي من نوع MatterSim-D3 منخفض التكلفة وشبكة عصبية رسومية ذات تفاعل ثنائي لإنشاء هياكل ثنائية الطبقات بجودة نظرية الكثافة الوظيفية (DFT) بكفاءة، والتنبؤ بخصائصها بدقة من خلال نمذجة التفاعلات داخل الطبقة وبين الطبقات بشكل صريح.

An Vuong, Chen Zhao, Jin Hu, Shui-Qing Yu, Xintao Wu2026-08-18
🤖 machine learning

Training and Evaluating Ethical Reinforcement Learning Agents on Per-Episode Distributions

تُثبت هذه الورقة أن تدريب وكلاء التعلم المعزز الأخلاقي باستخدام معيار العوائد القياسية المتوقعة (ESR) على التوزيعات لكل حلقة يضمن بفعالية الالتزام الصارم بميزانيات الانتهاك في كل حلقة دون التضحية بمتوسط الأداء، على عكس الطرق التقليدية التي تُحسن السلوك المتوسط فقط وتسمح بتركيز الانتهاكات الضارة في حلقات محددة.

Prabhjyot Singh, Majid Ghasemi, Mark Crowley2026-08-18
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

تقترح الورقة البحثية DUET، وهي طريقة تقطير داخل السياسة قائمة على اختيار الرموز (token-selective) تستفيد من عدم الاتفاق لكل رمز بين معلمين متماثلي الأوزان (أحدهما مع سياق الحظر والآخر بدونه) لتوليد إشارة إشراف نظيفة لتدريب النماذج على الامتثال للمحظورات الديناميكية الخاصة بكل طلب مع الحفاظ على المنفعة العامة.

Zihan Li, Feifei Li, Wenhui Que2026-08-18
💻 computer science

Stop Indexing at Full Precision: Revisiting Clustering for Vector Embeddings

تُثبت هذه الورقة أن تطبيق تقليل الأبعاد، والكمية، وتقليم الأبعاد قبل التجميع يسمح بفهرسة تضمينات المتجهات برموز مكونة من بت واحد، مما يحقق جودة بحث قريبة من المثالية مع تقليل متطلبات التخزين بمقدار 60 ضعفاً وتسريع وقت التجميع مقارنة بطرق الدقة الكاملة.

Leonardo Kuffo, Peter Boncz2026-08-18
🤖 machine learning

Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers

تقدم الورقة البحثية dLLM-SetScore، وهي طريقة للتصنيف متعدد الملصقات لا تتطلب تدريباً، تستفيد من نماذج لغة الانتشار المنفصلة لتقييم الملصقات المرشحة عبر مقارنات احتمالية (نعم/لا) لكل خانة، مما يؤدي إلى إزالة انحياز الموضع وتحقيق أداء رائد دون الحاجة إلى ضبط دقيق خاص بالمهمة.

Pawan Kumar2026-08-18
🤖 machine learning

LUNG-KGMM: Knowledge-Guided Multimodal Learning for Lung Cancer Incidence Prediction

تقترح هذه الورقة إطار عمل LUNG-KGMM، وهو إطار عمل متعدد الوسائط موجه معرفياً يدمج السجلات الصحية الإلكترونية، وتقارير الأشعة، وصور الصدر الشعاعية، والإرشادات السريرية لتحقيق تنبؤ فائق وقابل للنقل بحدوث سرطان الرئة مع معالجة عدم تجانس البيانات والتسرب من خلال مسارات معالجة متخصصة.

Chunlei Yang, Shuyan Li, Zhong Cao2026-08-18
🤖 machine learning

pico-type: A 1.5M-Parameter Byte-Level Multi-Head Content Classifier

تقدم الورقة البحثية pico-type، وهو مصنف متعدد الرؤوس على مستوى البايت خفيف الوزن بـ 1.5 مليون معلمة، يتنبأ في آن واحد بسبعة خصائص للمحتوى (بما في ذلك اللغة، ونوع MIME، وعلامات المخاطر) من بايتات UTF-8 الخام في أقل من 10 مللي ثانية دون الحاجة إلى عملية التجزئة (tokenization)، محققاً تحسينات كبيرة في الدقة مقارنة بالنماذج الاصطناعية المرجعية على مجموعات بيانات واقعية.

Gautam Kishore2026-08-18
🤖 AI

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

تُظهر هذه الدراسة التجريبية أنه في حين أن قيمة P(True)P(\text{True}) متعددة العينات ترتبط بشكل أفضل بصحة الكود، فإن طرق التصحيح الذاتي القائمة على عدم اليقين تفشل عموماً في تحسين الدقة وتؤدي غالباً إلى تدهور الأداء، بينما تظل إعادة التوليد القائمة على التحقق هي الاستراتيجية الوحيدة الموثوقة لتعزيز توليد الكود.

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu2026-08-18
🤖 machine learning

Ring-based Spatial Transformer: Learning Non-linear Spatial Interactions between Building Distribution and Pedestrian Flow

تقدم هذه الدراسة نموذج "المحول المكاني" القائم على الحلقات، والذي يثبت أن تدفق المشاة حول محطات السكك الحديدية في طوكيو مدفوع بتفاعلات غير خطية عبر منطقة النطاق الكامل البالغة 800 متر بدلاً من التنمية المجاورة، مما يتحدى افتراضات المدينة المدمجة التقليدية ويتفوق على الانحدار الموزون جغرافياً في دقة التنبؤ.

Shun Nakayama, Takahiro Kanamori, Wanglin Yan2026-08-18