🤖 AI

Identifying AI Web Scrapers Using Canary Tokens

تقترح هذه الورقة تقنية مبتكرة تستخدم رموز "كناري" ديناميكية لتحديد أي من أدوات كشط الويب التي تغذي نماذج لغوية كبيرة محددة بشكل تلقائي ودقيق، مما يمكّن مالكي المواقع الإلكترونية من التحكم بشكل أفضل في عمليات الكشط غير المرغوب فيها دون الاعتماد على الإفصاحات الطوعية من الشركات.

Steven Seiden, Triss Ren, Caroline Zhang, Taein Kim, Enze Liu, Emily Wenger2026-05-14
💬 NLP

Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة المدمجة ذات الـ 8 مليارات بارامتر، عند ضبطها بدقة باستخدام بيانات تعليمية مصممة من قبل خبراء، يمكنها توليد قصص قراءة باللغة الإنجليزية للأطفال بصعوبة قابلة للتحكم ومعايير سلامة تتفوق على النماذج الكبيرة ذات القدرات الصفرية مثل GPT-4o وLlama 3.3 70B في مقاييس الصعوبة، مع بقائها فعالة من حيث التكلفة للاستخدام التعليمي واسع النطاق.

Qian Shen (University of Florida, Gainesville, USA), Fanghua Cao (University of Florida, Gainesville, USA), Min Yao (Uni (…)2026-05-14
🤖 AI

Humanwashing -- It Should Leave You Feeling Dirty

تجادل هذه الورقة بأن الاستخدام العشوائي لاستعارة "الإنسان في الحلقة" يسهل عملية "التبييض البشري" (humanwashing) عبر تعتيم حقائق اتخاذ القرار في الذكاء الاصطناعي وخلق شعور زائف بالأمان، مما يؤدي بالتالي إلى الإخفاق في معالجة قضايا جوهرية مثل التحيز والمساءلة والشفافية.

Ben Wilson, Matimba Swana, Peter Winter, Matt Roach2026-05-14
🤖 AI

ScioMind: Cognitively Grounded Multi-Agent Social Simulation with Anchoring-Based Belief Dynamics and Dynamic Profiles

إن ScioMind هو إطار عمل للمحاكاة متعددة الوكلاء القائم على الأسس المعرفية، والذي يعزز الواقعية السلوكية لديناميكيات الآراء الاجتماعية من خلال دمج تحديثات المعتقدات المرتكزة على الذاكرة، وبنيات الذاكرة الهرمية، والملفات التعريفية الديناميكية للوكلاء، وذلك لنمذجة الشخصيات غير المتجانسة ومسارات المعتقدات المستقرة بشكل أفضل في عمليات المحاكاة القائمة على النماذج اللغوية الكبيرة (LLM).

Yitian Yang, Yiqun Duan, Linghan Huang, Yiqi Zhu, Francesco Bailo, Chunmeizi Su, Huaming Chen2026-05-14
🤖 AI

Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation

تقترح الورقة البحثية إطار عمل CMC، وهو إطار عمل من مرحلتين منفصلتين ينسق بين الشروط النصية والمسارية لتوليد حركة البشر من خلال ضمان اتباع المسار بدقة أولاً عبر تمثيل مبسط، ثم استكمال حركة الجسم الكامل عبر نموذج طلاء (inpainting) مشروط بالنص ومعزز بآلية طلاء انتقائية لتحقيق أداء رائد في هذا المجال.

Deli Cai, Haoyang Ma, Changxing Ding2026-05-14
🤖 AI

Weakly-Supervised Spatiotemporal Anomaly Detection

تقترح هذه الورقة طريقة للكشف عن الشذوذ المكاني والزماني تحت إشراف ضعيف، تستخدم تسميات على مستوى الفيديو وفقدان ترتيب الحالات المتعددة لتحديد حالات الشذوذ الموضعية داخل مقاطع الفيديو، مما يثبت فعاليتها في مجموعة بيانات UCF Crime2Local.

Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah2026-05-14
🤖 machine learning

High-Rate Quantized Matrix Multiplication II

تتقصى هذه الورقة البحثية عملية ضرب المصفوفات المكممة بمعدل مرتفع من أجل تكميم ما بعد التدريب للأوزان فقط في النماذج اللغوية الكبيرة، وذلك عبر إثبات كيف يحسن توزيع "ملء الخزان" (waterfilling) المدرك للتباين من التخصيص متساوي المعدل، وتحليل الأداء الخالي من الأساس والقريب من الأمثل لمخطط WaterSIC، وإظهار أن خوارزمية GPTQ مع التدوير العشوائي تحقق نتائج مماثلة قريبة من المثالية.

Or Ordentlich, Yury Polyanskiy2026-05-14
💬 NLP

Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry

تقترح هذه الورقة إطار عمل للكشف عن الهلوسة على مستوى الخطوة، يحدد أخطاء الاستدلال باعتبارها انحرافات موضعية في هندسة نقل الحالة الخفية، وذلك باستخدام معلم يعتمد على تحليل المكونات الرئيسية التبايني (PCA) وطالب (BiLSTM) مُقطّر للتفوق على خطوط الأساس الحالية في تحديد موقع الخطأ الأول أثناء الاستدلال بمرور واحد.

Tyler Alvarez, Ali Baheri2026-05-14
🤖 AI

(How) Do Large Language Models Understand High-Level Message Sequence Charts?

تقيم هذه الورقة قدرة ثلاثة نماذج لغوية كبيرة على فهم الدلالات الرسمية لمخططات تسلسل الرسائل عالية المستوى (HMSCs)، كاشفةً أنه في حين أنها تُظهر استيعاباً قوياً للمفاهيم الأساسية، إلا أن دقتها الإجمالية متواضعة (حوالي 52%) بسبب معاناتها الكبيرة مع الاستدلال الدلالي المعقد الذي يتضمن التجريد، والتركيب، والتبعية السببية.

Mohammad Reza Mousavi2026-05-14
🤖 machine learning

MinT: Managed Infrastructure for Training and Serving Millions of LLMs

تُعد MinT نظام بنية تحتية مُدارة تُمكّن من التدريب والتشغيل الفعال لملايين سياسات النماذج اللغوية الكبيرة القائمة على تقنية LoRA، وذلك عبر إبقاء نموذج أساسي ضخم واحد مقيماً في الذاكرة مع إدارة مراجعات المحولات خفيفة الوزن ديناميكياً، مما يحقق تحسينات كبيرة في قابلية التوسع، وكفاءة الذاكرة، وسرعة النشر عبر البنى الكثيفة وبنى الخبراء (MoE).

Mind Lab, :, Song Cao, Vic Cao, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng (…)2026-05-14