🤖 AI

OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery

يُعد OR-Agent إطار عمل بحثي متعدد الوكلاء يعزز التصميم الاستدلالي المؤتمت من خلال دمج توليد الفرضيات القائم على الأشجار مع نظام انعكاس هرمي مستوحى من التحسين، وذلك للتغلب على القيود الاستراتيجية والتعلمية التي تواجه الأساليب التطورية الحالية القائمة على النماذج اللغوية الكبيرة.

Qi Liu, Ruochen Hao, Can Li, Wanjing Ma2026-08-05
💻 computer science

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

تقيم هذه الورقة قدرة نماذج الذكاء الاصطناعي الرائدة على أداء الاستدلال المعقد دون رموز "سلسلة الأفكار" الصريحة من خلال قياس آفاق زمن إنجاز المهام مقابل الخطوط المرجعية البشرية، مما يكشف عن اتجاه يتمثل في مضاعفة الأداء سنويًا ويتوقع أن هذه النماذج يمكنها قريبًا حل المهام التي تتطلب أكثر من 25 دقيقة من الجهد البشري في تمريرة واحدة بحلول عام 2030.

Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Br (…)2026-08-05
💬 NLP

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

تقدم هذه الورقة PersonaTrail، وهو معيار لتقييم قدرة وكلاء الويب المخصصين على استنتاج تفضيلات المستخدم من سجلات التصفح الخام، إلى جانب PACMem، وهو إطار عمل ينظم هذا السجل في ذكريات واقعية وتفضيلية لتحسين أداء التنقل بشكل كبير.

Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park2026-08-05
💻 computer science

ISEE: Interactive Semantic Enrichment for Database Fields

تقدم الورقة البحثية ISEE، وهو نظام تفاعلي يعمل على إثراء أوصاف حقول قواعد البيانات الغامضة بشكل تعاوني باستخدام المعرفة بالمجال لدى المستخدم لتحسين أداء وكلاء النماذج اللغوية الكبيرة (LLM) في المهام المتعلقة بالبيانات.

Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi (…)2026-08-05
💻 computer science

Self-Organising Digital Circuits

تقدم هذه الورقة البحثية الدوائر الرقمية ذاتية التنظيم، وهي بنية مستوحاة حيويًا تستخدم نموذج "ترانسفورمر" مقنع طوبولوجيًا لصياغة توليد المنطق كمسألة تعلم ميتا، مما يمكّن الأجهزة الرقمية من التجميع الذاتي وإعادة التشكيل الديناميكي حول كل من الأخطاء الدائمة والبرمجية مع قدرة فائقة على تحمل الأخطاء والقابلية للتوسع.

Marcello Barylli, Gabriel Béna, Alexander Mordvintsev, Eleni Nisioti, Sebastian Risi2026-08-05
💻 computer science

KernelBrain: Coarse-to-Fine, Budget-Aware Search for Agentic GPU Kernel Optimization

تُعد KernelBrain وكيلًا عمليًا للتحسين يراعي الميزانية، حيث يجمع بين الطفرات الموجهة بواسطة النماذج اللغوية الكبيرة واستراتيجية تقييم تكيفية من الخشن إلى الناعم لتوليد نوى وحدات معالجة رسومية عالية الأداء بكفاءة، محققةً تسريعًا كبيرًا مقارنة بـ PyTorch ووكلاء الحالة الراهنة مع تقليل وقت التحسين بنسبة تصل إلى 48%.

Shuai Che, Gang Peng2026-08-05
💬 NLP

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

تقدم MemArena معياراً ومحاكياً واسع النطاق، متمحوراً حول منظور المستخدم (ego-centric)، لتقييم المساعدات الشخصية للذاكرة على الأجهزة، مما يكشف أن اختيار خلفية الذاكرة يؤثر بشكل كبير على دقة المحتوى وموثوقيته مع تحمل حد أدنى من زمن بحث الاسترجاع على أجهزة الحافة.

Jiadong Zhang, Xiaosong Ma2026-08-05
💬 NLP

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

تقدم هذه الورقة OncoTriad-QA، وهو معيار مرجعي شامل على مستوى المريض يدمج بيانات الأشعة والباثولوجيا والجينوميات من 9,281 حالة من مشروع TCGA لتقييم وتحسين قدرة النماذج متعددة الوسائط على إجراء استدلال شامل للسرطانات عبر نظام الإجابة على الأسئلة.

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian2026-08-05
💬 NLP

Evaluating OpenAI's Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks

تقدم هذه الورقة أول تقييم مستقل ومنهجي لمرشح الخصوصية (Privacy Filter) الخاص بشركة OpenAI عبر 42 معياراً، كاشفةً أنه في حين يتفوق النموذج على الأدوات الحالية في بيانات الهوية الشخصية (PII) الاصطناعية المهيكلة ومجالات محددة مثل خدمة العملاء، فإنه يعاني من تدهور حاد في الأداء عند التعامل مع النثر السردي، والنصوص غير اللاتينية، وأنواع بيانات الهوية الشخصية المتغيرة ثقافياً.

Rohith Uppala2026-08-05
💬 NLP

Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

تُثبت هذه الورقة أن التفضيلات الثنائية للأطباء هي مؤشر غير موثوق للسلامة السريرية في النماذج اللغوية الكبيرة، حيث يمكن للنماذج ذات التصنيف العالي أن تظل تُظهر إخفاقات جسيمة حرجة من الناحية السريرية، مما يستلزم ممارسات تقييم تبلغ مباشرة عن معدلات الفشل وتدمج تعديلات قائمة على معايير سريرية رصينة.

Fay Elhassan, David Sasu, Alexandra Kulinkina, Lars Henning Klein, Mary-Anne Hartley2026-08-05