🤖 AI

Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs

تقترح هذه الورقة بروتوكول التزام-مفتوح يستخدم التزامات شجرة ميركل لآثار ميزات المشفّر التلقائي المتناثر (SAE) للكشف بفعالية عن الاستبدال الصامت للنماذج في النماذج اللغوية الكبيرة المستضافة، متفوقة بذلك على مخططات "الاستقصاء بعد العودة" الحالية عبر رفض الهجمات التكيفية المتنوعة مع الحفاظ على حد أدنى من العبء الحسابي.

Ziyang Liu2026-05-26
💰 quantitative finance

AI-Driven Alpha Decay: Algorithmic Homogenization, Reflexive Signal Erosion, and the Paradox of Intelligent Markets

تجادل هذه الورقة بأن الاعتماد الواسع النطاق للذكاء الاصطناعي في استراتيجيات الاستثمار يخلق دورة ذاتية الهزيمة من تجانس الإشارات وتسارع التآكل، مما يؤدي في النهاية إلى تآكل العوائد الزائدة، وتحفيز موجات الانقراض، وزيادة الهشاشة النظامية رغم تحسن عملية اكتشاف الأسعار.

Shuchen Meng, Xupeng Chen2026-05-26
🤖 AI

In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models

تبحث هذه الورقة فيما إذا كانت نماذج الرؤية واللغة الكبيرة يمكنها محاكاة الاكتشاف الإبداعي مفتوح النهايات الملحوظ في تجارب "بيك بريدر" (Picbreeder) التي يقودها البشر، حيث وجدت أنه بينما تنتج هذه النماذج مخرجات متميزة، فإن دمج آليات مثل الضجيج الاستكشافي، والتنوع السلوكي، والذاكرة يعد ضروريًا لفهم الفجوة في القدرة التوليدية بشكل أفضل ولتجسيرها محتملاً.

Sam Earle, Kay Arulkumaran, Andrew Dai, Akarsh Kumar, Julian Togelius, Sebastian Risi2026-05-26
🤖 AI

Confidence Calibration in Large Language Models

تقدم هذه الورقة دراسة مسجلة مسبقاً تُظهر أن النماذج اللغوية الكبيرة تظهر نزعة عامة نحو الإفراط في الثقة، والتي يتم تعديلها من خلال تأثير "السهل-الصعب" حيث يبلغ الإفراط في الثقة ذروته في المهام الصعبة بينما يحدث نقص الثقة في المهام السهلة، مما أدى إلى تطوير معيار LifeEval لتقييم المعايرة عبر مستويات الصعوبة المختلفة.

Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore2026-05-26
🤖 AI

VineLM: Trie-Based Fine-Grained Control for Agentic Workflows

يُعد VineLM مديرًا لتدفق العمل يتيح اختيارًا ديناميكيًا دقيقًا للنماذج في تدفقات العمل الوكيلية، وذلك عبر تمثيل التنفيذات الممكنة كشجرة تري (trie) مُعنونة واستخدام نقاط التحقق مع التوصيف المتتالي لتحسين جبهة التكلفة والزمن ودقة النتائج دون الحاجة إلى توصيف شامل مسبق.

Nikos Pagonas, Matthew Lou, Tianyi Peng, Dan Rubenstein, Kostis Kaffes2026-05-26
📈 economics

Agent-Facing Information Design in LLM Tool Registries

تكشف هذه الورقة أن المبالغة القانونية، وليس الادعاءات المفبركة، هي المحرك الرئيسي للتحيز في اختيار أدوات النماذج اللغوية الكبيرة، مما يثبت فشل أساليب الإفصاح الحالية ويقترح تصميماً لطبقة السجل يفصل بين أوصاف القدرات المهيكلة والنسخ التسويقية لضمان مساءلة الوكيل.

Haochuan Kevin Wang2026-05-26
🤖 AI

Artificial Effort

تُثبت هذه الورقة أن معظم مهام الجهد الحقيقي المعيارية المستخدمة في الاقتصاد التجريبي يمكن الآن حلها بدقة وبتكلفة منخفضة بواسطة نماذج لغوية كبيرة متنوعة، مما يقوض صلاحية هذه المهام في البيئات غير الخاضعة للرقابة حيث قد يقوم المشاركون بتعهيد العمل إلى الذكاء الاصطناعي.

Federico Belotti, Stefano Coniglio, Antonio Cosma, Francesco Fallucchi2026-05-26
🤖 AI

High-Risk AI Systems and the Problem of Identity in the European AI Act

تجادل هذه الورقة بأن اعتماد قانون الذكاء الاصطناعي الأوروبي على أحكام الهوية الغامضة لأنظمة الذكاء الاصطناعي عالية المخاطر يمكن حله من خلال تطبيق إطار "الوظيفة+"، الذي يعمل على تخصيص الأنظمة عبر الوظيفة المقصودة وملفات تعريف الموثوقية لإنشاء معيار قابل للتدقيق والتشغيل للهوية التزامنية في السياقات التنظيمية والحوكمية.

Andrea Ferrario2026-05-26
🤖 AI

Context: Proactive Goal-Directed Intelligence via Composable Sandboxed Programs, Declarative Wiring, and Structured Interaction

تقدم هذه الورقة "Context" (السياق)، وهي طبقة ذكاء استباقية ضمن بنية "Magarshak" تستبدل برامج الدردشة الآلية التفاعلية بوكلاء موجهين نحو الأهداف عبر الاستفادة من تجميع السياق وقت الكتابة لكفاءة التخزين المؤقت، والبرامج المكونة والمحمية في بيئات معزولة للتنفيذ الحتمي، وآلات الحالة للتفاعل المستقل، وكل ذلك مدعوم ببراهين رسمية على خفض التكلفة، والصحة، والتفوق في الأداء.

Gregory Magarshak2026-05-26
🤖 AI

Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs

تحلل هذه الورقة المقايضات الجوهرية بين زمن الاستجابة، والموثوقية، والتكلفة في سير عمل الوكلاء المعتمد على النماذج اللغوية الكبيرة (LLM) من خلال تقديم نماذج أداء واستخلاص استراتيجيات تصميم مثلى، بما في ذلك سياسة تخصيص الرموز (tokens) بأسلوب "تعبئة الفراغ" (water-filling)، لتعظيم الموثوقية في ظل قيود معينة.

Ya-Ting Yang, Quanyan Zhu2026-05-26