💻 computer science

Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

تقدم هذه الورقة ماسحات ذكاء اصطناعي مؤتمتة مصممة للكشف عن أربعة عيوب محددة في الصلاحية ضمن نصوص الاختبارات المعيارية الوكيلية، مما يبرز قدرتها على توسيع نطاق جهود ضمان الجودة مع تسليط الضوء على قيود الأداء الحالية والحاجة إلى معايير أوسع في مجال التقييم.

Jeff Mohl, Nelson Gardner-Challis, Magda Dubois, Harry Coppock, Benjamin Allan-Rahill, Kaelan Yim, Damian Sójka, James M (…)2026-07-31
🤖 machine learning

Expanding Data-Agnostic Pivotal Instances Selection Models with Proximity Trees and Ensemble Learning

تقترح هذه الورقة نموذجاً تنبؤياً غير مرتبط بنوع محدد من البيانات، ومصمماً ليكون قابلاً للتفسير، يقوم باختيار نماذج مثالية ممثلة (بما في ذلك الأزواج والمجموعات) بشكل هرمي باستخدام أشجار التقارب والشبكات سابقة التدريب لتحقيق أداء تنافسي عبر أنماط بيانات متنوعة مع الحفاظ على قابلية تفسير عالية.

Alessio Cascione, Mattia Setzu, Cristiano Landi, Paolo Maria Mancarella, Riccardo Guidotti2026-07-31
💻 computer science

Hierarchical Reranking for Scalable Financial RAG System

تقدم هذه الورقة البحثية "Hierarchical Reranker"، وهو إطار عمل قابل للتوسع للجيل التالي من التوليد المعزز بالاسترجاع (RAG)، يدمج بين تحسين ما قبل الاسترجاع، وآلية ترتيب ثنائية المراحل، وإدارة السياق الطويل لتعزيز دقة الاسترجاع والاتساق الواقعي بشكل كبير في تحليل الوثائق المالية المعقدة، كما يتضح من أدائه المتفوق في تحدي FinanceRAG التابع لمؤتمر ACM-ICAIF '24.

Joohyun Lee, Sungwoo Hong2026-07-31
🤖 machine learning

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

تقترح هذه الورقة نموذج تضمين سلوكي خفيف الوزن يعتمد على إنتروبيا توازن ناش وحساسية الاستجابة للتنبؤ بنجاح بكيفية نقل الضبط الدقيق على ألعاب ذات صيغة عادية محددة للقدرات الاستراتيجية إلى ألعاب غير مرئية في النماذج اللغوية الكبيرة، متفوقة بذلك على التضمينات الهيكلية الحالية التي تكتفي بمجرد حفظ هويات الألعاب.

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson2026-07-31
💻 computer science

AI Literacy: An Exercise in Power-Knowledge

تجادل هذه الورقة بأن أطر محو الأمية بالذكاء الاصطناğı الحالية، التي تعطي الأولوية للمهارات التقنية والاستخدام المسؤول، غير كافية لأنها تعامل المستخدمين كمستهلكين سلبيين؛ وبدلاً من ذلك، وبالاستناد إلى فوكو وفريري، تقترح إطاراً مُعاد صياغته لمحو الأمية النقدية بالذكاء الاصطناعي يعزز الوكالة المعرفية، ويعالج عدم المساواة الهيكلية، ويُمكّن الأفراد من التقييم النقدي، والمقاومة، وحوكمة أنظمة الذكاء الاصطناعي.

Brady D. Lund, Zoë Abbie Teel2026-07-31
🤖 machine learning

Cross-Embodiment Transfer via Behavior-Aligned Representations

تقترح هذه الورقة استخدام تمثيلات متوافقة مع السلوك، ولا سيما آثار النهاية الطرفية للمنفذ، ضمن نماذج الرؤية واللغة والعمل لتوحيد بيانات متنوعة عابرة للأجساء وتحسين أداء نقل الروبوت بشكل كبير، محققةً زيادة بنسبة 28% في إكمال المهام في العالم الحقيقي بعد التدريب المسبق في المحاكاة.

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh2026-07-31
💰 quantitative finance

Using Large Language Models for Idea Generation in Innovation

تُظهر هذه الدراسة أنه في حين تُبدي أفكار المنتجات المُولدة بواسطة الذكاء الاصطناعي مستويات أقل من الجدة والتنوع مقارنة بالأفكار المولدة بشرياً، إلا أنها تتفوق بشكل كبير على الأفكار البشرية في متوسط نية الشراء، وتكون أكثر عرضة بسبع مرات لتصنيف ضمن أفضل 10% من المفاهيم عالية الجودة.

Lennart Meincke, Karan Girotra, Gideon Nave, Christian Terwiesch, Karl T. Ulrich2026-07-31
💻 computer science

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

تقدم هذه الورقة إطار عمل "الوظيفة-الدليل-التحقق" (FEV) لنقل تقييم الأنظمة المعلوماتية الحيوية الوكيلية من دقة المخرجات النهائية إلى المصداقية العلمية وقابلية التدقيق لمسارات سير العمل بأكملها، مما يكشف أن القدرات الحالية في التخطيط والتنفيذ تتجاوز تلك الموجودة في إثبات المصدر والتحقق والاختبار التجريبي.

Phuc Pham, Truong-Son Hy2026-07-31
💻 computer science

What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering

تقترح هذه الورقة تعريفاً تكوينياً وإطاراً تشغيلياً لـ "هندسة الرسوم البيانية للمطالبات" (prompt graph engineering) لتوصيف أنظمة المطالبات الحديثة رسمياً كرسوم بيانية صريحة وقابلة للتنفيذ، وبذلك تضع الشروط الضرورية، ومفردات مشتركة، وأجندة بحثية لممارسة منتشرة حالياً في الصناعة ولكنها تفتقر إلى تعريف نظري دقيق.

Sandeco Macedo2026-07-31
💻 computer science

Is Solving Better Than Evaluating GenAI Solutions?

وجدت دراسة عشوائية في مساق خوارزميات للمستوى المتقدم أن جعل الطلاب يقيمون حلولاً معيبة ناتجة عن الذكاء الاصطناعي التوليدي قد حسّن درجات الواجبات المنزلية دون الإضرار بالأداء العام في الامتحانات، إلا أنه لم يؤدِ تلقائياً إلى تحسين نقل المفاهيم أو مكاسب التعلم مقارنة بحل المشكلات التقليدي بدون تدعيم منهجي متعمد.

Ethan Dickey, Marios Mertzanidis, Alexandros Psomas2026-07-31