💻 computer science

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

يُعد AgentEval إطار عمل يعمل على صياغة سير العمل الوكيل (agentic workflows) في شكل رسوم بيانية موجهة غير حلقية (DAGs) لتمكين التقييم المنظم على مستوى الخطوات وعزو الأسباب الجذرية آلياً، مما يتفوق بشكل كبير على الطرق الشاملة (end-to-end) في استدعاء اكتشاف الفشل وتقليل وقت تصحيح الأخطاء في بيئات الإنتاج.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
🤖 machine learning

ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection

يُعد ComplianceNLP نظاماً متكاملاً يستخدم مسار استرجاع معززاً بالمعرفة (RAG) مدعوماً برسم بياني للمعرفة واستخراج الالتزامات متعدد المهام لأتمتة المراقبة التنظيمية وكشف الفجوات، متفوقاً بذلك على GPT-4o مع زيادة كفاءة المحللين بشكل كبير في عمليات النشر المالي الواقعية.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
⚡ electrical engineering

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

يُعد Talker-T2AV إطار عمل انتشار ذاتي الانحدار لتوليد الصوت والفيديو بشكل مشترك، وهو يحقق تماسكاً وكفاءة فائقتين عبر الوسائط من خلال استخدام عمود فقري مشترك للاستدلال الدلالي عالي المستوى وفك تشفير خاص بكل وسيط للتحسين منخفض المستوى.

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, W (…)2026-04-28
💻 computer science

FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

تُعد FinGround عبارة عن مسار عمل ثلاثي المراحل من نوع "التحقق ثم التثبيت" مصمم لتقليل الهلوسة المالية في النماذج اللغوية الكبيرة عبر تفكيك الإجابات إلى ادعاءات ذرية، وتطبيق استراتيجيات تحقق متخصصة (بما في ذلك إعادة الحساب الحسابي)، وتقديم استشهادات دقيقة، مما يحقق في النهاية انخفاضاً بنسبة 78% في الأخطاء مقارنة بـ GPT-4o.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
💻 computer science

XITE: Cross-lingual Interpolation for Transfer using Embeddings

تُعد XITE تقنية مبتكرة لتعزيز البيانات قائمة على التضمين، تعمل على تحسين النقل عبر اللغات في النماذج اللغوية متعددة اللغات من خلال تحديد النظراء باللغة الإنجليزية للنصوص المستهدفة ذات الموارد المنخفضة وإجراء تركيب تضمين استيفائي، وهو ما يمكن تعزيزه بواسطة التحليل التمييزي الخطي (LDA) لإسقاط النص في فضاء فرعي غني لغوياً.

Barah Fazili, Preethi Jyothi2026-04-28
💻 computer science

Personality Shapes Gender Bias in Persona-Conditioned LLM Narratives Across English and Hindi: An Empirical Investigation

تتقصى هذه الدراسة كيف يؤثر تكييف الشخصية على التحيز الجنسي في السرديات التي تولدها النماذج اللغوية الكبيرة عبر اللغتين الإنجليزية والهندية، حيث وجدت أن سمات الشخصية — ولا سيما تلك المستمدة من "الثالوث المظلم" — تؤثر بشكل كبير على حجم واتجاه الصور النمطية الجنسانية في السياقات المهنية.

Tanay Kumar, Shreya Gautam, Aman Chadha, Vinija Jain, Francesco Pierri2026-04-28
💻 computer science

GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs

يُعد GraphPlanner موجهاً وكيلًا ذا ذاكرة معززة بالرسوم البيانية غير المتجانسة، يصيغ توليد سير عمل النماذج اللغوية الكبيرة متعددة الوكلاء كعملية قرار ماركوف مُحسّنة عبر التعلم التعزيزي، مما يحسن دقة المهام والكفاءة الحسابية بشكل كبير مع دعم التعميم القوي والاستخدام التكيفي للذاكرة.

Tao Feng, Haozhen Zhang, Zijie Lei, Peixuan Han, Jiaxuan You2026-04-28
💻 computer science

Benchmarking Testing in Automated Theorem Proving

تقدم هذه الورقة البحثية "T"، وهو إطار عمل مبتكر يقيم الصحة الدلالية للنظريات الرسمية المولدة بواسطة الذكاء الاصطناعي من خلال التحقق مما إذا كانت النظريات اللاحقة المعتمدة تنجح في عملية التجميع، مما يكشف عن فجوة كبيرة في قدرات نماذج اللغات الكبيرة الحالية في توليد النظريات مقارنة بطرق التقييم المعجمية أو اليدوية التقليدية.

Jongyoon Kim, Hojae Han, Seung-won Hwang2026-04-28
💻 computer science

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

تقترح الورقة البحثية HeadRouter، وهو أسلوب لتقليم الرموز (token pruning) متكيف مع المهام وخالٍ من التدريب، يقوم بتوجيه الرموز الصوتية ديناميكيًا بناءً على الأهمية المتميزة لرؤوس الانتباه عبر المهام المختلفة، محققًا أداء ضغط هو الأفضل في فئته يتجاوز حتى دقة النموذج الأصلي في معايم رئيسية.

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhan (…)2026-04-28