🤖 AI

Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery

لمعالجة أوجه القصور في المعايير المرجعية الثابتة وتلوث البيانات عند تقييم قدرة الذكاء الاصطناعي على اكتشاف المعرفة، تقدم هذه الورقة DBench-Bio، وهو معيار مرجعي ديناميكي، مؤتمت بالكامل، ويُحدث شهرياً، يغطي 12 مجالاً فرعياً في الطب الحيوي، ويقيم بصرامة قدرة النماذج اللغوية الكبيرة على استخلاص معرفة بيولوجية جديدة.

Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua2026-03-05
🤖 AI

IntPro: A Proxy Agent for Context-Aware Intent Understanding via Retrieval-conditioned Inference

تقترح الورقة البحثية IntPro، وهو وكيل وسيط يعزز فهم النوايا القائم على السياق من خلال الاستفيد من الاستدلال المشروط بالاسترجاع من مكتبة تاريخ نوايا فردية، والتي تم تدريبها عبر الضبط الدقيق الخاضع للإشراف وGRPO متعدد الأدوار للتكيف بفعالية مع الأنماط الخاصة بالمستخدم عبر سيناريوهات متنوعة.

Guanming Liu, Meng Wu, Peng Zhang, Yu Zhang, Yubo Shu, Xianliang Huang, Kainan Tu, Ning Gu, Liuxin Zhang, Qianying Wang (…)2026-03-05
🤖 AI

Controllable and explainable personality sliders for LLMs at inference time

تقدم هذه الورقة البحثية التوجيه التكيفي المتسلسل (SAS)، وهو إطار عمل فعال من حيث المعلمات للضبط أثناء الاستنتاج، يعمل على تعامد متجهات التوجيه لتمكين التعديل القابل للتحكم والتفسير والمتزامن لسمات شخصية متعددة في النماذج اللغوية الكبيرة دون الحاجة إلى إعادة التدريب.

Florian Hoppe, David Khachaturov, Robert Mullins, Mark Huasong Meng2026-03-05
🤖 AI

StructLens: A Structural Lens for Language Models via Maximum Spanning Trees

تقدم هذه الورقة StructLens، وهو إطار عمل مبتكر يستخدم أشجار الامتداد القصوى المستمدة من تمثيلات تدفق المتبقي لتحليل العلاقات الهيكلية العالمية بين الطبقات في النماذج اللغوية، مما يكشف عن أنماط تشابه متميزة تتفوق على المقاييس التقليدية في مهام مثل تقليم الطبقات.

Haruki Sakajo, Frederikus Hudi, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe2026-03-05
🤖 AI

AutoHarness: improving LLM agents by automatically synthesizing a code harness

تُثبت هذه الورقة أن نموذج لغة أصغر (Gemini-2.5-Flash) يمكنه تلقائياً توليد أطر برمجية أو سياسات كاملة من خلال التحسين التكراري، مما يمنع الأفعال غير القانونية بفعالية ويتفوق على نماذج أكبر بكثير عبر مختلف ألعاب TextArena مع توفير كفاءة أكبر في التكلفة.

Xinghua Lou, Miguel Lázaro-Gredilla, Antoine Dedieu, Carter Wendelken, Wolfgang Lehrach, Kevin P. Murphy2026-03-05
🤖 AI

Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations

تُقيّم هذه الورقة تجريبياً متانة 13 نموذجاً من النماذج اللغوية الكبيرة ضد خمسة أنواع مهيكلة من اضطرابات "سلسلة الأفك" (Chain-of-Thought)، كاشفةً أنه في حين أن توسيع نطاق النماذج يقلل بشكل كبير من الأخطاء الرياضية، إلا أنه يقدم حماية محدودة ضد أخطاء تحويل الوحدات، وأن أنماط الضعف تتباين بشكل غير متجانس عبر أنواع الفساد المختلفة.

Ashwath Vaithinathan Aravindan, Mayank Kejriwal2026-03-05
💬 NLP

The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?

تقدم هذه الورقة CompMath-MCQ، وهي مجموعة بيانات مرجعية جديدة مكونة من 1,500 سؤال من نوع الاختيار من متعدد أعدها خبراء وتغطي الرياضيات الحسابية بمستوى الدراسات العليا، صُممت لتقييم وكشف القيود الحالية للنماذج اللغوية الكبيرة في الاستدلال الرياضي المتقدم بشكل صارم.

Bianca Raimondi, Francesco Pivi, Davide Evangelista, Maurizio Gabbrielli2026-03-05
💬 NLP

Compressed Sensing for Capability Localization in Large Language Models

تُثبت هذه الورقة أن قدرات محددة في النماذج اللغوية الكبيرة تتركز بشكل كبير في مجموعات فرعية متفرقة من رؤوس الانتباه، مقدمةً منهجية قائمة على الاستشعار المضغوط لتحديد هذه المكونات بكفاءة، وكاشفةً عن مبدأ تنظيمي معياري له تداعيات كبيرة على قابلية تفسير النماذج، وتحريرها، وسلامتها.

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter2026-03-05
🤖 machine learning

Prompt-Dependent Ranking of Large Language Models with Uncertainty Quantification

تقترح هذه الورقة إطار عمل آمن لاتخاذ القرار لترتيب النماذج اللغوية الكبيرة، يستخدم نموذج "برادلي-تيري-لوس" السياقي لبناء مجموعات ثقة صالحة إحصائياً للترتيبات المعتمدة على المطالبات، مما يعالج قيود التقديرات النقطية من خلال قياس عدم اليقين والتمييز بين فروق الأداء ذات المعنى والضجيج.

Angel Rodrigo Avelar Menendez, Yufeng Liu, Xiaowu Dai2026-03-05
💬 NLP

Arapai: An Offline-First AI Chatbot Architecture for Low-Connectivity Educational Environments

تقدم هذه الورقة "أراباي" (Arapai)، وهي بنية برمجية لروبوت محادثة يعمل بالذكاء الاصطناعي يعتمد مبدأ العمل دون اتصال بالإنترنت أولاً، مما يتيح تعلماً مخصصاً ومتوافقاً مع المناهج الدراسية على الأجهزة ذات المواصفات المنخفضة والتي تعتمد على المعالج فقط دون الحاجة للاتصال بالإنترنت، وبالتالي معالجة التفاوتات الرقمية وتعزيز المرونة التعليمية في البيئات محدودة الموارد.

Joseph Walusimbi, Ann Move Oguti, Joshua Benjamin Ssentongo, Keith Ainebyona2026-03-05