💬 NLP

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

تُظهر هذه الورقة أنه في حين أن الضبط الدقيق للنماذج اللغوية الكبيرة على المقالات الطويلة يعمل على تثبيت استجابات شخصيتها تجاه تغيرات المطالبات، إلا أنه يفشل في استحثاث سمات "الخمس الكبرى" المستهدفة بدقة من المقالات غير الموجهة، مما يسلط الضوء على الحاجة إلى مجموعات بيانات قائمة على السيناريوهات أو استقصاء تفاعلي من أجل استحثاث دقيق للشخصية.

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé2026-05-19
💻 computer science

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts

تكشف ورقة "PARALLAX" البحثية أن الكثير من التقدم المُبلغ عنه في اكتشاف الهلوسة في النماذج اللغوية الكبيرة هو في الواقع نتاج لعيوب في تصميم الاختبارات المعيارية حيث تكون الإجابات الصحيحة مضمنة داخل المطالبات، مما يثبت أن المسبارات الخاضعة للإشراف فقط على الحالات المخفية للطبقات العليا مثل SAPLMA وDRIFT هي التي تحافظ على قدرات اكتشاف حقيقية عندما يتم التحكم في هذه العيوب.

Khizar Hussain, Murat Kantarcioglu2026-05-19
💻 computer science

Agentic AI Translate: An Agentic Translator Prototype for Translation as Communication Design

يقدم هذا البحث "Agentic AI Translate"، وهو نظام أولي يعيد تعريف الترجمة بوصفها تصميماً للتواصل عبر استبدال نموذج (نص داخل/نص خارج) التقليدي بدورة وكيلة رباعية المراحل ومرحلة توليد موجز تفاعلية قائمة على نظرية "السكوبوس" (Skopos theory)، مما يعمل على تفعيل الأطروحة القائلة بأن الميتا-لغة الخاصة بدراسات الترجمة تعمل ككود تعليمي للذكاء الاصطناعي التوليدي.

Masaru Yamada2026-05-19
💻 computer science

Scale Determines Whether Language Models Organize Representation Geometry for Prediction

تقدم هذه الورقة "Subspace PGA" لتكشف أنه في حين أن هندسة تمثيل النموذج اللغوي منظمة من أجل التنبؤ، فإن النماذج الصغيرة تفقد هذا التوافق في الطبقات اللاحقة بسبب مقايضة في السعة تحجبها الاتجاهات المهيمنة، بينما تحافظ النماذج الكبيرة عليه طوال عملية التدريب.

Weilun Xu2026-05-19
💬 NLP

ACIL: Auto Chain of Thoughts for In-Context Learning

تقدم هذه الورقة Auto-CoT، وهو إطار عمل يعزز التعلم في السياق للنماذج اللغوية الكبيرة من خلال التوليد والانتخاب التلقائي لسلاسل استدلال عالية الجودة لبناء نماذج توضيحية مهيكلة، مما يحسن الأداء بشكل كبير في مهام الاستدلال المعقدة متعددة الخطوات.

Rui Chu2026-05-19
💻 computer science

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

تقدم الورقة البحثية HEED، وهي طريقة تقطير خالية من التدريب تستخدم محاذاة البواقي الموزونة بالكثافة لإعطاء الأولوية لقطع الصور ذات المعلومات العالية، مما يعالج الانخفاض الكبير في الأداء في مهام التعرف الضوئي على الحروف (OCR) والمهام المستندية الملحوظ عند تقطير النماذج الرؤية-اللغوية الكبيرة إلى بنيات هجينة فعالة، مع تحقيق دقة تضاهي دقة النموذج المعلم مع مكاسب كبيرة في الذاكرة والإنتاجية.

Yihao Liang, Niraj K. Jha2026-05-19
💬 NLP

The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning

تقدم هذه الورقة البحثية "التوطين التوقعي المضاد"، وهي طريقة قابلة للتوسع لتحديد اللحظة الدقيقة التي تلتزم فيها النماذج اللغوية بالخداع ضمن مسارات استدلالها، كاشفةً أن هذا الالتزام مدفوع بديناميكيات عامة تعتمد على الانتباه وليس بمجرد إشارات معجمية سطحية، وأنه يمكن كبحه سببياً بواسطة مجموعة فرعية صغيرة من رؤوس الانتباه.

Scott Merrill, Shashank Srivastava2026-05-19
💻 computer science

Responsible Agentic AI Requires Explicit Provenance

تجادل هذه الورقة بأن إرساء أصلٍ صريح، وقابل للقياس، وقابل للتتبع عبر دورة حياة الذكاء الاصطناجي الوكيل الكاملة هو المتطلب الأساسي لجعل المسؤولية قابلة للحوسبة والتنفيذ، مما يعالج عجز الثقة الحالي الناجم عن عدم القدرة على تحديد المساءلة عن الأضرار في التكوينات الوكيلية المعقدة متعددة الأطراف.

Jinwei Hu, Xinmiao Huang, Qisong He, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
💻 computer science

OpenJarvis: Personal AI, On Personal Devices

يقدم OpenJarvis بنية ذكاء اصطناعي شخصي مفككة ومعرفة بالأنواع، تستفيد من البحث الموجه بنماذج اللغات الكبيرة (LLM) في المواصفات لتحسين خمسة عناصر أولية مستقلة، مما يمكّن الأنظمة التي تعمل على الأجهزة من مضاهاة دقة مستوى السحابة مع تقليل تكاليف واجهة برمجة التطبيقات وزمن الاستجابة بشكل جذري.

Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, And (…)2026-05-19
💬 NLP

Why Do Safety Guardrails Degrade Across Languages?

تقدم هذه الورقة إطار عمل لنظرية الاستجابة للمفردات متعدد المجموعات لفك الارتباط وتحليل العوامل المتميزة التي تدفع تدهور السلامة في النماذج اللغوية الكبيرة عبر اللغات، كاشفةً أن إخفاقات السلامة هي في الأساس أحادية البعد، وغالباً ما تكون أكثر شدة في اللغة الإنجليزية منها في اللغات ذات الموارد المنخفضة، وتتأثر بشكل كبير بالفجوات العابرة للغات والخاصة بالنماذج التحفيزية والمتعلقة بالأذى الجسدي والتفاوتات الثقافية بدلاً من مجرد جودة الترجمة.

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo2026-05-19