💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

تقدم الورقة البحثية ROK-FORTRESS، وهي معيار تقييم ثنائي اللغة يستخدم "مصفوفة إعادة الصياغة الإبداعية" (transcreation matrix) لتوضيح أن تقييمات الأمن القومي والسلامة العامة للنماذج اللغوية الكبيرة يجب أن تأخذ في الاعتبار التفاعلات المعقدة بين اللغة والسياق الجيوسياسي، حيث تفشل مناهج الترجمة فقط في استيعاب كيفية تأثير اللغة الكورية والارتباط بالواقع بشكل فريد على سلوكيات سلامة النماذج ومعدلات الرفض المفرط.

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho (…)2026-05-15
💻 computer science

Agentic Systems as Boosting Weak Reasoning Models

تُثبت هذه الورقة أن البحث القائم على لجنة مدعومة بمدقق يمكن أن يعزز بشكل كبير أداء نماذج الاستدلال الضعيفة لتضاهي الأنظمة الأقوى بكثير من خلال الاختيار الفعال للحلول الصحيحة من مقترحات متنوعة، بشرط استخدام إشارات سلامة محلية (مثل الاختبارات أو البراهين) للتغلب على أخطاء الاختيار ومحدودية التغطية.

Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti2026-05-15
💻 computer science

The Evaluation Trap: Benchmark Design as Theoretical Commitment

تقدم هذه الورقة "الإبستيماتيك" (Epistematics)، وهي منهجية تقييمية عليا لتدقيق معايير قياس الذكاء الاصطناعي للكشف عن كيفية تسبب الافتراضات النظرية غير المفحوصة في خلق فخاخ تقييمية ذاتية التعزيز تحجب الحدود الهيكلية، وتوضح تطبيقها من خلال نقد مقترح حديث يرسخ دون قصد نفس النموذج الذي يسعى لتعديله.

Theodore J Kalaitzidis2026-05-15✓ Author reviewed
💻 computer science

Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations

تقدم هذه الورقة البحثية "الاستمرارية المرتكزة" (Grounded Continuation)، وهو متحقق من صحة وقت التشغيل يعمل في زمن خطي، يقوم ببناء رسم بياني صريح للتبعية باستخدام المنطق الرمزي وعمليات التحديث المصنفة بواسطة النماذج اللغوية الكبيرة للكشف عن الادعاءات غير المدعومة وسحبها في المحادثات الطويلة، وبذلك يتفوق على النماذج المرجعية القائمة على الاسترجاع في الدقة مع توفير ضمانات سلامة رسمية.

Qisong He, Yi Dong, Xiaowei Huang2026-05-15
💬 NLP

Thinking Ahead: Prospection-Guided Retrieval of Memory with Language Models

تقدم هذه الورقة البحثية إطار "الاسترجاع الموجه بالتطلع" (PGR)، وهو إطار عمل مبتكر يعزز التخصيص طويل الأمد في أنظمة الحوار عبر استخدام خطوات مستقبلية محاكات كمسابير استرجاع للكشف عن ذكريات المستخدم ذات الصلة التي تغفل عنها الطرق القياسية القائمة على التشابه، محققاً تحسناً ملحوظاً في دقة الاستدعاء وجودة الاستجابة في معيار "MemoryQuest" الجديد.

Harshita Chopra, Krishna Kant Chintalapudi, Suman Nath, Ryen W. White, Chirag Shah2026-05-15
💻 computer science

LLM-Based Robustness Testing of Microservice Applications: An Empirical Study

تُظهر هذه الدراسة التجريبية أن استراتيجية التلقين تؤثر بشكل كبير على تنوع وتغطية اختبارات المتانة المولدة بواسطة النماذج اللغوية الكبيرة لواجهات برمجة تطبيقات الخدمات المصغرة، مما يكشف أن نهج التعلم من أمثلة قليلة الموجه بالتصنيف يتفوق على كل من مجموعات النماذج الأكبر واللقنات الثابتة في كشف أنماط الفشل المتميزة.

Hrushitha Goud Tigulla, Marco Vieira2026-05-15
💻 computer science

SimPersona: Learning Discrete Buyer Personas from Raw Clickstreams for Grounded E-Commerce Agents

تُعد SimPersona إطار عمل مبتكر يتعلم شخصيات مشترين منفصلة وقابلة للتفسير من بيانات تدفق النقرات الخام باستخدام نموذج VQ-VAE لتجذير وكلاء التجارة الإلكترونية القائمين على النماذج اللغوية الكبيرة في توزيعات سكانية واقعية، محققاً بذلك تفوقاً في التوافق مع معدلات التحويل والأداء الموجه نحو الأهداف مقارنة بالأساليب الحالية دون الحاجة إلى إعادة التدريب أو هندسة الأوامر يدوياً.

Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ted Chaiwachirasak, Han Li, Lingyun Wang2026-05-15
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

تقدم الورقة البحثية ASH، وهو نظام وكيل ذاتي التحسين يتعلم سياسات تجسدية من فيديوهات الإنترنت غير المصنفة عبر الاستفادة من نموذج ديناميكيات عكسي لاستخراج الإشراف من إخفاقاته الخاصة، مما يمكنه من التعامل بنجاح مع المهام طويلة المدى في ألعاب معقدة مثل بوكيمون وزيلدا حيث تفشل النماذج المرجعية الحالية.

Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun2026-05-15
⚡ electrical engineering

PreFT: Prefill-only finetuning for efficient inference

تقدم هذه الورقة PreFT، وهو نهج ضبط دقيق يعتمد على مرحلة التعبئة المسبقة فقط (prefill-only) يقوم بالتخلص من المهايئات (adapters) بعد معالجة رموز الإدخال لتحسين إنتاجية الخدمة متعددة المستخدمين بشكل كبير مع حد أدنى من التأثير على أداء النموذج، مما يوفر مقايضة فائقة بين الدقة والإنتاجية مقارنة بطرق الضبط الدقيق التقليدية الموفرة للمعلمات.

Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu, Dhruv Pai, Ben Keigwin, Dan Jurafsky, Christopher Potts2026-05-15
🤖 machine learning

AudioMosaic: Contrastive Masked Audio Representation Learning

يُعد AudioMosaic إطار عمل جديد للتعلم الخاضع للإشراف ذاتياً بالتباين للصوت، يستخدم قناعاً زمنياً-ترددياً مهيكلاً لتوليد أزواج إيجابية بكفاءة، مما يُمكّن من تدريب تمثيلات على مستوى المتحدث عالية التمييز وقابلة للنقل تحقق أداءً رائداً عبر مختلف معايير الصوت ومهام الصوت واللغة.

Hanxun Huang, Qizhou Wang, Xingjun Ma, Cihang Xie, Christopher Leckie, Sarah Erfani2026-05-15