📊 statistics

In-Context Multi-Objective Optimization

تقدم الورقة البحثية TAMO، وهو سياسة قائمة على المحولات (transformer-based) ومستهلكة بالكامل (fully amortized)، تستفيد من التعلم داخل السياق (in-context learning) والتعلم التعزيزي (reinforcement learning) لإجراء تحسين شامل متعدد الأهداف للصندوق الأسود (multi-objective black-box optimization) بكفاءة، دون الحاجة إلى ملاءمة نماذج بديلة لكل مهمة (per-task surrogate fitting) أو هندسة دالة الاستحواذ (acquisition function engineering).

Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski2026-05-13
🤖 AI

Position: Universal Aesthetic Alignment Narrows Artistic Expression

تجادل ورقة الموقف هذه بأن الإفراط في مواءمة نماذج توليد الصور مع التفضيلات الجمالية العامة يقوض الاستقلالية الذاتية للمستخدم والتعددية الفنية من خلال معاقبة المخرجات "المناهضة للجمال" بشكل منهجي، حتى عندما تلتزم بدقة بالتعليمات الصريحة للمستخدم.

Wenqi Marshall Guo, Qingyun Qian, Khalad Hasan, Shan Du2026-05-13
🤖 AI

Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation

تقترح الورقة البحثية نظام Floorplan2Guide، وهو نظام ملاحة مدفوع بنماذج اللغات الكبيرة (LLM) للمكفوفين وضعاف البصر، يقوم بتحويل مخططات الطوابق إلى رسوم بيانية معرفية لتوليد تعليمات دقيقة، مما يثبت أن التعلم من أمثلة قليلة والاستدلال المكاني القائم على الرسوم البيانية يتفوقان بشكل كبير على الاستدلال البصري المباشر في تحسين دقة الملاحة.

Aydin Ayanzadeh, Tim Oates2026-05-13
💬 NLP

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

تقدم هذه الورقة RW-Post، وهو معيار مرجعي جديد قابل للتدقيق للتحقق من الحقائق متعدد الوسائط في العالم الحقيقي يربط منشورات وسائل التواصل الاجتماعي بالأدلة والمسارات الاستدلالية التي تحقق منها البشر، إلى جانب خط الأساس AgentFact، للكشف عن فجوات كبيرة في قدرة النماذج الحالية على ربط الادعاءات البصرية بالأدلة بأمانة.

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli2026-05-13
💬 NLP

Evaluating the Pre-Consultation Ability of LLMs using Diagnostic Guidelines

تقدم هذه الورقة EPAG، وهو إطار عمل ومجموعة بيانات مرجعية لتقييم قدرات نماذج اللغات الكبيرة في مرحلة ما قبل الاستشارة مقابل الإرشادات التشخيصية، مما يكشف أن النماذج الصغيرة مفتوحة المصدر والمعدلة بدقة يمكن أن تتفوق على النماذج الرائدة، وأن زيادة التاريخ المرضي لا تؤدي دائمًا إلى تحسين الدقة التشخيصية.

Jean Seo, Gibaeg Kim, Kihun Shin, Seungseop Lim, Hyunkyung Lee, Wooseok Han, Jongwon Lee, Eunho Yang2026-05-13
🤖 AI

One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization

تقدم هذه الورقة نظاماً قائماً على النماذج اللغوية الكبيرة يقوم بتحويل المطالبات باللغة الطبيعية إلى إعدادات موازنة ديناميكية، مستفيداً من التعلم في السياق والضبط الدقيق بناءً على بيانات تجارب الاستماع للتفوق إحصائياً على النماذج المرجعية الثابتة في التكيف مع تفضيلات المستمعين والسياقات المتنوعة.

Ioannis Stylianou, Jon Francombe, Pablo Martinez-Nuevo, Sven Ewan Shepstone, Zheng-Hua Tan2026-05-13
🤖 AI

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

تقترح الورقة البحثية إطار عمل ThinkSafe، وهو إطار عمل للمحاذاة مع معايير السلامة ذاتي التوليد يلغي الحاجة إلى معلمين خارجيين من خلال الاستفيد من توزيع النموذج الخاص المفلتر بمعايير السلامة كهدف أمثل لـ KL، مما يعيد استعادة السلامة ويحافظ على قدرات الاستنتاج بتكلفة حوسبية أقل بكثير.

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang2026-05-13
🤖 AI

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

تقترح هذه الورقة KEPO، وهو إطار عمل لتحسين التفضيل المعزز بالمعرفة يعمل على تحسين الاستدلال متعدد الوسائط في مهام السؤال والجواب المرئي الطبي (Medical VQA) من خلال الجمع بين التقطير داخل السياسة المعتمد على بوابة الجودة وبين الاستكشاف الموجه بالمعرفة للتغلب على عدم استقرار التدريب وإخفاقات الاستكشاف المتأصلة في التعلم التعزيزي القياسي.

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen2026-05-13
🤖 AI

Inference-Only Prompt Projection for Safe Text-to-Image Generation with TV Guarantees

تقدم هذه الورقة SPOT، وهو إطار عمل يعمل أثناء مرحلة الاستدلال يقوم باختيارياً بإسقاط المطالبات غير الآمنة نحو "مجموعة تاو الآمنة" (tau safe set) باستخدام نموذج لغوي كبير (LLM) ونموذج رؤية لغوي كبير (VLM) وقائي، وذلك لتقليل توليد الصور غير اللائقة بشكل كبير مع الحفاظ على سلوك المطالبات السليمة دون إعادة تدريب نموذج الانتشار.

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang2026-05-13
💬 NLP

Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation

تقدم هذه الورقة xMemory، وهو إطار عمل مبتكر لذاكرة الوكيل يعمل على تحسين تقنية RAG القياسية من خلال فصل سجلات التفاعل إلى مكونات قابلة لإعادة الاستخدام وتجميعها هرمياً لتمكين الاسترجاع من الأعلى إلى الأسفل، مما يقلل من التكرار مع الحفاظ على التفاصيل الجوهرية، وبالتالي يعزز جودة الإجابة وكفاءة الاستدلال.

Zhanghao Hu, Qinglin Zhu, Runcong Zhao, Di Liang, Hanqi Yan, Yulan He, Lin Gui2026-05-13