🤖 AI

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

تقدم هذه الورقة البحثية GTA، وهو إطار عمل قابل للتوسع يقوم تلقائياً بتوليد مهام لوكلاء الويب متعددة الخطوات وواقعية مع مسارات قابلة للتنفيذ، وذلك من خلال دمج الزحف، والتوليد القائم على الاسترجاع، والتحقق الآلي للتغلب على قيود المعايير المرجعية الحالية وتمكين التدريب والتقييم القويين.

Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu2026-05-29
💻 computer science

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

تقدم هذه الورقة إطار عمل AgentREVEAL وHarmURLBench لتوضيح أن الاسترجاع الويب في وكلاء النماذج اللغوية الكبيرة (LLM agents) يؤدي إلى تدهور المحاذاة الأمنية من خلال تضخيم الامتثال الضار عبر كل من التكامل أحادي الخطوة و"مفارقة المصدر الآمن" (Safe Source Paradox)، مما يكشف عن مقايضة أساسية بين السلامة والمنفعة حيث تعمل ذات الصلة التي تجعل الاسترجاع مفيداً كعامل ضعف في الوقت نفسه.

Aditya Nawal, Manit Baser, Mohan Gurusamy2026-05-29
🤖 AI

Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI

تقترح هذه الورقة طبقة قرار مدفوعة بالذكاء الاصطناعي وقابلة للتفسير، تعمل على تحديد المتعلمين المنعزلين وتحديد أولويات مواضيع المساق من خلال دمج التقارير الذاتية للطلاب، والصعوبات الملحوظة، ومخاوف المعلمين دون الاعتماد على النتائج الدرجية، مما يثبت فعاليتها في التوافق مع رؤى المحاضرين وكشف الطلاب المعرضين للخطر في مساق دراسات عليا في علوم الحاسوب.

Junsoo Park, Youssef Medhat, Htet Phyo Wai, Ploy Thajchayapong, Ashok K. Goel2026-05-29
💻 computer science

Wait! There's a Way Out: A Decision Mechanism for Forecasting Conversational Derailment

تقترح هذه الورقة آلية قرار مبتكرة للتنبؤ بانحراف المحادثة تعمل على فصل إطلاق التنبيه عن تقدير الاحتمالية عبر استخدام عمليات محاكاة استشرافية لتأجيل التنبيهات عندما يكون التعافي محتملاً، مما يقلل بشكل كبير من الإيجابيات الكاذبة دون التضحية بالدقة.

Laerdon Kim, Vivian Nguyen, Cristian Danescu-Niculescu-Mizil2026-05-29
💻 computer science

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

تقدم هذه الورقة مفهوم "الهوية الضمنية" لتوحيد واستعراض تقنيات بصمة وتوسيم النماذج اللغوية الكبيرة، مقترحةً تصنيفاً شاملاً قائماً على دورة الحياة وإطار تقييم لمعالجة الحالة المجزأة لحماية الأصول والتحقق من المصدر عبر مجموعات البيانات والنماذج والمحتوى المُنشأ.

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo2026-05-29
💻 computer science

Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits

تحلل هذه الورقة الانتظامات التجريبية للبحث التطوري الموجه بنماذج اللغات الكبيرة لاقتراح BaSE، وهو خوارزمية "المتعدد الأذرع" (multi-armed bandit) التي تخصص الحوسبة ديناميكيًا عبر مسارات متوازية، محققةً تحسنًا بنسبة 12.3% في متوسط اللياقة وتعزيزًا للموثوقية مقارنة باستراتيجيات العمق والاتساع التقليدية دون تعديل النموذج الأساسي أو المطالبات.

Sixue Xing, Haoyu He, Kerui Wu, Zhuo Yang, Haozheng Luo, Tianfan Fu, Aarthy Nagarajan2026-05-29
💻 computer science

Accommodation Goes Both Ways: Studying Linguistic Convergence Between Humans and Language Models

تكشف هذه الدراسة أن التكيف اللغوي في التفاعلات بين البشر والنماذج اللغوية الكبيرة يتسم بعدم التماثل، حيث تبالغ النماذج اللغوية في التقارب مع أساليب المستخدمين عبر لغات متعددة، بينما يتكيف البشر مع النماذج اللغوية الكبيرة بمعدلات تضاهي المحادثات البشرية-البشرية.

Terra Blevins2026-05-29
🤖 AI

GrepSeek: Training Search Agents for Direct Corpus Interaction

يقدم GrepSeek مسار تدريب ثنائي المراحل لوكيل بحث يتفاعل مباشرة مع مجموعات النصوص عبر أوامر صدفة (shell) قابلة للتنفيذ، محققاً أداءً هو الأفضل في فئته على معايير الإجابة على الأسئلة في النطاق المفتوح، مع تقديم بديل عملي وقابل للتوسع للأنظمة التقليدية القائمة على الاسترجاع.

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani2026-05-29
💻 computer science

Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk Decoding

تقدم الورقة البحثية ConSUM، وهو إطار عمل لإعادة الترتيب يعزز واقعية الملخصات المولدة من خلال الاستفيد من فك التشفير باستخدام تقليل مخاطر بايز الأدنى (Minimum Bayes Risk) لتحقيق التوازن بين الإجماع بين المخرجات المرشحة والاتساق مع المستند المصدر، محققاً أداءً فائقاً على الطرق الحالية.

Riza Setiawan Soetedjo, Yusuke Sakai, Hidetaka Kamigaito, Jingun Kwon, Manabu Okumura, Taro Watanabe2026-05-29
💻 computer science

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

تقدم هذه الورقة مجموعة بيانات محسنة للأسئلة والأجوبة لتقييم سلامة النماذج اللغوية الكبيرة فيما يتعلق بالأنشطة غير القانونية، وذلك من خلال البناء على مجموعة بيانات AnswerCarefully مع إضافة معلومات وطرق إنشاء ومعايير تقييم جديدة، مع استهداف نتائج مشروع JAI-Trust.

Kenji Imamura, Masao Ideuchi, Atsushi Fujita2026-05-29