💻 computer science

Learning Selective LLM Autonomy from Copilot Feedback in Enterprise Customer Support Workflows

تقدم هذه الورقة نظاماً مُطبقاً يستفيد من تعليقات المساعد البرمجي (copilot) وآثار التفاعل مع واجهة المستخدم لتدريب وكيل لغوي كبير انتقائي لأتمتة سير عمل دعم العملاء في المؤسسات، محققاً معدل أتمتة بنسبة 45% وانخفاضاً بنسبة 39% في وقت المعالجة مع الحفاظ على الجودة من خلال آلية امتناع قائمة على الثقة.

Nikita Borovkov, Elisei Rykov, Olga Tsymboi, Sergei Filimonov, Nikita Surnachev, Dmitry Bitman, Anatolii Potapov2026-04-28
💻 computer science

TSAssistant: A Human-in-the-Loop Agentic Framework for Automated Target Safety Assessment

يُعد TSAssistant إطار عمل متعدد الوكلاء يعتمد على وجود العنصر البشري في الحلقة، حيث يعمل على أتمتة صياغة تقارير تقييم سلامة الهدف من خلال تفكيك العملية إلى وكلاء فرعيين متخصصين ومستندين إلى الأدلة، مع السماح لعلماء السموم بتنقيح الأقسام بشكل تكراري والاحتفاظ بسلطة القرار النهائي.

Xiaochen Zheng, Zhiwen Jiang, Melanie Guerard, Klas Hatje, Tatyana Doktorova2026-04-28
💻 computer science

KOMBO: Korean Character Representations Based on the Combination Rules of Subcharacters

تقدم هذه الورقة البحثية KOMBO، وهو إطار عمل مبتكر للنماذج اللغوية الكورية المدربة مسبقاً، يستفيد من قواعد الجمع الفريدة لرموز الهانغل الفرعية كما هي محددة في كتاب "هونمين جونغ أوم" التاريخي، متفوقاً بذلك على النماذج الحالية الرائدة في عدة مهام لفهم اللغة الطبيعية من خلال التقاط السمات اللغوية للغة الكورية بشكل أفضل.

SungHo Kim, Juhyeong Park, Yeachan Kim, SangKeun Lee2026-04-28
🤖 machine learning

Representational Curvature Modulates Behavioral Uncertainty in Large Language Models

تُظهر هذه الورقة أن الانحناء الهندسي لمسار التمثيل الخاص بالنموذج —أي مدى "انحنائه" أثناء المعالجة— يرتبط ارتباطاً مباشراً ويمكن استخدامه لتعديل عدم اليقين التنبؤي (الاعتلاج) للنماذج اللغوية الكبيرة.

Jack King, Evelina Fedorenko, Eghbal A. Hosseini2026-04-28
🤖 machine learning

When to Commit? Towards Variable-Size Self-Contained Blocks for Discrete Diffusion Language Models

تقترح الورقة البحثية كتلًا ذات أحجام متغيرة ومكتفية ذاتيًا (VSB)، وهي طريقة لنماذج اللغة ذات الانتشار المنفصل تقوم باختيار حدود كتل فك التشفير المثلى عبر قياس التباعد بين التنبؤات التي تتم بوجود السياق المستقبلي وبدونه لضمان الاتساق التنبؤي ومنع الالتزام المبكر بالرموز.

Danny Wang, Ruihong Qiu, Zi Huang2026-04-28
💻 computer science

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

تقدم هذه الورقة تمثيل الجدولة-الهيكلية-المنطقية (SSL)، وهو إطار هيكلي مبتكر لمهارات الوكيل يعمل على فك الارتباط بين الجدولة والتنفيذ والأدلة المنطقية ليتفوق بشكل كبير على النماذج المرجعية القائمة على النصوص فقط في مهام اكتشاف المهارات وتقييم المخاطر.

Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu2026-04-28
💻 computer science

AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

يقدم AgentPulse إطار تقييم مستمر ومتعدد الإشارات يكمل الاختبارات المعيارية الثابتة من خلال تجميع البيانات اللحظية من مصادر التبني والمجتمع والنظام البيئي لتوفير تقييم شامل لأداء وكفاءة وكالة الذكاء الاصطناعي وتأثيرها في سيناريوهات النشر الفعلية.

Yuxuan Gao, Megan Wang, Yi Ling Yu2026-04-28
🔢 mathematics

Improving Robustness of Tabular Retrieval via Representational Stability

تحدد هذه الورقة أن تنسيقات تسلسل الجداول المختلفة (مثل CSV أو HTML) تسبب نتائج استرجاع غير متسقة، وتقترح طريقة لتحسين المتانة باستخدام تمثيلات متوسطة المركز (centroid-averaged representations) ومحول خفيف الوزن (lightweight adapter) لمحاذاة تضمينات التنسيق الواحد مع إشارة دلالية مستقرة وثابتة عبر التنسيقات.

Kushal Raj Bhandari, Adarsh Singh, Jianxi Gao, Soham Dan, Vivek Gupta2026-04-28
💻 computer science

Distilling Self-Consistency into Verbal Confidence: A Pre-Registered Negative Result and Post-Hoc Rescue on Gemma 3 4B

تفيد هذه الورقة بأنه بينما فشلت محاولة مسجلة مسبقاً لتقطير الاتساق الذاتي في الثقة اللفظية على نموذج Gemma 3 4B بسبب انهيار اعتلاج الملصقات، فإن تدريب الإنقاذ اللاحق على بيانات غير مصفاة نجح في ضغط إشارات الاتساق الذاتي عالية الدقة في قراءة تمريرة واحدة بمعدل AUROC2 بلغ 0.774، مما يثبت أن الحفاظ على اعتلاج الملصقات أمر بالغ الأهمية لمعايرة الثقة الفعالة.

Jon-Paul Cacioli2026-04-28
💻 computer science

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

تُثبت هذه الورقة أن تهيئة حكام النماذج اللغوية الكبيرة، ولا سيما صياغة الأوامر، تُعد مصدراً جوهرياً وغير مدروس سابقاً لتباين القياس في معايير السلامة، مما يتسبب في تحولات كبيرة في معدلات الاستجابات الضارة وعدم استقرار في تصنيفات سلامة النماذج.

Xinran Zhang2026-04-28