💬 NLP

Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits

تقدم الورقة البحثية PCNET، وهي طريقة قائمة على الدوائر الاحتمالية تكتشف الهلوسة كشذوذ هندسي في التدفق المتبقي للنموذج اللغوي الكبير لتمكين التدخل الديناميكي المستهدف عبر PC-LDCD، مما يقلل من الهلوسة بشكل كبير مع الحفاظ على سلامة التوليدات الصحيحة دون الحاجة إلى تعديل أوزان النموذج أو استخدام أدوات تحقق خارجية.

Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca2026-05-08
💬 NLP

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

يُعد TheraAgent إطار عمل وكيلِيّاً ذاتي التحسين يعمل على تعزيز تخطيط العلاج عبر استبدال التوليد لمرة واحدة بواسطة النماذج اللغوية الكبيرة بمسار تكراري من (التوليد-التحكيم-التحسين)، مستخدماً وحدة TheraJudge متخصصة لتحقيق مستويات رائدة في الدقة والاكتمال والسلامة تتجاوز أطباء بشريين في التقييمات الخبيرة.

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu2026-05-08
💬 NLP

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

تقترح هذه الورقة "تنظيم عنق زجاجة السلامة" (SBR)، وهو آلية دفاعية مبتكرة تعمل على تثبيت طبقة فك التشفيد (unembedding layer) بنماذج متوافقة مع معايير السلامة، مما يؤدي بفعالية إلى تحييد هجمات الضبط الدقيق الضارة من خلال استغلال العنق الزجاجي الهندسي للحفاظ على السلامة دون المساس بأداء المهام الحميدة.

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao2026-05-08
💬 NLP

PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue

تُعد PersonaKit منصة ويب مفتوحة المصدر ومنخفضة زمن الاستجابة، تُمكّن الباحثين من النمذجة الأولية السريعة وتقييم استراتيجيات متنوعة لتبادل الأدوار الخاصة بالشخصيات في أنظمة الحوار الصوتي ثنائية الاتجاه (full-duplex) من خلال إعدادات JSON بديهية واختبارات A/B مؤتمتة.

Hyunbae Jeon, Jinho D. Choi2026-05-08
💬 NLP

More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs

تقارن هذه الدراسة بين جيلين من النماذج اللغوية الكبيرة مقابل النصوص الإخبارية التي كتبها بشر باستخدام صيغة HPSG ومقاييس التنوع، مما يكشف أنه بينما تظل الكتابة البشرية مستقرة، تُظهر النماذج الأحدث المضبوطة للتعليمات انخفاضاً ملحوظاً في التنوع التركيبي والمعجمي، مما يشير إلى احتمال ضيق النطاق التعبيري رغم تحسن التماسك.

Adrián Gude, Roi Santos-Ríos, Francis Bond, Dan Flickinger, Carlos Gómez-Rodríguez, Olga Zamaraeva2026-05-08
💬 NLP

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

تقدم هذه الورقة طريقة بحث قائمة على الجدة تعتمد على "شجرة الأفكار" (Tree-of-Thought)، والتي تستفيد من المعرفة المسبقة للنماذج اللغوية الكبيرة (LLM) لقياس وتقليم مسارات الاستدلال الزائدة، مما يؤدي إلى تحسين الكفاءة وتقليل تكاليف الرموز (tokens) في مهام التخطيط والاستدلال القائمة على اللغة.

Leon Hamm, Zlatan Ajanovic2026-05-08
💬 NLP

Milestone-Guided Policy Learning for Long-Horizon Language Agents

تقدم الورقة البحثية BEACON، وهو إطار عمل لتعلم السياسات الموجهة بالمعالم (milestone-guided)، والذي يعالج مشكلتي سوء تخصيص الائتمان وعدم كفاءة العينات في الوكلاء اللغويين ذوي الأفق الطويل من خلال تقسيم المسارات عند حدود المعالم وتطبيق تقدير الميزة ثنائي النطاق، محققاً أداءً هو الأفضل حالياً في اختبارات قياسية مثل ALFWorld.

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongli (…)2026-05-08
💬 NLP

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

تقدم هذه الورقة "تخطيط محفظة مونت كارلو" (MCPP)، وهو مخطط خفيف الوزن ذو حلقة مغلقة يعمل على تحسين احتمالية إكمال سير العمل الوكيل ضمن قيود صريحة للميزانية والموعد النهائي من خلال التخصيص الديناميكي للنماذج والعينات المتوازية بناءً على النتائج المحاكاتية.

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan (…)2026-05-08
💬 NLP

IRC-Bench: Recognizing Entities from Contextual Cues in First-Person Reminiscences

تقدم هذه الورقة IRC-Bench، وهو معيار مرجعي جديد صُمم لتقييم التعرف على الكيانات المشار إليها ضمنياً في سرديات الاستذكار بضمير المتكلم من خلال اختبار النماذج على استنتاج الأهداف من خلال أدلة سياقية مبعثرة بدلاً من التلميحات الصريحة، حيث أظهرت النتائج أن نموذج Llama 3.1 8B المعدل بتقنية QLoRA يتفوق في بيئات العالم المفتوح بينما يتفوق نموذج DPR المضبوط بدقة في استرجاع العالم المغلق.

Yehudit Aperstein, Eden Moran, Alexander Apartsin2026-05-08
📊 statistics

Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes

توضح هذه المقالة أن "آلية المقلاع" (slingshot mechanism)، التي تتميز بزيادات دورية حادة في الخسارة ونمو سريع في المعلمات أثناء التدريب طويل الأمد، لا تمثل ديناميكية تحسين جوهرية، بل هي بالأحرى نتاج رقمي ناجم عن الحسابات بنظام الفاصلة العائمة منخفض الدقة، حيث تؤدي أخطاء التقريب في التدرجات إلى انتهاك شرط المجموع الصفري وتؤدي إلى حلقة تغذية راجعة إيجابية تُعرف باسم تضخم الميزات الرقمي (NFI).

Liu Hanqing, Jianjun Cao, Yuanze Li, Zijian Zhou2026-05-08