📊 statistics

Don't Throw Away Your Beams: Improving Consistency-based Uncertainties in LLMs via Beam Search

تقترح هذه الورقة استخدام البحث الشعاعي (beam search) بدلاً من أخذ العينات متعدد الحدود (multinomial sampling) لتوليد المرشحين لتقدير عدم اليقين القائم على الاتساق في النماذج اللغوية الكبيرة، مما يثبت أن هذا النهج يقلل التباين ويحقق أداءً رائدًا في مهام الأسئلة والأجوبة قصيرة الصيغة.

Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sac (…)2026-05-08
💬 NLP

How important is Recall for Measuring Retrieval Quality?

تتناول هذه الورقة تحدي قياس جودة الاسترجاع في البيئات الواقعية حيث يكون العدد الإجمالي للوثائق ذات الصلة غير معروف، وذلك من خلال تقييم الاستراتيجيات الحالية مقابل أحكام الاستجابة القائمة على النماذج اللغوية الكبيرة، واقتراح مقياس جديد وفعال لا يتطلب معرفة بمجموعة الاستدعاء الكاملة.

Shelly Schwartz, Oleg Vasilyev, Randy Sawaya2026-05-08
💬 NLP

Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

تقدم هذه الورقة مجموعة بيانات "Chameleon" لتوضيح أن تفاعلات المستخدمين مع النماذج اللغوية مدفوعة في الغالب بالحالة السياقية بدلاً من السمات الثابتة، مما يكشف أن النماذج الحالية "عمياء عن الحالة" بينما تتفاعل نماذج المكافأة بشكل غير متسق مع حالات المستخدمين.

Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near2026-05-08
💬 NLP

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

إنّ LLM-AutoDP هو إطار عمل مبتكر يسخّر وكلاء النماذج اللغوية الكبيرة (LLM agents) لتوليد استراتيجيات معالجة البيانات وتحسينها بشكل تكراري لضبط النماذج بدقة، وذلك دون وصول مباشر من البشر إلى البيانات الحساسة، محققاً نتائج عالية الجودة ومقللاً وقت البحث بشكل كبير من خلال تقنيات تسريع متخصصة.

Wei Huang, Anda Cheng, Yinggui Wang, Lei Wang, Tao Wei2026-05-08
💬 NLP

Leviathan: Decoupling Input and Output Representations in Language Models

تقدم الورقة البحثية "ليفياثان" (Leviathan)، وهي بنية "ترانسفورمر" (Transformer) تعمل على فصل تمثيلات المدخلات عن المخرجات من خلال استبدال مصفوفة التضمين المترابطة القياسية بترميز متجهي للتضمين المتعلم (LEV)، مما يحقق تحسينات ملحوظة في أداء نمذجة اللغة ومعايير الاختبار اللاحقة مع حد أدنى من الزيادة في عدد المعلمات.

Reza T. Batley, Sourav Saha2026-05-08
💬 NLP

Monotonic Reference-Free Refinement for Autoformalization

تقدم هذه الورقة إطار عمل للتحسين الرتيب التكراري غير المعتمد على مرجع للتحويل التلقائي للنظريات الكاملة، والذي يستفيد من التغذية الراجعة المتكاملة من مبرهنات النظريات وحكام النماذج اللغوية الكبيرة لتحسين الصلاحية الصورية، والحفاظ المنطقي، والاتساق الرياضي، والجودة الصورية في آن واحد، محققاً أداءً هو الأفضل في مجاله على معايير miniF2F وProofNet دون الحاجة إلى بيانات الحقيقة الأرضية أو تدخل بشري.

Lan Zhang, Marco Valentino, André Freitas2026-05-08
💬 NLP

CAMEL: Confidence-Gated Reflection for Reward Modeling

يُعد CAMEL إطار عمل للتأمل القائم على الثقة يجمع بين قرارات التفضيل الفعالة أحادية الرمز مع التصحيح الذاتي الانتقائي المدفوع بالتعلم التعزيزي للحالات منخفضة الثقة، مما يحقق دقة هي الأفضل في مجال نمذجة المكافأة مع عدد أقل بكثير من المعلمات ونسبة دقة إلى كفاءة متفوقة.

Zirui Zhu, Hailun Xu, Yang Luo, Yong Liu, Kanchan Sarkar, Kun Xu, Yang You2026-05-08
💬 NLP

PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning

تقدم هذه الورقة PulseLM، وهو عبارة عن مجموعة بيانات مرجعية ونموذج تأسيسي واسع النطاق يضم أكثر من مليون مقطع من إشارات PPG و2.5 مليون زوج من الأسئلة والأجوبة التي تجسر الفجوة بين الموجات الفسيولوجية الخام واللغة الطبيعية لتمكين التعلم متعدد الوسائط، والتعميم، والتقييم المعياري لنماذج الذكاء الاصطناعي القائمة على إشارات PPG.

Hung Manh Pham, Jinyang Wu, Xiao Ma, Yiming Zhang, Yixin Xu, Aaqib Saeed, Bin Zhu, Zhou Pan, Dong Ma2026-05-08
🤖 machine learning

Data-Driven Variational Basis Learning Beyond Neural Networks: A Non-Neural Framework for Adaptive Basis Discovery

تقدم هذه الورقة "تعلم الأساسات التبايني القائم على البيانات" (DVBL)، وهو إطار عمل غير عصبي يتعلم دوال أساس تفسيرية ومتكيفة مع البيانات من خلال التحسين التبايني، مما يوفر بديلاً شفافاً رياضياً للشبكات العصبية مع تقديم ضمانات صارمة بشأن الوجود والتقارب والقابلية لتحديد الهوية.

Andrew Kiruluta2026-05-08
💬 NLP

AdaGATE: Adaptive Gap-Aware Token-Efficient Evidence Assembly for Multi-Hop Retrieval-Augmented Generation

يُعد AdaGATE متحكماً في الأدلة، لا يتطلب تدريباً وكفؤاً في استهلاك الرموز (tokens)، لعمليات التوليد المعزز بالاسترجاع متعدد الخطوات، حيث يصيغ عملية اختيار الأدلة كمسألة إصلاح مدركة للفجوات، محققاً بذلك متانة وأداءً فائقين في ظروف الاسترجاع المشوبة بالضجيج أو التكرار مقارنة بالطرق الحالية.

Yilin Guo, Yinshan Wang, Yixuan Wang2026-05-08