💬 NLP

YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents

تقدم هذه الورقة YIELD، وهي مجموعة بيانات واسعة النطاق تضم 2,281 حواراً تم الحصول عليها من مصادر أخلاقية وإطار تقييم مقابل يعتمد على عملية اتخاذ قرار ماركوف لآلية التنبؤ بقرار ذي أفق محدد (finite-horizon POMDP)، والمصممة لتطوير وتقييم وكلاء استقاء المعلومات (IEAs) الذين يعملون بشكل استباقي لجمع المعلومات من أجل أهداف مؤسسية.

Victor De Lima, Grace Hui Yang2026-04-14
🤖 AI

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

تستقصي هذه الورقة بشكل منهجي تأثير تطور النماذج اللغوية الكبيرة الأساسية (من LLaMA-1 إلى LLaMA-3) على نماذج الرؤية واللغة من خلال ضبط المتغيرات الأخرى، كاشفةً أن النماذج الأساسية الأحدث لا تُحسن الأداء بشكل شامل، بل تغير بدلاً من ذلك السلوكيات الخاصة بمهام معينة، مثل حل أسئلة بصرية مختلفة بثقة أكثر دقة، بينما تقدم فوائد محدودة للمهام التي تعتمد أساساً على الفهم البصري.

Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik2026-04-14
💬 NLP

When Verification Fails: How Compositionally Infeasible Claims Escape Rejection

تكشف هذه الورقة أن معايير التحقق من الادعاءات العلمية الحالية تفشل في التمييز بين الاستدلال الصارم وبين اختصار "القيد البارز" لأنها تختبر فقط الاضطرابات أحادية العنصر، مما يؤدي بالنماذج باستمرار إلى قبول الادعاءات غير الممكنة تركيبياً حيث تتعارض القيود غير البارزة رغم دعم القيد البارز.

Muxin Liu, Delip Rao, Grace Kim, Chris Callison-Burch2026-04-14
💬 NLP

When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies

تُثبت هذه الورقة أنه في حين يمكن لحلقة تحسين تلقائي للمطالبات أن تُمكّن نموذج لغة كبير (LLM) مجمد من استخراج سمات تنبؤية من النصوص المالية تعمل على تحسين وكلاء التداول القائمين على التعلم التعزيزي في الأنظمة المستقرة، إلا أن هذه السمات غالباً ما تفشل في تعزيز المتانة أثناء الصدمات الاقتصادية الكلية، مما يكشف عن فجوة حرجة بين الصلاحية على مستوى السمات والأداء على مستوى السياسة تحت تأثير تغير التوزيعات.

Zhengzhe Yang2026-04-14
🤖 machine learning

K-Way Energy Probes for Metacognition Reduce to Softmax in Discriminative Predictive Coding Networks

تقدم هذه الورقة نتيجة سلبية تثبت أن مجسات الطاقة من نوع K-way في شبكات الترميز التنبؤي التمييزية القياسية لا توفر إشارة أغنى من دالة softmax، حيث أنها تختزل رياضياً إلى دالة رتيبة لـ softmax margin وتؤدي تجريبياً أداءً أدنى منها عبر مختلف ظروف التدريب والاستدلال على مجموعة بيانات CIFAR-10.

Jon-Paul Cacioli2026-04-14
🤖 AI

Min-kk Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics

تقدم هذه الورقة البحثية استراتيجية "Min-kk Sampling"، وهي استراتيجية فك تشفير مبتكرة تحقق ثباتاً صارماً في درجة الحرارة (temperature invariance) وتحسناً في جودة النص من خلال قطع توزيع اللوجيت (logit distribution) ديناميكياً بناءً على "المنحدرات الدلالية" (semantic cliffs) المحلية بدلاً من الإحصاءات العالمية أو عتبات الاحتمالية الثابتة.

Yuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang2026-04-14
💬 NLP

Uncertainty-Aware Web-Conditioned Scientific Fact-Checking

تقدم هذه الورقة إطار عمل للتحقق من الحقائق العلمية يعتمد على الويب ومدرك لعدم اليقين، حيث يقوم بتفكيك الادعاءات إلى حقائق ذرية، والتحقق منها مقابل السياق المحلي، واستدعاء عمليات البحث عبر الويب بشكل انتقائي فقط في حالات عدم اليقين لتحقيق تحقق مفسر، وفعال من حيث التكلفة، وعالي الدقة في المجالات المتخصصة.

Ashwin Vinod, Katrin Erk2026-04-14
💬 NLP

Shared Emotion Geometry Across Small Language Models: A Cross-Architecture Study of Representation, Behavior, and Methodological Confounds

تكشف هذه الدراسة أن نماذج اللغات الصغيرة المتنوعة تشترك في تمثيل هندسي متسق للغاية لـ 21 عاطفة بغض النظر عن الاختلافات السلوكية أو ضبط التعلم المعزز من التغذية الراجحة البشرية (RLHF)، شريطة أن تكون النماذج ناضجة، بينما تكشف أيضًا عن مغالطات منهجية حرجة في الأبحاث السابقة فيما يتعلق بأنماط الفهم مقابل التوليد وآثار الدقة.

Jihoon Jeong2026-04-14
💬 NLP

Use of AI Tools: Guidelines to Maintain Academic Integrity in Computing Colleges

تتناول هذه الورقة التحديات والفرص المتاحة لدمج أدوات الذكاء الاصطناعي في تعليم الحوسبة من خلال تصنيف أنواع التقييم، واقتراح إرشادات عامة وخاصة للموازنة بين الفوائد التربوية والنزاهة الأكاديمية، وتقديم نموذج رياضي رسمي لتقييم تقييمات الطلاب في ظل وجود المساعدة من الذكاء الاصطناعي.

Hatem M. El-boghdadi, Toqeer Ali Syed, Ali Akarma, Qamar Wali2026-04-14
💬 NLP

DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning

تُعد DeCoVec إطار عمل غير تدريبي وغير جراحي يقوم ببناء ناقلات المهام في فضاء فك التشفير من خلال الاستفيد من الفرق بين توزيعات الـ "لوجيت" (logit) لعدد قليل من الأمثلة (few-shot) وبين حالة عدم وجود أمثلة (zero-shot) لتوجيه النماذج اللغوية الكبيرة، مما يحقق تحسينات كبيرة في الدقة والمتانة دون الحاجة إلى ضبط دقيق أو تكاليف إضافية للرموز (tokens).

Feiyang Li, Yile Wang2026-04-14