🤖 AI

Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning

تقدم هذه الورقة البحثية "المعايرة الخاضعة للإشراف" (Supervised Calibration - SC)، وهي إطار عمل لتقليل الخسارة يعمل على تعزيز التعلم في السياق (In-Context Learning) في النماذج اللغوية الكبيرة من خلال تعلم تحويلات تآلفية مثلى لكل فئة لتصحيح الانحيازات المنهجية وتغيير اتجاهات حدود القرار، مما يحقق أداءً رائدًا عبر نماذج وبيانات متعددة.

Korel Gundem, Juncheng Dong, Dennis Zhang, Vahid Tarokh, Zhengling Qi2026-03-05
💬 NLP

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

تتقصى هذه الورقة كيف تعتمد نماذج التفضيل بشكل مفرط على سمات سطحية مثل الطول والأسلوب بدلاً من الجودة الجوهرية، وتعمل على قياس هذا الخلل في المعايرة مقابل التفضيلات البشرية، وتُبين أن طريقة تعزيز البيانات بأسلوب واقعي مضاد تخفف بفعالية من هذه الانحيازات مع الحفاظ على الأداء العام.

Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi, Mark Yatskar2026-03-05
🤖 machine learning

Context Biasing for Pronunciation-Orthography Mismatch in Automatic Speech Recognition

تقترح هذه الورقة طريقة جديدة للتحيز السياقي للتعرف التلقائي على الكلام تستفيد من التصحيحات التي يقدمها المستخدم في الوقت الفعلي لأخطاء الاستبدال لمعالجة عدم التطابق بين النطق والتهجئة بفعالية، محققةً تحسناً نسبياً يتراوح بين 22% و34% في معدلات خطأ الكلمات المتحيزة دون المساس بأداء النظام العام.

Christian Huber, Alexander Waibel2026-03-05
🤖 AI

UQLM: A Python Package for Uncertainty Quantification in Large Language Models

تقدم الورقة البحثية حزمة UQLM، وهي حزمة برمجية بلغة بايثون تستفيد من تقنيات قياس عدم اليقين الحديثة لتوليد درجات ثقة للكشف عن الهلوسة وتعزيز موثوقية مخرجات النماذج اللغوية الكبيرة.

Dylan Bouchard, Mohit Singh Chauhan, David Skarbrevik, Ho-Kyeong Ra, Viren Bajaj, Zeya Ahmad2026-03-05
🤖 AI

From Ambiguity to Accuracy: The Transformative Effect of Coreference Resolution on Retrieval-Augmented Generation systems

تُظهر هذه الدراسة أن دمج عملية حل الإحالة المرجعية (coreference resolution) في أنظمة التوليد المعزز بالاسترجاع (RAG) يعزز بشكل كبير من صلة الاسترجاع وأداء الإجابة على الأسئلة، لا سيما بالنسبة للنماذج اللغوية الصغيرة، وذلك من خلال حل غموض الكيانات الذي قد يعيق الفهم السياقي بخلاف ذلك.

Youngjoon Jang, Seongtae Hong, Junyoung Son, Sungjin Park, Chanjun Park, Heuiseok Lim2026-03-05
🤖 AI

Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition

تستخدم هذه الورقة تقنيات التفسير في مهمة الجمع بزيادة واحد (off-by-one) لتكشف أن النماذج اللغوية الكبيرة تحقق تعميماً على مستوى المهمة من خلال آلية "استقراء الدوال" القابلة لإعادة الاستخدام، حيث تتعاون رؤوس انتباه متعددة لتعلم وتركيب دوال مجردة لحل مشكلات غير مرئية.

Qinyuan Ye, Robin Jia, Xiang Ren2026-03-05
🤖 AI

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

تقدم الورقة البحثية Text2VLM، وهو مسار مبتكر يحول مجموعات البيانات النصية فقط إلى مطالبات متعددة الوسائط لتقييم وكشف الحساسية المتزايدة لنماذج اللغة المرئية مفتوحة المصدر تجاه هجمات حقن المطالبات الطباعية، مما يعزز تطوير آليات سلامة قوية للذكاء الاصطناعي متعدد الوسائط.

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas2026-03-05
🤖 AI

WebDS: An End-to-End Benchmark for Web-based Data Science

تقدم هذه الورقة WebDS، وهو أول معيار شامل (end-to-end) لعلوم البيانات القائمة على الويب، والذي يضم 870 مهمة معقدة ومتعددة الخطوات عبر مواقع إلكترونية متنوعة، مما يكشف عن فجوات أداء كبيرة بين وكلاء النماذج اللغوية الكبيرة الحاليين والقدرات البشرية في مجالات الحصول على البيانات وتحليلها واستخلاص الرؤى في العالم الحقيقي.

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexa (…)2026-03-05
🤖 AI

ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering

تقدم هذه الورقة ObfusQAte وإطار عمل Obfus, وهو معيار جديد مصمم لتقييم متانة النماذج اللغوية الكبيرة من خلال اختبار أدائها في الأسئلة الواقعية الخاضعة للتعمية متعددة المستويات، مما يكشف أن النماذج غالباً ما تفشل أو تهلوس عندما تواجه تنوعات لغوية دقيقة.

Shubhra Ghosh, Abhilekh Borah, Aditya Kumar Guru, Kripabandhu Ghosh2026-03-05
💬 NLP

MultiWikiQA: A Reading Comprehension Benchmark in 300+ Languages

تقدم الورقة البحثية MultiWikiQA، وهو معيار قياس ضخم لفهم القراءة يغطي 306 لغات مع أكثر من 1.2 مليون عينة تم إنشاؤها من مقالات ويكيبيديا والتحقق من صحتها من خلال التقييم البشري، مما يظهر تفاوتات كبيرة في الأداء عبر اللغات وبنى النماذج المختلفة.

Dan Saattrup Smart2026-03-05