💻 computer science

Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR

تقترح هذه الورقة البحثية تعلم تعزيزي منفصل التنسيق (FD-RL)، وهو نهج مبتكر يستفيد من تصفية البيانات القائمة على الإنتروبيا والمكافآت الخاصة بالتنسيق لمعالجة عدم اليقين العالي في المخرجات عند التعرف الضوئي على الحروف (OCR) للمستندات المعقدة، محققاً درجة قياسية جديدة بلغت 90.41 في اختبار OmniDocBench.

Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Ya (…)2026-01-15
💻 computer science

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

تقدم الورقة البحثية DeliberationBench لتوضيح أنه، خلافاً للافتراضات الشائعة، فإن بروتوكولات المداولة متعددة النماذج اللغوية الكبيرة (multi-LLM) تقل بشكل ملحوظ في الأداء عن خط الأساس البسيط "أفضل من N" (best-of-N) من حيث كل من الدقة والكفاءة الحسابية.

Vaarunay Kaushal, Taranveer Singh2026-01-15
💻 computer science

A Review: PTSD in Pre-Existing Medical Condition on Social Media

تُجمّع هذه المراجعة الأدبيات من عام 2008 إلى عام 2024 لتوضيح كيف يكشف تحليل وسائل التواصل الاجتماعي، باستخدام معالجة اللغات الطبيعية والتعلم الآلي، عن التحديات الفريدة المرافقة للاضطراب اللاحق للصدمة واعتلال الأمراض المزمنة، مع تسليط الضوء على إمكانات المجتمعات عبر الإنترنت للتدخل المبكر والدعم المستهدف.

Zaber Al Hassan Ayon, Nur Hafieza Ismail, Nur Shazwani Kamarudin2026-01-15
💻 computer science

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

تقدم هذه الورقة وتثبت تجريبياً إطار عمل للتحقق المتقاطع ثلاثي الوكلاء يحقق توليفاً معرفياً تكرارياً مستقراً عبر نماذج لغوية كبيرة متباينة من خلال دمج التوليد الدلالي، والتحقق من الاتساق، وتدقيق الشفافية في دورة تكرارية، مما يظهر تقارباً وموثوقية عاليين في عمليات النشر العامة.

Toshiyuki Shigemura2026-01-15
💻 computer science

Consistency-Aware Editing for Entity-level Unlearning in Language Models

تقدم هذه الورقة "التحرير الواعي بالاتساق" (CAE)، وهو إطار عمل مبتكر يعمل على تكييف تقنيات تحرير النماذج من أجل إلغاء تعلم مستوى الكيانات بكفاءة ومتانة، وذلك عبر التحسين المشترك للتحديثات منخفضة الرتبة عبر مطالبات متنوعة متعلقة بالكيانات لضمان الإزالة الشاملة للمعرفة مع الحفاظ على قدرات النموذج.

Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan2026-01-15
💻 computer science

Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation

تكشف هذه الدراسة أنه بينما تستطيع النماذج اللغوية الضبطية التعليمية معالجة إشارات السلامة الخارجية بموجب أوامر صريحة، فإن تحسين التعلم المعزز من التغذية الراجحة البشرية (RLHF) يتسبب في جعلها تتجاهل هذه التصحيحات الحاسمة بشكل منهجي أثناء المحادثات الطبيعية، مما يخلق فجوة خطيرة بين التفاعل المتوقع للمستخدم والتحكم الفعال في السلامة.

Felipe Biava Cataneo2026-01-15
💻 computer science

Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness

تقيم هذه الورقة البحثية بشكل منهجي أداء النماذج اللغوية الكبيرة المشروطة بمعايير التقييم في التصحيح الآلي للإجابات القصيرة، كاشفةً أنه بينما يكون التوافق مع الخبراء قوياً في المهام الثنائية، فإنه يتدهور مع المعايير المعقدة، رغم إمكانية تحسين الدقة من خلال التأجيل القائم على عدم اليقين، كما يسلط اختبار المتانة الضوء على الحساسية تجاه استبدال المترادفات رغم المرونة تجاه حقن الأوامر.

Haotian Deng, Chris Farber, Jiyoon Lee, David Tang2026-01-15
💻 computer science

Emissions and Performance Trade-off Between Small and Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الصغيرة التي تم ضبطها بدقة يمكنها تحقيق أداء يضاهي النماذج اللغوية الكبيرة عبر مهام متنوعة مع تقليل انبعاثات الكربون بشكل كبير، مما يوفر مساراً قابلاً للتطبيق نحو ذكاء اصطناعي مستدام.

Anandita Garg, Uma Gaba, Deepan Muthirayan, Anish Roy Chowdhury2026-01-15
💻 computer science

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

تقدم هذه الورقة البحثية PediaMind-R1، وهو نموذج لغوي كبير متخصص يدمج نظرية "توماس-تشيس" للمزاج ومسار تدريب ثنائي المراحل لتقديم استدلال مخصص وقائم على أسس نفسية لرعاية الطفولة المبكرة.

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng2026-01-15
💻 computer science

Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment

تُظهر هذه الدراسة أن المطابقة الآلية للإجابات باستخدام النماذج اللغوية الكبيرة تظل قوية في مواجهة تكتيكات التلاعب النصي الاستراتيجي مثل الإطناب وتضمين الإجابة، حيث أثبت التقييم الثنائي فعالية خاصة، مما يؤكد موثوقيتها كبديل قابل للتوسع للتقييم البشري عند توفر إجابات مرجعية.

Manas Khatore, Sumana Sridharan, Kevork Sulahian, Benjamin J. Smith, Shi Feng2026-01-15