📊 statistics

Debiased Inference for AI-Generated Data without Gold-Standard Labels: Identification via Multiple Imperfect Measurements

تقترح هذه الورقة إطار عمل الاستدلال غير المنحاز مع القياسات المتعددة غير المثالية (DMM)، والذي يتيح إجراء استدلال إحصائي صالح للبيانات المولدة بواسطة الذكاء الاصطناعي دون الحاجة إلى تسميات مرجعية قياسية، وذلك من خلال الجمع بين قياسات متعددة للذكاء الاصطناعي عرضة للخطأ تحت فرضية الاستقلال الشرطي.

Naoki Egami, Sooahn Shin2026-08-20
💬 NLP

Artifact-centered Claim-aware Observability for Autonomous Scientific Agents

تقترح هذه الورقة إطار عمل للملاحظة القائم على الادعاءات للوكلاء العلميين المستقلين، والذي يعامل الادعاءات العلمية كقطع أثرية من الدرجة الأولى ذات روابط أدلة وسلالة صريحة، مما يعالج أوجه القصور في أدوات التسجيل الحالية في تدقيق إخفاقات الأنظمة الموزعة.

Xiangyu Yin, Ming Du, Michael H. Prince, Mathew J. Cherukara2026-08-20
💬 NLP

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

تقترح هذه الورقة البحثية \algname، وهو إطار عمل موحد للتكيف في وقت الاختبار (Test-Time Adaptation) للنماذج الرؤية-اللغوية، يقوم بالربط بين الاستدلال والتكيف من خلال صياغة التصنيف صفري القدرة (zero-shot classification) كمسألة نقل أمثل من نوع واسرستاين (Wasserstein Optimal Transport) لتوليد تسميات مستعارة (pseudo-labels) قوية، والتي تُستخدم لاحقاً في فقد تباين (Info-NCE contrastive loss) متوافق نظرياً لتحقيق أداء رائد (state-of-the-art) تحت ظروف تغير التوزيع.

Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingru (…)2026-08-20
💬 NLP

Figurative and Cultural Knowledge in LLMs: Investigating Cross-Domain Transfer through Fine-Tuning

تتقصى هذه الورقة ما إذا كان الضبط الدقيق على البيانات الثقافية يعزز فهم اللغة المجازية في النماذج اللغوية الكبيرة، حيث وجدت أنه بينما يحسن التدريب على الشعر استيعاب الاصطلاحات بطريقة قابلة للنقل، فإن الضبط الدقيق الثقافي غالبًا ما يؤدي إلى تدهور تفسير الأمثال ويكشف عن علاقة معقدة وغير خطية بين الانغماس الثقافي واكتساب اللغة المجازية لا يمكن استيعابها ببساطة من خلال الضبط الدقيق وحده.

Mena Attia, Mona Diab, Thamar Solorio2026-08-20
💬 NLP

Multimodal Rapport Estimation in Real-World HRI

تُظهر هذه الدراسة أن الدمج متعدد الوسائط لنماذج اللغات الكبيرة ذات التعلم الصفري (وتحديداً Gemini 2.5 Flash) مع نماذج صوتية وبصرية مدربة مسبقاً (Hubert و V-JEPA) يُقدر بفعالية مستوى الألفة المقيم من قبل طرف ثالث في بيئات التفاعل بين الإنسان والروبوت الواقعية، متفوقاً بذلك على النماذج الفردية ومسلطاً الضوء على ضرورة مراعاة التباين السياقي مثل مدة التفاعل وحجم المجموعة.

Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada2026-08-20
💬 NLP

Tangut Word Segmentation under Extreme Resource Scarcity: Integrating Traditional Lexicons and Unlabeled Text

تقدم هذه الورقة أول دراسة منهجية لتقسيم كلمات لغة تانغوت في ظل ندرة شديدة في الموارد، حيث تقدم إطار عمل هجين يدمج البيانات المشروحة من قبل الخبراء، والمعاجم التقليدية، والنصوص غير المصنفة لتحقيق درجة F1 تبلغ 0.911 وإثبات قدرة قوية على التعميم تتجاوز المفردات الخاضعة للإشراف المحدودة.

Lifan Deng, Yongwei Zhang, Sen Sun, Bojun Sun, Jingsong Yu2026-08-20
💬 NLP

OmniAlign: A Unified Multilingual Aligner for Word and Sentence Alignment

يُعد OmniAlign نموذجاً لغوياً موحداً وخفيف الوزن، يحقق في آن واحد أداءً فائقاً في كل من المحاذاة على مستوى الكلمات والمحاذاة على مستوى الجمل عبر لغات وأطوال نصوص متنوعة، وذلك من خلال مسار تدريب متخصص يتكون من أربع مراحل.

Mengpeng Yang, Jingxu Yang, Chao Chen, Tian Xia, Yabo Sun, Qiang Liu2026-08-20
💬 NLP

Building real-time digital twin instances with Function+Data Flow: user evaluation and extension for iterative pipelines

تقدم هذه الورقة دراسة تجريبية للمستخدم توضح أن لغة التصور الوظيفي + تدفق البيانات (FDF) وتطبيقها في برنامج DesCartes Builder يعززان بفعالية من إمكانية الوصول والموثوقية لتطوير التوأم الرقمي القائم على الذكاء الاصطناعي لخبراء المجال، مع تحفيز اقتراح امتداد هرمي (H-FDF) لدعم المسارات الأكثر تعقيداً وتكراراً.

Eduardo de Conto, Blaise Genest, Arvind Easwaran, Nicholas Ng, Shweta Menon2026-08-20
💬 NLP

WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing

تُعد WhiteMatter بنية "ترانسفورمر" (Transformer) مبتكرة تعزز الأداء وتخفض بصمة الذاكرة عبر توظيف موجه لخلط حالات الرموز (token states) لجميع الطبقات في مجموعة مضغوطة من قنوات (KV)، مما يتيح اتصالات "الكل إلى الكل" (all-to-all) عابرة للطبقات، تكون ديناميكية ومتكيفة مع الرموز أثناء فك التشفير ذاتي الانحدار.

Wenbo Zhang, Xiang Ren2026-08-20
💬 NLP

Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages

من خلال تحليل ٢٩ لغة عبر خمس عائلات من النماذج، تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة متعددة اللغات تستخدم دوائر حوسبية مشتركة جزئياً لاتفاق المبتدأ والخبر، مع ازدياد درجة التداخل عبر اللغات في اللغات التي تعبر صراحة عن التصريف الصرفي.

Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer2026-08-20