Counting on Consensus: Selecting the Right Inter-annotator Agreement Metric for NLP Annotation and Evaluation
تعد هذه الورقة بمثابة دليل شامل لاختيار وتفسير مقاييس اتفاق المُدوّنين في معالجة اللغات الطبيعية من خلال تصنيف المقاييس وفقاً لأنواع المهام، ومعالجة تحديات مثل عدم توازن التسميات والبيانات المفقودة، والدعوة إلى ممارسات إبلاغ شفافة لضمان موثوقية وإمكانية إعادة إنتاج التدوين البشري.