Are you sure? Measuring models bias in content moderation through uncertainty
Diese Arbeit stellt einen unüberwachten Ansatz vor, der die Verzerrung von Sprachmodellen in der Inhaltsmoderation durch die Analyse ihrer Unsicherheit bei der Klassifizierung von Nachrichten misst, die von Angehörigen vulnerabler Gruppen annotiert wurden, um so Lücken in der Repräsentation aufzudecken, die reine Leistungsmetriken wie der F1-Score übersehen.