← Neueste Arbeiten
💬 NLP

ClaimPT: A Portuguese Dataset of Annotated Claims in News Articles

In dieser Arbeit wird ClaimPT vorgestellt, ein neues annotiertes Datenset für europäisches Portugiesisch, das aus 1.308 Nachrichtenartikeln der Nachrichtenagentur LUSA besteht und als erste Ressource für die automatische Erkennung von Faktenbehauptungen in journalistischen Inhalten dient, um die Forschung zur Faktenprüfung in einer bisher unterversorgten Sprache voranzutreiben.

Ursprüngliche Autoren: Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António Branco, Alípio Jorge, Sérgio Nunes, Nuno Guimarães, Purificação Silvano

Veröffentlicht 2026-03-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António Branco, Alípio Jorge, Sérgio Nunes, Nuno Guimarães, Purificação Silvano

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

🕵️‍♂️ Die große Lügenjagd: Wie KI endlich portugiesische Nachrichten prüft

Stellen Sie sich vor, das Internet ist ein riesiger, lauter Marktplatz. Jeden Tag werden dort Tausende von Behauptungen aufgestellt: „Der Himmel fällt heute Abend!", „Die Preise für Brot sind verdoppelt!" oder „Der Bürgermeister hat das versprochen."

Das Problem? Falschmeldungen (Desinformation) sind wie schnelle, kleine Rennwagen. Sie rasen durch die Menge und erreichen jeden sofort. Faktenchecks hingegen sind wie schwere, alte Panzer. Sie brauchen viel Zeit, um zu prüfen, ob etwas stimmt, und kommen oft zu spät, wenn die Lüge schon überall ist.

Bisher gab es für die englische Sprache eine ganze Armee von KI-Robotern, die diesen Panzer fahren können. Aber für die portugiesische Sprache fehlte das Werkzeug komplett. Es gab keine „Trainingsdaten", damit die KI lernen konnte, was eine überprüfbare Behauptung ist und was nur ein Meinungsschwall.

Hier kommt ClaimPT ins Spiel.

1. Was ist ClaimPT? (Der neue Trainingsplatz)

Stellen Sie sich ClaimPT wie einen riesigen Trainingscamp für KI-Roboter vor. Die Forscher haben 1.308 echte Nachrichtenartikel aus Portugal gesammelt (von der Nachrichtenagentur LUSA).

In diesen Artikeln haben menschliche Experten mit Lupen nachgeschaut und genau markiert:

  • Wo beginnt eine Behauptung?
  • Wo endet sie?
  • Wer hat sie gesagt?
  • Ist es eine Tatsache, die man prüfen kann, oder nur eine Meinung?

Das ist wie ein Lehrbuch mit roten Unterstreichungen. Ohne dieses Buch würde die KI raten müssen. Mit dem Buch kann sie lernen, die Unterschiede zu erkennen.

2. Das Besondere: Nicht nur Social Media, sondern echte Zeitungen

Bisher haben die meisten KI-Modelle nur gelernt, wie man Behauptungen auf Twitter oder in Parlamentsreden findet. Das ist wie das Lernen von Schach, indem man nur Partien von Kindern beobachtet.

ClaimPT ist anders. Es konzentriert sich auf professionelle Zeitungsartikel.

  • Warum ist das wichtig? In Zeitungen sind Behauptungen oft gut versteckt. Ein Politiker sagt vielleicht: „Die Regierung hat versprochen, die Brücke zu bauen." Das ist eine Behauptung. Aber der Journalist schreibt daneben: „Ich glaube, das war eine gute Idee." Das ist nur eine Meinung.
  • ClaimPT hat der KI beigebracht, genau diese feinen Unterschiede zu sehen. Es ist, als würde man einem Schüler beibringen, nicht nur zu lesen, sondern zu verstehen, wer eigentlich das Wort im Mund führt.

3. Wie wurde es gemacht? (Der menschliche Faktor)

Damit das Lehrbuch perfekt ist, haben die Forscher eine sehr sorgfältige Methode angewendet:

  • Zwei Lehrer pro Aufgabe: Jeder Artikel wurde von zwei verschiedenen Experten gelesen und markiert.
  • Der Schiedsrichter: Wenn die beiden Experten sich nicht einig waren (z. B. „Ist das jetzt eine Behauptung oder nur ein Gerücht?"), hat ein dritter, sehr erfahrener Experte (der Kurator) das letzte Wort gehabt.
  • Das Ergebnis: Ein Datensatz, der so sauber ist, dass die KI darauf aufbauen kann.

4. Der erste Test: Wie gut ist die KI schon?

Die Forscher haben ihre neuen KI-Modelle (die „Schüler") auf diesem Trainingsplatz getestet.

  • Das Ergebnis: Die KI kann bereits erkennen, wo Fakten und wo Meinungen sind, aber sie ist noch nicht perfekt. Sie macht Fehler, genau wie ein Schüler in der ersten Schulwoche.
  • Ein interessanter Befund: Die KI neigt manchmal dazu, alles als „prüfbar" zu markieren, was wie eine Behauptung klingt. Sie muss noch lernen, dass manche Sätze zwar klingen wie Fakten, aber eigentlich nur Hörensagen oder Meinungen sind.

5. Warum ist das alles wichtig? (Das große Ziel)

Warum sollte sich jemand dafür interessieren?
Stellen Sie sich vor, Sie sind ein Journalist. Sie haben 100 E-Mails mit Gerüchten am Morgen. Sie können nicht alle manuell prüfen.
Mit ClaimPT und den darauf trainierten KIs könnte ein digitaler Assistent in Sekunden sagen:

„Hey, in dieser E-Mail steht eine Behauptung über die Gesundheitspolitik. Die andere ist nur eine Meinung. Hier ist der Link zu den Fakten, die du prüfen musst."

Das würde die Arbeit der Faktenprüfer beschleunigen und helfen, die „schnellen Rennwagen" der Falschmeldungen schneller zu stoppen.

Zusammenfassung in einem Satz

ClaimPT ist das erste große, hochwertige Wörterbuch für portugiesische Nachrichten, das KI-Systemen beibringt, zwischen echten Fakten und bloßen Meinungen zu unterscheiden, damit wir im digitalen Zeitalter schneller die Wahrheit finden können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →