← Neueste Arbeiten
💬 NLP

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

Die Arbeit stellt CAPITU vor, ein neuartiges Benchmark-System zur Evaluierung der Instruktionsbefolgung von Sprachmodellen in brasilianischem Portugiesisch, das Aufgaben in den Kontext klassischer brasilianischer Literatur einbettet und dabei kulturell fundierte, automatisch überprüfbare sprachliche sowie strukturelle Anforderungen in Einzel- und Mehrturn-Szenarien testet.

Ursprüngliche Autoren: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

Veröffentlicht 2026-03-25
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

🇧🇷 CAPITU: Der „Literatur-Prüfstand" für KI auf Portugiesisch

Stellen Sie sich vor, Sie haben einen sehr intelligenten Roboter, der alles auf der Welt weiß. Aber wenn Sie ihm einen einfachen Befehl geben – zum Beispiel: „Schreibe eine Geschichte über einen Kaffeebohnen-Diebstahl, aber benutze genau 50 Wörter und jedes dritte Wort muss auf -inho enden" –, dann scheitert er oft. Er vergisst die Wortzahl oder benutzt das falsche Suffix.

Das ist das Problem, das die Forscher mit CAPITU lösen wollen.

1. Was ist CAPITU eigentlich?

CAPITU ist wie ein großer, strenger Lehrer, der speziell für die brasilianische Sprache (Portugiesisch) und die brasilianische Literatur entwickelt wurde.

Bisher gab es viele Tests für KI, aber die waren meistens auf Englisch oder einfach nur Übersetzungen. Das ist, als würde man einem brasilianischen Koch einen deutschen Kochbuch-Test geben, der nur deutsche Gewürze kennt. Er könnte zwar kochen, aber er würde die feinen Nuancen der eigenen Küche verpassen.

CAPITU ändert das. Es testet KIs nicht mit trockenen, technischen Fragen, sondern in einer Welt voller brasilianischer Bücher.

2. Die Magie der Literatur: Warum Bücher?

Stellen Sie sich vor, Sie wollen testen, wie gut jemand eine Sprache beherrscht. Sie könnten ihm eine Liste mit Fakten geben. Besser ist es aber, ihn in eine Geschichte zu stecken.

CAPITU nimmt acht berühmte brasilianische Klassiker (wie Dom Casmurro oder Iracema) und baut die Tests darauf auf.

  • Die Analogie: Es ist, als würde man einen Schauspieler nicht nur bitten, einen Text auswendig zu lernen, sondern ihn in eine echte Theateraufführung zu stecken. Er muss nicht nur die Worte sagen, sondern auch die Stimmung, den Dialekt und die Kultur der Figur verstehen.
  • Die KI muss also sagen: „Erzähle mir eine Geschichte über den Charakter Bento aus Dom Casmurro, aber achte auf diese 5 strengen Regeln."

3. Die strengen Regeln (Die „Zaubersprüche")

Das Besondere an CAPITU ist, dass die Regeln automatisch überprüfbar sind. Kein Mensch muss am Ende sitzen und raten, ob die KI gut war. Ein Computerprogramm prüft das sofort.

Hier sind einige der „Zaubersprüche", die die KI befolgen muss:

  • Die Wort-Zählung: „Deine Antwort muss genau 100 Wörter haben." (Wie ein Bäcker, der genau 100 Brötchen backen muss, nicht 99 und nicht 101).
  • Die Endungs-Zauberei: „Du musst mindestens 3 Wörter benutzen, die auf -inho enden." (Das ist ein typisch portugiesisches Suffix, das „klein" oder „lieb" bedeutet, wie cachorrinho für „Hündchen").
  • Das Verbot: „Benutze das Wort 'sehr' nicht."
  • Die Struktur: „Dein Text muss ein Akrostichon sein (die Anfangsbuchstaben der Sätze müssen ein Wort ergeben)."

4. Wer wurde getestet?

Die Forscher haben 18 verschiedene KI-Modelle gegeneinander antreten lassen.

  • Die Super-Sterne (wie GPT-5): Diese waren extrem gut. Sie konnten fast alle Regeln befolgen, selbst wenn die Aufgabe sehr schwer war.
  • Die Portugiesischen Spezialisten (wie Sabiá): Diese Modelle sind kleiner und billiger, aber sie kennen die Sprache und Kultur so gut, dass sie oft besser abschneiden als die riesigen, teuren US-Modelle.
  • Die Großen Riesen (wie Qwen): Manchmal waren sie groß, aber bei den feinen portugiesischen Regeln etwas ungeschickt.

5. Das große Problem: Das „Vergessliche"

Ein spannendes Ergebnis war, wie KIs mit mehreren Gesprächen umgehen.

  • Einmaliges Gespräch: Die KI hört den Befehl, macht es und ist fertig.
  • Mehrere Gespräche: Stellen Sie sich vor, Sie geben der KI einen Auftrag. Dann sagen Sie: „Ändere das, aber behalte die alte Regel bei." Dann noch eine Änderung.
  • Das Ergebnis: Viele KIs vergessen die ersten Regeln! Es ist wie ein Gespräch mit einem Freund, der nach drei Sätzen vergisst, dass Sie wollten, dass er leise spricht. CAPITU zeigt, dass viele KIs hier noch Probleme haben, ihre „Disziplin" über mehrere Runden hinweg zu behalten.

6. Warum ist das wichtig?

Früher haben wir KIs nur gefragt: „Kannst du eine Geschichte schreiben?"
Jetzt fragen wir: „Kannst du eine Geschichte schreiben, während du gleichzeitig 10 strenge Regeln befolgst, ohne dabei den Faden zu verlieren?"

CAPITU zeigt uns:

  1. KIs werden immer besser, aber sie brauchen noch Übung bei den feinen Details der Sprache.
  2. Man muss KIs in ihrer eigenen kulturellen Umgebung testen, nicht nur in englischen Übersetzungen.
  3. Es gibt spezielle, günstigere Modelle, die für Brasilien perfekt sind, ohne dass man die teuersten Modelle der Welt kaufen muss.

Fazit

CAPITU ist wie ein großes, literarisches Spiel, bei dem die KI beweisen muss, dass sie nicht nur „alles weiß", sondern auch genau zuhört und die Regeln der brasilianischen Sprache und Kultur respektiert. Es ist ein wichtiger Schritt, um sicherzustellen, dass KI-Systeme in der echten Welt wirklich hilfreich und zuverlässig sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →