← Neueste Arbeiten
💬 NLP

StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs

Die Arbeit stellt StructEval vor, ein umfassendes Benchmark zur Bewertung der Fähigkeit von Large Language Models, strukturierte Ausgaben in 18 verschiedenen Formaten zu generieren oder zu konvertieren, und zeigt dabei erhebliche Leistungsunterschiede zwischen den Modellen sowie die größere Schwierigkeit von Generierungs- und visuellen Aufgaben im Vergleich zu Konvertierungs- und rein textbasierten Aufgaben.

Ursprüngliche Autoren: Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe Wang, Benjamin Schneider, Chi Ruan, Wentao Ma, Zhiheng Lyu, Yifei Wang, Yi Lu
Veröffentlicht 2026-04-06
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe Wang, Benjamin Schneider, Chi Ruan, Wentao Ma, Zhiheng Lyu, Yifei Wang, Yi Lu, Quy Duc Do, Ziyan Jiang, Ping Nie, Wenhu Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, du hast einen genialen Koch (das ist die KI oder das Large Language Model). Dieser Koch kann die köstlichsten Gerichte kochen, die wie echte Menschen schmecken. Er kann über alles reden, Witze erzählen und Rezepte erklären.

Aber es gibt ein Problem: Wenn du in einer echten Küche arbeitest, reicht es nicht, dass das Essen gut schmeckt. Es muss auch richtig serviert werden.

  • Wenn du eine Pizza bestellst, willst du nicht, dass der Koch sie einfach als Haufen Zutaten auf den Tisch wirft. Sie muss in einer runden Form sein, mit dem richtigen Rand.
  • Wenn du einen Burger bestellst, müssen die Zutaten in der richtigen Reihenfolge gestapelt sein (Bun, Patty, Salat, Bun), sonst fällt alles auseinander.
  • Wenn du eine Torte für eine Hochzeit willst, muss sie nicht nur lecker sein, sondern auch exakt so aussehen wie auf dem Foto, mit der richtigen Schriftart und den richtigen Dekorationen.

In der Welt der Computer nennt man diese „Servierregeln" strukturierte Ausgaben. Das können Dinge sein wie:

  • JSON oder CSV: Das sind wie strenge Listen oder Tabellen für Daten.
  • HTML oder React: Das sind die Baupläne für Webseiten, damit sie hübsch aussehen und funktionieren.
  • LaTeX oder SVG: Das sind Anweisungen für wissenschaftliche Dokumente oder Grafiken.

Das Problem: Der Koch ist verwirrt

Bisher haben wir nur getestet, ob der Koch das Essen schmackhaft macht (ob der Text Sinn ergibt). Aber wir haben selten geprüft, ob er die Pizza auch wirklich rund backt oder ob die Burger-Schichten sitzen.

Die Forscher von StructEval haben gesagt: „Halt! Wir müssen testen, ob unsere KIs auch die Form einhalten können."

Was ist StructEval?

Stell dir StructEval wie einen strengen Restaurantinspektor vor, der eine neue, riesige Prüfung für KI-Köche entwickelt hat.

  1. Die Prüfung besteht aus zwei Teilen:

    • Teil 1: Das „Text-Only"-Menü (StructEval-T): Hier muss die KI Listen, Tabellen oder Code-Blöcke schreiben, die perfekt formatiert sind. Stell dir vor, die KI soll eine Einkaufsliste schreiben, die genau so aussieht wie eine Excel-Tabelle. Wenn ein Komma fehlt oder eine Zeile falsch ist, ist die Note schlecht.
    • Teil 2: Das „Visuelle"-Menü (StructEval-V): Hier muss die KI Code schreiben, der sich in ein Bild verwandelt. Die KI soll sagen: „Hier ist der Code für eine Webseite," und dann muss die KI (oder ein Computer) diesen Code tatsächlich in ein Bild umwandeln. Wenn die KI sagt „Hier ist ein roter Button", muss der Button im Bild auch wirklich rot sein und an der richtigen Stelle stehen.
  2. Die Aufgaben:

    • Erstellen (Generation): Die KI bekommt einen Auftrag wie „Schreib mir eine Liste von Planeten" und muss sie perfekt formatieren.
    • Umwandeln (Conversion): Die KI bekommt eine Liste in einem Format (z. B. eine Excel-Tabelle) und muss sie in ein anderes Format (z. B. eine JSON-Datei) umschreiben, ohne dass etwas kaputtgeht.

Was haben sie herausgefunden? (Die Ergebnisse)

Der Restaurantinspektor hat viele Köche getestet, von kleinen, kostenlosen Köchen (Open-Source-Modelle) bis hin zu den teuersten, berühmtesten Köchen der Welt (wie GPT-4o oder o1-mini).

  • Die großen Köche sind gut, aber nicht perfekt: Selbst der beste KI-Koch der Welt (o1-mini) hat nur eine 75,58 von 100 Punkten erreicht. Das klingt hoch, aber in der Welt der KI bedeutet das: „Du kannst das Essen kochen, aber manchmal fällt der Teller runter."
  • Der Abstand ist groß: Die kostenlosen, kleinen Köche (Open Source) lagen etwa 10 Punkte hinter den teuren Köchen zurück. Sie machen öfter Fehler in der Struktur.
  • Das Schwierigste: Es ist viel schwerer, etwas zu erschaffen (z. B. eine neue Webseite aus dem Nichts zu bauen) als etwas zu übersetzen (z. B. eine Excel-Tabelle in eine andere Sprache zu schreiben).
  • Die Hürde: Besonders schwierig war es für die KIs, Dinge zu zeichnen, die man sieht (wie Diagramme oder Webseiten), im Vergleich zu reinen Text-Listen.

Warum ist das wichtig?

Stell dir vor, du programmierst eine App, die Bankdaten verarbeitet. Wenn die KI die Daten nicht in das exakte Format schreibt, das die Bank braucht, funktioniert die App nicht. Oder wenn du eine Webseite bauen willst und die KI den Code falsch formatiert, sieht die Seite auf dem Handy kaputt aus.

StructEval zeigt uns also: Unsere KIs werden immer klüger beim Reden, aber sie müssen noch viel üben, um ordentliche Handwerker zu werden, die ihre Arbeit sauber und strukturiert ausführen.

Kurz gesagt: Die KIs können jetzt gut reden, aber sie müssen noch lernen, ihre Hausaufgaben ordentlich abzuschreiben, damit die Lehrer (oder Computer) sie verstehen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →