← Neueste Arbeiten
💬 NLP

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

Dieses Paper führt einen gemeinsamen Datensatz von 1.446 unstrukturierten Forschungstexten mit UK-Qualitätsbewertungen sowie eine entsprechende Herausforderung ein, optimale Prompts für Large Language Models zu entwerfen, die präzise gültige Werte extrahieren oder fehlende Werte identifizieren, mit dem Ziel, eine initiale Genauigkeits-Baseline von 72,6 % zu übertreffen und gleichzeitig das Verständnis für Prompt Engineering bei komplexen numerischen Aufgaben voranzutreiben.

Ursprüngliche Autoren: Mike Thelwall

Veröffentlicht 2026-01-27
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Mike Thelwall

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Bibliothekar, der versucht, einen riesigen Stapel von Briefen zu ordnen. Jeder Brief wurde von einem anderen Roboter (einer KI) geschrieben, um zu beschreiben, wie gut ein Forschungsartikel ist. Die Roboter sollten eine einfache Bewertung abgeben, wie etwa eine Sternbewertung von 1 bis 4.

Die Roboter sind jedoch unordentliche Schreiber. Einige Briefe beginnen mit der Punktzahl, andere verstecken sie mitten in einem Absatz, manche geben drei verschiedene Punktzahlen an und vergessen, diese zu kombinieren, und manche schwafeln einfach nur herum, ohne eine Punktzahl zu nennen. Schlimmer noch, einige Roboter erfinden sogar gefälschte Punktzahlen wie „95 %“ oder „4/5“, obwohl die Regeln nur 1 bis 4 Sterne zulassen.

Das Problem
Mike Thelwall, der Autor dieser Arbeit, hat 1.446 dieser unordentlichen Briefe gesammelt. Er nennt dies einen „Shared Dataset“ (einen gemeinsamen Datensatz). Sein Ziel ist es, andere Forscher herauszufordern, eine „magische Bedienungsanleitung“ (einen Prompt) für einen neuen, klügeren Roboter zu erstellen.

Die Aufgabe dieses neuen Roboters ist es, die unordentlichen Briefe zu lesen und die richtige Zahl herauszuziehen. Er muss jedoch zwei strengen Regeln folgen:

  1. Ein Detektiv sein: Er muss die richtige Punktzahl herausfinden, selbst wenn der Brief verwirrend ist. Wenn der Brief „Originalität“, „Bedeutung“ und „Gründlichkeit“ separat erwähnt, muss der Roboter wissen, dass er diese herausrechnen bzw. den Durchschnitt bilden muss. Wenn der Brief keine Punktzahl enthält, muss er „-1“ sagen (was bedeutet: „Ich weiß es nicht“).
  2. Ein Roboter sein, kein Plaudertasche: Der Roboter darf nur die Zahl ausspucken (wie „3*“ oder „-1“). Er darf nicht sagen: „Ich denke, die Punktzahl ist 3, weil...“ Wenn er zusätzliche Wörter hinzufügt, ist die Antwort falsch.

Die Herausforderung
Betrachten Sie dies wie ein Spiel „Simon sagt“, das mit einem sehr wörtlich nehmenden, aber leicht verwirrten Roboter gespielt wird.

  • Der aktuelle Stand: Der Autor hat es mit einer einfachen Bedienungsanleitung versucht, und der Roboter hatte in etwa 73 % der Fälle recht.
  • Das Ziel: Die Herausforderung besteht darin, dass jeder eine bessere Bedienungsanleitung entwirft, die eine höhere Punktzahl erreicht.

Warum macht man das?
In dieser Arbeit geht es nicht darum, dies aktuell zu verwenden, um echte Schüleraufsätze zu bewerten oder medizinische Diagnosen zu korrigieren. Stattdessen ist es eine Trainingsübung. Indem wir Forscher dazu zwingen, herauszufinden, wie man Roboter dazu bringt, spezifische Zahlen aus unordentlichen Texten zu extrahieren, lernen wir:

  • Wie man mit Robotern spricht, damit sie besser zuhören (Prompt Design).
  • Wo Roboter verwirrt werden und wie man diese Anweisungen korrigiert.
  • Wie man mit Situationen umgeht, in denen sich der Roboter unsicher ist (zu wissen, wann man „-1“ sagen muss, anstatt zu raten).

Der Kern der Sache
Diese Arbeit ist eine Einladung zu einem Wettbewerb. Sie sagt: „Hier ist ein Stapel unordentlicher Roboter-Notizen und eine Liste der richtigen Antworten. Können Sie den perfekten Satz an Anweisungen schreiben, um einen Roboter dazu zu bringen, diese Notizen zu lesen und Ihnen jedes Mal genau die richtige Zahl zu liefern?“ Der Gewinner ist die Person, die den höchsten Prozentsatz an korrekten Antworten erzielt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →