Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading
Dieser Beitrag argumentiert, dass aktuelle LLM-Evaluierungsrahmen, die auf statischen Prompts basieren, irreführend sind, da Prompt-Optimierung die Modellrankings erheblich verändert, was eine promptoptimierung pro Modell erfordert, um das für eine spezifische Aufgabe beste Modell genau zu identifizieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Die große Idee: Die Falle des „Einheitslösungs"-Ansatzes
Stellen Sie sich vor, Sie sind ein Personalchef, der den besten Koch für Ihr Restaurant sucht. Sie haben fünf verschiedene Köche (nennen wir sie Modell A, B, C, D und E). Um sie zu testen, geben Sie ihnen allen exakt dieselbe Rezeptkarte: „Machen Sie einen Eintopf. Verwenden Sie Salz, Pfeffer und Zwiebeln."
Sie beobachten, wie sie kochen, probieren den Eintopf und ordnen sie ein. Koch B gewinnt. Sie stellen Koch B ein.
Das Problem: Koch B ist großartig darin, genau dieses Rezept zu befolgen, aber vielleicht ist Koch D eigentlich ein Genie, das nur braucht, dass das Rezept leicht anders formuliert wird, um zu glänzen. Vielleicht braucht Koch D die Anweisung „Zwiebeln zuerst schmoren, dann Salz hinzufügen", um seine beste Arbeit zu leisten.
Dieses Papier argumentiert, dass die aktuellen Methoden zum Testen von KI-Modellen (Large Language Models) wie dieser Personalchef sind. Sie geben jedem einzelnen KI-Modell exakt denselben statischen Prompt (die Rezeptkarte) und ordnen sie danach ein, wer mit dieser spezifischen Karte am besten zurechtkommt.
Die Autoren sagen, dies sei irreführend. In der realen Welt würden Sie, wenn Sie eine KI einstellen, ihr nicht nur einen generischen Prompt geben; Sie würden die Anweisungen anpassen, um die beste Leistung aus diesem spezifischen KI-Modell herauszuholen. Dieses Papier nennt diesen Prozess Prompt-Optimierung (PO).
Das Experiment: Rezept anpassen, Gewinner ändern
Die Forscher nahmen fünf beliebte KI-Modelle und testeten sie an verschiedenen Aufgaben (wie das Lösen von Matheproblemen, Beantworten von Geschäftsfragen oder Extrahieren von Daten).
- Runde 1 (Der alte Weg): Sie gaben jedem Modell denselben „Basis"-Prompt. Sie ordneten sie ein.
- Runde 2 (Der neue Weg): Sie nutzten ein automatisiertes Werkzeug, um den Prompt für jedes Modell individuell zu „tunen". Sie fragten die KI: „Wie können wir die Anweisungen umschreiben, damit Sie sie am besten verstehen?" und führten dann die Tests erneut durch.
Das Ergebnis: Die Ranglisten änderten sich vollständig.
- In einigen Fällen sprang das Modell, das in Runde 1 den letzten Platz belegte, in Runde 2 auf den ersten Platz.
- Das Modell, das im alten Test „am besten" war, war nicht unbedingt das beste, wenn es Anweisungen erhielt, die auf sein spezifisches Gehirn zugeschnitten waren.
Die Analogie: Es ist wie das Testen von Läufern auf einer Bahn.
- Alte Methode: Sie lassen alle in schweren Stiefeln laufen. Läufer A gewinnt, weil er an schwere Stiefel gewöhnt ist.
- Neue Methode: Sie geben Läufer A leichte Turnschuhe und Läufer B maßgefertigte Einlagen. Plötzlich gewinnt Läufer B.
- Fazit: Wenn Sie sie nur in schweren Stiefeln getestet hätten, hätten Sie den falschen Läufer für einen Marathon eingestellt.
Wichtige Erkenntnisse aus der Studie
1. Das „beste" Modell hängt vom Prompt ab
Das Papier fand heraus, dass sich der „Gewinner" eines Wettbewerbs ändert, je nachdem, wie die Anweisungen formuliert sind. Wenn Sie das beste KI-Modell für eine bestimmte Aufgabe auswählen wollen, müssen Sie zuerst die Anweisungen für dieses spezifische KI-Modell optimieren. Tun Sie dies nicht, wählen Sie möglicherweise ein Modell aus, das für Ihre Bedürfnisse eigentlich mittelmäßig ist.
2. Unterschiedliche Modelle reagieren unterschiedlich
Genau wie Menschen haben verschiedene KI-Modelle unterschiedliche „Persönlichkeiten" oder Empfindlichkeiten.
- Einige Modelle (wie Modell B in der Studie) waren sehr empfindlich gegenüber Prompt-Änderungen. Eine kleine Anpassung ließ sie deutlich besser performen.
- Andere Modelle waren bei einer bestimmten Aufgabe (wie einfaches Routing) bereits so gut, dass das Anpassen des Prompts ihnen nicht viel half oder sie manchmal sogar verwirrte.
3. Der „Kritiker" kann verwirrt werden
Die Forscher nutzten eine „Kritiker"-KI (GPT-4o), um die Prompts für die anderen Modelle umzuschreiben. Normalerweise funktionierte dies hervorragend. Manchmal wurde der Kritiker jedoch zu clever oder die Anweisungen wurden zu komplex, was dazu führte, dass das Modell scheiterte.
- Beispiel: In einem Fall sagte der optimierte Prompt der KI so oft, sie solle „schrittweise denken", dass sie begann, die Beispiel-Fragen im Prompt zu beantworten, anstatt die eigentliche Testfrage. Es war wie ein Schüler, der die Antworten des Übungstests laut vorliest, anstatt die Prüfung zu schreiben.
Was dies für Sie bedeutet (als Praktiker)
Wenn Sie ein Unternehmen sind, das eine KI auswählen möchte, um eine Aufgabe zu erledigen (wie das Beantworten von Kunden-E-Mails oder das Analysieren von Dokumenten), führen Sie nicht einfach einen Standard-Benchmark durch.
Das Papier kommt zu dem Schluss, dass Sie, um das wahre beste Modell für Ihre spezifische Aufgabe zu finden, Folgendes tun müssen:
- Nehmen Sie Ihre Aufgabe.
- Testen Sie verschiedene Modelle.
- Optimieren Sie den Prompt für jedes Modell individuell, um zu sehen, wozu sie wirklich fähig sind.
- Wählen Sie dann den Gewinner.
Wenn Sie Schritt 3 überspringen und nur einen generischen Prompt verwenden, treffen Sie wahrscheinlich eine schlechte Einstellungsentscheidung basierend auf einem irreführenden Test.
Zusammenfassung
Das Papier ist eine Warnung: Bewerten Sie einen Fisch nicht nach seiner Fähigkeit, einen Baum zu erklimmen, und bewerten Sie eine KI nicht nach ihrer Fähigkeit, einem generischen Prompt zu folgen. Um zu wissen, wer wirklich der Beste ist, müssen Sie ihre Sprache sprechen. Wenn Sie den Prompt für jedes Modell nicht optimieren, sind Ihre Evaluierungsergebnisse wahrscheinlich falsch, und Sie landen möglicherweise mit dem falschen Werkzeug für den Job.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.