U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning
Dieser Beitrag stellt U-Define vor, ein System, das die Benutzerkontrolle über LLM-basierte Planung verbessert, indem es Benutzern ermöglicht, Einschränkungen entweder als strikte „harte" Regeln oder als flexible „weiche" Präferenzen zu kategorisieren, die durch komplementäre formale Modellprüfung und LLM-als-Richter-Methoden verifiziert werden, um Zuverlässigkeit, Benutzerfreundlichkeit und Zufriedenheit zu steigern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie planen einen perfekten Familienurlaub. Sie haben eine Liste von Dingen, die müssen passieren (wie „wir müssen innerhalb unseres Budgets bleiben" oder „die Kinder müssen im Pool Schwimmwesten tragen") und Dinge, die Sie sich wirklich wünschen, dass sie passieren (wie „wir hätten gerne einen ruhigen Strand" oder „es wäre schön, ein Museum zu besuchen").
In der Vergangenheit, wenn Menschen KI (Large Language Models) fragten, diesen Trip zu planen, riet die KI einfach. Sie könnte die Schwimmwesten vergessen, weil sie zu sehr damit beschäftigt war, kreativ zu sein, oder sie könnte ein Hotel vorschlagen, das viel zu teuer ist. Die KI ist wie ein sehr talentierter, aber etwas zerstreuter Reisebürokaufmann, der fließend spricht, aber nicht immer auf die strengen Regeln hört.
Das Problem:
Aktuelle KI-Tools sind entweder zu starr (sie zwingen Sie, komplexen Code zu verwenden, um Regeln festzulegen) oder zu locker (sie ignorieren Ihre Regeln vollständig). Nutzer steckten fest, die Arbeit der KI manuell zu überprüfen, was mühsam ist und fehleranfällig.
Die Lösung: U-Define
Die Forscher haben ein neues System namens U-Define entwickelt. Stellen Sie es sich vor wie einen „intelligenten Reisebürokaufmann mit einem Doppel-Check-System". Anstatt die KI nur zu bitten, „einen Trip zu planen", ermöglicht U-Define Ihnen, der KI genau mitzuteilen, welche Regeln Hart und welche Weich sind.
So funktioniert es, mit einfachen Analogien:
1. Die zwei Eimer für Regeln
U-Define bittet Sie, Ihre Anweisungen in zwei Eimer zu sortieren:
- Der „Harte" Eimer (Die Backsteinmauer): Dies sind nicht verhandelbare Regeln. Wenn die KI eine bricht, ist der Plan nutzlos.
- Beispiel: „Wir müssen vegetarisch essen."
- Der Zauber: U-Define übersetzt Ihren englischen Satz sofort in einen strengen, mathematischen „Code" (genannt LTL/PRISM), den ein Computer perfekt überprüfen kann. Es ist, als würden Sie Ihre Regel in eine Überwachungskamera verwandeln, die nie blinzelt. Wenn der Plan ein Steak enthält, schreit die Kamera sofort „FEHLER!".
- Der „Weiche" Eimer (Die Wunschliste): Dies sind Präferenzen. Wenn die KI sie verpasst, ist der Plan immer noch okay, nur nicht perfekt.
- Beispiel: „Wir bevorzugen ein entspanntes Tempo."
- Der Zauber: Für diese verwendet U-Define eine zweite KI (ein „Richter"), um den Plan zu lesen und ihm eine Sternebewertung (1 bis 5 Sterne) sowie einen Kommentar zu geben, wie gut er zu Ihrem Vibe passte.
2. Der Workflow: Wie Sie interagieren
Stellen Sie sich vor, Sie sitzen mit U-Define an einem Computer:
- Sie sprechen: Sie tippen „Planen Sie einen Trip nach Venedig". Sie fügen Ihre Harten Regeln (Schwimmwesten, vegetarisches Essen) und Weichen Regeln (entspanntes Tempo, Spaß für Kinder) hinzu.
- Der Übersetzer: Das System verwandelt Ihre „Harten" Regeln heimlich in diesen strengen mathematischen Code. Es zeigt Ihnen die Übersetzung, um sicherzustellen, dass es Sie richtig verstanden hat.
- Der Generator: Die Haupt-KI erstellt drei verschiedene Trip-Pläne.
- Der Doppel-Check:
- Der Math-Computer prüft die Harten Regeln. Er sagt: „Plan A ist gescheitert, weil er keine Schwimmwesten gepackt hat. Plan B hat alle Harten Regeln bestanden."
- Die Richter-KI prüft die Weichen Regeln. Sie sagt: „Plan B erhielt 4 Sterne, weil er entspannend war, aber Plan C erhielt 5 Sterne, weil er mehr lustige Aktivitäten hatte."
- Das Ergebnis: Sie sehen die Pläne sortiert. Sie wissen mit Sicherheit, dass die Top-Pläne Ihre „Must-Haves" nicht verletzen, und Sie können sehen, welcher am besten zu Ihren „Wants" passt.
3. Was die Forscher herausfanden
Das Team testete dies mit normalen Menschen (wie Eltern, die Urlaube planen) und Experten (wie Bauleitern oder Stipendienkoordinatoren).
- Normale Menschen liebten es: Sie fühlten sich viel selbstbewusster. Sie mussten nicht „Detektiv" spielen, um Fehler zu finden. Ihnen gefiel, dass sie die „Must-Dos" von den „Nice-to-Haves" trennen konnten. Es fühlte sich so an, als hätte die KI endlich den Unterschied zwischen einer Regel und einem Vorschlag verstanden.
- Die „Harten" Regeln sind mächtig: Wenn das System garantierte, dass die Harten Regeln eingehalten wurden, vertrauten die Menschen der KI viel mehr. Sie waren bereit, ein paar kleinere Verfehlungen bei den Weichen Regeln zu akzeptieren, aber wenn eine Harte Regel gebrochen wurde, waren sie sehr unglücklich.
- Die „Weichen" Regeln sind flexibel: Die Menschen nutzten die Weichen Regeln, um den Plan zu justieren, bis er sich genau richtig anfühlte. Allerdings stellten sie fest, dass die „Sternebewertungen" der KI für weiche Regeln nicht immer perfekt waren, sodass sie den Plan dennoch selbst überprüfen mussten.
- Experten wollten mehr Hilfe: Die Experten (die sehr komplexe Jobs haben) liebten das System, fanden es aber schwierig, alle ihre vielen Regeln einzutippen. Sie wünschten sich, das System könnte ihre üblichen Regeln merken oder aus Tabellenkalkulationen importieren, damit sie nicht jedes Mal alles von Grund auf neu eingeben mussten.
Die große Erkenntnis
Die Studie kommt zu dem Schluss, dass KI für die Planung wirklich nützlich sein muss, damit Sie entscheiden können, was eine strenge Regel und was eine flexible Präferenz ist.
- Harte Constraints = Das Fundament des Hauses (muss solide sein).
- Weiche Constraints = Die Farbe und Dekoration (kann nach Geschmack geändert werden).
Indem es den Nutzern eine Möglichkeit gibt, diese beiden klar zu unterscheiden und verschiedene „Werkzeuge" zu ihrer Überprüfung zu verwenden (Mathematik für die harten Dinge, eine zweite KI für die weichen Dinge), macht U-Define die KI-Planung zuverlässiger, ohne ihre Kreativität zu verlieren. Es verwandelt die KI von einer „Black Box", die rät, in einen „kooperativen Partner", der Ihre Grenzen respektiert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.