← Neueste Arbeiten
💻 computer science

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench führt ein automatisiertes, agentenbasiertes Framework ein, das die Evaluierung der Web-Generierung als einen dynamischen, kollaborativen Review-Prozess unter Einbeziehung spezialisierter Rollen neu definiert, um der interaktiven, vielfältigen und sich schnell entwickelnden Natur von Frontend-Artefakten gerecht zu werden und dadurch eine Übereinstimmung mit menschlichem Expertenurteil zu erreichen.

Ursprüngliche Autoren: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

Veröffentlicht 2026-08-05
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Computer nicht nur mit Ihnen chatten, sondern tatsächlich Dinge bauen. Im Bereich der Künstlichen Intelligenz, speziell bei den Large Language Models (LLMs), haben wir einen Punkt erreicht, an dem diese digitalen Geister Code schreiben können, um ganze Websites zu erschaffen, nicht nur einzelne Sätze. Betrachten Sie ein LLM als einen superschnellen, unglaublich sachkundigen Lehrlings-Architekten. Wenn Sie es bitten, „ein Baumhaus zu bauen“, kann es die Baupläne entwerfen, das Holz zuschneiden und sogar die Wände streichen. Aber hier ist der knifflige Teil: Woher wissen Sie, ob das Baumhaus tatsächlich sicher zu erklimmen ist? Lange Zeit haben wir diese KI-Baumeister getestet, indem wir uns ihre Baupläne (den Code) angesehen oder ein einzelnes Foto des fertigen Hauses betrachtet haben. Aber Websites sind keine statischen Fotos; sie sind lebendige, atmende Spielplätze, auf denen Buttons geklickt werden, Animationen hüpfen und Nutzer herumwandern. Wenn man nur die Baupläne prüft, übersieht man vielleicht eine wackelige Leiter oder eine Tür, die sich nicht öffnen lässt. Dies ist die große Frage, mit der sich Forscher beschäftigen: Wie testen wir, ob eine KI in der Lage ist, eine Website zu bauen, die tatsächlich funktioniert und sich gut bedienen lässt, anstatt nur auf dem Papier gut auszusehen?

Hier kommt LiveEvalBench ins Spiel, ein neues und kluges Framework, das genau dieses Problem lösen soll. Die Autoren argumentieren, dass die alte Art des Testens – wie ein Lehrer, der einen statischen Aufsatz bewertet – für interaktive Webprojekte nicht ausreicht. Stattdessen haben sie ein System entwickelt, das wie ein Team von Experten-Inspektoren fungiert, von denen jeder eine andere Aufgabe hat, um die Kreationen der KI gründlich zu prüfen.

So funktioniert ihr „Inspektionsteam“:

  1. Der Bauingenieur: Stellen Sie sich einen Bauleiter vor, der versucht, das Haus tatsächlich zu montieren. Dieser Agent nimmt den Code der KI und versucht, die Website zu starten. Wenn die Website abstürzt oder die Anweisungen verwirrend sind, erwischt dieser Ingenieur dies.
  2. Der Code-Ingenieur: Dies ist der Qualitätskontrolleur, der die Baupläne (den Quellcode) betrachtet, ohne das Haus zu berühren. Er prüft, ob die Materialien gut organisiert sind, ob die Struktur stabil ist und ob die KI die spezifischen Regeln befolgt hat, die Sie ihr gegeben haben (wie „verwende blaue Farbe“ oder „erstelle eine React-App“).
  3. Der UI-Tester: Dies ist das neugierige Kind, das auf dem Spielplatz herumläuft. Dieser Agent schaut sich den Code überhaupt nicht an; er klickt einfach auf Buttons, fährt mit der Maus über Bilder und nutzt die Website genau so, wie ein Mensch es tun würde. Er prüft, ob die Animationen flüssig sind, ob der Text lesbar ist und ob die Seite tatsächlich das tut, was Sie verlangt haben.

Was LiveEvalBench besonders macht, ist seine Adaptivität. In der Vergangenheit waren Tests starr, wie ein Multiple-Choice-Test, bei dem es nur eine richtige Antwort gab. Aber in der realen Welt gibt es eine Million Möglichkeiten, eine großartige Website zu bauen. LiveEvalBench schaut sich an, was die KI tatsächlich gebaut hat, und erstellt eine maßgeschneiderte Checkliste für diese spezifische Version. Wenn die KI ein ausfahrbares Menü statt eines Dropdown-Menüs gebaut hat, passt sich der Test an, um zu prüfen, ob das ausfahrbare Menü funktioniert, anstatt es deshalb scheitern zu lassen, weil es kein Dropdown-Menü ist. Es ist wie ein Richter, der versteht, dass eine Pizza quadratisch oder rund sein kann, solange sie köstlich schmeckt.

Die Forscher haben dieses neue System an 100 realen Anfragen (die von einfachen Aufgaben bis hin zu komplexen, mehrseitigen Anwendungen reichen) getestet und 11 der klügsten KI-Modelle gebeten, diese zu erstellen. Die Ergebnisse waren aufschlussreich. Während viele Modelle sehr gut darin waren, Code zu schreiben und die Website zu starten, stolperten sie oft, wenn es um die eigentliche Benutzererfahrung ging. Der „UI-Tester“ fand heraus, dass die größten Probleme auftraten, wenn Nutzer mit der Seite interagierten – Buttons, die nicht klickbar waren, Animationen, die einfroren, oder Layouts, die zerbrachen.

Als sie ihre KI-Inspektoren mit menschlichen Experten verglichen, waren die Ergebnisse sehr nah beieinander, was darauf hindeutet, dass dieses automatisierte Team eine zuverlässige Methode ist, um die KI-Baumeister zu beurteilen. Die Studie ergab, dass die besten Modelle etwa 70 von 90 Punkten erreichten, wobei die Top-Performer (wie Claude Opus 4.7) starke Fähigkeiten zeigten, während andere bei den interaktiven Teilen erheblich scheiterten. Das Paper legt nahe, dass die KI zwar immer besser im Bauen wird, der „Spaß“-Aspekt – Dinge zu erschaffen, die sich lebendig und reaktionsschnell anfühlen – jedoch weiterhin die größte Herausforderung darstellt. LiveEvalBench bietet eine neue, flexible Methode, um diesen Fortschritt zu messen und stellt sicher, dass wir, während die KI immer besser im Bauen wird, auch die richtigen Werkzeuge haben, um sicherzustellen, dass diese Gebäude sicher, unterhaltsam und bereit für die Welt sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →