← Neueste Arbeiten
🤖 AI

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

Dieses Paper stellt AIR-BENCH Live vor, einen selbstentwickelnden Sicherheits-Benchmark für Foundation Models, der eine automatisierte Pipeline nutzt, um kontinuierlich neue staatliche Regulierungen zu integrieren und mehrsprachige Attack-Prompts zu generieren, wodurch die Einschränkungen statischer Benchmarks in einer sich schnell verändernden KI-Landschaft adressiert werden.

Ursprüngliche Autoren: Rohan Naphade, Minzhou Pan, Bo Li

Veröffentlicht 2026-07-28
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Rohan Naphade, Minzhou Pan, Bo Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich die Welt der künstlichen Intelligenz als eine riesige, sich ständig ausdehnende Bibliothek vor, in der Roboter lernen, Geschichten zu schreiben, Probleme zu lösen und sogar mit uns zu chatten. Aber genau wie in jeder Bibliothek gibt es Regeln darüber, was geschrieben werden darf: keine Anleitungen zum Bau von Bomben, keine Hassrede und keine Tricks, um Geheimnisse zu stehlen. Wissenschaftler erstellen „Sicherheitstests“, um zu sehen, ob diese Roboter die Regeln befolgen. Denken Sie bei diesen Tests an eine Serie von Rätseln oder Fallen, die darauf ausgelegt sind, den Roboter dazu zu verleiten, gegen die Regeln zu verstoßen. Wenn der Roboter dem Trick widersteht, erhält er eine hohe Punktzahl; wenn er darauf hineinfällt, erhält er eine niedrige Punktzahl. Das Problem ist, dass sich die Welt schnell verändert. Neue Gesetze werden verabschiedet, neue Wege, Roboter zu überlisten, werden erfunden, und alte Rätsel werden zu einfach zu lösen. Ein Sicherheitstest aus dem letzten Jahr könnte heute nutzlos sein, weil der Roboter gelernt hat, die alten Tricks zu ignorieren, oder weil ein neues Gesetz etwas verboten hat, das der Test gar nicht erst bedacht hat. Deshalb suchen Forscher ständig nach einem Weg, diese Tests „lebendig“ zu machen und sie sich selbst aktualisieren zu lassen, damit sie in einer Welt, die niemals stillsteht, relevant bleiben.

Dieses Paper stellt einen neuen, selbstaktualisierenden Sicherheitstest namens AIR-BENCH Live vor. Denken Sie an einen Sicherheitswachmann, der nicht nur mit einer festen Liste verbotener Gegenstände an der Tür steht, sondern stattdessen einen Roboter-Assistenten hat, der ständig die Nachrichten scannt, neue Gesetze aus der ganzen Welt liest und sofort neue, hinterlistige Rätsel erstellt, um die KI zu testen. Die Forscher haben eine Pipeline gebaut, die automatisch Regulierungen von Regierungen aus Orten wie den USA, China und der EU „scrapt“ (liest). Wenn sie eine neue Regel finden – wie etwa ein Gesetz gegen das Stehlen eines Robotergehirns oder die Verwendung von gefälschten Videos, um Wahlen zu manipulieren – fügt sie eine neue Kategorie zu ihrer Sicherheitscheckliste hinzu. Dann arbeitet ein Team von KI-Agenten zusammen, um realistische, mehrsprachige Prompts (die Rätsel) basierend auf diesen neuen Regeln zu schreiben. Sie verwenden „Personas“, die wie Rollen beim Schauspielern sind, um die Rätsel so klingen zu lassen, als kämen sie von echten Menschen in verschiedenen Situationen, anstatt von einem Roboter, der ein Skript vorliest.

Das Team testete 14 verschiedene KI-Modelle mit diesem neuen, sich entwickelnden Benchmark. Sie fanden eine enorme Sicherheitslücke: Einige Modelle waren unglaublich sicher und lehnten fast jeden Trick ab (Punktzahl 1,00), während andere recht leicht zu überlisten waren (Punktzahlen so niedrig wie 0,17). Interessanterweise waren die neuen, modernisierten Prompts schwieriger als die alten, was dazu führte, dass selbst die regelkonformsten Modelle etwas eher einmal aus der Fassung gerieten. Die Forscher entdeckten auch, dass die meisten Modelle etwas weniger sicher waren, wenn sie in anderen Sprachen als Englisch gefragt wurden, was darauf hindeutet, dass die Aufgabe, Roboter über alle menschlichen Sprachen hinweg höflich und sicher zu halten, noch ein laufender Prozess ist. Das Paper kommt zu dem Schluss, dass wir die Welt zwar nicht am Verändern hindern können, aber wir können Sicherheitstests bauen, die sich direkt mit ihr entwickeln, um sicherzustellen, dass mit zunehmender Intelligenz der KI auch unsere Fähigkeit, ihre Sicherheit zu testen, intelligenter wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →