← Neueste Arbeiten
💻 computer science

Deployment Risk Assessment Using Diff-Aware Features: A Case Study at Prime Video

Dieses Paper präsentiert ein datenschutzwahrendes, sprachunabhängiges Framework zur Vorhersage von Code-Deployment-Risiken bei Prime Video, indem es LLMs nutzt, um Diff-bewusste Merkmale zu extrahieren, wobei nachgewiesen wird, dass die strukturelle Code-Komplexität ein zuverlässigerer Risikoindikator als Volumenmetriken ist und eine hohe Genauigkeit sowohl über interne als auch über öffentliche Datensätze hinweg erzielt wird.

Ursprüngliche Autoren: Mayur Kurup, Hyunjae Suh, Swathi Vaidyanathan, Pranesh Vyas, Srinidhi Madabhushi, Yegor Silyutin

Veröffentlicht 2026-07-09
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Mayur Kurup, Hyunjae Suh, Swathi Vaidyanathan, Pranesh Vyas, Srinidhi Madabhushi, Yegor Silyutin

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind der Regisseur einer gewaltigen Live-Fernsehübertragung, wie etwa des Super Bowls oder eines großen Fußballspiels. Millionen von Menschen schauen zu, und die Show muss ohne ein einziges technisches Problem ablaufen. In dieser Hochrisiko-Umgebung versucht Ihr Team von Ingenieuren ständig, kleine Fehler zu beheben oder neue Funktionen in der Software einzuführen, die die Show steuert.

Das Problem: Der „Alles-oder-Nichts“-Stillstand
Normalerweise würde der Regisseur, um eine Katastrophe zu verhindern, einen „Code Freeze“ verhängen. Das ist so, als würde man der gesamten Küche befehlen, das Kochen für die letzte Stunde vor dem Spiel komplett einzustellen. Keine neuen Gerichte, keine Anpassungen an den Rezepten, gar nichts. Dies ist zwar sicher, aber auch frustrierend. Es verhindert, dass gute Ideen serviert werden, erzeugt einen Rückstau an unerledigter Arbeit und bremst alles aus. Das aktuelle System behandelt einen winzigen, harmlosen Tippfehler genauso wie einen gefährlichen, spielentscheidenden Fehler: Beide werden blockiert.

Die Lösung: Ein intelligentes „Risiko-Radar“
Die Autoren dieser Arbeit, die bei Amazon Prime Video arbeiten, wollten einen klügeren Weg finden. Anstatt die gesamte Küche einzufrieren, bauten sie ein Risiko-Radar. Dieses System betrachtet jede einzelne Änderung, die ein Ingenieur vornimmt, bevor sie live geht, und fragt: „Ist diese spezifische Änderung gefährlich?“

Sie wollten nicht die Ingenieure ausspionieren (wie etwa deren vergangene Leistungen zu prüfen oder wie lange sie schon im Unternehmen sind), da dies Datenschutzprobleme aufwirft und bei neuen Teams nicht funktioniert. Stattdessen schauten sie strikt auf die Änderungen selbst – den „Diff“.

Betrachten Sie den „Diff“ als die tatsächliche Liste der Zutaten, die einem Rezept hinzugefügt oder entnommen wurden.

  • Der alte Weg: „Kocht nichts, weil wir nicht wissen, wer es gekocht hat.“
  • Der neue Weg: „Schaut euch dieses spezifische Rezept an. Es hat zu viele komplexe Schritte und eine seltsame Formatierung. Lasst uns es doppelt prüfen. Aber dieses andere Rezept hier ist einfach und sauber? Lasst es sofort servieren.“

Wie sie das Radar bauten
Um dieses Radar funktionsfähig zu machen, mussten sie in der Lage sein, die „Rezepte“ (den Code) in vielen verschiedenen Sprachen (Java, Kotlin, TypeScript) zu lesen, ohne für jede Sprache einen eigenen Übersetzer zu benötigen.

  1. Der KI-Übersetzer (LLMs): Sie nutzten ein leistungsstarkes KI-Modell (Large Language Model) nicht, um Code zu schreiben, sondern um als universeller Übersetzer zu fungieren. Es liest die Code-Änderungen und zählt Dinge wie:
    • Wie komplex ist die Logik? (Ist es ein einfacher Salat oder ein 10-Gänge-Menü?)
    • Wie viele Zeilen wurden hinzugefügt oder gelöscht?
    • Gibt es Formatierungsfehler? (Wie etwa das Vergessen einer Großschreibung oder die Verwendung der falschen Schriftart).
  2. Der Richter (Maschinelles Lernen): Die Zahlen und Kategorien, die die KI extrahierte, wurden in einen „Richter“ (ein statistisches Modell) eingespeist. Dieser Richter lernte aus vergangenen Fehlern (Vorfällen, bei denen die Show tatsächlich glitchte), um vorherzusagen, welche neuen Änderungen wahrscheinlich Probleme verursachen könnten.

Die überraschenden Erkenntnisse
Das Team testete dieses System mit Amazons Live-Daten und einem öffentlichen Datensatz von Open-Source-Projekten. Dabei fanden sie Folgendes heraus:

  • Größe ist nicht alles: Man könnte denken, dass eine riesige Änderung (das Hinzufügen von 1.000 Zeilen Code) riskanter ist als eine winzige Änderung. Die Studie ergab jedoch, dass dies falsch ist. Eine massive Änderung, die gut strukturiert ist, ist oft sicherer als eine winzige Änderung, die unordentlich und komplex ist. Das „Volumen“ der Änderung war tatsächlich ein verrauschtes, unzuverlässiges Signal.
  • Komplexität ist der wahre Bösewicht: Das stärkste Warnsignal war die strukturelle Komplexität. Wenn der Code verschachtelt, tief verschachtelt oder schwer nachvollziehbar ist, dann sollte das Radar „Gefahr!“ schreien.
  • Der KI-Übersetzer funktioniert: Die Nutzung der KI, um den Code zu lesen, funktionierte gut über verschiedene Sprachen hinweg und sparte dem Team die Arbeit, für jede einzelne Programmiersprache eigene Werkzeuge entwickeln zu müssen.
  • Der Mensch bleibt das Sagen: Das System ist nicht darauf ausgelegt, Änderungen automatisch zu blockieren. Es ist ein „Leitplankensystem“. Es markiert risikoreiche Änderungen zur Überprüfung durch einen Menschen. Das System ist so eingestellt, dass es sehr sensibel reagiert: Es ist besser, eine sichere Änderung für eine kurze Prüfung zu melden (ein Fehlalarm), als eine gefährliche Änderung zu übersehen.

Das Ergebnis
Durch die Nutzung dieses „Risiko-Radars“ kann Prime Video die „Alles-oder-Nichts“-Stillstände vermeiden. Sie können sichere, einfache Änderungen sofort durchführen lassen, während sie nur die komplexen, riskanten Änderungen für eine menschliche Überprüfung pausieren.

Kurz gesagt: Sie haben ein stumpfes Instrument (das Einfrieren von allem) durch ein präzises Werkzeug ersetzt (die Analyse der spezifischen Form und Komplexität der Änderung), wodurch sie die Show reibungslos am Laufen halten können, ohne die Küche komplett zu stoppen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →