← Neueste Arbeiten
💻 computer science

Can LLMs Produce Better Object-Oriented Designs than Human-Involved Development?

Diese Studie vergleicht die Qualität des objektorientierten Designs in Java-Projekten vor, nach und ausschließlich mit LLMs und stellt fest, dass zwar LLM-generierter Code eine geringere Komplexität und weniger Code-Smells aufweist, jedoch häufig unter Vereinfachung und schwacher Trennung der Verantwortlichkeiten leidet, was die anhaltende Notwendigkeit menschlicher Anleitung bei der Zerlegung von Designs unterstreicht.

Ursprüngliche Autoren: Zushuai Zhang, Elliott Wen, Ewan Tempero

Veröffentlicht 2026-05-20
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zushuai Zhang, Elliott Wen, Ewan Tempero

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Meisterarchitekt, der beauftragt ist, ein komplexes Haus zu bauen. Sie haben drei verschiedene Teams zur Auswahl, um den eigentlichen Bau durchzuführen:

  1. Die Alte Garde (PreAI): Erfahrene Bauarbeiter, die noch nie einen computergestützten Assistenten verwendet haben. Sie zeichnen ihre eigenen Baupläne und bauen alles von Hand.
  2. Die Hybrid-Crew (PostAI): Erfahrene Bauarbeiter, die nun einen leistungsstarken computergestützten Assistenten haben. Sie zeichnen weiterhin die Baupläne und treffen die großen Entscheidungen, lassen den Computer ihnen jedoch helfen, Ziegel zu legen und Holz zu schneiden.
  3. Das Roboterteam (PureAI): Ein Team fortschrittlicher Roboter, das eine einfache verbale Beschreibung des Hauses entgegennimmt und das gesamte Gebäude von Grund auf, von Anfang bis Ende, baut, ohne dass ein Mensch ein Werkzeug berührt.

Diese Arbeit stellt eine einfache Frage: Welches Team baut das beste Haus? Genauer gesagt: Erstellt das „Roboterteam" ein Design, das genauso gut oder sogar besser ist als die von menschlichen Teams?

Das Experiment

Die Forscher richteten eine „Bauherausforderung" mit einem klassischen Brettspiel namens Kalah ein. Sie forderten drei Gruppen auf, ein Java-Softwareprogramm zu entwickeln, um dieses Spiel zu spielen:

  • Gruppe 1 (PreAI): Studierende aus dem Jahr 2021 (bevor KI-Coding-Tools üblich waren).
  • Gruppe 2 (PostAI): Studierende aus dem Jahr 2024 (nachdem KI-Tools populär geworden waren).
  • Gruppe 3 (PureAI): Dieselbe Aufgabe, gegeben an drei verschiedene Top-KI-Modelle, die den Code vollständig eigenständig generierten.

Sie prüften nicht nur, ob das Spiel funktionierte; sie untersuchten die Qualität des Designs. Stellen Sie sich dies vor wie die Überprüfung, ob das Haus einen logischen Grundriss hat, ob die Räume die richtige Größe haben und ob die Rohrleitungen nicht verwickelt sind.

Was sie fanden

1. Das Roboterteam baute „kleinere" Häuser, aber sie waren zu einfach

Die PureAI (Roboterteams) bauten Code, der auf den ersten Blick sehr sauber aussah.

  • Die gute Nachricht: Ihr Code hatte weniger „Gerüche" (schlechte Gewohnheiten wie unordentlicher Code) und wirkte insgesamt weniger komplex. Es war wie ein Haus mit sehr wenigen Wänden und einem sehr offenen Grundriss.
  • Die schlechte Nachricht: Diese Einfachheit war tatsächlich ein Problem. Die Roboter vereinfachten das Design übermäßig. Anstatt separate Räume für den „Spieler", das „Brett" und die „Gruben" (die Löcher im Spiel) zu bauen, schlugen die Roboter oft alles zu einem oder zwei riesigen Räumen zusammen.
  • Die Metapher: Stellen Sie sich ein Haus vor, in dem Küche, Schlafzimmer und Badezimmer nur ein großer Raum ohne Türen sind. Es ist sehr einfach und leicht zu reinigen (geringe Komplexität), aber es ist schrecklich zum Wohnen, weil man seine Aktivitäten nicht trennen kann (schlechte „Trennung der Verantwortlichkeiten"). Die Roboter verpassten die wichtigen „Abstraktionen" (die unterschiedlichen Konzepte), die ein System verständlich machen.

2. Die Hybrid-Crew (PostAI) fing an, wie Roboter zu handeln

Die Studierenden aus dem Jahr 2024 (die KI-Helfer nutzten) bauten nicht ganz so „roboterhaft" wie das PureAI-Team, aber sie waren den Robotern näher als die Studierenden aus dem Jahr 2021.

  • Ihre Designs wurden ebenfalls etwas zu einfach und verpassten einige der unterschiedlichen „Räume" (Konzepte), die die Studierenden aus dem Jahr 2021 einbezogen.
  • Im Gegensatz zu den Robotern hatte der Code der Hybrid-Crew jedoch tatsächlich mehr unordentliche Gewohnheiten (Code-Gerüche) als der Code der altmodischen Studierenden. Es scheint, dass wenn Menschen versuchen, von Robotern generierten Code zu reparieren oder zu bearbeiten, sie manchmal lokal neue Unordnung einführen, selbst wenn die Gesamtstruktur einfach aussieht.

3. Der „Prompt" ist wichtig, aber kein Zauberstab

Die Forscher versuchten, den Robotern spezifischere Anweisungen zu geben, wie zum Beispiel: „Stellen Sie sicher, dass Sie eine separate Klasse für den Spieler und eine separate für das Brett haben."

  • Ergebnis: Wenn die Anweisungen spezifischer waren, leisteten die Roboter einen besseren Job beim Erstellen separater „Räume" (Konzepte).
  • Einschränkung: Selbst mit den besten Anweisungen erreichten die Roboter immer noch nicht ganz die Qualität der von Menschen entworfenen Häuser. Sie neigten immer noch dazu, Dinge übermäßig zu vereinfachen.

Die große Erkenntnis

Roboter sind großartig darin, Ziegel zu legen, aber Menschen werden immer noch benötigt, um die Baupläne zu zeichnen.

Die Arbeit kommt zu dem Schluss, dass KI zwar Code schreiben kann, der funktioniert und sauber aussieht, aber sie hat Schwierigkeiten mit dem großen Ganzen des objektorientierten Designs. Sie neigt dazu, alles zusammenzufassen, um Dinge „einfach" zu machen, was die Software später tatsächlich schwerer wartbar macht, weil die unterschiedlichen Teile des Systems verloren gehen.

  • PureAI (Roboter): Großartig darin, kleine Fehler zu vermeiden, aber schlecht darin, die große Struktur zu verstehen.
  • PostAI (Menschen mit KI): Beginnen, einige der strukturellen Tiefe zu verlieren, und machen den Code dabei manchmal unordentlicher.
  • Die Lehre: Wenn Sie KI verwenden, um Software zu schreiben, müssen Sie als Architekt fungieren. Sie müssen der KI genau sagen, wie sie das Problem in unterschiedliche Teile zerlegen (Dekomposition) und wofür jeder Teil verantwortlich ist. Wenn Sie nur sagen „baue ein Spiel", wird die KI eine unordentliche, übermäßig vereinfachte Version bauen, die sauber aussieht, aber später schwer zu reparieren ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →