← Neueste Arbeiten
🤖 machine learning

From Words to Amino Acids: Does the Curse of Depth Persist?

Dieser Artikel zeigt, dass der „Fluch der Tiefe", bei dem nur eine Teilmenge von Schichten erheblich zur Aufgabenleistung beiträgt, während andere lediglich eine inkrementelle Verfeinerung bieten, eine allgegenwärtige Ineffizienz in verschiedenen Protein-Sprachmodell-Architekturen darstellt, einschließlich autoregressiver, maskierter und multimodaler Diffusionsmodelle.

Ursprüngliche Autoren: Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Osw
Veröffentlicht 2026-04-27
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Frage: Ist der „tiefe" Teil des Deep Learning tatsächlich tief?

Stellen Sie sich vor, Sie bauen einen massiven, mehrstöckigen Wolkenkratzer, um ein komplexes Rätsel zu lösen. Sie gehen davon aus, dass jeder einzelne Stockwerk (oder jede Schicht) des Gebäudes für die endgültige Lösung unverzichtbar ist. Wenn Sie die oberste Etage entfernen, sollte das Gebäude doch einstürzen, oder?

Lange Zeit glaubten Wissenschaftler, dass dies auch für Protein-Sprachmodelle (PLMs) zutrifft. Dies sind KI-Systeme, die auf der „Sprache" von Proteinen (Ketten von Aminosäuren) trainiert wurden, um zu verstehen, wie diese funktionieren, sich falten und mutieren. Wie die berühmten Large Language Models (LLMs), die Texte verfassen, sind auch diese Protein-Modelle sehr „tief" aufgebaut, mit Dutzenden von Schichten, die übereinander gestapelt sind.

Neuere Forschungen zu textbasierten KI-Systemen haben jedoch eine überraschende Entdeckung gemacht, die als „Fluch der Tiefe" bezeichnet wird. Es stellt sich heraus, dass in vielen dieser hohen Gebäude die oberen Etagen nicht viel Schwerarbeit leisten. Sie polieren hauptsächlich nur die Antwort, die bereits in den unteren Etagen ermittelt wurde.

Diese Arbeit fragt: Tritt dieser „Fluch der Tiefe" auch bei Protein-Modellen auf?

Die Untersuchung: Testen der Schichten

Die Forscher wählten einen „Brechstangen"-Ansatz, um 7 verschiedene Familien von Protein-Modellen (darunter beliebte wie ESM2, ESM3 und ProGen) zu testen. Sie betrachteten die Modelle nicht nur passiv, sondern zerstörten sie aktiv, um zu sehen, was passiert.

Sie verwendeten drei Hauptmethoden, die wir uns wie folgt vorstellen können:

  1. Der „Etagen überspringen"-Test (Intervention): Stellen Sie sich vor, die KI verarbeitet eine Proteinsequenz. Die Forscher sagten der KI: „Ignoriere die 20. Etage; springe direkt von der 19. zur 21. Etage." Anschließend prüften sie, ob sich die endgültige Antwort änderte.

    • Ergebnis: In den meisten Modellen verursachte das Überspringen der oberen Etagen kaum eine Veränderung. Die KI erhielt immer noch die richtige Antwort. Aber das Überspringen der mittleren Etagen? Das führte zu einem Chaos. Die „Schwerstarbeit" findet in der Mitte statt, nicht oben.
  2. Der „Rate die Antwort"-Test (Output Readouts): Sie spähten in den „Denkprozess" der KI auf jeder einzelnen Etage, um zu sehen, was sie vorhersagte.

    • Ergebnis: Bis die Information die Mitte des Gebäudes erreichte, hatte die KI die Hauptantwort bereits ermittelt. Die oberen Etagen passten lediglich die Konfidenzniveaus an (z. B. änderten sie ein „vielleicht" in ein „definitiv"), anstatt die eigentliche Antwort zu verändern.
  3. Der „Realwelt"-Test (Downstream Performance): Sie testeten, wie gut die KI eine reale Aufgabe erfüllte (die Vorhersage, wie sich eine Mutation auf ein Protein auswirkt), indem sie nur die Informationen aus bestimmten Etagen nutzte.

    • Ergebnis: Bei großen Modellen flachte die Leistungskurve ab. Die mittleren Schichten erfassten fast alle für die Aufgabe notwendigen nützlichen Informationen. Das Hinzufügen weiterer Schichten oben brachte nur winzige, schrittweise Verbesserungen.

Die Ausnahmen und Nuancen

Während der „Fluch der Tiefe" ein gemeinsames Thema war, fand das Papier einige interessante Variationen:

  • Die „Polierer" vs. die „Bauer": In den meisten Modellen sind die frühen und mittleren Schichten die „Bauer", die das grundlegende Verständnis aufbauen. Die späteren Schichten sind die „Polierer", die nur die endgültige Ausgabe verfeinern.
  • Die „ESM3"-Wendung: Ein spezifisches Modell, ESM3, verhielt sich anders. Es ist ein „multimodales" Modell, was bedeutet, dass es sowohl die Sequenz des Proteins (die Buchstaben) als auch seine 3D-Struktur (die Form) betrachtet.
    • Analogie: Bei ESM3 scheinen die frühen Etagen damit beschäftigt zu sein, die Sequenz und die Struktur einander „vorzustellen" und sicherzustellen, dass sie dieselbe Sprache sprechen. Die eigentliche Schwerstarbeit zur Problemlösung findet später im Gebäude statt. Dies deutet darauf hin, dass bei der Mischung verschiedener Datentypen die „Tiefe" anders genutzt wird.
  • Das „Sparse"-Modell: Ein Modell, ProGen3, verwendet ein „Mixture of Experts" (MoE)-Design, das wie ein Team von Spezialisten funktioniert, bei dem nur wenige gleichzeitig an jedem Problem arbeiten. Dieses Modell zeigte weniger vom „Fluch der Tiefe", was darauf hindeutet, dass „Sparsamkeit" (die Verwendung weniger aktiver Teile) helfen könnte, die Tiefe effizienter zu nutzen.

Das Fazit

Das Papier kommt zu dem Schluss, dass Ineffizienz der Tiefe ein gemeinsames Merkmal moderner Protein-Modelle ist.

Genau wie bei textbasierten KI-Systemen bedeutet es nicht zwangsläufig, dass ein Protein-Modell „tiefer" wird (durch Hinzufügen weiterer Schichten), dass es auch proportional intelligenter wird. Ein großer Teil der Berechnung ist in einer bestimmten Teilmenge von Schichten konzentriert (meist den mittleren), während die verbleibenden Schichten hauptsächlich nur die endgültige Vorhersage verfeinern.

Warum ist das wichtig?
Die Autoren schlagen vor, dass wir, wenn wir wissen, dass die oberen Etagen nicht viel Schwerarbeit leisten, in der Zukunft intelligentere und effizientere Protein-Modelle entwerfen könnten. Anstatt höhere Wolkenkratzer zu bauen, könnten wir kürzere, effizientere bauen oder Systeme schaffen, die während des Betriebs unnötige Etagen „überspringen", um Energie und Zeit zu sparen.

Kurz gesagt: Das Papier bestätigt, dass Protein-Modelle unter demselben „Fluch der Tiefe" leiden wie Textmodelle. Die mittleren Schichten leisten die eigentliche Arbeit; die oberen Schichten fügen hauptsächlich nur einen letzten Anstrich hinzu.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →