← Neueste Arbeiten
💻 computer science

Predictive and Adaptive Resource Scheduling for Kubernetes–Ceph Hyperconverged Infrastructure on Proxmox VE

Diese Arbeit schlägt ein prädiktives, adaptives Scheduling-Modell vor und evaluiert dieses, welches die Arbeitslastprognose mit Ceph-bewussten Speicherentscheidungen integriert, um Ressourcenkonflikte und I/O-Latenzen in einer Kubernetes–Ceph-hyperkonvergenten Infrastruktur auf Proxmox VE signifikant zu reduzieren und dabei eine überlegene Lastverteilung sowie Performance im Vergleich zum Standard-Kubernetes-Scheduler zu erreichen.

Ursprüngliche Autoren: Doston Khasanov, Abdurauf Abdullaev, Halimjon Khujamatov, Temirbek Toshtemirov, Alisher Mamatov, Razvan Craciunescu

Veröffentlicht 2026-07-23
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Doston Khasanov, Abdurauf Abdullaev, Halimjon Khujamatov, Temirbek Toshtemirov, Alisher Mamatov, Razvan Craciunescu

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine geschäftige Stadt vor, in der die Straßen, das Stromnetz und die Wasserversorgung alle im selben Viertel leben. In der Welt des modernen Computings wird dies als „Hyperconverged Infrastructure“ bezeichnet. Anstatt separate Gebäude für Server (Rechenleistung), Festplatten (Speicher) und Netzwerkkabel zu haben, ist alles kompakt auf denselben physischen Maschinen untergebracht. Es ist effizient und spart Platz, erzeugt aber ein kniffliges Verkehrsproblem. Wenn ein massiver Lieferwagen (ein datenintensives Programm) versucht, durch eine Straße zu fahren, während eine Baustelle (eine Speicheraufgabe) direkt daneben arbeitet, gerät alles ins Stocken.

Um diese digitale Stadt zu verwalten, verwenden wir ein System namens Kubernetes. Stellen Sie sich Kubernetes als den Verkehrskontrolleur der Stadt vor. Seine Aufgabe ist es zu entscheiden, welches Gebäude (Server) welchen neuen Lieferwagen (Softwareprogramm oder „Pod“) erhält. Der Standard-Verkehrskontrolleur ist jedoch etwas altmodisch. Er betrachtet nur das, was gerade jetzt passiert. Er sieht, dass ein Gebäude leer ist, und sagt: „Super, schick den LKW dorthin!“ Er merkt jedoch nicht, dass das Stromnetz des Gebäudes bereits kämpft, weil in der Nähe ein Bauprojekt stattfindet, oder dass der LKW gleich mit einer Ladung ankommt, die in fünf Minuten einen Stau verursachen wird. Dieser reaktive Stil führt oft dazu, dass einige Gebäude unter zu viel Arbeit zusammenbrechen, während andere untätig sind, und die „Straßen“ (Datenspeicher) verstopfen, was alles verlangsamt.

Um dieses Rätsel zu lösen, haben Forscher von Universitäten aus Usbekistan und Rumänien beschlossen, die Frage zu stellen: Was wäre, wenn unser Verkehrskontrolleur in die Zukunft blicken könnte? Was wäre, wenn er voraussehen könnte, wo Staus entstehen werden, bevor sie passieren, und die LKWs entsprechend umleiten könnte? In ihrer Arbeit haben sie ein intelligenteres, „prädiktives und adaptives“ System entwickelt, das nicht nur auf die Gegenwart reagiert, sondern für die unmittelbare Zukunft plant. Durch die Kombination eines einfachen Vorhersagewerkzeugs mit einer neuen Art der Softwareplatzierung gelang es ihnen, das Chaos in ihrer Teststadt zu glätten, und sie bewiesen, dass manchmal ein wenig Weitblick besser ist als ein superkomplexes Gehirn.

Das Problem: Der reaktive Verkehrskontrolleur

In der digitalen Welt haben die Forscher einen „hyperkonvergenten“ Testaufbau mit drei Hauptwerkzeugen erstellt: Proxmox VE (das Fundament, das die Server hält), Ceph (das Speichersystem, das wie eine riesige gemeinsame Festplatte fungiert) und Kubernetes (der Verkehrskontrolleur).

In einem Standardaufbau spielt Kubernetes auf Nummer sicher. Es wartet, bis ein Server ein Programm ausführt, prüft, wie viel CPU (Rechenleistung) und Arbeitsspeicher (Kurzzeitgedächtnis) genutzt werden, und entscheidet dann, wo das nächste Programm platziert wird. Es ist wie ein Polizist, der nur die Autos sieht, die gerade auf der Straße sind. Wenn ein Server frei aussieht, schickt der Polizist ein neues Auto dorthin. Aber in einem hyperkonvergenten System muss das „Auto“ möglicherweise auf den „Speicher“ (die Festplatte) auf demselben Server zugreifen. Wenn der Polizist nicht weiß, dass der Speicher des Servers bereits beschäftigt ist, bleibt das neue Auto stecken, was zu Verzögerungen führt.

Die Forscher fanden heraus, dass dieser „reaktive“ Ansatz zu drei großen Problemen führt:

  1. Ressourcenkonflikte (Resource Contention): Zu viele Programme, die gleichzeitig um dieselbe CPU oder denselben Speicher kämpfen.
  2. Lastungleichgewicht (Load Imbalance): Einige Server schwitzen extrem (laufen mit 95 % Kapazität), während andere schlafen (laufen mit 40 % Kapazität).
  3. Speicherlatenz (Storage Latency): Die Zeit, die zum Lesen oder Schreiben von Daten benötigt wird, wird langsamer, weil das Speichersystem überlastet ist.

Die Lösung: Eine Kristallkugel und eine flexible Karte

Das Team schlug ein neues Modell vor, das wie ein Verkehrskontrolleur mit einer Kristallkugel und einer flexiblen Karte funktioniert. Ihr System besteht aus vier Teilen, die in einer Schleife zusammenarbeiten:

  1. Die Kristallkugel (Vorhersage): Anstatt nur den gegenwärtigen Moment zu betrachten, nutzt das System einen mathematischen Trick namens „Exponentially Weighted Moving Average“ (EWMA). Denken Sie an einen Wettervorhersager, der sich an den Regen der letzten Tage orientiert, um vorherzusagen, ob Sie morgen einen Regenschirm benötigen. Er prognostiziert, wie viel CPU und Speicher ein Programm in den nächsten Minuten benötigen wird. Sie fanden heraus, dass eine spezifische Einstellung für diese „Vorhersage“ am besten funktionierte: Die CPU-Anforderungen wurden mit einer Fehlerrate von etwa 8,4 %, der Arbeitsspeicher mit 5,1 % und die Speicheranforderungen mit 12,3 % vorhergesagt.
  2. Die flexible Karte (Adaptives Scheduling): Sobald das System weiß, was kommt, dumpt es das Programm nicht einfach auf den ersten freien Server. Es berechnet die „vorhergesagte Last“ für jeden Server. Es fragt: „Wenn ich dieses Programm hier platziere, wird der Server in fünf Minuten überlastet sein?“ Wenn die Antwort ja lautet, überspringt es diesen Server und sucht einen besseren Platz.
  3. Die speicherbewusste Entscheidung: Dies ist das Geheimrezept. Das System betrachtet nicht nur die CPU; es prüft auch die Gesundheit des Ceph-Speichers (die „OSD“ oder Speicher-Daemons). Wenn ein Server ein beschäftigtes Laufwerk hat, weiß das System, dass es die datenintensiven Programme woanders hin schicken muss, selbst wenn die CPU frei aussieht.
  4. Die dynamische Anpassung: Wenn ein Programm plötzlich mehr Leistung benötigt als erwartet, kann das System seine Limits automatisch anpassen, ohne abzustürzen oder neu zu starten, um den Fluss aufrechtzuerhalten.

Das Experiment: Ein Test in drei Städten

Um zu sehen, ob dies funktionierte, bauten die Forscher eine echte, kleine Stadt mit drei physischen Computern (Nodes) auf. Jeder Node verfügte über einen leistungsstarken Prozessor, 32 GB RAM und zwei schnelle NVMe SSDs (superschnelle Festplatten). Sie füllten diese Stadt mit unterschiedlichem Verkehr:

  • CPU-intensive LKWs: Programme, die nur Zahlen berechnen (wie stress-ng).
  • Speicherintensive LKWs: Programme, die massive Mengen an Daten lesen und schreiben (wie fio).
  • Gemischter Verkehr: Datenbanken und Webanwendungen, die ein bisschen von allem machen (wie YCSB).

Sie ließen zwei Szenarien nebeneinander für 30 Minuten laufen:

  • Szenario A (Der alte Weg): Standard-Kubernetes ohne Vorhersage.
  • Szenario B (Der neue Weg): Ihr prädiktives, adaptives Modell.

Die Ergebnisse: Glattere Straßen, schnellere Lieferung

Die Ergebnisse waren ein klarer Sieg für das neue Modell, und die Zahlen erzählen eine lebendige Geschichte der Verbesserung.

1. Lastverteilung:
Auf dem alten Weg war der Verkehr extrem ungleichmäßig. Ein Server war unter dem Druck am Schreien und lief mit 95,64 % Kapazität, während ein anderer kaum arbeitete (3,973 %). Das „Ungleichgewicht“ (die Differenz zwischen dem geschäftigsten und dem ruhigsten Server) war ein chaotisches 53,29 %.
Mit dem neuen Modell glättete sich der Verkehr perfekt. Der geschäftigste Server sank auf 67,41 % und der ruhigste erwachte zu 56,33 % auf. Das Ungleichgewicht sank drastisch auf nur 10,98 %. Das ist eine Reduktion des Chaos um 79,4 %. Das neue System hielt alle Server in einem engen, glücklichen Band von 54 % bis 68 % Auslastung, was bedeutet, dass niemand überarbeitet und niemand gelangweilt war.

2. Beschleunigung des Speichers:
Da das neue System wusste, wo der Speicher beschäftigt war, vermied es Verstopfungen auf den Straßen. Die durchschnittliche Zeit, um Speicheränderungen anzuwenden (Latenz), sank von 1,11 ms auf 1,00 ms. Das klingt nach einem winzigen Unterschied, aber in der Welt der Daten bedeutet es, dass das System konsistenter und zuverlässiger ist. Auch die „Worst-Case“-Verzögerung (das 95. Perzentil) verbesserte sich von 1,15 ms auf 1,00 ms, was zeigt, dass das System den schweren Verkehr viel besser bewältigte.

3. Keine Zusatzkosten:
Die Forscher betonten sorgfältig, dass sie nicht die gesamte Stadt neu bauen oder teure, komplexe KI-Gehirne verwenden mussten. Sie nutzten Standard-Tools (Kubernetes und Prometheus APIs) und eine einfache Vorhersagemethode. Sie bewiesen, dass man keine superkomplexen Algorithmen braucht, um großartige Ergebnisse zu erzielen; man muss nur die Punkte zwischen Computing und Speicher miteinander verbinden.

Das Fazit: Integration statt Komplexität

Der spannendste Teil dieser Arbeit ist nicht nur, dass es funktionierte, sondern warum es funktionierte. Die Forscher argumentieren, dass das Problem nicht war, dass der alte Verkehrskontrolleur zu dumm war, sondern dass er das Problem nur in einer Dimension betrachtete. Er sah die CPU, ignorierte aber den Speicher.

Durch das einfache Hinzufügen einer Ebene von „Voraussicht“ und „Speicherbewusstsein“ zur bestehenden Struktur erreichten sie massive Gewinne. Sie zeigten, dass architektonische Integration (dass Computing und Speicher miteinander kommunizieren) mächtiger ist als nur die Algorithmen komplexer zu machen. Selbst ein einfaches, leichtgewichtiges Vorhersagewerkzeug kann, kombiniert mit intelligenter Platzierung, die größten Engpässe in einem hyperkonvergenten System beheben.

Letztendlich legt diese Arbeit nahe, dass die Zukunft des effizienten Computings nicht unbedingt darin besteht, größere, intelligentere Gehirne zu bauen, sondern sicherzustellen, dass die verschiedenen Teile des Systems Hand in Hand gehen und gemeinsam vorausblicken. Der Verkehrskontrolleur muss kein Genie sein; er muss nur wissen, was um die Ecke kommt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →