Phoenix-VL 1.5 Medium Technical Report
Phoenix-VL 1.5 Medium ist ein 123-Milliarden-Parameter umfassendes, von Grund auf multimodales und mehrsprachiges Basis-Modell, das durch umfangreiche lokalisierte Vor- und Ausrichtungstraining spezifisch für den singapurischen Kontext angepasst wurde und dabei auf regionalen Benchmarks State-of-the-Art-Leistung erzielt, während es gleichzeitig im Bereich der allgemeinen Intelligenz global wettbewerbsfähig bleibt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Die große Idee: Ein „lokaler Experte"-Superhirn
Stellen Sie sich einen brillanten, weltreisenden Professor vor, der alles über Wissenschaft, Mathematik und globale Geschichte weiß. Dies ist das Mistral Medium 3.1-Modell, mit dem die Forscher begannen. Es ist unglaublich intelligent, aber wenn Sie es nach einem spezifischen lokalen Gesetz in Singapur oder dem Namen eines berühmten Spielplatzes im Stadtteil Toa Payoh fragen, könnte es falsch raten oder eine allgemeine Antwort geben.
Phoenix-VL 1.5 Medium ist das Ergebnis, wenn man diesen weltreisenden Professor zu einem rigorosen, 12-monatigen „Singapur-Immersion-Bootcamp" schickt. Das Ziel war die Schaffung einer Souveränen KI – ein digitales Gehirn, das Singapur gehört, seine einzigartige Kultur und Gesetze versteht und sicher arbeiten kann, ohne im Internet nachschlagen zu müssen (wie ein „air-gapped"-System, das nicht mit der Außenwelt spricht).
Das Trainingsrezept: Wie sie es gemacht haben
Die Forscher haben dem Modell nicht einfach einen Haufen Bücher übergestülpt. Sie verwendeten ein spezifisches, vierstufiges Kochrezept, um diese neue KI zu backen:
Die Basisschicht (Fortgesetztes Vor-Training):
Stellen Sie sich dies vor, als würde man dem Modell eine massive, spezialisierte Bibliothek zuführen. Sie gaben ihm 1 Billion Token (ein Token ist wie ein Wort oder ein Wortteil) an Daten. Dies war nicht einfach zufälliger Internettext; es war eine kuratierte Mischung, die stark auf singapurischen Gesetzen, regionalen Sprachen (wie Malay, Tamil und Chinesisch) und der lokalen Kultur basierte.- Die Analogie: Stellen Sie sich vor, der Professor liest ein Jahr lang jede singapurische Zeitung, jedes Regierungsblatt und jeden lokalen Roman, während er gleichzeitig sein globales Wissen behält.
Die Lang-Lese-Erweiterung (Langer Kontext):
Sie lehrten das Modell, enorme Informationsmengen gleichzeitig zu behalten. Sie erweiterten sein „Kurzzeitgedächtnis", um 131.072 Token zu halten (ungefähr die Größe eines dicken Romans).- Die Analogie: Der Professor kann nun ein ganzes 500-seitiges juristisches Dokument an einem Stück lesen und sich an die Details von Seite 1 erinnern, wenn er bei Seite 400 angelangt ist, ohne den Anfang zu vergessen.
Das Feinabstimmen (Instruktions- und Domänen-Training):
Hier lernte das Modell, wie es sich zu verhalten hat. Sie zeigten ihm spezifische Beispiele dafür, wie man Fragen zu singapurischen Regierungspolitiken beantwortet und wie man lokale Szenen beschreibt (wie einen „Toa Payoh Dragon Playground" statt nur eines allgemeinen „Spielplatzes").- Die Analogie: Der Professor nimmt nun einen Kurs in „Kundenservice und lokales Benehmen". Er lernte, dass wenn ein Singapurer nach einem Gesetz fragt, eine präzise Antwort benötigt wird und keine vage Vermutung. Er lernte auch, Bilder lokaler Wahrzeichen zu betrachten und sie genau zu beschreiben.
Das Polieren (Online Direct Preference Optimization):
Schließlich überprüften menschliche Lehrer die Antworten des Modells und bewerteten sie. Wenn das Modell zu plauderhaft war, halluzinierte (Dinge erfand) oder unhöflich war, korrigierten die Lehrer es.- Die Analogie: Eine letzte „Generalprobe", bei der der Professor das Beantworten von Fragen übt, und ein Richterpanel ihm Feedback gibt, um sicherzustellen, dass er hilfreich, ehrlich und sicher ist, bevor er auf die Bühne geht.
Was macht es besonders?
Der Bericht hebt drei Haupt-Superkräfte dieses neuen Modells hervor:
- Es ist eine lokale Legende: Bei Tests, die speziell für Singapur entwickelt wurden (wie das Wissen um die Namen aller 16 Regierungsministerien oder das Verständnis lokaler Sicherheitsgesetze), schlug Phoenix-VL 1.5 Medium viel größere, berühmtere Modelle.
- Das Ergebnis: Es erzielte bei lokalem Wissen höhere Punktzahlen als Modelle mit 400 Milliarden Parametern (wie Llama 4 Maverick). Dies beweist, dass tiefes lokales Training wichtiger ist als nur ein größeres Gehirn zu haben.
- Es hat die Welt nicht vergessen: Eine gängige Befürchtung ist, dass das Lehren eines Modells über ein spezifisches Thema dazu führt, dass es alles andere vergisst. Der Bericht behauptet, Phoenix-VL 1.5 Medium habe seine allgemeinen Intelligenz bewahrt. Es ist immer noch hervorragend in Mathematik, Programmierung und allgemeiner Logik, genauso gut wie andere Top-Modelle.
- Es sieht und versteht: Im Gegensatz zu älteren Modellen, die nur Text lesen, ist dieses „multimodal". Es kann ein Bild einer singapurischen Straßenszene oder eines komplexen Diagramms betrachten und es im lokalen Kontext erklären.
Sicherheit: Der „Ehrlichkeits"-Filter
Die Forscher bauten einen speziellen Sicherheitsrahmen, der auf Singapurs Regeln zugeschnitten ist.
- Die Regel „Nichts erfinden": In rechtlichen oder behördlichen Kontexten ist das Erfinden von Fakten gefährlich. Das Modell wurde darauf trainiert, „Ich weiß es nicht" zu sagen, anstatt zu raten.
- Die Regel „Keine bösen Akteure": Das Modell ist resistent gegen „Jailbreaks" (Tricks, die Menschen verwenden, um KI dazu zu bringen, böse Dinge zu tun) und wird seine eigenen geheimen Anweisungen nicht preisgeben.
- Die Analogie: Stellen Sie es sich als einen sehr disziplinierten Staatsbeamten vor, der genau weiß, was er sagen darf und was er verweigern muss, um sicherzustellen, dass er niemals versehentlich gegen das Gesetz verstößt oder Fehlinformationen verbreitet.
Das Fazit
Phoenix-VL 1.5 Medium ist ein KI-Modell mit 123 Milliarden Parametern, das beweist, dass man nicht das größte Modell der Welt braucht, um der klügste lokale Experte zu sein. Durch die sorgfältige Kuratierung von Daten und das spezifische Training für Singapurs einzigartige Gesetze, Sprachen und Kultur schufen die Entwickler ein Modell, das:
- Tiefes Wissen über Singapur hat (besser als Giganten).
- Global wettbewerbsfähig in allgemeiner Intelligenz ist.
- Sicher und geschützt für den Einsatz in Regierungs- und Privatsektoren ist, ohne das Internet zu benötigen.
Es ist ein „souveränes Gut", was bedeutet, dass es ein digitales Werkzeug ist, das speziell für Singapurs Bedürfnisse gebaut wurde und von der Nation besitzt und kontrolliert wird.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.