Qwen3-ASR Technical Report
Dieser Bericht stellt die Qwen3-ASR-Familie vor, die aus zwei leistungsstarken All-in-One-Spracherkennungsmodellen (0,6B und 1,7B Parameter) und einem neuartigen nicht-autoregressiven Forced-Alignment-Modell besteht, welche kollektiv eine State-of-the-Art-Genauigkeit und Effizienz über 52 Sprachen hinweg erreichen und unter einer Apache 2.0-Lizenz veröffentlicht werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich die Welt der Sprachtechnologie als eine geschäftige Stadt vor. Jahrelang waren die „Polizisten“ (traditionelle Spracherkennungssysteme) sehr gut darin, klare, geschriebene Schilder in einem ruhigen Raum zu lesen. Aber wenn man in einem belebten Markt schrie, ein Lied sang oder mit einem starken Akzent sprach, wurden sie oft verwirrt oder gaben auf.
Das Qwen3-ASR-Team hat gerade eine neue Gruppe von „Super-Cops“ und einen „Zeitwächter“ veröffentlicht, die das Spiel völlig verändern. Hier ist das, was sie gebaut haben, einfach erklärt:
1. Die zwei Super-Cops: Qwen3-ASR-1.7B und Qwen3-ASR-0.6B
Betrachten Sie diese beiden Modelle als ein Paar Detektive mit unterschiedlichen Stärken, die beide von einem „Super-Mentor“ (einem Fundamentmodell namens Qwen3-Omni) trainiert wurden, der die Welt tiefgreifend versteht.
- Der große Detektiv (Qwen3-ASR-1.7B): Dies ist der Schwergewichtler. Er ist wie ein erfahrener Veteran, der schon alles gehört hat. Er kann einem Gespräch in einer lauten Fabrik zuhören, ein Lied mit einer vollen Band im Hintergrund verstehen oder herausfinden, was jemand sagt, selbst wenn er einen seltenen Dialekt spricht. Er ist so gut, dass er mit den teuersten, geschlossenen Diensten konkurriert, die von riesigen Technologieunternehmen betrieben werden.
- Der schnelle Detektiv (Qwen3-ASR-0.6B): Dies ist der leichte, agile Partner. Er ist kleiner und schneller. Stellen Sie sich einen Detektiv vor, der einen Marathon laufen kann, während er ein Rätsel löst. Er ist darauf ausgelegt, unglaublich effizient zu sein. Das Paper behauptet, dass er 2.000 Sekunden Sprache in nur 1 Sekunde verarbeiten kann, wenn er viele Aufgaben gleichzeitig ausführt. Er ist perfekt dafür geeignet, in Ihr Telefon oder ein kleines Gerät integriert zu werden, da er keinen massiven Computer benötigt, um zu funktionieren.
Was macht sie besonders?
- Der „Universalübersetzer“-Hut: Sie sprechen nicht nur Englisch oder Mandarin; sie verstehen 52 Sprachen und Dialekte. Egal, ob Sie Standardchinesisch, einen spezifischen regionalen Dialekt wie Sichuanisch oder eine Sprache wie Vietnamesisch sprechen – sie können den Hut augenblicklich wechseln.
- Die „Geräuschunterdrückungs“-Ohren: Sie wurden trainiert, dem Chaos zu trotzen. Wenn Sie ein Lied singen, während eine Trommel schlägt, oder wenn ein Kind in einer belebten Straße schreit, können diese Modelle die Worte dennoch klar hören.
- Das „Spracherkennungs“-Abzeichen: Noch bevor sie die Wörter aufschreiben, wissen sie genau, welche Sprache Sie gerade sprechen. Sie können den Unterschied zwischen ähnlich klingenden Sprachen (wie Malaiisch und Indonesisch) mit hoher Genauigkeit feststellen.
2. Der Zeitwächter: Qwen3-ForcedAligner-0.6B
In den alten Tagen, wenn man genau wissen wollte, wann ein Wort in einer Aufnahme begann und endete (wie etwa für die Erstellung von Untertiteln), musste man eine langsame, klobige Maschine verwenden, die oft Fehler machte.
Das Team hat ein neues Werkzeug namens Qwen3-ForcedAligner eingeführt.
- Die Analogie: Stellen Sie sich vor, Sie haben ein Transkript (die Wörter) und eine Aufnahme (den Klang). Die alten Werkzeuge waren wie der Versuch, die Wörter durch Raten mit dem Klang abzugleichen. Dieses neue Modell ist wie ein super-schneller, nicht-autoregressiver Zeitwächter.
- Wie es funktioniert: Anstatt ein Wort nach dem anderen zu erraten (was langsam ist), betrachtet es den gesamten Satz und weist jedem einzelnen Wort oder Zeichen sofort einen Zeitstempel zu.
- Das Ergebnis: Es ist unglaublich genau und schnell. Es kann 11 Sprachen handhaben und funktioniert selbst dann, wenn der Sprecher mitten im Satz die Sprache wechselt. Es ist so schnell, dass es eine Stunde Audio in nur wenigen Minuten verarbeiten kann.
3. Wie sie lernten (Das Training)
Sie fragen sich vielleicht: „Wie sind sie so klug geworden?“
- Das Fundament: Sie begannen mit einem Modell, das bereits Audio, Vision und Text verstand (Qwen3-Omni).
- Die Übung: Sie übten an einer massiven Bibliothek von 40 Millionen Stunden aufgenommener Sprache (hauptsächlich Chinesisch und Englisch).
- Das „Realitätscheck“-Training: Sie haben nicht nur in einem ruhigen Studio geübt. Sie wurden getestet auf:
- Ältere Menschen und Kinder: Verschiedene Stimmlagen.
- Zungenbrecher: Schnelles, schwieriges Sprechen.
- Singen: Melodien, die Wörter dehnen.
- Hintergrundgeräusche: Laute Musik und Menschenmengen.
- Die „Verstärkungs“-Lektion: Schließlich verwendeten sie eine spezielle Trainingsmethmethode (Reinforcement Learning), bei der sie bei ihren schwierigsten Fehlern korrigiert wurden, was sie in der realen Welt viel robuster macht.
4. Die Ergebnisse: Warum es wichtig ist
Das Paper vergleicht diese neuen Modelle mit den besten Wettbewerbern (sowohl freien Open-Source-Modellen als auch bezahlten kommerziellen Diensten).
- Genauigkeit: Das große Modell (1.7B) ist oft das genaueste verfügbare Open-Source-Modell und übertrifft oder erreicht die teuren bezahlten Dienste.
- Geschwindigkeit: Das kleine Modell (0.6B) ist das schnellste und bietet die beste Balance zwischen Geschwindigkeit und Intelligenz.
- Vielseitigkeit: Sie sind die Ersten, die hochwertige Spracherkennung, Spracherkennung (Language ID) und Gesenserkennung in einem Paket kombinieren, das in Dutzenden von Sprachen funktioniert.
Zusammenfassend lässt sich sagen: Die Qwen3-ASR-Familie ist ein Werkzeugkasten, der es Computern ermöglicht, die menschliche Sprache so gut zu verstehen wie ein Mensch – selbst in lauten, chaotischen oder musikalischen Situationen – und das in vielen verschiedenen Sprachen. Sie haben diese Werkzeuge kostenlos für alle zur Verfügung gestellt, in der Hoffnung, Forscher und Entwickler dabei zu unterstützen, bessere Sprachtechnologien für die Zukunft zu bauen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.