Swiss Parliaments Corpus Re-Imagined (SPC_R): Enhanced Transcription with RAG-based Correction and Predicted BLEU
Dit artikel introduceert SPC_R, een uitgebreid corpus van Zwitserse parlementsdebatten in het Zwitsers-Duits dat via Whisper Large-v3 is getranscribeerd en met behulp van GPT-4o is verfijnd en gefilterd, resulterend in een dataset van 555 uur met een aanzienlijke verbetering in vertaalkwaliteit ten opzichte van eerdere versies.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🇨🇭 Het Grote Zwitserse Parlements-Project: Van Ruwe Steen tot Glanzend Mosaïek
Stel je voor dat je een enorme berg ruwe stenen hebt (de audio-opnames van het Zwitserse parlement). Je wilt er een prachtig mozaïek van maken (de tekst), maar de stenen zijn vuil, gebroken en soms zelfs verkeerd geplaatst. Dit paper beschrijft hoe de onderzoekers van de FHNW (een hogeschool in Zwitserland) deze ruwe stenen hebben omgetoverd tot een perfect, schoon mozaïek dat iedereen kan gebruiken.
Hier is hoe ze dat deden, stap voor stap:
1. De Eerste Proef: De "Slome" Vertaler (Whisper)
Eerst namen ze 801 uur aan audio-opnames van parlementsdebatten. In Zwitserland wordt er vaak in een dialect (Zwitser-Duits) gesproken, maar de officiële notities zijn in Standaard-Duits. Dat is als proberen een gesprek in een lokaal dialect te vertalen naar formeel Frans; het is lastig!
Ze gebruikten een slimme AI genaamd Whisper Large-v3 om de audio om te zetten in tekst.
- De analogie: Denk aan Whisper als een zeer snelle, maar soms slordige stagiair. Hij schrijft alles snel op, maar hij maakt fouten bij moeilijke namen (bijvoorbeeld "Alba Rutschi" in plaats van "Alberucci") en verwarde zinnen.
- Het probleem: De stagiair is snel, maar niet perfect. Soms schrijft hij iets op dat klinkt alsof het klopt, maar dat eigenlijk onzin is.
2. De Tweede Proef: De "Slimme Controleur" (GPT-4o)
Om de fouten van de stagiair te corrigeren, haalden ze een tweede, nog slimmere AI erbij: GPT-4o.
- De RAG-methode (De "Boekhouder"): Deze AI kreeg niet alleen de ruwe tekst, maar ook toegang tot de officiële notities van het parlement.
- Hoe het werkt: Stel, de stagiair schrijft "De heer Müller". De slimme AI kijkt in de officiële notities (haar "boek"), ziet dat er "De heer Müller" staat, en corrigeert de tekst direct. Ze gebruikten een techniek genaamd RAG (Retrieval-Augmented Generation), wat je kunt vergelijken met het geven van een open boek aan een student tijdens een examen. De student (de AI) kan de antwoorden opzoeken in het boek in plaats van ze uit het hoofd te raden.
- Het resultaat: De fouten bij namen en specifieke termen verdwenen bijna volledig.
3. De Kwaliteitscontrole: De "Scorebord" (Predicted BLEU)
Niet alle stukjes tekst zijn even goed. Soms is de audio zo slecht dat zelfs de slimste AI niet kan helpen. De onderzoekers wilden weten: Welke stukjes zijn goed genoeg om te bewaren?
Ze bedachten een slimme truc:
- De Analogie: Stel je voor dat Whisper een "zelfvertrouwen-score" geeft bij elke zin. Als hij erg zeker is van zijn zaak, is de tekst waarschijnlijk goed. Als hij twijfelt, is hij waarschijnlijk aan het gissen.
- Ze ontdekten een rechte lijn: Hoger zelfvertrouwen = Hogere kwaliteit.
- Ze gebruikten dit om een "Voorspelde BLEU-score" te berekenen. Dit is een cijfer dat aangeeft hoe goed de tekst is, zonder dat ze eerst alles handmatig hoeven te nakijken. Alles wat onder een bepaald cijfer (65) viel, werd weggegooid.
4. De Eindselectie: Van 801 uur naar 555 uur
Na al dit werk (Whisper vertalen, GPT-4o corrigeren met behulp van officiële notities, en de kwaliteit controleren), hadden ze een selectie gemaakt:
- Start: 801 uur audio.
- Eindresultaat: 555 uur hoogwaardige audio met perfecte teksten.
Ze gooiden ongeveer 250 uur weg omdat die te veel ruis of fouten bevatten. Het resultaat is een dataset die 6 punten beter scoort dan eerdere versies.
Waarom is dit belangrijk?
Voorheen waren datasets voor Zwitser-Duits vaak op zin-niveau (losse zinnen). Dit is als een woordenboek: handig, maar niet nuttig voor een echt gesprek.
- De nieuwe aanpak: Dit project levert lange stukken audio (soms urenlang). Dit is als een heel boek in plaats van losse zinnen.
- Het doel: Hiermee kunnen we betere spraakherkenningsystemen bouwen. Denk aan een stemassistent die echt begrijpt wat een Zwitserse politicus zegt, inclusief zijn dialect en snelle zinnen, en dat vertaalt naar correct Standaard-Duits.
Samenvatting in één zin
De onderzoekers hebben een enorme berg ruwe parlementsopnames gepakt, ze eerst snel laten vertalen door een AI, daarna laten nakijken en corrigeren door een slimmere AI met behulp van officiële documenten, en uiteindelijk alleen de allerbeste stukjes geselecteerd om een superieure dataset te maken voor de toekomst.
Het is een bewijs dat je met de juiste combinatie van technologie (Whisper + GPT) en slimme filtering, zelfs uit "moeilijke" talen als Zwitser-Duits prachtige, bruikbare data kunt halen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.