Safe Deployment of a Generative AI Assistant for Traditional-Medicine Education: Defense-in-Depth Architecture, Domain-Calibrated Safety Evaluation, and a Proposed Minimum Safety Stack
Dit artikel presenteert TLAS-YHCT, een generatieve AI-assistent voor onderwijs in de traditionele geneeskunde die 100% veiligheid bereikt tegen domeinspecifieke aanvallen door middel van een defense-in-depth-architectuur, waarmee wordt aangetoond dat klinisch gekalibreerde veiligheidsnormen en een minimale veiligheidsstack bestaande uit RAG, gestandaardiseerde prompting en LLM-as-judge-verificatie essentieel zijn voor veilige implementatie in het klinisch onderwijs.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Een Veiligheid-Eerst AI-Tutor
Stel je voor dat je een klas geeft over Traditionele Geneeskunde (met behulp van oude kruiden en middelen). Je wilt een super slimme AI-chatbot gebruiken om studenten te helpen studeren. Maar er is een groot probleem: als deze AI een fout antwoord geeft over welke kruiden je moet mengen, kan een student een gevaarlijk recept leren dat later een echte patiënt schade kan berokkenen.
De onderzoekers van de Hoa Binh Universiteit hebben een speciale AI-tutor gebouwd genaamd TLAS-YHCT. Ze hebben de AI niet alleen gevraagd om "aardig te zijn". In plaats daarvan hebben ze een fort rondom de AI gebouwd om ervoor te zorgen dat deze nooit gevaarlijk advies geeft. Ze hebben dit fort getest tegen 206 verschillende "aanvallen" (listige vragen die ontworpen zijn om de AI te misleiden) en ontdekten dat het perfect was, terwijl twee populaire commerciële AI's (GPT en Gemini) fouten maakten.
Het Kernprobleem: Twee Verschillende Soorten "Veiligheid"
Het artikel stelt dat "veiligheid" twee verschillende dingen betekent, en dat de meeste mensen deze verwarren:
- IT-Beveiligingsveiligheid: Dit is als een uitsmijter bij een club. Het controleert of je probeert de regels te breken, gegevens te stelen of het systeem te misleiden om zijn geheimen te onthullen.
- Klinische Educatieve Veiligheid: Dit is als een chef-kok in een keuken. Het controleert of het eten (het antwoord) daadwerkelijk veilig is om te eten.
De Analogie:
Stel je een robotchef voor.
- IT-Veiligheid vraagt: "Heeft de robot geprobeerd het receptenboek te stelen? Heeft hij het bordje 'Niet Aanraken' genegeerd?"
- Kklinische Veiligheid vraagt: "Heeft de robot gif in de soep gemengd?"
Het artikel stelde vast dat een robot de IT-controle kan passeren (hij heeft het boek niet gestolen), maar nog steeds kan falen op de Klinische controle (hij heeft gif geserveerd). De meeste AI-veiligheidstests kijken alleen naar de regels van de "uitsmijter", en missen daarmee het "gif" in de soep.
Hoe Ze het "Fort" Bouwden (De Defense-in-Depth)
In plaats van te vertrouwen op het interne brein van de AI om perfect te zijn, bouwden ze een 5-laagse beveiligingspijplijn. Denk aan een hoogbeveiligde bankkluis met meerdere sloten:
- De Harde Guardrails (De Uitsmijter): Voordat de AI zelfs maar nadenkt, blokkeert een strikte regelcontrole elke aanvraag die probeert het systeem te misleiden of om verboden onderwerpen vraagt. Je kunt er niet met praatjes langs komen; het is een hard "Nee".
- De Gecontroleerde Bibliotheek (Het Naslagwerk): De AI mag niet gokken. De AI moet antwoorden opzoeken in een specifieke, goedgekeurde bibliotheek van boeken over traditionele geneeskunde geschreven door experts. Als het antwoord niet in de bibliotheek staat, zegt de AI: "Ik weet het niet", in plaats van iets te verzinnen.
- Het Gestandaardiseerde Script (De Functieomschrijving): De AI heeft een strikt script dat precies vertelt hoe hij zich als docent moet gedragen. De AI weet dat hij nooit een echte arts mag vervangen.
- Het Tweede Mening (De Rechter): Voordat het antwoord aan de student wordt getoond, controleert een tweede AI het werk. De vraag is: "Heeft de eerste AI zich aan de bibliotheek gehouden? Is dit advies daadwerkelijk veilig voor een patiënt?" Als het antwoord "Nee" is, corrigeert het systeem dit of blokkeert het de output.
- De Menselijke Audit (De Directeur): Echte docenten beoordelen regelmatig de logs van de gesprekken van de AI om eventuele vreemde fouten te ontdekken en de regels bij te werken.
Het Grote Experiment: De Red Team
Om dit te testen, deden de onderzoekers iets zeer strikts:
- De Aanvallers: Vijf deskundige artsen en docenten (die niets wisten over hoe de AI was gebouwd) schreven 206 listige vragen om te proberen het systeem te breken.
- De Bouwers: De persoon die de AI bouwde, mocht de vragen niet zien totdat de test voorbij was.
- De Rechters: Dezelfde deskundige artsen beoordeelden de antwoorden blind (ze wisten niet welke AI welk antwoord gaf).
Ze gebruikten twee scorekaarten voor elk antwoord: één voor IT-beveiliging en één voor klinische veiligheid.
De Resultaten: Fort vs. Open Deur
- TLAS-YHCT (De Custom AI): Behaalde een veiligheidsscore van 100%. Het gaf nooit een gevaarlijk antwoord en liet geen enkele bedrieger de regels breken.
- Commerciële AI's (GPT & Gemini): Scoorden veel lager (rond de 79% tot 89%).
- Ze faalden wanneer mensen hen probeerden te misleiden met rollenspellen of valse autoriteit.
- Cruciaal: Ze faalden op "Klinische Veiligheid", zelfs wanneer ze de "IT-Veiligheid" passeerden. Bijvoorbeeld, ze gaven gevaarlijk advies over het mengen van giftige kruiden. Ze braken geen beveiligingsregels, maar gaven wel slecht medisch advies. Ze waren niet "gehackt", maar wel "onveilig".
De "Minimum Safety Stack"
Het artikel concludeert dat als je AI wilt gebruiken voor medische educatie, je niet zomaar een generieke AI kunt kopen en op het beste te hopen. Je hebt een Minimum Safety Stack nodig:
- Retrieval-Augmented Generation (RAG): Dwing de AI om een geverifieerde bibliotheek te gebruiken, in plaats van zijn eigen geheugen.
- Gestandaardiseerde Prompts: Geef het een strikte, onveranderlijke functieomschrijving.
- LLM-as-Judge: Gebruik een tweede AI om de eerste AI te controleren tegen specifieke medische regels.
- Domein-gekalibreerde Criteria: Je moet experts (artsen) hebben die definiëren wat "onveilig" betekent voor hun vakgebied, niet alleen IT-beveiligingsexperts.
De Belangrijkste Les
Het artikel bewijst dat voor sectoren met een hoog risico, zoals de geneeskunde, architectuur belangrijker is dan het basismodel. Een op maat gemaakt systeem met lagen van veiligheidscontroles (het "Fort") is veel veiliger dan een krachtig, generiek AI-model, zelfs als dat generieke model erg slim is. De belangrijkste les is dat veiligheid niet alleen gaat over het stoppen van hackers; het gaat erom te garanderen dat het gegeven advies daadwerkelijk veilig is voor de menselijke gezondheid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.