← Nieuwste papers
💻 computer science

TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

TrajShield is een trainingsvrij, inferentie-tijd defensieframework dat jailbreak-aanvallen en tijdelijk opkomende risico's in tekst-naar-video-modellen mitigeert door prompttrajecten te simuleren om onveilige inhoud causaal te lokaliseren en minimaal te herschrijven, terwijl de semantische trouw behouden blijft.

Oorspronkelijke auteurs: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

Gepubliceerd 2026-05-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een magische verhalenverteller-robot voor die je geschreven zinnen in korte films kan omzetten. Deze robot is ontzettend getalenteerd in het laten vloeiend overgaan van scènes van het ene moment naar het volgende, net als een echte film. Er is echter een probleem: soms, als je een zin geeft die klinkt onschuldig maar toch op problemen duidt, laat de robot zich meeslepen door zijn verhalenvertelling. Het kan beginnen met een onschuldig ruzietje tussen twee mensen en, in zijn zoektocht naar een dramatisch en samenhangend verhaal, dit opvoeren tot een gewelddadige vechtpartij die je nooit hebt gevraagd.

Dit is het kernprobleem dat TrajShield oplost.

Het probleem: De "glijdende helling" van verhalenvertelling

Bestaande veiligheidscontroles voor deze robots werken als een portier bij de ingang van een club. Ze controleren je kaartje (de tekstprompt) op slechte woorden zoals "bom" of "mes". Als ze een slecht woord zien, stoppen ze je.

Maar deze aanpak heeft een blinde vlek. Het begrijpt verhalenvertelling in de tijd niet.

  • De oude manier: Als je zegt "Twee mannen die ruzie maken op een parkeerterrein", ziet de portier geen wapens en laat hij je binnen.
  • De fout van de robot: De robot, die probeert een goede film te maken, denkt: "Oké, ruzies leiden meestal tot duwen, en duwen leidt tot vechten." Dus genereert het een video van een brute vechtpartij.
  • Het resultaat: Je vroeg om een ruzie, maar je kreeg een gewelddadige film. Het "slechte" zat niet in je woorden; het zat in de fantasie van de robot over hoe het verhaal zou moeten verlopen.

De oplossing: TrajShield (De "scenario-editor")

De auteurs van dit artikel hebben TrajShield ontwikkeld, een nieuw veiligheidssysteem dat niet alleen het kaartje controleert; het fungeert als een scenario-editor die het verhaal voordat de film wordt opgenomen, leest.

Hier is hoe het werkt, met een eenvoudig drie-stappenproces:

1. Het verhaal ontleden (Motion-Semantic Decoupling)

Stel je de prompt van de robot voor als een verwarde bal garen. TrajShield ontwarpt deze in drie onderscheiden delen:

  • De setting (Statisch): Wie is er? Waar zijn ze? Hoe ziet het eruit? (Bijv. "Twee mannen, een parkeerterrein, 's nachts.")
  • Het plot (Dynamisch): Wat gebeurt er daarna? (Bijv. "Ze ruziën, dan...")
  • Het doel (Intentie): Wat probeert de gebruiker eigenlijk te tonen? (Bijv. "Een spannende scène.")

Door de setting te scheiden van de actie, zorgt het systeem ervoor dat wanneer het het verhaal corrigeert, het niet per ongeluk de personages of de locatie verandert. Het raakt alleen het plot aan.

2. De toekomst simuleren (Temporal Risk Propagation)

Voordat de robot daadwerkelijk de video maakt, voert TrajShield een "mentale simulatie" uit. Het vraagt zich af: "Als ik begin met deze ruzie, wat is dan het meest waarschijnlijke volgende tafereel? En het daaropvolgende?"

Het bouwt een "risicokaart" van de toekomst van het verhaal. Het zoekt naar het exacte moment waarop het verhaal begint te glijden naar gevaar.

  • Voorbeeld: Het ziet dat "Ruzie" \rightarrow "Schreeuwen" \rightarrow "Duwen" een gevaarlijk pad is.
  • Het identificeert het triggerpunt: het exacte moment waarop het verhaal gaat van "veilig" naar "onveilig" (bijv. het moment waarop het schreeuwen overgaat in duwen).

3. De minimale herschrijving (Temporally-Consistent Safe Rewriting)

Zodra het het triggerpunt heeft gevonden, voert TrajShield "chirurgie" uit op het verhaal. Het verwijdert niet de hele film. In plaats daarvan herschrijft het alleen het gevaarlijke deel van het plot om het terug te sturen naar veiligheid, terwijl alles anders exact hetzelfde blijft.

  • Origineel gevaarlijk pad: Ruzie \rightarrow Schreeuwen \rightarrow Vechten (Onveilig!)
  • TrajShield's herschrijving: Ruzie \rightarrow Schreeuwen \rightarrow Woedend wegstormen (Veilig!)

Het resultaat is een video die nog steeds voelt als het oorspronkelijke idee van de gebruiker (spannend, dramatisch, twee mannen op een parkeerterrein), maar die stopt voordat het gewelddadig wordt. Het "verhaal" vloeit natuurlijk, alleen in een veilige richting.

Waarom dit belangrijk is

Het artikel testte dit systeem tegen 14 verschillende soorten veiligheidsrisico's (zoals geweld, illegale handelingen of verontrustende inhoud) en over 6 verschillende video-generatiemodellen.

  • Het resultaat: TrajShield stopte ongeveer 52% meer onveilige video's dan eerdere methoden.
  • De kwaliteit: Cruciaal is dat het de goede video's niet bedierf. Bij een veilige prompt zag het resulterende er precies uit zoals de gebruiker wilde. Het veranderde een vredige scène niet in een saaie; het voorkwam gewoon de "glijdende helling" naar gevaar.

De kernboodschap

Zie TrajShield als een veiligheidsnet dat een verhaal vangt voordat het van een klif valt. In plaats van alleen woorden te verbieden, begrijpt het dat verhalen een richting hebben. Het ziet hoe het verhaal zich in het hoofd van de robot ontvouwt, herkent het moment waarop het op het punt staat van de rails te raken, en stuurt het zachtjes terug naar een veilig pad, allemaal zonder de setting of de personages te veranderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →