Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution
Dit onderzoek onthult een kritieke kwetsbaarheid in Claw-personal AI-agenten waarbij onbetrouwbare achtergrondinformatie tijdens 'heartbeat'-uitvoering stilzwijgend het geheugen kan vervuilen en de gebruikersinteractie beïnvloedt zonder dat prompt-injectie nodig is.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Pas op voor je Hartslag! (Mind Your HEARTBEAT!)
Stel je voor dat je een persoonlijke assistent hebt, een slimme AI die voor je werkt. Deze assistent is niet alleen slim, maar ook altijd wakker. Zelfs als jij slaapt of aan het werk bent, blijft deze AI een beetje "polsen" – net zoals je hartslag. Dit noemen de onderzoekers een Heartbeat (hartslag).
Tijdens deze hartslag-tikjes kijkt de AI in de achtergrond naar je e-mails, nieuwsfeeds, sociale media en berichten. Hij doet dit om je te helpen: "Oh, er staat een belangrijke afspraak in je e-mail, ik zet die alvast in je agenda," of "Er is een nieuw artikel over jouw hobby, ik sla het even op."
Het Probleem: De Gedeelde Woonkamer
Hier zit het gevaar. In deze nieuwe AI-systemen (genaamd "Claw") draait die achtergrond-werkzaamheid in dezelfde ruimte als je normale gesprek met de AI.
Stel je voor dat je AI een woonkamer is.
- Jij zit op de bank en praat met de AI.
- De Heartbeat is als een bediende die de hele dag door de ramen en deuren loopt om post te halen.
Het probleem is dat de bediende (Heartbeat) de post die hij haalt, direct op de salontafel legt, samen met de gesprekken die jij met de AI voert. De AI ziet alles wat op die tafel ligt.
De "Stille Vergiftiging"
Nu komt de kwetsbaarheid. Een hacker hoeft geen ingewikkelde code te schrijven of de AI direct aan te vallen. Hij hoeft alleen maar nepnieuws of verkeerde informatie op die post te plakken.
- De Valstrik: De hacker plaatst een nepbericht op een populief forum: "Gebruik deze software-versie, die is super veilig!" (terwijl die versie juist gevaarlijk is).
- De Hartslag: De AI ziet dit bericht terwijl hij in de achtergrond "polsst". Omdat het eruitziet als een normaal bericht van een betrouwbare bron (bijvoorbeeld met veel "likes" of van een moderator), denkt de AI: "Ah, dit is nuttige informatie!"
- Het Geheugen: De AI slaat dit op in zijn korte-termijn geheugen (de woonkamer). Later, als jij vraagt: "Welke software moet ik gebruiken?", raadpleegt de AI zijn geheugen. Omdat hij het nepbericht al heeft opgeslagen, zegt hij: "Gebruik die versie!"
- Het Duurzame Gevaar: Als de AI dit bericht ook nog eens opschrijft in zijn lange-termijn geheugen (een notitieboekje dat hij altijd bij zich draagt), dan blijft de fout zitten. Zelfs als je de AI morgen opnieuw start, zal hij nog steeds denken dat die nep-software veilig is.
Waarom is dit zo gevaarlijk?
- Geen "Hacken" nodig: De hacker hoeft de AI niet te "hacken". Hij hoeft alleen maar een nepbericht te plaatsen waar de AI toevallig naar kijkt.
- Geen Prompt Injection: Dit is geen geval van iemand die de AI dwingt om iets te doen met een commando. De AI doet het gewoon, omdat hij denkt dat het waar is.
- Het Vertrouwensprobleem: De AI vertrouwt op sociale signalen. Als er veel mensen (of andere AI's) met een nepbericht instemmen ("consensus"), dan gelooft de AI het. Het maakt niet uit of de bron echt betrouwbaar is; het ziet er zo uit.
Wat hebben de onderzoekers ontdekt?
Ze hebben een eigen, veilige versie van zo'n sociaal platform gebouwd (genaamd MissClaw) om dit te testen. Hun resultaten waren schokkend:
- Sociale druk werkt: Als een nepbericht eruitziet als een consensus (veel mensen zijn het ermee eens), gelooft de AI het in 61% van de gevallen.
- Het blijft hangen: Zelfs als de AI het bericht alleen maar even "leest" en daarna een normaal gesprek voert, kan hij het per ongeluk opslaan in zijn lange-termijn geheugen. In 91% van de gevallen werd de vergiftigde informatie opgeslagen.
- Het werkt ook in de echte wereld: Zelfs als er duizenden normale berichten tussen zitten en de AI moet filteren, blijft de nepinformatie soms hangen en beïnvloedt het zijn beslissingen.
De Les voor ons allemaal
Deze studie laat zien dat we moeten oppassen met AI-assistenten die "altijd wakker" zijn en in de achtergrond naar internet kijken.
- Je AI is niet onfeilbaar: Hij kan net als een mens beïnvloed worden door nepnieuws, vooral als het eruitziet alsof iedereen het gelooft.
- Het geheugen is kwetsbaar: Wat de AI in de achtergrond ziet, kan zijn toekomstige gedrag bepalen, zelfs als jij het niet gezien hebt.
- Oplossing: Ontwikkelaars moeten zorgen dat de AI beter kan onderscheiden wat hij zelf heeft gezien en wat hij "in de achtergrond" heeft gehoord. Misschien moet hij vragen: "Waar heb je dit vandaan?" voordat hij het opslaat in zijn permanente geheugen.
Kortom: Pas op voor je hartslag. Soms is het rustig in de achtergrond, maar daar wordt je geheugen stiekem vergiftigd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.