← Nieuwste papers
⚡ electrical engineering

Towards General Language-Conditioned Latent Safety Filters

Dit artikel stelt een taalgeconditioneerd veiligheidsfilteringsframework voor met behulp van Hamilton-Jacobi acteurs en critics om dynamisch diverse veiligheidsbeperkingen af te dwingen over verschillende robotica-taken, waarbij minder schendingen en een gedeeltelijke transfer naar ongeziene beperkingsinstanties worden aangetoond.

Oorspronkelijke auteurs: Ihab Tabbara, Yuxuan Yang, Hussein Sibai

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ihab Tabbara, Yuxuan Yang, Hussein Sibai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin robots niet alleen lompe machines zijn die geprogrammeerd zijn voor één specifieke taak, zoals een broodrooster die alleen brood roostert. Stel je in plaats daarvan een robot voor die je kan begrijpen als een behulpzame vriend. Je zou kunnen zeggen: "Ruim de tafel alsjeblieft op," of "Bouw een toren met deze blokken," en de robot zou uitzoeken hoe hij dat moet doen. Dit is de opwindende grens van "generieke" robotlering, waarbij kunstmatige intelligentie combineert wat het ziet (visie) met wat je zegt (taal) om te beslissen wat het moet doen (actie). Maar hier is de crux: alleen omdat een robot slim genoeg is om je verzoek te begrijpen, betekent dat niet dat hij ook slim genoeg is om te weten wat hij niet moet doen. Als je hem vraagt een tafel af te ruimen, kan hij per ongeluk een kostbare vaas omverwerpen of een glas melk morsen.

Om robots veilig te houden, gebruiken wetenschappers iets dat een "veiligheidsfilter" wordt genoemd. Denk aan dit filter als een strikte, onzichtbare beschermengel die direct naast het brein van de robot staat. Voordat de robot zijn arm beweegt, controleert de bewaker het plan. Als het plan eruitziet alsof het een vaas zou kunnen raken, grijpt de bewaker in, neemt de controle over en stuurt de robot weg van het gevaar. Traditioneel waren deze bewakers erg rigide; je moest ze specifiek leren over vazen, en dan apart over wijnglazen, en dan weer apart over hete koffie. Als je wilde dat de robot iets nieuws vermeed, moest je de bewaker vanaf nul opnieuw trainen. De grote vraag die onderzoekers stellen is: Kunnen we de bewaker van een robot leren om elke veiligheidsregel te begrijpen door simpelweg naar ons te luisteren, zodat hij zich direct kan aanpassen aan nieuwe situaties zonder een totale reboot nodig te hebben?

Dit artikel, getiteld "Towards General Language-Conditioned Latent Safety Filters," verkent precies dat idee. De auteurs, Ihab Tabbara, Yuxuan Yang en Hussein Sibai, stellen een nieuw soort veiligheidsfilter voor dat niet voor elke nieuwe regel opnieuw getraind hoeft te worden. In plaats daarvan hebben ze een systeem gebouwd waarbij de bewaker een instructie in natuurlijke taal kan begrijpen — zoals "raak de melkpak niet aan" — en deze regel direct kan toepassen op de acties van de robot. Ze testten dit op robots die taken uitvoerden zoals het oppakken van blokken, het afnemen van tafels en het stapelen van objecten.

De onderzoekers ontdekten dat dit "taal-geconditioneerde" filter verrassend goed werkt. In hun experimenten voorkwam het nieuwe filter succesvol dat de robot tegen specifieke objecten botste wanneer de robot werd verteld deze te vermijden, zelfs wanneer het oorspronkelijke plan van de robot was om er recht tegenaan te botsen. Bijvoorbeeld, in een taak waarbij een robot gekleurde blokken in een specifieke volgorde moest stapelen, hielp het filter de robot om de instructies in ongeveer 80% van de gevallen correct op te volgen, zelfs wanneer de instructies veranderden. Het filter was ook in zekere mate in staat tot generalisatie; toen ze het testten op objecten of kleuren die het nog nooit eerder had gezien (zoals een geel boek in plaats van een rood exemplaar), slaagde het er nog steeds in om de regels beter te volgen dan bij een willekeurige gok, hoewel het niet perfect was.

Het artikel is echter voorzichtig om dit geen perfecte oplossing te noemen. De auteurs laten zien dat hoewel het filter een enorme stap voorwaarts is, het nog steeds fouten maakt, vooral wanneer de robot de wereld bekijkt via een camera (visie) in plaats van de exacte positie van elk object te weten (wat als een superkracht is die de robot eigenlijk niet heeft). Ze testten ook geavanceerde AI-modellen om als de "ogen" te fungeren die de filter vertellen wat gevaarlijk is, maar ontdekten dat zelfs de slimste huidige modellen niet betrouwbaar genoeg zijn om op zichzelf de enige rechter over veiligheid te zijn.

De studie suggereert dat we bewegen naar een toekomst waarin we één algemeen veiligheidsfilter kunnen hebben dat leert om veel verschillende regels te begrijpen door ze simpelweg te lezen, in plaats van dat er voor elk object in een kamer een uniek filter nodig is. Hoewel de huidige versie niet vlekkeloos is en nog steeds worstelt met volledig nieuwe scenario's, suggereren de resultaten dat deze aanpak een veelbelovende weg voorwaarts is. Het wijst op een toekomst waarin robots on-the-fly complexe, veranderende veiligheidsinstructies kunnen krijgen, wat ze veiliger en nuttiger maakt in onze huizen en werkplekken zonder dat er telkens een team van ingenieurs nodig is om ze te herprogrammeren wanneer we een meubelstuk verplaatsen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →