← Nieuwste papers
💻 computer science

ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs

Dit artikel introduceert ReactHuman, de eerste op fysica gebaseerde benchmark die belichaamde multimodale LLM's evalueert op hun vermogen om onmiddellijke, veiligheidskritische reactieve beslissingen te nemen in gesimuleerde huishoudelijke omgevingen, waarbij wordt onthuld dat huidige modellen moeite hebben met intuïtieve fysica en veiligheid ondanks schaling.

Oorspronkelijke auteurs: Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu

Gepubliceerd 2026-09-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een keuken voor waar een zware pan van het aanrecht glijdt, of een gang waar een hoge kast begint te wankelen. In een fractie van een seconde verwerkt het menselijk brein het visuele gevaar, voorspelt waar het object zal landen en geeft het lichaam het bevel om het object ofwel te vangen of opzij te stappen. Deze reactie van een fractie van een seconde is niet louter een reflex; het is een complexe fusie van begrijpen wat een object is, weten hoe zwaar het is, en precies berekenen waar het naartoe zal gaan. Terwijl wetenschappers werken aan het bouwen van robots die met ons kunnen leven en werken in onze huizen, staan zij voor een cruciale vraag: kan kunstmatige intelligentie leren te reageren met dezelfde snelheid en veiligheid? Huidige tests voor deze intelligente systemen vragen hen vaak om vragen te beantwoorden over video's of om langetermijn-taken te plannen, zoals het schoonmaken van een kamer, maar deze methoden testen niet of een machine een levensreddende beslissing kan nemen op het moment dat een gevaar zich voordoet.

Een nieuwe studie introduceert een rigoureuze test genaamd ReactHuman, ontworpen om te zien of kunstmatige intelligentie kan handelen als een competente mens wanneer zij wordt geconfronteerd met plotseling fysiek gevaar. De onderzoekers bouwden een gesimuleerde wereld waarin een digitale robot in een kamer staat en een reeks gevaarlijke gebeurtenissen ziet ontvouwen, zoals een vallend mes, een verschuivende plank of een bal die naar de robot toe stuiteren. Het systeem pauzeert de simulatie vlak voordat de ramp gebeurt, waarbij de robot enkele seconden van de gebeurtenis vanuit meerdere camerahoeken te zien krijgt. De kunstmatige intelligentie, die fungeert als het brein van de robot, moet vervolgens beslissen wat te doen en een specifiek commando geven: naar een nieuwe plek lopen, uitreiken om het object te grijpen, of stil blijven staan. In tegenstelling tot eerdere tests waarbij een computer simpelweg het juiste antwoord uit een lijst zou kunnen kiezen, dwingt dit systeem de robot om de actie daadwerkelijk uit te voeren in een fysica-simulatie. Als de robot besluit een vallend object te vangen, draait de simulatie door om te zien of de hand het object daadwerkelijk op tijd raakt. Als de robot besluit te ontwijken, controleert de simulatie of de robot er succesvol naast is gestapt.

De onderzoekers creëerden meer dan duizend unieke scènes die zeventien verschillende soorten plotselinge gebeurtenissen beslaan, variërend van eenvoudige vallen tot complexe kettingreacties waarbij één vallend item tegen een ander aan botst. Ze namen zelfs "truik"-objecten op die er als het ene uitzien maar zich als het andere gedragen, zoals een schuimrubberen aambeeld dat er zwaar uitziet maar licht is, of een stalen appel die eruitziet als fruit maar zwaar en gevaarlijk is. Deze opzet test of de robot vertrouwt op hoe dingen eruitzien of op hoe ze daadwerkelijk bewegen. Het team evalueerde zeven verschillende geavanceerde modellen van kunstmatige intelligentie op deze taak. De resultaten waren sober: de modellen faalden in hun reactie ongeveer één op de drie keer. Wanneer de juiste actie het was om weg te bewegen van het gevaar, bevroren de robots vaak op hun plaats of probeerden ze het object te vangen, wat leidde tot onveilige uitkomsten.

Misschien wel het meest onthullende was dat de robots niet leken te leren van hun fouten naarmate ze groter of complexer werden. De grootste, krachtigste modellen waren niet significant veiliger of nauwkeuriger dan de kleinere modellen. In plaats van de specifieke scène voor hen te analyseren, leek elk model een vaste persoonlijkheid te hebben: sommige kozen er altijd voor om weg te rennen, terwijl anderen er altijd voor kozen om dingen te grijpen, ongeacht of dat de juiste zet was. De robots hadden ook moeite met het beoordelen van snelheid. Ze konden wel zien of iets bewoog, maar ze konden niet bepalen of het langzaam of snel bewoog, en behandelden een langzaam bewegend gevaar vaak alsof het geen bedreiging was. Wanneer de robots wel de juiste actie kozen, voerden ze deze vaak niet correct uit, waarbij ze bijvoorbeeld naar een object reikten maar hun hand een meter verwijderd van waar deze moest zijn stopten.

De studie concludeert dat hoewel deze systemen van kunstmatige intelligentie steeds beter worden in het begrijpen van de wereld, ze nog lang niet in staat zijn om veilig te reageren op plotseling fysiek gevaar. Het onderzoek benadrukt dat het simpelweg groter maken van modellen het probleem van veiligheid niet oplost. Om robots te bouwen die echt in onze huizen kunnen wonen, zullen ontwikkelaars hen moeten leren om te vertrouwen op wat ze op het moment zelf zien gebeuren in plaats van te vertrouwen op hoe een object eruitziet, en om snelheid en afstand te beoordelen met dezelfde instinctieve precisie die mensen bezitten. Tot die tijd blijft de kloof tussen een machine die een vallend object kan beschrijven en een machine die het veilig kan vangen, groot.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →