The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
Dit artikel introduceert de 2025 AI Agent Index, een uitgebreide bron die de oorsprong, capaciteiten en veiligheidsfuncties van 30 geavanceerde AI-agenten documenteert om de uitdagingen aan te pakken bij het volgen van een snel evoluerend ecosysteem, terwijl het tegelijkertijd significante tekortkomingen in de transparantie van ontwikkelaars met betrekking tot veiligheid en maatschappelijke impact blootlegt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van Kunstmatige Intelligentie voor als een bruisende, chaotische bouwplaats. Jarenlang hebben we naar de arbeiders (de AI-modellen) gekeken terwijl ze leerden hoe ze blauwdrukken moeten lezen en cement moeten mengen. Maar onlangs is er iets nieuws gearriveerd: AI-agenten. Zie deze niet alleen als arbeiders, maar als voorman die daadwerkelijk gereedschap kunnen oppakken, deuren kunnen openen en dingen op eigen houtje kunnen bouwen, met zeer weinig hulp van mensen.
Het probleem? De bouwplaats groeit zo snel en de voormannen zijn zo geheimzinnig, dat niemand echt weet wie wat bouwt, hoe veilig ze zijn of of ze zich wel aan de regels houden.
Dit paper, "The 2025 AI Agent Index," is als een team onderzoekers dat veiligheidshelmen opzet en de bouwplaats betreedt om een gedetailleerde inventarisatie te maken. Ze hebben niet alleen de voormannen geteld; ze hebben geprobeerd in hun gereedschapskisten te gluren en hun veiligheidshandboeken te lezen.
Dit is wat ze vonden, eenvoudig uitgelegd:
1. De "Wie is Wie" Lijst
De onderzoekers keken naar 30 van de meest populaire en krachtige AI-agenten die momenteel in gebruik zijn. Ze keken niet alleen naar chatbots die vragen beantwoorden; ze keken naar systemen die daadwerkelijk dingen kunnen doen, zoals vluchten boeken, code schrijven, bedrijfsworkflows beheren of het web afzoeken om artikelen te kopen.
Ze deelden deze 30 agenten in drie hoofdgebieden in:
- De Chat-buurt (12 agenten): Dit zijn als behulpzame assistenten waarmee je in een chatvenster praat, maar ze hebben speciale sleutels om andere apps en tools te openen.
- De Browser-buurt (5 agenten): Dit zijn als digitale werknemers die in je webbrowser leven. Ze kunnen op knoppen klikken, formulieren invullen en door websites navigeren precies zoals een mens dat zou doen, vaak zonder dat je elke stap ziet.
- De Enterprise-buurt (13 agenten): Dit zijn de "voorman-bouwers" voor grote bedrijven. Het zijn platforms waar een bedrijf een team van digitale werkers kan opzetten om taken zoals HR, verkoop of IT-ondersteuning automatisch af te handelen.
2. Het "Black Box" Probleem (Transparantie)
De grootste verrassing in het paper is hoeveel informatie er ontbreekt. Stel je voor dat je een auto koopt, maar de fabrikant weigert je te vertellen:
- Hoe de remmen werken.
- Of de auto op botsingen is getest.
- Wat er gebeurt als de motor oververhit raakt.
- Wie verantwoordelijk is als de auto een ongeluk krijgt.
Dat is precies wat de onderzoekers bij deze AI-agenten vonden.
- Veiligheidsgeheimen: Voor ongeveer 56% van de veiligheidsvragen die ze stelden (zoals "Is dit getest op hacking?"), was het antwoord "We weten het niet" of "We hebben geen publieke informatie gevonden."
- Het "Safety-Washing" effect: Sommige bedrijven praten veel over veiligheid in hun marketing, maar wanneer de onderzoekers zoch even naar de werkelijke testresultaten of veiligheidsrapporten zochten, waren de planken leeg. Het is als een restaurant dat beweert de "gezondste van de stad" te zijn, maar weigert zijn hygiëne-inspectiescores te tonen.
- Identiteitscrisis: De meeste van deze agenten vertellen mensen niet dat ze robots zijn. Als een browser-agent een website bezoekt, denkt de website vaak dat het een menselijke gebruiker is. Slechts een enkeling heeft een "digitaal legitimatiebewijs" dat zegt: "Hallo, ik ben een AI."
3. Het "Driehoofdige Monster" (Wie controleert wat?)
Het paper legt uit dat deze agenten in lagen zijn opgebouwd, zoals een sandwich, en dat dit het lastig maakt om te weten wie de leiding heeft.
- Het Brood (Het Fundatiemodel): Dit is de hersenpan (zoals GPT, Claude of Gemini). Slechts een paar grote bedrijven maken deze.
- De Vulling (De Agent Builder): Dit is de middelste laag (zoals Microsoft Copilot Studio of Zapier) die de hersenen vertelt wat ze moeten doen.
- Het Bovenste Broodje (De Gebruiker/Het Bedrijf): Dit is de persoon of het bedrijf dat de agent daadwerkelijk gebruikt.
De onderzoekers ontdekten dat omdat deze lagen door verschillende bedrijven worden gemaakt, niemand het volledige plaatje heeft. De maker van de hersenen weet niet wat de builder doet, en de builder weet niet precies hoe de gebruiker het inzet. Dit creëert een "blame game" (schuldvraag) als er iets misgaat.
4. Het "Wilde Westen" op het Web
Het paper belicht een grote spanning: browser-agenten breken de regels van het internet.
Decennialang hebben websites een "Verboden Toegang"-bord gehad, genaamd robots.txt, om computerprogramma's (crawlers) te vertellen waar ze wel en niet mogen komen.
- De Oude Manier: Websites zeggen "Niet crawlen hier," en beleefde robots stoppen.
- De Agent-Manier: Veel van deze nieuwe agenten zijn ontworpen om als mensen te handelen. Ze negeren vaak de "Verboden Toegang"-borden, omzeilen beveiligingscontroles en doen zich voor als mensen om taken te volbrengen.
- Het Resultaat: Dit veroorzaakt juridische gevechten. Bedrijven zoals Amazon en Perplexity dagen elkaar voor de rechter over de vraag of een AI-agent het recht heeft om zonder toestemming op een site te winkelen of te browsen.
5. De Afhankelijkheid van de "Grote Drie"
Bijna al deze 30 agenten vertrouwen op slechts drie families van hersenen: de GPT van OpenAI, de Claude van Anthropic en de Gemini van Google.
- De Analogie: Stel je 30 verschillende automerken voor, maar ze gebruiken allemaal exact dezelfde motor van drie fabrikanten. Als één van die motormakers een probleem krijgt, de productie staakt of de prijs verandert, komen alle 30 automerken in de problemen. Dit creëert een enorm concentratierisico.
De Kernboodschap
De "2025 AI Agent Index" is een momentopname van een snelgroeiende technologie die momenteel in het duister opereert.
De onderzoekers zeggen niet dat deze agenten "slecht" zijn, maar ze zeggen dat we blind vliegen. We hebben krachtige tools die namens ons kunnen handelen, maar we hebben geen duidelijke regels, veiligheidsrapporten of identiteitscontroles voor hen. Het paper suggereert dat als we willen dat deze agenten veilig en betrouwbaar zijn, de "voormannen" hun werk moeten laten zien en de "bouwplaats" betere bewegwijzering nodig heeft.
Kortom: We hebben een vloot autonome robots gebouwd, maar de meeste van hen rijden zonder kentekenplaat, zonder veiligheidsinspectie en zonder iedereen te vertellen dat ze robots zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.