← Nieuwste papers
🤖 AI

Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence

Dit artikel introduceert Safactory, een nieuw, unified raamwerk dat parallelle simulatie, betrouwbare gegevensbeheer en platformen voor autonome evolutie integreert om systematisch de uitdagingen van besluitvorming op lange termijn en risicodetectie bij de training van volgende generatie betrouwbare autonome agenten aan te pakken.

Oorspronkelijke auteurs: Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang
Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang Xu, Yiwen Cong, Meng Jin, Gaolei Li, Xuansheng Wu, Linhan Liu, Zijing He, An Li, Yan Teng, Xin Tan, Dongrui Liu, Jing Shao, ChaoChao Lu, Ji He, Jie Li, Chunfeng Song, Jinya Xu, Fan Song, Shujie Wang, Jianmin Qian, Jie Hou, Xuhong Wang, Yingchun Wang, Hui Wang, Xia Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar zeer nieuwe, robotassistent leert complexe taken uit te voeren, zoals het beheren van een computer, navigeren op een telefoon of zelfs het spelen van een videospel. In het verleden leerden we deze robots voornamelijk door hen simpele vragen te stellen en te controleren of hun antwoorden veilig waren. Maar nu worden deze robots autonome agenten – ze praten niet alleen; ze handelen. Ze klikken op knoppen, openen bestanden en nemen beslissingen over lange reeksen stappen.

Het probleem is dat wanneer een robot een fout maakt in één gesprek, het slechts een verkeerde zin is. Maar wanneer een robot een fout maakt terwijl het handelt in de echte wereld (zoals het per ongeluk verwijderen van het verkeerde bestand of klikken op een kwaadaardige link), kunnen de gevolgen echt en schadelijk zijn.

Safactory is een nieuwe "fabriek" gebouwd door het Shanghai AI Laboratory om dit op te lossen. Denk hierbij niet aan één enkel hulpmiddel, maar aan een volledig, zelfwerkend ecosysteem dat is ontworpen om deze robots veilig, betrouwbaar en betrouwbaar te maken.

Hier is hoe Safactory werkt, opgesplitst in drie hoofd-"workshops" binnen de fabriek:

1. Het Parallelle Simulatieplatform (De "Massale Testgrond")

Stel je voor dat je een nieuwe auto wilt testen. Je zou deze niet één keer rijden op een zonnige dag; je zou hem rijden in de regen, 's nachts, op ijsachtige wegen en misschien zelfs een paar keer laten crashten in een simulator om te zien wat er gebeurt.

Bestaande systemen waren als het één keer rijden van de auto. Safactory is anders. Het creëert een massale, parallelle testgrond waar duizenden robotagenten dezelfde taak gelijktijdig kunnen uitvoeren in virtuele omgevingen (zoals een nep-computerbureaublad, een nep-Android-telefoon of een nep-Minecraft-wereld).

  • De "Tijdsreis"-functie: Als een robot een fout maakt, start Safactory niet de hele dag opnieuw. Het heeft een "Git voor Agenten"-functie. Het kan de staat van de robot op elk moment opslaan, zoals een opslagbestand in een videospel. Als de robot bijna een bestand verwijdert, kan het systeem "terugspoelen" naar dat exacte moment en een ander pad proberen om te zien of de robot kan leren het gevaar te vermijden.
  • Het Doel: Verborgen gevaren vinden die pas verschijnen na 20 of 30 interactiestappen, welke simpele tests zouden missen.

2. Het Betrouwbare Dataplatform (De "Slimme Bibliotheek")

Elke keer dat een robot een test uitvoert, genereert het een enorme hoeveelheid data: wat het zag, waar het op klikte, wat het dacht en of het slaagde of faalde. Meestal wordt deze data gewoon in een map gedumpt en vergeten.

Safactory behandelt deze data als goud. Het gebruikt een speciale "AI-bibliothecaris" genaamd DataElf.

  • De "Intentie"-magie: Je hoeft geen complexe code te schrijven om deze data te organiseren. Je kunt DataElf gewoon in plat Engels vertellen: "Vind alle momenten waarop de robot bijna op een phishing-link klikte en geef me een samenvatting."
  • De "Zwarte Doos"-veiligheid: DataElf kan gevoelige data (zoals wachtwoorden of privé-bestanden) bekijken binnen een beveiligde "zwarte doos". Het kan de data analyseren om risico's te vinden zonder ooit daadwerkelijk de privé-informatie te zien of te lekken.
  • Het Resultaat: Het verandert rommelige logs in schone, georganiseerde "ervaringsboeken" die de robot later kan bestuderen om uit zijn fouten te leren.

3. Het Autonome Evolutieplatform (De "Continue Trainingsgym")

Zodra de robots zijn getest en hun data is georganiseerd, moeten ze beter worden. Hier komt het Evolutieplatform om de hoek kijken.

  • De Lus: In plaats van de robot één keer te trainen en dan te stoppen, creëert dit platform een continue lus. De robot oefent, het systeem registreert de resultaten, de "Bibliothecaris" selecteert de beste lessen en de robot traint direct opnieuw.
  • Het "Leraar"-systeem: Het gebruikt een techniek genaamd On-Policy Distillatie. Stel je een meesterleraar voor die de student-robot observeert. Als de student aarzelt of een risicovolle zet doet, leidt de leraar hen zachtjes naar de veiligere keuze in real-time, waardoor de robot sneller en stabieler leert.
  • Het Doel: Een systeem creëren waarin de robot elke dag veiliger en slimmer wordt, automatisch, zonder dat menselijke ingenieurs elke bug handmatig hoeven op te lossen.

De Machinekamer: DeepLink Computing

Het uitvoeren van al deze duizenden simulaties en trainingssessies vereist enorme rekenkracht. Safactory is gebouwd om te draaien op DeepLink, een binnenlands (Chinees) hardware- en software-ecosysteem. Denk hierbij aan het krachtcentrale en het logistieke netwerk van de fabriek, waardoor ervoor wordt gezorgd dat zelfs als de hardware verschilt van standaard Westerse chips, de fabriek soepel, efficiënt en veilig draait.

Het Grote Plaatje

Het artikel stelt dat veiligheid geen checklist is die je afvinkt voordat je een robot release. Het is een continu proces.

  • Oude manier: Test de robot één keer \rightarrow Bugs oplossen \rightarrow Release.
  • Safactory-methode: Test de robot in een massale simulatie \rightarrow Registreer elke fout \rightarrow Zet fouten om in lessen \rightarrow Train de robot opnieuw \rightarrow Herhaal voor altijd.

Safactory is de infrastructuur die deze "eeuwige lus" mogelijk maakt, waardoor ervoor wordt gezorgd dat naarmate AI-agenten krachtiger en autonomer worden, ze controleerbaar, auditabel en veilig blijven voor de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →