← Nieuwste papers
💬 NLP

Orchard: An Open-Source Agentic Modeling Framework

Het artikel introduceert Orchard, een open-source framework met een lichtgewicht omgevingslaag (Orchard Env) en gespecialiseerde trainingsrecepten die schaalbaar, hoogpresterend agentisch modelleren mogelijk maken op de gebieden codering, GUI en persoonlijke assistenten, en waarmee state-of-the-art resultaten worden bereikt onder open-source modellen.

Oorspronkelijke auteurs: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Universeel "Speeltuintje" voor AI Bouwen

Stel je voor dat je een robot wilt leren complexe taken te doen, zoals een kapot computerprogramma repareren, door een website navigeren om boodschappen te kopen, of je e-mail beheren. Om te leren, moet de robot oefenen in een veilige, geïsoleerde "zandbak" (zoals een videospelletje-niveau) waar het dingen kan proberen, fouten kan maken en kan zien wat er gebeurt, zonder de echte wereld te verstoren.

Lange tijd was het bouwen van deze zandbakken als het bouwen van een speciaal speeltuintje voor elk speelgoedstukje apart. Als je een coderingsrobot wilde testen, bouwde je één speeltuintje. Als je een winkelrobot wilde testen, moest je een volledig ander speeltuintje van nul af aan bouwen. Dit maakte onderzoek traag, duur en moeilijk om te delen.

Orchard is een nieuw open-source framework dat dit oplost door één universeel, hoogwaardig speeltuintje te bouwen dat werkt voor elk type robot-agent. De onderzoekers noemen dit de "Orchard Env".

Zie Orchard als een universeel stekkerdoos en gereedschapsriem voor AI-onderzoekers. In plaats van voor elk apparaat een nieuw stopcontact te bouwen, bouwden ze één slim stopcontact dat met alles werkt. Dit stelt onderzoekers in staat zich te focussen op het leren van de AI hoe te denken, in plaats van zich zorgen te maken over de leidingen van de zandbak.


De Drie "Recepten" (Wat Ze Bouwden)

Met dit universele speeltuintje kookte het team drie verschillende "recepten" om AI-agenten op te leiden in drie specifieke gebieden. Ze bouwden niet alleen de keuken; ze lieten zien hoe je drie verschillende, heerlijke maaltijden maakt.

1. Orchard-SWE: De "Junior Ontwikkelaar"-Agent

  • De Taak: Bugs in softwarecode repareren.
  • De Uitdaging: Programmeren is moeilijk. Soms blijft een AI vastzitten of maakt halverwege een fout. De meeste trainingsmethoden kijken alleen naar de "perfecte" oplossingen en gooien de mislukte pogingen weg.
  • De Orchard-Truc: Ze gebruikten een techniek genaamd "Credit-Assignment" (toewijzing van verdiensten). Stel je een student voor die een wiskundetoets niet haalt. In plaats van de toets gewoon weg te gooien, kijkt een leraar naar het papier en zegt: "Je hebt de eerste drie stappen goed! Dat was goed." Orchard doet dit met AI. Het slaat de "goede delen" van mislukte pogingen op en leert de AI om die succesvolle stappen te herkennen.
  • Het Resultaat: Ze trainden een model dat even goed is in het repareren van code als veel grotere, duurdere modellen, maar het leerde van een mix van successen en "bijna's".

2. Orchard-GUI: De "Browser-Navigatie"-Agent

  • De Taak: Door websites klikken, formulieren invullen en producten vinden (zoals een hondenbed vinden op Amazon).
  • De Uitdaging: Websites zijn visueel. De AI moet een screenshot "zien" en uitzoeken waar te klikken. Het is als iemand autorijden leren door alleen maar foto's van de weg te laten zien.
  • De Orchard-Truc: Ze trainden een klein, efficiënt model (slechts 4 miljard parameters, wat klein is voor een AI) met een mix van oefenrondes en een "jury" (een andere AI) die de resultaten beoordeelt. Ze hadden geen miljoenen voorbeelden nodig; ze gebruikten een zorgvuldig samengestelde set van ongeveer 2.600 taken.
  • Het Resultaat: Dit kleine model werd de sterkste open-source browser-agent ooit gemaakt. Het presteerde even goed als (en soms beter dan) massale, dure systemen van bedrijven zoals Google en OpenAI, wat bewijst dat je geen gigantisch brein nodig hebt als je de juiste training hebt.

3. Orchard-Claw: De "Persoonlijke Assistent"-Agent

  • De Taak: Dagelijkse levens taken beheren zoals e-mails sorteren, agenda's controleren en bestanden organiseren.
  • De Uitdaging: Deze taken vinden plaats in verschillende "tools" (e-mailapps, agenda-apps). Meestal raakt een AI die is getraind op één tool in de war als je overstapt naar een andere.
  • De Orchard-Truc: Ze trainden de AI met twee verschillende "bedieningspanelen" (harnassen) tegelijkertijd. Het is als een bestuurder leren om zowel een handgeschakelde als een automatische auto tegelijkertijd te besturen. Dit dwong de AI om het concept van rijden te leren, niet alleen de specifieke pedalen van één auto.
  • Het Resultaat: De AI werd zeer flexibel. Toen ze het aan het einde schakelden naar een geavanceerder bedieningspaneel, brak het niet; het werd zelfs beter in de taak, wat liet zien dat het de vaardigheid echt had geleerd, niet alleen de knoppen had gememoriseerd.

Waarom Dit Belangrijk Is: De "Dunne Laag"-Revolutie

Het papier stelt dat de grootste bottleneck in AI-onderzoek niet het "brein" (het model) is; het zijn de "benen" (de omgeving).

  • Vroeger: Onderzoekers bouwden een speciale motor voor elke auto. Als je een nieuwe motor wilde testen, moest je een hele nieuwe auto bouwen.
  • Nu (Orchard): Orchard is een universeel chassis. Je kunt elke motor (AI-model) erin plaatsen en het werkt.
    • Het is Goedkoop: Omdat het draait op standaard cloud-technologie, kost het ongeveer 10 keer minder dan bestaande commerciële diensten.
    • Het is Snel: Het kan duizenden oefensessies tegelijkertijd draaien zonder vast te lopen.
    • Het is Herbruikbaar: Data die is verzameld voor een coderingsrobot kan worden hergebruikt om een winkelrobot te trainen.

De Conclusie

Het Orchard-papier zegt: "Stop met het wiel opnieuw uit te vinden."

Door een schoon, open en goedkoop "speeltuintje" te creëren dat voor iedereen werkt, lieten ze zien dat open-source AI kan concurreren met de grootste tech-reuzen. Ze bewezen dat met de juiste infrastructuur en slimme trainingsrecepten (zoals leren van fouten en trainen op meerdere tools), kleine, open modellen complexe, echte wereldproblemen net zo goed kunnen oplossen als de enorme, gesloten systemen.

Ze hebben al hun code, data en recepten vrijgegeven aan het publiek, in de hoop het hele veld van AI-onderzoek te versnellen door het "speeltuintje" voor iedereen beschikbaar te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →