In-IDE Toolkit for Developers of AI-Based Features
Dit artikel introduceert een AI Toolkit-plugin voor JetBrains-IDE's die tracing en evaluatie direct in de ontwikkelingsworkflow integreert, waardoor niet-ML-softwareontwikkelaars AI-gebaseerde functies effectief kunnen testen, debuggen en reproduceren via een gebruikersgerichte, IDE-inheemse aanpak.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een chef-kok bent die probeert een nieuw, complex gerecht te maken met behulp van een mysterieuze, superintelligente sous-chef (een AI-agent). Je geeft de sous-chef instructies en hij begint te snijden, te bakken en te serveren. Maar soms smaakt het gerecht heerlijk; andere keren is het een ramp. Wat is het probleem? De sous-chef doet dingen niet altijd op exact dezelfde manier, en als het eten slecht smaakt, heb je geen idee waarom het misging. Was het het zout? De temperatuur? Of raakte de sous-chef in de war door een specifiek ingrediënt?
Dit is de dagelijkse strijd voor software-engineers die AI-functies bouwen. Zij zijn de chefs, en de AI is de onvoorspelbare sous-chef.
Het Probleem: De "Black Box"-Keuken
Momenteel moet een ontwikkelaar, als hij wil zien wat zijn AI doet, stoppen met koken, zijn keuken (zijn code-editor) verlaten en naar een apart, ingewikkeld dashboard op internet gaan. Het is alsof je je keuken verlaat om naar een ander gebouw te gaan om alleen maar de temperatuur van je oven te controleren. Het is onhandig, verwarrend, en de meeste ontwikkelaars slaan het gewoon over. Ze raden uiteindelijk waarom dingen misgingen, of ze wachten tot klanten klagen om erachter te komen.
De Oplossing: De "Slimme Schort" (AI-toolkit)
De auteurs van dit artikel, een team van JetBrains (het bedrijf achter populaire codeertools zoals PyCharm), hebben een plugin gebouwd die de AI Toolkit heet. Denk hierbij aan een "slimme schort" die je terwijl je in je eigen keuken kookt, draagt. Het vraagt je niet om je werkruimte te verlaten.
Hieronder wordt uitgelegd hoe het werkt, met eenvoudige analogieën:
1. De "Directe Herhaling"-Camera (Tracing)
Wanneer je op "Uitvoeren" klikt om je code te starten, schakelt de toolkit automatisch een camera in. Het neemt niet alleen het eindgerecht op, maar elke stap die de AI heeft gezet.
- De Analogie: Stel je een camera voor die je sous-chef opneemt terwijl hij zegt: "Ik voeg zout toe", "Ik controleer de timer" en "Ik raak in de war over dit groente".
- Het Voordeel: Je kunt de video pauzeren, terugspoelen en precies zien waar de fout is ontstaan, zonder je IDE (je programmeeromgeving) te verlaten. Het verandert een "black box"-mysterie in een duidelijke, stap-voor-stap film.
2. De "Recepttester" (Evaluatie)
Op de oude manier was het testen of je AI werkt alsof je de soep één keer proeft en hoopt dat het goed is. De toolkit verandert dit in iets dat lijkt op een professionele recepttester.
- De Analogie: Je kunt een specifiek voorbeeld uit je "Directe Herhaling"-video nemen (bijvoorbeeld: "De keer dat de AI het groente verpestte") en opslaan als een "testgeval". Nu, elke keer dat je je recept aanpast, voert de toolkit automatisch dat specifieke testgeval uit om te zien of je het probleem hebt opgelost of verergerd.
- Het Voordeel: Het behandelt AI-testen net als standaard softwaretesten. Je hoeft geen wiskundig genie of AI-expert te zijn om dit te doen; je klikt gewoon op een knop en het voert een reeks controles voor je uit.
3. De "Eén-klik"-Werkstroom
De grootste innovatie is dat dit binnen het gereedschap gebeurt dat ontwikkelaars al gebruiken.
- De Analogie: In plaats van een hele nieuwe lab op te zetten, een nieuw team aan te nemen en een nieuwe taal te leren om je koken te testen, voegt de toolkit gewoon een paar nieuwe knoppen toe aan je bestaande keukenblad.
- Het Voordeel: Ontwikkelaars hoeven niet van context te wisselen. Ze voeren hun code uit, zien de "film" van wat er gebeurde, en slaan een testgeval op, allemaal zonder ooit een webbrowser te openen.
Wat Ze Vonden
Het team testte deze nieuwe "slimme schort" met echte ontwikkelaars:
- Hoge Interesse: Toen ontwikkelaars een pop-up zagen die hen voorstelde om het direct te installeren nadat ze op "Uitvoeren" hadden geklikt, installeerde ongeveer 58% het direct.
- Echt Gebruik: Eenmaal geïnstalleerd, gebruikte ongeveer 40% van die gebruikers het daadwerkelijk om hun eerste "film" (trace) op te nemen.
- Vasthoudendheid: Mensen die het gebruikten, bleven het gebruiken. Ze hebben het niet verwijderd. Dit suggereert dat het hebben van deze tools precies daar waar ze werken, een enorm verschil maakt.
De Haken (Beperkingen)
Het artikel geeft toe dat deze "slimme schort" momenteel alleen past bij één specifiek type "sous-chef" (een framework genaamd LangGraph). Als een ontwikkelaar een ander type AI-framework gebruikt, kan de toolkit deze nog niet zien. Het team plant om het binnenkort compatibel te maken met meer frameworks.
De Conclusie
Dit artikel stelt dat we, om AI-ontwikkeling betrouwbaar te maken, moeten stoppen met het behandelen ervan als een mysterieus wetenschappelijk experiment dat in een apart lab plaatsvindt. In plaats daarvan moeten we de tools voor observatie en testen direct in de dagelijkse werkruimte van de ontwikkelaar brengen. Door het eenvoudig te maken om de AI te "bekijken" en zijn recepten te "testen" op de plek waar de code wordt geschreven, kunnen zelfs ontwikkelaars die geen AI-experts zijn, betere, betrouwbaardere AI-functies bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.