← Nieuwste papers
💻 computer science

DeCEAT: Decoding Carbon Emissions for AI-driven Software Testing

Dit paper introduceert het DeCEAT-framework om de milieueffecten en prestaties van kleine taalmodellen bij het genereren van softwaretests te analyseren, waarbij wordt aangetoond dat promptontwerp en modelkeuze een cruciale rol spelen in de duurzaamheid.

Oorspronkelijke auteurs: Pragati Kumari, Novarun Deb

Gepubliceerd 2026-02-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Pragati Kumari, Novarun Deb

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt vol met instructies voor het bouwen van huizen (software). Vroeger moesten mensen handmatig elke muur en elk raam controleren om te zien of het stevig was. Dat kostte veel tijd. Vandaag de dag hebben we slimme robots (kunstmatige intelligentie) die deze controles voor ons kunnen doen. Maar er is een probleem: deze robots zijn soms erg hongerig. Ze verbruiken enorm veel stroom om te "denken", en dat zorgt voor een grote CO2-uitstoot.

De meeste onderzoekers kijken alleen naar de gigantische robots (de grote taalmodellen of LLM's), die net als olifanten zijn: ze kunnen veel, maar ze eten ook heel veel. Maar wat gebeurt er met de kleine robots (de kleine taalmodellen of SLM's)? Die zijn vaak sneller en lichter, maar niemand heeft ooit goed gekeken hoeveel stroom ze echt verbruiken als ze testjes schrijven voor software.

Hier komt DeCEAT om de hoek kijken.

Wat is DeCEAT eigenlijk?

DeCEAT is als een milieu-checklist voor slimme robots. Het is een nieuw systeem dat uitrekent:

  1. Hoeveel stroom verbruikt een robot om een test te schrijven?
  2. Hoeveel CO2 komt er vrij?
  3. Is de test die de robot schrijft wel goed genoeg?

De onderzoekers wilden weten: Kunnen we een robot kiezen die niet alleen slim is, maar ook "groen"?

Hoe hebben ze dit getest? (De Proef)

Stel je voor dat je vijf verschillende kleine robots hebt (zoals Phi-3, Qwen, Mistral, etc.). Je geeft ze allemaal dezelfde opdracht: "Schrijf een test voor deze stukjes code."

Maar je doet het op een slimme manier:

  • De Voeding: Je geeft ze niet zomaar een opdracht. Je probeert verschillende "recepten" (prompten). Soms zeg je gewoon "Doe het", en soms geef je een heel gedetailleerd recept: "Je bent een expert, gebruik deze regels, en doe het op deze manier."
  • De Maatlat: Ze gebruikten een bekend spelletje (HumanEval) met 164 kleine code-opdrachten.
  • De Meter: Ze gebruikten een speciale app (CodeCarbon) die als een slimme stroommeter fungeert. Die telt precies hoeveel stroom er verbruikt wordt en zet dat om in CO2-uitstoot.

Wat hebben ze ontdekt? (De Verhalen)

Het onderzoek leek op een race tussen verschillende auto's. Sommige auto's zijn snel, andere zuinig, en weer anderen zijn heel betrouwbaar.

  1. De "Zuinige Sportauto" (deepseek-coder-7b):
    Deze robot was de winnaar als het ging om stroombesparing. Hij verbruikte het minst en stootte de minste CO2 uit. Hij was als een hybride auto die heel efficiënt rijdt.

  2. De "Betrouwbare Bestelbus" (Qwen2.5-1.5B):
    Deze robot was niet de snelste of de zuinigste, maar hij was het meest stabiel. Als je hem twee keer dezelfde opdracht gaf, deed hij het bijna precies hetzelfde. Hij gaf geen verrassingen. Voor bedrijven die zekerheid willen, is dit een goede keuze.

  3. De "Balans-Kampioen" (Phi-3.5-mini):
    Deze robot was de beste in het vinden van een perfecte balans. Hij was snel, stootte niet veel uit, en schreef goede tests. Hij was als een fiets die zowel snel als comfortabel is.

  4. De "Kwaliteits-Kampioen" (Mistral-7B & Llama-3-8B):
    Deze robots waren heel goed in het schrijven van tests die veel van de code bedekten (ze vonden meer foutjes). Ze waren als een grondige inspecteur die alles tot in detail controleert, ook al kost dat iets meer tijd.

De Grote Les: Het hangt af van je doel

Het belangrijkste wat dit papier laat zien, is dat er geen enkele "beste" robot is. Het is net als bij het kopen van schoenen:

  • Wil je de zuinigste? Kies dan de robot die het minst stroom verbruikt.
  • Wil je stabiliteit? Kies dan de robot die altijd hetzelfde resultaat geeft.
  • Wil je kwaliteit? Kies dan de robot die de meeste foutjes vindt.

En het allerbelangrijkste geheim? Hoe je de robot vraagt (de prompt) maakt een enorm verschil.
Als je een robot vraagt: "Schrijf een test", is hij misschien slordig en verbruikt hij veel energie omdat hij moet "gissen".
Als je zegt: "Je bent een expert, volg deze regels, en gebruik deze structuur", dan wordt de robot slimmer, sneller en verbruikt hij minder energie. Het is alsof je een kok een recept geeft: met een goed recept maakt hij een betere maaltijd met minder ingrediënten.

Conclusie

DeCEAT is een handig kompas voor iedereen die software ontwikkelt. Het helpt om te kiezen voor slimme robots die niet alleen goed zijn voor de kwaliteit van je software, maar ook goed zijn voor het milieu. Het bewijst dat we niet hoeven te kiezen tussen "goed" en "groen"; met de juiste instellingen en de juiste robot kunnen we beide hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →