Using Large Language Models for Idea Generation in Innovation
Deze studie toont aan dat hoewel door AI gegenereerde productideeën een lagere nieuwheid en diversiteit vertonen in vergelijking met door mensen gegenereerde ideeën, ze de menselijke ideeën aanzienlijk overtreffen in gemiddelde aankoopintentie en ze zeven keer vaker tot de top 10% van de hoogwaardige concepten behoren.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je in een uitgestrekt, mistig veld staat genaamd "Het Ideeënlandschap". Je doel is om de meest waardevolle schat te vinden die ergens in dit veld verborgen ligt. In de wereld van zaken en innovatie is deze schat een briljant nieuw productidee waar mensen graag voor willen betalen. Lange tijd was de enige manier om deze schatten te vinden het uitsturen van menselijke ontdekkingsreizigers. Deze mensen dwaalden rond en groeven ideeën één voor één op. De regel van het spel was altijd dat je niet elk idee perfect hoefde te hebben; je had er alleen een paar absolute pareltjes van nodig. Als je 100 ideeën opgraaft en 99 zijn stenen maar één is een diamant, dan heb je gewonnen. Maar wat als je een magische, supersnelle robot kon inhuren die 1.000 ideeën kan opgraven in de tijd dat een mens er tien opgraaft? Dat is de vraag die wetenschappers stellen over Kunstmatige Intelligentie (AI). Specifiek testen ze "Large Language Models" (LLM's)—superintelligente computerprogramma's die getraind zijn op bijna alles wat ooit op het internet is geschreven. Deze programma's zijn geweldig in het schrijven van verhalen en het beantwoorden van vragen, maar kunnen ze net zo creatief zijn als mensen als het gaat om het uitvinden van nieuwe dingen? Dit artikel is bedoeld om te zien of deze digitale dromers daadwerkelijk beter kunnen verzinnen dan echte mensen.
De onderzoekers van topuniversiteiten besloten dit aan een test te onderwerpen met een specifieke uitdaging: bedenk een nieuw fysiek product voor studenten dat minder dan $50 kost. Ze verzamelden drie verschillende groepen "ideeën-generatoren". De eerste groep was een team van universiteitsstudenten die eerder een cursus productontwerp hadden gevolgd voordat AI-tools zoals ChatGPT breed beschikbaar kwamen. De tweede groep was een computerprogramma (GPT-4 van OpenAI) dat de opdracht kreeg om ideeën te genereren met een eenvoudige instructie, zoals een leeg canvas (dit wordt "zero-shot" prompting genoemd). De derde groep was hetzelfde computerprogramma, maar dit keer kreeg het eerst een paar voorbeelden van goede ideeën te zien om het in de juiste stemming te brengen (dit wordt "few-shot" prompting genoemd).
Om te zien wie het beste presteerde, vroegen de onderzoekers niet alleen aan experts, maar ook aan gewone mensen. Ze lieten honderden van deze productideeën aan een grote groep mensen van studentleeftijd zien en vroegen: "Hoe waarschijnlijk is het dat u dit zou kopen?" Ze vertaalden deze antwoorden naar een "aankoopscore" om de kwaliteit te meten. Ze gebruikten ook computertools om te controleren hoe vergelijkbaar de ideeën met elkaar waren en vroegen mensen om te beoordelen hoe "nieuw" of "origineel" de ideeën aanvoelden.
Dit is wat ze vonden, en het is een beetje verrassend. Ten eerste was de AI eigenlijk beter in de hoofdtaak: het maken van ideeën waar mensen voor willen kopen. Gemiddeld werden de door de computer gegenereerde ideeën hoger beoordeeld dan de ideeën gemaakt door de studenten. De computer die een paar voorbeelden kreeg om mee te beginnen (few-shot), deed het het beste van allemaal. Het is alsof de robot een beter "gevoel" had voor wat klanten wilden.
Er zat echter een addertje onder het gras. Hoewel de AI beter was in het maken van goede ideeën, was het niet zo goed in het maken van verschillende ideeën. De ideeën van de computer neigden er erg veel op elkaar en klonken erg vergelijkbaar. Als je je de menselijke studenten voorstelt die het hele mistige veld verkennen, leek de AI in één of twee specifieke plekken te blijven hangen, waarbij het veel variaties van dezelfde paar schatten opgroef. De ideeën van de computer werden door de mensen die ze lazen ook als iets minder "origineel" of uniek beoordeeld. Het is alsof de robot heel goed was in het polijsten van bestaande concepten, maar moeite had om buiten de gebaande paden te denken zoals mensen dat soms doen.
Maar hier is het meest opwindende deel. In innovatie doet het gemiddelde idee er minder toe dan het beste idee. De onderzoekers keken naar de bovenste 10% van alle verzamelde ideeën—de absolute topstukken. Ze ontdekten dat de AI zeven keer waarschijnlijker een idee produceerde dat in deze top 10% terechtkwam, vergeleken met de mensen. Voor elk één geweldig idee dat de studenten bedachten, kwam de computer er zeven met.
De auteurs suggereren dat dit een conservatieve schatting is. Ze hebben zelfs niet meegeteld hoe veel sneller de computer was. Een mens kan 15 minuten nodig hebben om vijf ideeën te bedenken, terwijl de computer in diezelfde tijd 200 ideeën kan genereren. De computer is dus niet alleen beter in kwaliteit; het is een productiviteitsmonster.
Het artikel concludeert dat hoewel AI misschien niet zo wild of divers is als een menselijke brainstormsessie, het een krachtpatser is voor het vinden van hoogwaardige, verkoopbare ideeën. Het suggereert dat bedrijven in de toekomst misschien niet meer zo veel tijd hoeven te besteden aan het bedenken van ideeën vanaf nul. In plaats daarvan zouden ze de AI honderden hoogwaardige opties snel kunnen laten genereren, om vervolgens mensen te laten focussen op het kiezen van de beste ideeën en het nog beter maken ervan. De robot vervangt de menselijke dromer niet, maar geeft hem een superkrachtige schep om veel sneller diamanten op te graven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.