← Nieuwste papers
💬 NLP

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

Deze verkennende studie evalueert vijf grote taalmodellen op 6x6 Sudoku-puzzels en stelt vast dat, hoewel één model beperkte oplossingsvaardigheid vertoont, geen enkel model uitleggen kan die strategisch redeneren of intuïtieve probleemoplossing weerspiegelen, wat aanzienlijke barrières voor effectieve mens-AI-gemeenschappelijke besluitvorming blootlegt.

Oorspronkelijke auteurs: Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

Gepubliceerd 2026-04-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van zeer slimme, goed gelezen robots. Je vraagt hen een logische puzzel op te lossen genaamd Sudoku (specifiek een kleinere 6×6-versie) en, belangrijker nog, om je in platte taal te leren hoe ze het hebben opgelost.

Dit artikel is als een rapportkaart voor vijf van deze robots, waarbij twee dingen worden gecontroleerd:

  1. Kregen ze het juiste antwoord?
  2. Kon hun denken op een manier worden uitgelegd die voor een mens echt logisch is?

Hier is de uiteenzetting van wat de onderzoekers vonden, met behulp van alledaagse analogieën.

De Opzet: De "Sudoku-test"

De onderzoekers creëerden bijna 2.300 van deze 6×6-puzzels. Zie deze puzzels als een sportschool voor de hersenen. Ze zijn niet de moeilijkste puzzels ter wereld (zoals de 9×9-versie), maar ze zijn lastig genoeg om niet zomaar te raden; je moet logica en regels gebruiken om uit te zoeken waar de cijfers moeten komen.

Ze wilden zien of Large Language Models (LLM's) – de AI-hersenen achter chatbots – konden optreden als een goede tutor. Een goede tutor geeft je niet alleen het antwoord; ze lopen met je door de stappen zodat je begrijpt waarom een zet is gedaan.

De Resultaten: De "Oplossers" versus de "Verklarende"

1. De Open-Source Robots (Het "Amateuruur")

De onderzoekers testten vier verschillende open-source modellen (zoals Llama, Gemma en Mistral).

  • Het Resultaat: Deze robots faalden de test in de basis. Van de 2.293 puzzels kregen ze het hele puzzle correct in minder dan 1% van de gevallen.
  • De Analogie: Stel je voor dat je een groep mensen vraagt om een kruiswoordpuzzel in te vullen. Deze robots waren als mensen die willekeurige woorden raden. Ze zouden misschien door toeval een paar letters goed hebben, maar ze konden het hele plaatje niet consistent houden. Ze vergaten de regels zodra ze begonnen te schrijven.

2. De Sterke Leerling: OpenAI's "o1-preview"

Dan was er één specifiek model van OpenAI genaamd o1-preview.

  • Het Resultaat: Dit model was een ster in het oplossen. Het kreeg de volledige puzzel ongeveer 65% van de tijd helemaal goed. Bij de eenvoudigere puzzels was het perfect (100%).
  • De Haken: Naarmate de puzzels moeilijker werden (het "Duivelse" niveau), daalde de prestatie. Het begon fouten te maken, zoals een student die geweldig is in wiskundehuiswerk maar in de war raakt als de toets echt zwaar wordt.

3. Het Echte Probleem: De "Slechte Verklarende"

Hier wordt het onderzoek interessant. De onderzoekers namen de 20 puzzels die o1-preview correct had opgelost en vroeg het om zijn stappen uit te leggen aan menselijke experts.

  • Het Resultaat: De uitleg was een ramp.

    • Onderbouwing: Slechts 5% van de tijd legde de robot daadwerkelijk uit waarom hij een cijfer had gekozen. De meeste tijd zei hij gewoon: "Ik heb hier een 5 gezet", zonder te zeggen waarom.
    • Duidelijkheid: De uitleg was verwarrend, sprong heen en weer en gebruikte termen incorrect.
    • Onderwijswaarde: Als je probeerde te leren hoe je Sudoku oplost met deze robot, zou je niets leren. Het leerde geen strategieën.
  • De Analogie: Stel je voor dat een meesterkok een perfect biefstuk kan bereiden. Je vraagt hen: "Hoe heb je dat gedaan?"

    • Een goede uitleg: "Ik heb het twee minuten op hoog vuur geseard, daarna de temperatuur verlaagd..."
    • Wat o1-preview deed: Het gaf je het biefstuk en zei: "Het is klaar. Het is goed. Hier is het biefstuk." Het gaf je het resultaat, maar weigerde (of kon niet) het recept te delen. Het was als een goochelaar die een truc perfect uitvoert, maar wanneer er om uitleg wordt gevraagd, gewoon zegt: "Ik heb het gewoon gedaan", en vervolgens een nepreden verzonnet die niet overeenkomt met wat er echt gebeurd is.

De Grote Conclusie

Het artikel concludeert dat AI, terwijl het beter wordt in het doen van het werk (het oplossen van de puzzel), nog steeds vreselijk is in het vertellen van het verhaal van hoe het het werk heeft gedaan.

De auteurs betogen dat AI, om een echte partner voor mensen te zijn – vooral in belangrijke banen zoals geneeskunde of recht – in staat moet zijn om zijn werk duidelijk te tonen. Op dit moment is zelfs de slimste AI als een student die een 'A' haalt op de toets, maar het antwoord niet aan de leraar kan uitleggen.

Wat Komt Er Volgende?

Het artikel suggereert dat we, in plaats van te proberen dat AI volledig op zichzelf "denkt" zoals een mens, AI moeten combineren met logische hulpmiddelen (zoals gespecialiseerde wiskundesoftware).

  • Het Idee: Laat de logische software het harde, strenge rekenwerk doen om ervoor te zorgen dat het antwoord 100% correct is. Laat de AI vervolgens fungeren als vertaler, die die strenge, saaie wiskunde omzet in een vriendelijk, makkelijk te begrijpen verhaal voor een mens.

Kortom: De AI kan de puzzel oplossen, maar kan je nog niet leren hoe je hem oplost. Het is een geweldige werknemer, maar een vreselijke leraar.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →