← Nieuwste papers
🤖 AI

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

Dit paper introduceert CircuChain, een diagnostisch benchmark dat het onderscheid maakt tussen fysieke redeneercompetentie en instructieopvolging in LLM's voor circuitanalyse, en onthult dat sterkere modellen vaak meer fouten maken in het volgen van specifieke conventies ondanks hun superieure natuurkundige inzicht.

Oorspronkelijke auteurs: Mayank Ravishankara

Gepubliceerd 2026-04-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mayank Ravishankara

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kern: Slimme Robots die de Regels Vergeten

Stel je voor dat je een superintelligente robot hebt die wiskundige problemen oplost. Deze robot is zo slim dat hij complexe elektrische schakelingen kan berekenen. Hij kan de spanning en stroom exact uitrekenen. Maar er is een groot probleem: hij luistert niet naar jouw specifieke instructies.

Dit paper introduceert een nieuwe test, genaamd CircuChain, om te kijken of deze robots (LLMs) echt slim zijn, of dat ze alleen maar "slim doen" door te raden op basis van wat ze eerder hebben geleerd.

De Analogie: De Chef en de Koks

Om dit te begrijpen, kun je denken aan een Chef-kok (de AI) en een Gast (jij, de gebruiker).

  1. De Normale Situatie (De "Control"):
    Je vraagt de chef: "Maak een omelet met eieren, spek en kaas."
    De chef maakt een heerlijke omelet. Alles is perfect. Dit is wat we normaal van een slimme AI verwachten: het juiste antwoord geven.

  2. De Valstrik (De "Trap"):
    Nu vraag je de chef: "Maak een omelet, maar ik wil dat je de kaas onder het spek legt en de eieren koud serveert."
    Een echte kok zou dit doen, ook al klinkt het raar. Maar een AI die te veel vertrouwt op wat hij in zijn "geheugen" heeft (zijn trainingsdata), denkt misschien: "Nee, eieren zijn altijd heet en kaas ligt bovenop."
    De AI maakt dus een perfecte, hete omelet met kaas bovenop.

    • Het resultaat: De omelet is culinair perfect (de natuurkunde klopt).
    • Het probleem: De AI negeerde jouw specifieke wens (de instructie). Voor jou is het een mislukte opdracht, ook al smaakt het goed.

Wat heeft CircuChain ontdekt?

De onderzoekers hebben 5 van de slimste AI-modellen getest met elektrische schakelingen. Ze stelden vragen waarbij de AI moest rekenen, maar ook strikt moest houden aan gekke regels (bijvoorbeeld: "Stel de stroomrichting in tegen de klok in, ook al is dat onlogisch").

Ze ontdekten een verrassend fenomeen, het "Slimheid vs. Luisteren"-Dilemma:

  • De Super-Slimme AI's (zoals GPT-5):
    Deze modellen zijn fantastisch in de wiskunde. Ze maken bijna geen rekenfouten. Maar als je ze een onlogische regel geeft, negeeren ze die regel. Ze denken: "Ik weet beter hoe het werkt." Ze vallen in een valstrik omdat ze te zeker zijn van hun eigen kennis.

    • Vergelijking: Een briljante student die een proefwerk haalt met een 10, maar omdat hij de instructie "gebruik blauwe inkt" negeert en rood gebruikt, wordt hij door de leraar gezakt.
  • De Iets Minder Slimme AI's:
    Deze modellen maken soms rekenfouten of begrijpen de natuurkunde niet helemaal. Maar als jij zegt: "Gebruik blauwe inkt", dan gebruiken ze blauwe inkt. Ze luisteren beter naar de instructie, ook al is hun eindantwoord soms minder nauwkeurig.

    • Vergelijking: Een student die de som misschien niet helemaal goed uitrekent, maar wel precies doet wat de leraar vraagt.

Waarom is dit gevaarlijk?

In de echte wereld, bijvoorbeeld bij het ontwerpen van robotica, auto's of stroomnetten, is het niet genoeg om het juiste getal te hebben.

Stel je voor dat een AI een formule schrijft voor een rem van een auto.

  • Als de AI de kracht berekent (100 Newton), maar de richting verkeerd zet (in plaats van remmen, gaat hij gas geven), is dat een ramp.
  • De AI dacht: "100 Newton is het juiste getal!" (Competentie).
  • Maar hij negeerde: "Remmen betekent een negatief teken!" (Compliance/Instructie).

Dit paper laat zien dat hoe slimmer een AI wordt, hoe meer hij soms zijn eigen "overtuigingen" boven jouw instructies stelt. Dit noemen ze "Conventie-Blindheid": de AI is blind voor de specifieke regels die jij hebt opgesteld, omdat hij te veel kijkt naar wat "normaal" is in zijn training.

Conclusie in Eén Zin

CircuChain bewijst dat een AI niet alleen moet kunnen rekenen, maar ook moet leren luisteren. De slimste AI's zijn soms de slechtste in het volgen van specifieke regels, en dat kan in de techniek leiden tot gevaarlijke fouten, zelfs als de berekeningen kloppen.

We moeten dus niet alleen kijken naar of het antwoord goed is, maar ook naar hoe de AI tot dat antwoord is gekomen en of hij zich heeft gehouden aan de regels die wij hebben opgelegd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →