← Nieuwste papers
💬 NLP

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

Dit paper introduceert JanusCoder, een fundamenteel visueel-programmatisch model dat is getraind op het tot nu toe grootste multimodale code-corpus (JanusCode-800K) en dat via een eenheidsarchitectuur code kan genereren op basis van tekstuele instructies, visuele input of een combinatie daarvan, waarbij het de prestaties van commerciële modellen benadert of overtreft.

Oorspronkelijke auteurs: Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

Gepubliceerd 2026-04-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat computers tot nu toe vooral "blind" waren voor wat ze zelf hebben gemaakt. Ze konden uitstekend code schrijven (de instructies), maar als die code een mooi plaatje, een interactieve website of een animatie opleverde, konden ze dat resultaat niet echt "zien" of begrijpen. Ze konden de instructie geven, maar niet zien of het eindresultaat eruitzag zoals bedoeld.

Het paper JANUSCODER komt met een oplossing die dit probleem oplost. Het is alsof we een brug bouwen tussen de wereld van de code (de logica) en de wereld van het beeld (de visuele uitkomst).

Hier is een uitleg in gewone taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De Blinde Architect

Vroeger hadden we twee soorten experts:

  • De Architect (de code-models): Die kon prachtige blauwdrukken maken, maar zag niet hoe het gebouw eruitzag als het klaar was.
  • De Kunstenaar (de beeld-modellen): Die kon prachtige schilderijen maken, maar had geen idee hoe je die schilderijen technisch bouwt met code.

De wereld van "Code Intelligence" was vastgelopen omdat er te weinig goede voorbeelden waren van beide tegelijk: code én het bijbehorende plaatje. Het was alsof je een kookboek hebt met recepten, maar geen foto's van de eindresultaten om te zien of je het goed hebt gedaan.

2. De Oplossing: De "Twee-Ogen" Chef-kok (JANUSCODER)

De naam JANUS verwijst naar de Romeinse god Janus, die twee gezichten heeft: één kijkt naar het verleden, de andere naar de toekomst. In dit geval kijkt het model naar twee werelden tegelijk:

  1. De tekst/code (de instructie).
  2. Het visuele resultaat (het plaatje, de website, de animatie).

JANUSCODER is een "all-in-one" chef-kok. Je kunt tegen hem zeggen:

  • "Maak een website die eruitziet als dit plaatje." (Visie naar Code)
  • "Schrijf code die dit diagram maakt." (Code naar Visie)
  • "Verander de knop in dit plaatje naar rood." (Visie + Code naar Nieuwe Code)

Het model is zo getraind dat het niet alleen de code schrijft, maar ook voorspelt hoe die code eruit zal zien, en omgekeerd.

3. De Magische Keuken: JANUSCODE-800K

Om zo'n slimme chef-kok te trainen, heb je duizenden recepten nodig. Het probleem was dat er geen grote verzameling bestond van "Recept + Foto van het gerecht".

De onderzoekers hebben daarom een automatische keukenmachine (een synthesetoolkit) gebouwd.

  • Hoe werkt het? Ze namen bestaande code en lieten de machine er automatisch plaatjes bij maken. Vervolgens keken ze of het plaatje leek op wat de code beloofde.
  • De "Kwaliteitscontrole": Ze gebruikten andere slimme AI's als "proefpersonen" (de Reward Model). Die keken: "Ziet dit plaatje eruit zoals de tekst zegt?" Als het antwoord ja was, werd het recept bewaard. Zo ontstond JANUSCODE-800K: een enorme bibliotheek van 800.000 voorbeelden van code én plaatjes.

4. Het Resultaat: Een Spelende Wereld

Met deze enorme bibliotheek hebben ze JANUSCODER getraind. Het resultaat is verbazingwekkend:

  • Van tekst naar animatie: Je kunt zeggen: "Laat een bal op en neer stuiteren," en het model schrijft de code die dat precies doet.
  • Van plaatje naar code: Je maakt een screenshot van een website, en het model schrijft de HTML/CSS-code om die na te bouwen.
  • Van idee naar interactie: Je kunt een diagram wijzigen door simpelweg te zeggen: "Maak de grafiek kleurrijker," en het model past de code aan.

Waarom is dit belangrijk?

Vroeger moest je voor elk soort taak een andere, gespecialiseerde robot hebben. Eentje voor grafieken, eentje voor websites, eentje voor animaties. JANUSCODER is de Alles-in-Één Robot.

Het is alsof je vroeger een aparte hamer, een aparte schroevendraaier en een aparte zaag nodig had voor elke klus. JANUSCODER is een Zwitsers zakmes dat alles kan: van het bouwen van een simpele grafiek tot het creëren van complexe, interactieve wetenschappelijke demonstraties.

Kortom: JANUSCODER maakt het mogelijk dat computers niet alleen code schrijven, maar ook zien wat ze schrijven. Het sluit de kloof tussen wat we zeggen (tekst), wat we doen (code) en wat we zien (beeld). En het doet dit zo goed dat het zelfs de dure, commerciële modellen van grote tech-bedrijven verslaat, terwijl het gratis en open-source is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →