← Nieuwste papers
💻 computer science

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

Dit artikel introduceert DisciplineGen-1M, een multidisciplinaire dataset op miljoenschaal en een bijbehorend redeneergeneratiemodel dat de nauwkeurigheid van kennisintensieve visuele creatie en bewerking aanzienlijk verbetert door de kloof te overbruggen tussen esthetische plausibiliteit en verifieerbare, concept-gegronde diagramgeneratie.

Oorspronkelijke auteurs: Zhaokai Wang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Yiguo He, Mohan Zhang, Leyao Gu, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Xuanhe Zhou, Zhihang Zhong, Junchi Yan, Xue Yang

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhaokai Wang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Yiguo He, Mohan Zhang, Leyao Gu, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Xuanhe Zhou, Zhihang Zhong, Junchi Yan, Xue Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische penseel hebt die alles kan tekenen wat je beschrijft. Als je zegt: "een kat die op een kleedje zit," werkt het perfect. Maar als je vraagt om "een chemische reactie waarbij molecuul A uiteenvalt in B en C te tekenen," of "een tijdlijn van de geschiedenis die de exacte data van het Romeinse Rijk laat zien," raakt de magische penseel vaak in de war. Hij tekent misschien een mooie afbeelding, maar de wetenschap of geschiedenis daarin is fout. Het is alsof het een kunstenaar is die geweldig is in het schilderen van landschappen, maar niet weet hoe hij een kaart of een wiskundeboek moet lezen.

Het artikel "DisciplineGen-1M" introduceert een oplossing voor dit probleem. Hier is een eenvoudige analyse van wat ze hebben gedaan:

1. Het Probleen: De "Mooi maar Fout"-valstrik

Huidige AI-beeldgeneratoren zijn als getalenteerde kunstenaars die miljoenen foto's hebben gezien. Ze zijn erg goed in het maken van realistische en mooie dingen. Echter, ze worstelen met academische diagrammen (zoals wiskundige grafieken, biologische cellen of bladmuziek).

  • Het probleem: In een normale foto is het niet erg als een boom er iets vreemd uitziet. In een chemisch diagram is het, als één atoom op de verkeerde plek staat, wetenschappelijk gezien nutteloos.
  • De kloof: Er was geen grote genoeg bibliotheek van "correcte" academische plaatjes om de AI te leren hoe hij de details goed moet krijgen.

2. De Oplossing: Het bouwen van een enorme "Leerboek"-bibliotheek

Het team bouwde DisciplineGen-1M, een dataset met 1,2 miljoen voorbeelden. Zie dit niet als een fotoalbum, maar als een enorme, georganiseerde bibliotheek van instructiehandleidingen voor het tekenen.

  • Wat zit erin? Het beslaat 10 verschillende onderwerpen: Wiskunde, Natuurkunde, Scheikunde, Biologie, Geografie, Informatica, Economie, Geschiedenis, Muziek en Sport.
  • Het doel: Om de AI niet alleen te leren hoe te tekenen, maar ook wat te tekenen, zodat de feiten correct zijn.

3. Hoe ze het hebben gebouwd: Vier verschillende "Bouwploegen"

Je kunt niet zomaar foto's van het internet pakken, want die zijn vaak slordig of foutief. Daarom heeft het team vier verschillende methoden gebruikt om hun bibliotheek op te bouwen, als vier gespecialiseerde bouwploegen:

  • Crew 1: De Vector Architecten (SVG & TikZ)
    • Analogie: In plaats van een plaatje te schilderen, schreven ze computercode om het te tekenen.
    • Hoe het werkt: Ze gebruikten code (zoals SVG of TikZ) om perfecte diagrammen te genereren. Omdat het code is, kunnen ze één regel aanpassen (bijv. "verplaats deze pijl") en direct een nieuw, perfect uitgelijnd plaatje krijgen. Dit zorgt ervoor dat de wiskunde en geometrie 100% accuraat zijn.
  • Crew 2: De OCR Editors (Tekst Maskeren)
    • Analogie: Zoals een "Waar is Waldo?"-spel waarbij je het antwoord afdekt.
    • Hoe het werkt: Ze namen educatieve afbeeldingen, gebruikten een tool om alle tekstlabels te vinden, en "wissen" (maskeerden) deze vervolgens. De AI leert naar de lege ruimte te kijken en de juiste label in te vullen op basis van de context.
  • Crew 3: De Filteraars (Het web schoonmaken)
    • Analogie: Goud scheiden van zand.
    • Hoe het werkt: Ze namen miljoenen afbeeldingen van het internet en gebruikten een slimme filter om de slechte weg te gooien (zoals wazige foto's of tekstzware pagina's) en hielden alleen de heldere, gestructureerde diagrammen over die lijken op tekstboekillustraties.
  • Crew 4: De Programmeurs (Gespecialiseerde Motoren)
    • Analogie: Het gebruiken van een gespecialiseerde fabrieksmachine voor specifieke onderdelen.
    • Hoe het werkt: Voor lastige zaken zoals chemische moleculen, bladmuziek of schaakborden, schreven ze speciale computerprogramma's om de afbeeldingen vanaf nul te generen, zodat elke regel (zoals een geldige schaakzet of een juiste muzieknoot) werd gevolde.

4. Het Resultaat: Een Slimmere AI-kunstenaar

Met behulp van deze nieuwe bibliotheek trainden het team een nieuw AI-model.

  • De Test: Ze lieten de AI "examens" (benchmarks) afleggen over wiskunde, wetenschap en geschiedenis.
  • De Uitkomst: De nieuwe AI scoorde veel hoger dan eerdere open-source modellen. Het maakte niet alleen mooie plaatjes; het maakte feitelijk correcte diagrammen.
    • Voorbeeld: Als er gevraagd werd om een specifieke chemische structuur te tekenen, kreeg het de verbindingen goed. Als er gevraagd werd om een geschiedeniskaart aan te passen, plaatste het de grenzen correct.
  • De Bonus: Opvallend genoeg hielp deze training de AI ook om beter te worden in algemene taken (zoals het begrijpen van oorzaak-gevolg in afbeeldingen), wat suggereert dat het leren van strikte regels helpt om er in het algemeen beter over na te denken.

Samenvatting

Beschouw DisciplineGen-1M als een enorme, hoogwaardige leerboek en werkboek voor AI. Voorheen waren AI-kunstenaars als mensen die leerden tekenen door naar willekeurige foto's te kijken. Nu hebben ze een gestructureerd curriculum dat hen de regels van wetenschap, wiskunde en geschiedenis leert. Het team beweert dat dit de sleutel is om AI te laten bewegen van alleen "mooie" afbeeldingen maken naar het maken van "nuttige en correcte" kennisgebaseerde afbeeldingen.

Het team heeft beloofd deze bibliotheek en de code die ze hebben gebruikt om het op te bouwen te delen, zodat andere onderzoekers er ook gebruik van kunnen maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →