DKSE: Automated Extraction of Structured Domain Ontologies from Software Requirement Documents via Large Language Models
Dit artikel presenteert DKSE, een op Rust gebaseerde tool die gebruikmaakt van grote taalmodellen om ongestructureerde softwarevereisten-documenten uit de Chinese banksector automatisch om te zetten in machineleesbare, herkomst-gevolideerde ontologieën, waarbij een hoge nauwkeurigheid en praktische bruikbaarheid voor downstream-taken zoals testgeneratie en kennisgrafiekconstructie wordt aangetoond.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, eeuwenoude bibliotheek binnenloopt waar elk boek is geschreven in een taal die alleen mensen kunnen begrijpen. Je kunt de verhalen, de regels en de instructies lezen, maar als je een robot probeert te vragen om een specifiek feit te vinden, een nieuwe machine te bouen op basis van die instructies, of te controleren of een regel is nageleefd, staart de robot je alleen maar glazig aan. Hij ziet paragrafen tekst, niet de gestructureerde data die hij nodig heeft om zijn magie te bedrijven. Dit is de dagelijkse realiteit van de wereld van software engineering. Decennialang is de "broncode" van hoe bedrijven functioneren—hun vereisten, regels en processen—opgesloten gebleven in ongestructureerde documenten zoals Word-bestanden en PDF's. Hoewel Kunstmatige Intelligentie ongelooflijk goed is geworden in het lezen en schrijven van code, heeft het moeite gehad met het begrijpen van de rommelige, natuurlijke taal-documenten die vertellen wat er überhaupt gebouwd moet worden. De grote vraag is geweest: Hoe veranderen we deze menselijke verhalen in een formaat dat machines daadwerkelijk kunnen gebruiken om te denken, te bouwen en te verifiëren?
Maak kennis met DKSE (Domain Knowledge Structuring Engine), een nieuwe tool die fungeert als een superkrachtige vertaler en bibliothecaris. Zie het als een magische scanner die niet alleen een vereistendocument leest; het begrijpt het verhaal erin en herschrijft het onmiddellijk naar een perfect georganiseerd, machineleesbaar blauwdruk. In plaats van de informatie achter te laten als een muur van tekst, breekt DKSE het af in zes specifieke, nuttige categorieën: Entities (de personages in het verhaal, zoals "Klant" of "Rekening"), Relations (hoe ze met elkaar verbonden zijn, zoals "Klant bezit Rekening"), Rules (de wetten van het universum, zoals "Als het saldo laag is, blokkeer transactie"), Processes (de stapsgewijze dansen, zoals "Hoe een lening goed te keuren"), APIs (de deuren en ramen voor data om binnen of buiten te komen) en Dictionaries (de officiële lijsten van toegestane woorden en codes).
De onderzoekers testten deze tool op een enorme stapel echte financiële documenten—ongeveer 800.000 Chinese karakters aan complexe financiële regels. Het resultaat was indrukwekkend: DKSE haalde automatisch 3.439 afzonderlijke stukken gestructureerde kennis naar boven, inclusief meer dan 1.200 regels en bijna 600 datainterfaces. Toen menselijke experts het werk controleerden, bleek het 96% accuraat te zijn, met nul "hallucinaties" (waarbij een AI dingen verzint). Maar de echte magie zit niet alleen in de extractie; het is wat er daarna gebeurt. Omdat de informatie nu gestructureerd is, gebruikte het team het om direct 1.214 testvragen te genereren om andere AI-modellen te controleren, bouwde het een enorme trainingsdataset van ongeveer 2 miljoen tokens om nieuwe AI-hersenen te onderwijzen, en voedde het de informatie zelfs aan een kennisgrafiek-systeem om computers te helpen precieze feiten op te halen zonder dingen te verzinnen. Het paper presenteert dit als een succesvolle proof-of-concept specif kind voor de bankensector, waarmee wordt aangetoond dat we die stoffige vereistendocumenten eindelijk kunnen veranderen in de levende, ademende "hersenen" die de moderne softwareontwikkeling aansturen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.