Chunking German Legal Code
Dieser Beitrag zeigt, dass für retrieval-augmentierte Generierung im Bereich des deutschen Gesetzesrechts Chunking-Strategien, die mit den inhärenten strukturellen Einheiten des Dokuments (wie Abschnitten und Unterabschnitten) übereinstimmen, komplexere semantische oder hierarchische Methoden übertreffen, indem sie eine höhere Recall-Rate bei größerer Recheneffizienz erzielen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, eine spezifische Regel in einer riesigen, jahrhundertealten Bibliothek von Gesetzen (dem Bürgerlichen Gesetzbuch, BGB) zu finden. Sie haben einen superintelligenten KI-Bibliothekar (ein Large Language Model), der Ihre Fragen beantworten kann, aber eine kurze Aufmerksamkeitsspanne hat. Wenn Sie ihm die gesamte Bibliothek übergeben, gerät er in Verwirrung, vergisst die mittleren Teile oder erfindet Dinge.
Um dies zu beheben, müssen Sie die Bibliotheksbücher in kleinere, handhabbare „Chunks" (Abschnitte) schneiden, damit die KI die benötigte Seite schnell finden kann. Diese Arbeit ist eine Testfahrt, um zu sehen, welche Art, die Bücher zu schneiden, am besten funktioniert.
Hier ist die Aufschlüsselung ihres Experiments und ihrer Erkenntnisse, unter Verwendung einfacher Analogien:
Das Problem: Wie man den Kuchen schneidet
Die Forscher testeten verschiedene Möglichkeiten, den juristischen Text für die KI zu zerschneiden:
- Die „Anwalts-Methode" (Strukturbasiert): Den Text genau dort zu schneiden, wo die Gesetzgeber es getan haben – nach Paragrafen und Absätzen. Denken Sie daran wie das Schneiden eines Kuchens entlang der vom Bäcker vorgezeichneten Linien.
- Die „Roboter-Methode" (Feste Fenster): Den Text in gleich große Blöcke von Wörtern zu schneiden, wobei ignoriert wird, wo Sätze oder Regeln enden. Das ist wie das Verwenden eines Ausstechers, um einen Kuchen zu schneiden; Sie könnten eine einzelne Regel in der Mitte durchschneiden, wobei die „Oberseite" der Regel auf einem Teller und die „Unterseite" auf einem anderen landet.
- Die „Smart AI"-Methode (Kontextuell/Lumber/RAPTOR): Eine superintelligente KI zu verwenden, um den Text zu lesen und basierend auf der Bedeutung zu entscheiden, wo geschnitten werden soll, oder ähnliche Ideen zusammenzufassen, auch wenn sie weit voneinander entfernt im Buch stehen. Das ist wie ein Koch, der Zutaten aus verschiedenen Rezepten neu zu „Geschmacksbündeln" arrangiert.
Das Experiment
Sie nahmen 525 reale Fragen von normalen Menschen (wie „Wann kann ich meine Kaution zurückbekommen?") und baten das System, den richtigen Rechtsabschnitt zu finden. Sie maßen drei Dinge:
- Recall (Wiedergewinnungsrate): Hat das System die richtige Antwort gefunden?
- Geschwindigkeit: Wie schnell hat es sie gefunden?
- Kosten: Wie viel Zeit und Computerspeicher waren erforderlich, um die Bibliothek einzurichten?
Die Ergebnisse: Einfachheit bewahren
Die Erkenntnisse waren überraschend unkompliziert:
1. Die „Anwalts-Methode" gewann das Rennen
Die Methoden, die die ursprüngliche Struktur des Gesetzes respektierten (Schneiden nach Paragrafen und Absätzen), waren am genauesten.
- Warum? Gesetze sind wie eine Hierarchie geschrieben. Ein „Paragraf" enthält normalerweise einen vollständigen Gedanken oder eine Regel. Wenn Sie genau dort schneiden, wo die Gesetzgeber geschnitten haben, halten Sie die „Bedingung" (wenn X passiert) und die „Konsequenz" (dann passiert Y) zusammen.
- Die Analogie: Wenn Sie nach dem „Rezept für Schokoladenkuchen" fragen, wollen Sie die ganze Rezeptkarte, nicht die Hälfte der Zutatenliste und die Hälfte der Backanweisungen.
2. Die „Roboter-Methode" scheiterte
Das Schneiden des Textes in festgroße Chunks (unter Ignorierung der Rechtsstruktur) schnitt am schlechtesten ab.
- Warum? Oft wurde eine Regel in der Mitte durchgeschnitten. Die KI würde den „wenn"-Teil einer Regel sehen, aber den „dann"-Teil verpassen, weil er im nächsten Chunk war.
- Die Analogie: Es ist wie das Lesen eines Satzes, der sagt: „Wenn Sie schnell fahren, werden Sie..." und dann beginnt die nächste Seite mit „...ein Ticket zu bekommen." Wenn die KI nur die erste Hälfte sieht, weiß sie nicht, wie es ausgeht.
3. Die „Smart AI"-Methoden waren übertrieben
Methoden, die komplexe KI verwendeten, um ähnliche Ideen zu gruppieren oder Kapitel zusammenzufassen (wie RAPTOR oder Lumber-artiges Chunking), performten nicht besser als die einfachen strukturellen Schnitte. Tatsächlich waren sie oft schlechter.
- Warum? Indem die KI verschiedene Regeln basierend auf „Vibe" oder Thema gruppierte, verschwammen die Grenzen. Eine spezifische rechtliche Ausnahme ging in einer allgemeinen Zusammenfassung verloren.
- Die Analogie: Stellen Sie sich einen Bibliothekar vor, der alle Bücher über „Geld" zusammenlegt. Wenn Sie nach einer spezifischen Steuerregel fragen, gibt Ihnen der Bibliothekar einen riesigen Ordner mit jedem Gesetz über Geld. Sie müssen den ganzen Ordner durchsuchen, um Ihre eine Regel zu finden. Es ist besser, Ihnen einfach die spezifische Seite zu geben.
4. Effizienz ist wichtig
Die komplexen KI-Methoden benötigten eine lange Zeit zum Einrichten (Stunden oder sogar Tage) und erforderten viel Computerspeicher. Die einfache „Anwalts-Methode" war schnell einzurichten und günstig zu speichern.
- Der Kompromiss: Die ausgefallenen Methoden versuchten, durch Hinzufügen von Kontext „klüger" zu sein, aber sie endeten damit, langsamer, teurer und ungenauer zu sein als das einfache Festhalten an der ursprünglichen Buchstruktur.
Das Fazit
Im Umgang mit Gesetzbüchern ist Struktur der König.
Die Arbeit kommt zu dem Schluss, dass Sie keine superkomplexe KI benötigen, um herauszufinden, wie man eine Rechtsbibliothek organisiert. Die Gesetzgeber haben bereits die harte Arbeit geleistet, die Regeln in logische Abschnitte zu organisieren. Die beste Strategie für eine KI ist es einfach, diese ursprünglichen Grenzen zu respektieren. Der Versuch, die Organisation durch ein anderes Schneiden des Textes oder Gruppieren von Ideen nach Thema zu „verbessern", macht die KI tatsächlich dümmer und langsamer beim Finden der richtigen Antwort.
Kurz gesagt: Erfinden Sie das Rad nicht neu. Wenn das Gesetz in Kapiteln und Abschnitten geschrieben ist, lassen Sie die KI nach Kapiteln und Abschnitten suchen. Es ist schneller, günstiger und liefert öfter die richtige Antwort.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.