← Neueste Arbeiten
💻 computer science

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

Dieses Paper präsentiert eine End-to-End-Pipeline, die erfolgreich strukturierte Immobilien-Metadaten aus 2.781 heterogenen Immobilien-Fragebogen extrahiert, indem sie zunächst deren strukturelle Typen klassifiziert und anschließend das Large Language Model DeepSeek R1 verwendet, um hochwertige JSON-Daten zu generieren, welche durch Konsistenzbewertung und Marktsegmentierungs-Clustering validiert wurden.

Ursprüngliche Autoren: Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

Veröffentlicht 2026-07-08
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten ein Haus kaufen. Sie besuchen eine Immobilienwebsite und sehen ein schönes Foto, den Preis und die Anzahl der Schlafzimmer. Das sind die „leichten Daten“ – es ist wie das saubere, gedruckte Etikett auf einer Müslischachtel.

Aber verborgen in diesem Inserat befindet sich ein viel detaillierteres, unordentliches Dokument namens „Immobilienfragebogen“. Dies ist wie das Kleingedruckte auf der Rückseite der Schachtel, aber anstatt ordentlich gedruckt zu sein, ist es eine Mischung aus getippten Formularen, handschriftlichen Notizen, gescannten Fotokopien und Dokumenten mit seltsamen Häkchen. Dieses Dokument enthält die wahren Geheimnisse: Gibt es Asbest? Wer liefert das Gas? Gibt es Rechtsstreitigkeiten?

Das Problem:
Derzeit sind Computer schlecht darin, diese unordentlichen Dokumente zu lesen. Sie können die sauberen „Müslischachtel“-Daten problemlos lesen, aber wenn sie versuchen, die „Kleingedruckten“ PDFs zu lesen, werden sie verwirrt. Einige sind getippt, andere sind unscharfe Scans und einige enthalten seltsame Symbole, die Standard-Lesewerkzeuge durcheinanderbringen. Aus diesem Grund werden diese reichhaltigen Informationen ignoriert und landen auf einem digitalen Müllhaufen.

Die Lösung (Die „Intelligente Pipeline“):
Die Autoren dieser Arbeit haben ein Roboter-Fließband gebaut, um dies zu beheben. Sie testeten es an fast 4.000 Immobilieninseraten einer Immobilienplattform in Aberdeen, Schottland. So funktioniert ihre Maschine, Schritt für Schritt:

1. Der Sprechende Hut (Klassifizierung)

Zuerst betrachtet der Roboter jedes PDF-Dokument und sortiert es in einen von drei Stapeln:

  • Der „Schreibmaschinen“-Stapel: Sauberer, digitaler Text, den ein Computer leicht lesen kann.
  • Der „Fotokopie“-Stapel: Gescannte Bilder von Papierformularen. Der Computer kann den Text noch nicht lesen, da es nur ein Bild ist.
  • Der „Seltsame Symbole“-Stapel: Dokumente mit Kontrollkästchen oder seltsamen Markierungen, die Standard-Lesegeräte verwirren.

Das Ergebnis: Der Roboter konnte die Dokumente erfolgreich sortieren. Er behielt den „Schreibmaschinen“-Stapel (etwa 70 % von ihnen) für den nächsten Schritt und legte die anderen beiden Stapel vorerst beiseite.

2. Der Super-Leser (LLM-Extraktion)

Für den „Schreibmaschinen“-Stapel verwendete der Roboter kein langweiliges Regelwerk (wie „wenn du das Wort 'Gas' siehst, schreibe 'Gas'“). Stattdessen nutzte er ein Large Language Model (LLM) namens DeepSeek R1. Stellen Sie sich diese KI wie einen superintelligenten, unermüdlichen Bibliothekar vor, der jede Sprache oder jeden Stil lesen kann.

Die Forscher gaben der KI eine spezifische Anweisung: „Lies dieses unordentliche Dokument, finde 35 spezifische Fakten über das Haus (wie Heizungsart oder Rechtsstatus) und schreibe sie in eine ordentliche, organisierte Liste (JSON-Format).“

Die Magie: Selbst obwohl die Verkäufer Dinge unterschiedlich geschrieben haben (einige sagten „Gaszentralheizung“, andere „GCH“, andere „Erdgas“), verstand die KI, dass sie alle dasselbe meinten, und schrieb sie konsistent auf. Sie erledigte dies für 2.781 Dokumente mit einer Erfolgsquote von 100 %.

3. Die Qualitätskontrolle (Validierung)

Nun verfügte das Team über eine riesige Datenbank mit Hausfakten. Aber hat die KI Dinge erfunden? Um dies zu prüfen, führten sie drei Tests durch:

  • Der „Zwillingstest“ (Ähnlichkeit): Sie fragten den Computer: „Welche Häuser sind diesem hier am ähnlichsten?“ Sie verwendeten drei verschiedene mathematische Methoden, um die Antworten zu finden. Die Ergebnisse stimmten sehr gut überein (82 % Konsistenz). Dies bewies, dass die KI nicht einfach nur rät; sie versteht die tatsächlichen Beziehungen zwischen den Häusern.
  • Der „Gruppierungstest“ (Clustering): Sie baten den Computer, die Häuser in natürliche Kategorien einzuteilen, ohne ihm vorzugeben, wonach er suchen soll. Der Computer teilte sie ganz natürlich in „Bezahlbare/Kleinere“ Häuser und „Premium/Größere“ Häuser ein. Dies zeigte, dass die Daten aussagekräftig sind und reale Unterschiede widerspiegeln.
  • Der „Ranking-Test“: Sie baten den Computer, die Häuser basierend auf verschiedenen Prioritäten zu ranken (z. B. „billigstes“ vs. „meiste Annehmlichkeiten“). Die Rankings waren unterschiedlich und logisch, was bewies, dass die Daten genügend Details besitzen, um komplexe Entscheidungen zu unterstützen.

Das Fazit

Die Arbeit beweist, dass man ein System bauen kann, das automatisch tausende unordentliche, reale Immobiliendokumente liest und sie in saubere, nutzbare Daten verwandelt.

Was sie (noch) nicht getan haben:

  • Sie haben den „Fotokopie“- und den „Seltsame Symbole“-Stapel noch nicht gelesen (etwa 30 % der Dokumente). Diese wurden für zukünftige Arbeiten zurückgestellt.
  • Sie haben dies nicht bei anderen Arten von Dokumenten wie medizinischen Unterlagen oder Rechtsverträgen getestet, obwohl sie darauf hinweisen, dass ihr System dort funktionieren könnte.
  • Sie haben keine menschlichen Käufer gefragt, ob ihnen die Ergebnisse gefallen haben; sie haben lediglich geprüft, ob die Computer-Mathematik funktionierte.

Kurz gesagt: Sie haben eine Maschine gebaut, die einen chaotischen Stapel Papierformulare in eine ordentliche, organisierte Tabelle verwandeln kann, wodurch verborgene Details von Häusern zum ersten Mal sichtbar werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →