← Neueste Arbeiten
💻 computer science

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1 ist ein orchestriertes Vision-Agent-System, das spezialisierte Computer-Vision-Modelle, werkzeugnutzende Agenten und eine Wissensdatenbank für das Bauwesen integriert, um eine Materialmengenauszugserstellung auf dem Stand der Technik aus rohen Architekturplänen zu erreichen, wobei es sowohl führende KI-Modelle als auch unabhängige professionelle Kalkulatoren in Bezug auf Abdeckung und Präzision übertrifft.

Ursprüngliche Autoren: Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

Veröffentlicht 2026-08-18
📖 8 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Der Bau eines Hauses beginnt mit einem Versprechen: einer Reihe von Zeichnungen, die einem Erbauer genau sagen, was zu konstruieren ist und wie viel Material benötigt wird. Diese Blaupausen sind keine bloßen Skizzen; sie sind komplexe Anweisungen, bei denen eine einzelne Linie eine Wand repräsentiert, eine Notiz auf eine bestimmte Art von Holz hindeutet und eine Maßkette die Länge eines Balkens diktiert. Diese Seiten in eine Materialliste zu verwandeln – jeden Ständer, jede Gipskartonplatte und jeden Quadratfuß Dachdeckung zu zählen – ist eine Aufgabe, die als Mengenermittlung (Quantity Takeoff) bekannt ist. Jahrzehntelang war dies das Terrain menschlicher Experten, die Informationen lesen, messen und abgleichen mussten, die über Dutzende von Seiten verstreut waren und oft Lücken mit Wissen füllten, das niemals auf dem Papier erschien. Ein Fehler hier ist nicht nur ein Rechenfehler; er kann bedeuten, dass tausende Dollar an Material verschwendet werden oder ein Projekt ins Stocken gerät, weil die falsche Menge Beton bestellt wurde.

Seit Jahren versuchen Informatiker, Maschinen beizubringen, diese Arbeit zu erledigen. Große Sprachmodelle, die leistungsstarken KI-Systeme, die Aufsätze schreiben und Fragen beantworten können, wurden an diesen Zeichnungen getestet. Sie können den Text lesen und die Wörter verstehen, aber sie kämpfen mit der visuellen Realität der Blaupause. Sie erkennen vielleicht eine Wand, versäumen es aber, sie korrekt auszumessen, oder sie zählen eine Tür, die auf zwei verschiedenen Seiten erscheint, als zwei separate Türen. Ihnen fehlt das spezifische, fundierte Verständnis von Baunormen – wie etwa das Wissen, dass Wände mit Ständern in präzisen Abständen gebaut werden – das erfahrene Bauleiter im Kopf tragen. Das Ergebnis war eine Lücke zwischen dem, was Maschinen sagen können, und dem, was sie tatsächlich berechnen können.

Ein Team von Forschern bei Handoff AI Research hat nun ein System namens Handoff-H1 vorgestellt, das darauf ausgelegt ist, diese Lücke zu schließen – nicht indem es eine einzige, intelligentere Maschine erschafft, sondern indem es ein Team spezialisierter Werkzeuge aufbaut, die zusammenarbeiten. Ihre Arbeit, die gegen einen neuen Benchmark aus echten Wohnhaus-Blaupausen evaluiert wurde, zeigt, dass ein System, das Computer Vision, spezialisierte Softwaretools und eine strukturierte Wissensdatenbank kombiniert, Materiallisten erstellen kann, die nicht nur gründlicher sind als die aktueller Spitzen-KI-Modelle, sondern auch die Genauigkeit und Vollständigkeit menschlicher Experten erreichen.

Der Kern des Problems liegt darin, wie Konstruktionszeichnungen kommunizieren. Eine Blaupause listet nicht jeden einzelnen Nagel oder Ständer auf; sie zeigt die Struktur und verlässt sich darauf, dass der Leser Standardregeln anwendet. Wenn eine Zeichnung eine Wand zeigt, weiß ein menschlicher Kalkulator, wie man die Anzahl der Holzständer basierend auf einem Standardabstand berechnet, selbst wenn der Abstand nicht explizit angegeben ist. Es erfordert das Betrachten eines Grundrisses, das Messen eines Maßes, das Prüfen einer Notiz auf einer anderen Seite und das anschließende Anwenden einer Faustregel, um zu einem Endergebnis zu gelangen. Dieser Prozess beinhaltet drei unterschiedliche Herausforderungen: die visuellen Elemente klar zu sehen, über mehrere Seiten hinweg zu schlussfolgern, um zusammenhängende Informationen zu verknüpfen, und die Ergebnisse in den Branchenkonventionen zu verankern, die niemals aufgeschrieben werden.

Handoff-H1 adresset diese Herausforderungen, indem es die Arbeit in drei Schichten organisiert. Die erste Schicht ist eine Reihe zweckgebundener Computer-Vision-Modelle. Im Gegensatz zu allgemeinen Bildlesern sind diese Modelle speziell auf Konstruktionszeichnungen trainiert, um die typisierten Elemente wie Räume, Wände, Türen und Fenster zu identifizieren und zu beschriften. Sie fungieren als die Augen des Systems und gewinnen die Grundstruktur aus den Roh-PDF-Dateien zurück. Die zweite Schicht ist ein persistentes Projektfundament, eine strukturierte Datenbank, die das, was die Augen gesehen haben, organisiert. Dieses Fundament hält die Informationen in einer Hierarchie, die der Art und Weise entspricht, wie Bauprojekte tatsächlich aufgebaut sind, indem es die Arbeiten in verschiedene Gewerke wie Rohbau, Sanitär und Elektro unterteilt. Entscheidend ist, dass dieses Fundament in einer kuratierten Wissensdatenbank aus Bauregeln und Konventionen verwurzelt ist, die sicherstellt, dass das System beispielsweise weiß, dass ein bestimmter Dachtyp eine spezifische Berechnung für die Neigung erfordert, die in der flachen Zeichnung nicht sichtbar ist.

Die dritte Schicht ist die Orchestrierung von Vision-Agenten. Dies sind Software-Arbeiter, die die Informationen aus dem Fundament und die von den Vision-Modellen bereitgestellten Werkzeuge nutzen, um die eigentliche Zählung und Messung durchzuführen. Sie versuchen nicht, alles auf einmal zu erledieren. Stattdessen konzentrieren sie sich auf ein Gewerk nach dem anderen und nutzen spezialisierte Tools, um komplexe Pläne in einzelne Bestandteile zu zerlegen, wie etwa das Aufschlüsseln eines Rohbaus in jeden einzelnen Ständer. Wenn ein Agent unsicher ist, kann er ein spezialisiertes Tool aufrufen, um einen bestimmten Bereich zu zählen oder zu messen, anstatt zu raten. Schließlich führt ein unabhängiger Verifizierungsschritt ein Audit der Arbeit durch, um fehlende Posten oder unmögliche Mengen zu prüfen, bevor die endgültige Liste erstellt wird.

Um dieses System zu testen, entwickelten die Forscher einen Benchmark namens TAKEOFFBENCH-V1. Sie sammelten zehn Sätze echter, genehmigter Wohnhaus-Blaupausen und paarten diese mit einer „Goldstandard“-Materialliste. Dieser Goldstandard wurde nicht von einer einzelnen Person erstellt, sondern war das Ergebnis eines Konsensprozesses, bei dem mehrere unabhängige professionelle Kalkulatoren an denselben Zeichnungen arbeiteten und deren Ergebnisse zu einer einzigen, verifizierten Wahrheit zusammengeführt wurden. Dieser Ansatz erkennt an, dass selbst menschliche Experten bei bestimmten Messungen uneinig sein können, sodass der Benchmark einen realistischen, hochwertigen Standard widerspiegelt und kein unmögliches Ideal darstellt. Der Benchmark umfasst über zwei tausend verifizierte Positionen, die neun verschiedene Bau-Gewerke abdecken, von Beton und Rohbau bis hin zu Trockenbau und Dachdeckung.

Als die Forscher den Test durchführten, waren die Ergebnisse beeindruckend. Sie verglichen Handoff-H1 mit sieben der fortschrittlichsten verfügbaren KI-Modelle, einschließlich sowohl geschlossener als auch Open-Weight-Systeme. Diesen Modellen wurden dieselben Roh-PDF-Dateien gegeben und sie wurden aufgefordert, eine Materialliste zu erstellen. Die besten dieser Frontier-Modelle erreichten einen zusammengesetzten Score von etwa 61 Prozent. Im Gegensatz dazu erreichte Handoff-H1 einen Score von 81,6 Prozent. Diese Differenz von etwa zwanzig Punkten ist signifikant und deutet darauf hin, dass die spezialisierte Architektur von Handoff-H1 – seine Kombination aus Vision, Wissen und Orchestrierung – Probleme löst, an denen allgemeine Modelle scheitern.

Vielleicht noch wichtiger ist, dass das System direkt mit unabhängigen professionellen Kalkulatoren verglichen wurde, den menschlichen Experten, die den Goldstandard erstellt hatten. Als diese Menschen gegen denselben Goldstandard getestet wurden, erreichten sie einen zusammengesetzten Score von 77,6 Prozent. Handoff-H1 übertraf den menschlichen Durchschnitt und erreichte in sechs der zehn Zeichnungssätze ein höheres Ergebnis als die Experten. Das System tat dies, indem es gründlicher war; es fand und zählte mehr Artikel als die Menschen, insbesondere in komplexen Bereichen wie Rohbau und Dachdeckung, in denen menschliche Kalkulatoren oft Details übersehen oder Arbeitsbereiche auslassen. Während die menschlichen Experten bei den von ihnen gefundenen Artikeln etwas präziser waren, führte die Fähigkeit des Systems, mehr Fläche abzudecken, zu einer besseren Gesamtbewertung.

Die Analyse der Ergebnisse zeigte auf, wo das System glänzt und wo es noch vor Herausforderungen steht. Das System schnitt außergewöhnlich gut bei Gewerken ab, die Mengen aus Flächen und Neigungen ableiten müssen, wie etwa Dachdeckung und Trockenbau, wo menschliche Kalkulatoren oft Schwierigkeiten mit der Konsistenz haben. Es schnitt auch sehr gut bei Zählaufgaben wie Sanitärarmaturen und Fenstern ab. Dennoch fanden das System und die Menschen gleichermaßen kontinuierliche Messungen – wie die exakte Länge einer Wand oder die Fläche eines Daches – als die schwierigsten Aufgaben. Diese Aufgaben erfordern das Lösen von Unklarheiten in den Zeichnungen, wie etwa die Frage, ob eine Maßlinie die Wandstärke einschließt – eine Debatte, die selbst menschliche Experten führen können. Die Präzision des Systems bei diesen Messungen war etwas niedriger als die der menschlichen Experten, aber seine Abdeckung war weita viel überlegener, was bedeutet, dass es insgesamt weniger Artikel übersah.

Die Forscher betonen, dass dieser Erfolg nicht auf einen einzelnen Durchbruch in der künstlichen Intelligenz zurückzuführen ist, sondern auf die sorgfältige Kombination verschiedener Fähigkeiten. Allgemeine Modelle, selbst die fortschrittlichsten, konnten das Niveau der menschlichen Experten oder des Handoff-H1-Systems nicht erreichen, wenn sie mit denselben Rohdaten konfrontiert wurden. Sie neigten dazu, Listen zu erstellen, die zwar flüssig wirkten, aber keinen dimensionalen Bezug hatten, wobei sie Mengen halluzinierten oder die gewerbespezifische Logik vermissen ließen, die nötig ist, um eine Zeichnung in eine Materialliste zu verwandeln. Das Handoff-H1-System war erfolgreich, weil es nicht auf ein einziges Modell setzte, das alles erledigt; stattdessen nutzte es einen strukturierten Ansatz, der Sehen, Wissen und Schlussfolgern trennte.

Diese Arbeit weist den Weg für künstliche Intelligenz in spezialisierten Fachbereichen. Sie demonstriert, dass für komplexe Echtwelt-Aufgaben die effektivsten Systeme nicht unbedingt jene mit den größten Sprachmodellen sind, sondern jene, die mit einem tiefen Verständnis der Struktur und der Regeln des Fachbereichs gebaut wurden. Durch die Kombination von Computer Vision mit einer kuratierten Wissensdatenbank und einem strukturierten Workflow konnte das System ein Leistungsniveau erreichen, das mit dem menschlichen Experten konkurriert. Die Forscher haben ihre Evaluierungswerkzeuge öffentlich zugänglich gemacht, damit andere ihre eigenen Systeme gegen denselben Benchmark testen können, während sie die eigentlichen Blaupause-Daten und den Goldstandard unter Verschluss halten, um zu verhindern, dass das System einfach die Antworten auswendig lernt. Dieser Ansatz stellt sicher, dass zukünftiger Fortschritt an tatsächlicher Leistungsfähigkeit gemessen wird und nicht an der Fähigkeit, Trainingsdaten abzurufen.

Die Studie kommt zu dem Schluss, dass das System zwar nicht perfekt ist, aber einen bedeutenden Schritt zur Automatisierung einer Aufgabe darstellt, die lange Zeit das exklusive Terrain menschlicher Experten war. Es ersetzt nicht die Notwendigkeit menschlicher Aufsicht, bietet aber ein Werkzeug, das gründlicher und konsistenter sein kann als ein Mensch allein. In einem Bereich, in dem ein einzogener Fehler tausende Dollar kosten kann, ist die Fähigkeit, eine vollständigere und genauere Materialliste aus einem Satz Zeichnungen zu generieren, eine greifbare Verbesserung. Die Leistung des Systems, die sowohl die besten allgemeinen KI-Modelle als auch den durchschnittlichen menschlichen Kalkulator übertrifft, zeigt, dass die Kombination aus spezialisierter Vision, strukturiertem Wissen und orchestrierter Logik ein leistungsstarker Ansatz zur Lösung komplexer, realer Probleme ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →