← Neueste Arbeiten
🤖 AI

WetRobo: A Reproducible Robot Kit for Coding Agents in Biological Laboratories

Das Paper stellt WetRobo vor, ein reproduzierbares Robotik-Kit, das es einem Coding-Agenten ermöglicht, biologische Aufgaben in natürlicher Sprache autonom über verschiedene Laboratorien hinweg anzupassen und auszuführen, indem es Code schreibt und ausführt, wodurch die Transferbeschränkungen traditioneller Vision-Language-Action-Policies überwunden werden.

Ursprüngliche Autoren: Yuna Oikawa, Kei Endo, Takanori Uzawa, Yunzhe Zhang, Manan Anjaria, Lerrel Pinto, Sherry Yang, Koji Tsuda

Veröffentlicht 2026-09-17
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yuna Oikawa, Kei Endo, Takanori Uzawa, Yunzhe Zhang, Manan Anjaria, Lerrel Pinto, Sherry Yang, Koji Tsuda

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In dem leisen Summen eines biologischen Labors hängt ein Großteil der Arbeit von den stetigen, repetitiven Händen menschlicher Forscher ab. Sie füttern Zellen, bewegen empfindliche Glasschalen und öffnen schwere Türen von Inkubatoren – Aufgaben, die Tag für Tag mit Präzision ausgeführt werden müssen. Seit Jahrzehnten hoffen Wissenschaftler darauf, diese Pflichten an Roboter zu übertragen, um menschliche Experten von manueller Arbeit zu befreien, damit sie sich stattdessen auf die Entdeckung konzentrieren können. Der vielversprechendste jüngste Ansatz stützte sich auf KI-Systeme, die darauf trainiert wurden, die Welt zu sehen und in ihr zu handeln, ganz so, wie ein Mensch eine neue Fertigkeit lernt, indem er ein Video beobachtet. Diese Systeme, oft als Vision-Language-Action-Modelle bezeichnet, werden trainiert, indem man ihnen tausende Beispiele zeigt, wie ein Roboterarm eine Flasche bewegt oder einen Deckel hebt. Die Hoffnung ist, dass der Roboter, sobald er trainiert ist, einfach eine neue Situation betrachten und wissen kann, was zu tun ist. Doch in der chaotischen Realität eines arbeitenden Labors, in dem sich die Beleuchtung ändert, die Ausrüstung variiert und Objekte leicht versetzt platziert werden, stolpern diese trainierten Systeme oft. Ein Roboter, der eine Aufgabe in einem Raum meistert, kann in einem anderen Raum völlig versagen, weil die subtilen Veränderungen die gelernten Muster verwirren. Diese Fragilität hat dazu geführt, dass viele Labors auf eine anpassungsfähigere Lösung warten.

Ein Team von Forschern hat nun einen anderen Weg vorgestellt, den sie WetRobo nennen. Anstatt zu versuchen, einen Roboter darauf zu trainieren, einen spezifischen Satz von Bewegungen auswendig zu lernen, haben sie ein Kit entwickelt, das es einem Computerprogramm ermöglicht, seine eigenen Anweisungen vor Ort zu schreiben. Das Kit enthält einen Standard-Roboterarm, gängige Laborausrüstung wie einen Inkubator und Reagenzgläser sowie eine Reihe von aufgezeichneten Videos, die zeigen, wie ein Mensch eine Aufgabe ausführen würde. Entscheidend ist auch ein Handbuch in einfacher Sprache, das einem Coding-Agenten sagt, wie er die Aufgabe anzugehen hat. Dieser Agent ist eine Art künstliche Intelligenz, die in der Lage ist, Computercode zu schreiben. Wenn ein Forscher dem Roboter einen einfachen Befehl in natürlicher Sprache gibt, wie etwa „hebe den Flaschendeckel ab“, betrachtet der Agent die lokale Umgebung, konsultiert das Handbuch und schreibt ein maßgeschneidertes Programm, um das Problem zu lösen. Er verlässt sich nicht auf ein vortrainiertes Gehirn, das durch einen Wechsel des Kamerawinkels oder eine andere Marke eines Greifers verwirrt werden könnte. Stattdessen beobachtet er die Szene, misst Distanzen und passt seinen eigenen Code an, bis die Aufgabe erledigt ist.

Die Forscher testeten diesen Ansatz in zwei unterschiedlichen Laboratorien, die sie Lab X und Lab Y nannten. Diese Räume waren nicht identisch; sie hatten unterschiedliche Beleuchtung, eine unterschiedliche Anzahl an Kameras und sogar unterschiedliche Arten von Roboter-Greifern. In einem Experiment wurde der Roboter gebeten, einen Schraubverschluss von einer Reagenzglasflasche zu entfernen. Der Coding-Agent fand unter Verwendung des WetRobo-Kits erfolgreich heraus, wie er den Verschluss greifen und drehen konnte, sowohl in beiden Laboratorien. Dies geschah, indem er Code schrieb, der die Kameras nutzte, um den weißen Deckel zu lokalisieren, die Distanz zu ihm maß und dann seine Bewegungen basierend auf dem, was er sah, anpasste. In Lab Y, wo der Roboter einen Standard-Greifer verwendte, schrieb der Agent ein Programm, das stoppte, falls der Arm zu viel Widerstand spürte. In Lab X, wo der Roboter einen anderen, maßgeschneiderten Greifer hatte, der den Druck nicht auf die gleiche Weise messen konnte, schrieb der Agent ein anderes Programm, das sich auf visuelle Kontrollen und simulierte Kollisionen verließ, um Fehler zu vermeiden. Das Ergebnis war ein Roboter, der seine eigenen Anweisungen anpassen konnte, um in das jeweilige Zimmer zu passen.

Um zu sehen, wie effektiv diese Methode war, verglichen die Forscher sie mit dem traditionellen Ansatz des Trainings eines visionsbasierten Modells. Sie nahmen ein System, das auf tausenden Videodemonstrationen aus Lab X feinabgestimmt worden war, und ließen es dieselbe Flaschendeckel-Aufgabe ausführen. In Lab X, wo es trainiert worden war, funktionierte das System perfekt. Aber als dasselbe System nach Lab Y versetzt wurde, mit seiner anderen Beleuchtung und Ausrüstung, versagte es völlig. Es konnte sein Wissen nicht auf die neue Umgebung übertragen. Der Coding-Agent hingegen war in beiden Orten erfolgreich. Er musste nicht neu trainiert werden oder neue Videos sehen; er beobachtete einfach den neuen Raum und schrieb einen neuen Satz von Anweisungen, die funktionierten. Die Forscher testeten das System auch bei anderen Aufgaben, wie dem Anheben des Deckels einer Petrischale und dem Öffnen der schweren Tür eines Inkubators. In jedem Fall beobachtete der Agent die lokalen Bedingungen, schrieb Code, um die spezifische Geometrie der Tür oder der Schale zu handhaben, und führte die Aufgabe erfolgreich aus.

Der Prozess der Anpassung war im Code sichtbar, den der Agent produzierte. Wenn der Roboter Schwierigkeiten hatte, seinen Greifer mit einem Flaschendeckel auszurichten, schrieb der Agent ein kleines Programm, um die Bewegung zu testen, das Kamerabild zu prüfen und dann den Ansatz anzupassen. Wenn der Roboter abrutschte, schrieb der Agent den Code um, um ein langsameres, vorsichtigeres Ziehen einzuschließen. In einem Fall stellte der Agent fest, dass Schatten auf der Inkubator-Tür seine Sicht täuschten, und schrieb ein neues Programm, das den Winkel der Tür mithilfe von Tiefendaten statt Licht maß. Diese Fähigkeit, die eigenen Fehler zu inspizieren und die eigene Logik umzuschreiben, ermöglichte es dem Roboter, Herausforderungen zu überwinden, die ein vortrainiertes System hätten scheitern lassen. Die Forscher stellten fest, dass der Agent oft Teile des Codes, den er für vorherige Aufgaben geschrieben hatte, wiederverwendete – wie etwa die Logik für das Greifen eines dünnen Objekts –, um neue Probleme zu lösen. Dies bedeutete, dass der Roboter während seiner Arbeit in einem Labor eine Bibliothek nützlicher Anweisungen aufbaute, die mit anderen Laboren geteilt werden konnten, was zukünftige Setups schneller und einfacher machte.

Diese Arbeit deutet auf einen praktischen Weg hin, um Robotik in die biologische Forschung zu bringen. Anstatt dass jedes Labor Stunden an Videodaten sammeln und teure neuronale Netze für jeden neuen Roboter trainieren muss, können Wissenschaftler ein Kit verteilen und einen Coding-Agenten nutzen, um es an die lokale Umgebung anzupassen. Die Forscher demonstrierten, dass diese Methode es einem Roboter ermöglicht, reale Variationen in Ausrüstung und Beleuchtung zu bewältigen, die traditionelle Systeme zum Scheitern bringen. Obwohl die Studie auf einige spezifische Aufgaben und einen einzigen Typ von Coding-Agenten beschränkt war, deuten die Ergebnisse auf eine Zukunft hin, in der Roboter ohne die Notwendigkeit eines umfangreichen Retrainings in vielfältigen Umgebungen eingesetzt werden können. Die zentrale Erkenntnis ist, dass die Fähigkeit eines Roboters, seine eigenen Anweisungen basierend auf dem, was er sieht, zu schreiben, ein robusterer Weg ist, um die unvorhersehbare Natur eines arbeitenden Labors zu bewältigen, als zu versuchen, ihm einen festen Satz von Bewegungen beizubringen. Indem WetRobo die Last der Anpassung von menschlichen Trainern auf die Software selbst überträgt, bietet es einen Weg, die Laborautomatisierung flexibler, zugänglicher und bereit für die reale Welt zu machen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →