A Distributed Stereo Visual Feedback Framework for VR- based Telesurgical Robotic Teleoperation: Design and Latency Characterization
Este artículo presenta y caracteriza un marco de retroalimentación visual estéreo distribuido para la teleoperación de telecirugía basada en RV, revelando que, si bien el retraso de transmisión de red es mínimo, la mayor parte de la latencia total del sistema (aproximadamente 78 ms) proviene de las etapas de procesamiento de imágenes y renderización de visualización.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando jugar a un videojuego donde controlas un brazo robótico en una habitación al otro lado del mundo. Mueves tu mano y el robot se mueve, pero solo puedes ver lo que ve el robot a través de una pantalla. Si la imagen en la pantalla tiene incluso un mínimo de retraso, tu cerebro se confunde. Es como intentar atrapar una pelota mientras usas gafas que muestran dónde estaba la pelota hace un segundo, no dónde está ahora. Este es el gran problema en la "teleoperación", que es solo una palabra elegante para controlar un robot desde lejos.
Para que esto funcione bien, especialmente para tareas delicadas como la cirugía, necesitas dos cosas: una imagen clara en 3D (para juzgar la profundidad, como qué tan lejos está una aguja) y velocidad (para que la imagen se actualice instantáneamente). Los científicos llaman a esto "retroalimentación visual estereoscópica" y "baja latencia". Si el retraso es demasiado largo, el operador se siente torpe, el robot podría chocar o, en un entorno médico, podría ocurrir un error. La gran pregunta que los investigadores se hacen es: "¿A dónde se va el tiempo?". ¿Es la conexión a internet lo que ralentiza las cosas, o es la computadora la que tarda demasiado en procesar la imagen?
Este artículo se sumerge en este misterio construyendo una "máquina del tiempo" especial para la visión robótica. Los investigadores crearon un sistema donde un robot en un lado de la habitación envía una transmisión de video 3D a una persona que usa un visor de Realidad Virtual (VR) al otro lado. No solo midieron el tiempo total; dividieron el viaje en tres tramos distintos, como cronometrar una carrera de relevos para ver qué corredor es el más lento. Descubrieron que, mientras la conexión a internet era increíblemente rápida —como un tren bala—, el procesamiento de video por la computadora y el visor de VR mostrando la imagen eran los verdaderos cuellos de botella, actuando más como un caracol de movimiento lento.
Los ojos 3D del robot y el visor de VR
Los investigadores configuraron un sistema que actúa como un par de ojos remotos. En el lado del "seguidor" (donde está el robot), hay una cámara estéreo especial que toma dos fotos a la vez, tal como lo hacen los ojos humanos, para crear un efecto 3D. Estas imágenes se envían a través de una red al lado del "maestro", donde un operador humano está esperando. El humano usa un visor de VR Meta Quest 3, que es como una ventana de alta tecnología que le permite sentir que está parado justo al lado del robot.
El viaje del video comienza en la cámara, viaja a través de una computadora intermedia (que actúa como una oficina de correos clasificando el correo), llega a la computadora principal, es procesada por un motor de juego llamado Unity y finalmente aparece dentro del visor de VR. El equipo quería saber exactamente cuánto tiempo tomó cada paso de este viaje.
La carrera de relevos del tiempo
Para averiguar dónde se escondía el tiempo, el equipo dividió el viaje del video en tres etapas, como una carrera de relevos con tres corredores:
- El Corredor de la Red: Este es el tiempo que tarda el video en viajar a través de los cables.
- El Corredor de Unity: Este es el tiempo que la computadora tarda en desempaquetar el video y prepararlo para el visor de VR.
- El Corredor de VR: Este es el tiempo que el visor tarda en mostrar la imagen a tus ojos.
Midieron primero al Corredor de la Red. Enviaron 10,000 fotogramas de video y descubrieron que era asombrosamente rápido. El promedio de tiempo fue de solo 5.59 ± 1.04 ms. ¡Eso es increíblemente rápido! Incluso probaron si la computadora de la "oficina de correos" intermedia ralentizaba las cosas, y añadió menos de 1 milisegundo. Esto demostró que la conexión a internet en sí misma no era el problema; era la parte más rápida de todo el sistema.
Sin embargo, cuando miraron al Corredor de Unity, la carrera se ralentizó significamente. La computadora tardó un promedio de 40.06 ± 10.12 ms solo en procesar el video y prepararlo. Este fue el fragmento más grande del retraso. El Corredor de VR final (el visor) tardó otros 32.30 ± 0.09 ms en mostrar la imagen.
Cuando sumas los tres corredores, el tiempo total desde el momento en que la cámara ve algo hasta el momento en que el humano lo ve en el visor de VR fue de 77.95 ± 10.17 ms.
La gran sorpresa: ¡No es el internet!
El descubrimiento más importante de este artículo es un poco de giro en la trama. Muchas personas asumen que, si quieres un robot más rápido, solo necesitas una conexión a internet más rápida. Pero este estudio demostró que, incluso con una red superrápida (la parte de los 5.59 ms), el retraso total seguía siendo de casi 78 milisegundos. ¿Por qué? Porque el procesamiento de video por la computadora y el mostrar la imagen en el visor estaban ocupando la mayor parte del tiempo.
Es como tener un Ferrari (el internet) atrapado en un embotellamiento causado por un peaje lento (el procesamiento de la computadora) y un conductor lento (el renderizado del visor). No importa qué tan rápido sea el auto, el viaje toma mucho tiempo debido a las paradas. Los investigadores encontraron que la red solo era responsable de una fracción minúscula del retraso. El verdadero "embotellamiento" estaba ocurriendo dentro del software y el hardware de visualización.
¿Realmente funciona?
Para ver si este sistema era realmente útil, los investigadores pidieron a cuatro personas que jugaran un juego. El juego era una tarea de "recoger y colocar": usar el robot para mover pequeños bloques de un lugar a otro. Lo intentaron haciendo esto con la vista 3D de VR y sin ella (usando una pantalla 2D normal).
Los resultados fueron prometedores. Cuando los participantes usaron el sistema VR, terminaron la tarea más rápido (promediando 373.7 segundos con VR frente a 527.2 segundos sin ella). También movieron el robot en trayectorias más cortas y directas, y dejaron caer menos bloques. Cada uno de los participantes dijo que la versión de VR les dio una mejor sensación de profundidad y se sintió más conveniente.
Sin embargo, los autores son cuidadosos al decir que esta fue solo una prueba "preliminar" con solo cuatro personas. Esto sugiere que el sistema funciona bien, pero no es una prueba final de que funcionará para todos en todas las situaciones. Necesitan probarlo con más personas y en condiciones más difíciles antes de declarar que es una solución perfecta.
La conclusión
Este artículo construye una base sólida para la futura cirugía robótica y el trabajo remoto. Demuestra que puedes enviar video 3D de alta calidad a un visor de VR con muy poco retraso desde el internet. Pero también envía un mensaje claro a los ingenieros: si quieren que estos sistemas sean más rápidos, no solo compren un cable de internet más rápido. Necesitan arreglar el software que procesa el video y el hardware que lo muestra. El internet está listo; ahora las computadoras y los visores deben ponerse al día.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.