Towards smart and adaptive agents for active sensing on edge devices
Este artículo presenta un sistema agéntico compacto basado en la inferencia activa que permite el sensado activo adaptativo y en tiempo real en dispositivos periféricos con recursos limitados, al permitirles planificar y controlar dinámicamente los movimientos de la cámara para superar las limitaciones de los enfoques tradicionales de TinyML.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina una cámara que no solo graba el mundo, sino que elige activamente hacia dónde mirar, de forma muy parecida al ojo humano que salta de un detalle a otro para construir una imagen completa. Este es el reino de la detección activa (active sensing), un concepto donde las máquinas no esperan pasivamente a recibir datos, sino que mueven sus sensores para recopilar la información más útil. Durante años, el sueño ha sido dotar de este tipo de comportamiento inteligente y adaptativo a dispositivos pequeños y con batería que se ubiquen justo donde ocurre la acción, como en una cámara de seguridad o un robot, sin necesidad de enviar datos a un servidor remoto en la nube. El desafío ha sido que los sistemas de inteligencia artificial potentes capaces de esto suelen requerir una cantidad masosa de potencia de cálculo y memoria, lo que los hace imposibles de ejecutar en estos dispositivos pequeños y locales.
Un equipo de investigadores ha construido ahora un sistema que cierra esta brecha, creando un agente inteligente capaz de ver, planificar y mover una cámara en tiempo real mientras se ejecuta en un dispositivo no más grande que una pequeña placa de ordenador. Publicado en un estudio reciente, este trabajo demuestra que es posible combinar dos enfoques diferentes de la inteligencia artificial: uno que es excelente reconociendo objetos en imágenes, y otro que es excelente tomando decisiones bajo la incertidumbre. El resultado es un "agente de sacadas" (saccade agent), llamado así por los movimientos oculares rápidos y bruscos que realizan los humanos para enfocarse en los detalles, el cual puede controlar una cámara para rastrear personas o explorar una habitación de forma autónoma. El sistema se ejecuta íntegramente en el dispositivo de borde (edge device), lo que significa que procesa todo localmente, garantizando reacciones rápidas y manteniendo la privacidad de los datos.
Los investigadores se enfrentaron a un problema específico: los modelos de aprendizaje profundo estándar, que son muy buenos detectando cosas como personas o coches en una transmisión de vídeo, son rígidos. Una vez entrenados, tienen dificultades para adaptarse si el entorno cambia o si necesitan decidir hacia dónde mirar después para encontrar algo nuevo. Dependen de enormes cantidades de datos y potencia de cálculo para aprender, lo cual es lo opuesto a lo que necesita un dispositivo pequeño y de baja potencia. Para resolver esto, el equipo no intentó hacer el modelo de aprendizaje profundo más grande o más inteligente. En su lugar, añadieron una segunda capa de inteligencia encima de este, basada en un principio llamado inferencia activa. Este enfoque trata al agente como un científico que actualiza constantemente sus creencias sobre el mundo. Se pregunta: "¿Qué espero ver?" y "¿Qué me sorprendería?". Si la cámara no ve nada nuevo, el agente decide moverse a un lugar diferente para aprender más. Si ve algo interesante, como una persona, se enfoca en ella. Este proceso de toma de decisiones es increíblemente ligero, requiere muy poca memoria, lo que le permite ejecutarse junto al software de detección de objetos más pesado.
Para probar esta idea, el equipo construyó un prototipo físico utilizando un dispositivo NVIDIA Jetson, un ordenador potente diseñado para tareas de inteligencia artificial en el borde. Conectaron este dispositivo a una cámara que podía realizar movimientos de pan y tilt (giro horizontal y vertical), similar a las cámaras de seguridad que se encuentran en muchos edificios. El sistema recibió una tarea simple pero poderosa: observar una escena y decidir hacia dónde apuntar la lente. La primera parte del sistema, el módulo de percepción, utilizó una herramienta de detección de objetos muy conocida llamada YOLO para escanear la transmisión de vídeo y encontrar personas u objetos. Esta herramienta fue optimizada para ejecutarse rápidamente en el hardware del dispositivo. La segunda parte, el módulo de planificación, tomó la lista de cosas que la cámara vio y utilizó la inferencia activa para decidir el siguiente movimiento. Calculó en qué dirección debería girar la cámara para mantener el ojo puesto en una persona o para escanear un área vacía para ver si aparecía algo nuevo.
Los resultados mostraron que esta combinación funcionó notablemente bien dentro de los estrictos límites del hardware. Todo el sistema, incluyendo el software necesario para ejecutarlo, se ajustó a una huella de memoria de solo 304 megabytes, lo cual es minúsculo para un sistema de inteligencia artificial. En una configuración, la cámara podía procesar vídeo y tomar la decisión de hacia dónde mirar a continuación 108 veces por segundo, una velocidad lo suficientemente rápida como para parecer instantánea para un observador humano. En otra configuración, el sistema priorizó la velocidad sobre la memoria, logrando 45 fotogramas de análisis de vídeo por segundo mientras tomaba decisiones 250 veces por segundo. Los investigadores descubrieron que el tiempo que tardaba en tomar una decisión era tan corto que el sistema podía seguir fácilmente la transmisión de vídeo, permitiendo que la cámara siguiera suavemente objetivos en movimiento o recorriera una habitación sin retraso.
Lo que hace que este logro sea significativo no es solo que la cámara se moviera, sino cómo se movió. El agente no siguió una ruta preprogramada. En su lugar, reaccionó al entorno en tiempo real. Si una persona entraba en el encuadre, la cámara se fijaba en ella. Si la persona se movía, la cámara la seguía. Si la persona se iba y la habitación quedaba vacía, el agente decidía escanear el resto de la habitación para ver si algo más estaba sucediendo. Este comportamiento imita la forma en que los humanos exploramos naturalmente nuestro entorno, equilibrando la necesidad de enfocarse en lo que es importante con la necesidad de mantenerse consciente de la imagen completa. Los investigadores demostraron esto con una cámara montada en un pequeño robot, mostrando que el sistema podía ayudar a una máquina a explorar un nuevo entorno y recopilar información de manera eficiente sin intervención humana.
El estudio también probó cuidadosamente diferentes formas de ejecutar el software en el hardware para encontrar el mejor equilibrio entre velocidad y uso de memoria. Descubrieron que el uso de herramientas específicas diseñadas para el procesador gráfico del dispositivo permitía que el sistema funcionara mucho más rápido que usando métodos estándar. Sin embargo, también descubrieron que para la parte de la toma de decisiones del sistema, que es muy pequeña, intentar ejecutarla en el potente procesador gráfico en realidad la ralentizaba porque la carga de gestión de la tarea era mayor que el beneficio de la potencia extra. Este hallazgo destaca la importancia de hacer coincidir las herramientas de software adecuadas con el hardware adecuado, un paso crucial para hacer que estos sistemas sean prácticos para el uso en el mundo real.
Este trabajo sugiere que el futuro de los dispositivos inteligentes no requiere necesariamente supercomputadoras masivas basadas en la nube. Al combinar una capacidad robusta de visión con una capacidad ligera de planificación, es posible crear agentes que sean tanto inteligentes como eficientes. Los investigadores demostraron que estos sistemas pueden operar de forma independiente, tomando decisiones en fracciones de segundo para recopilar información en entornos complejos y cambiantes. Aunque el sistema actual se centra en controlar una cámara, los mismos principios podrían aplicarse a otras tareas, como ayudar a un robot a navegar por una habitación llena de gente o a un dron a buscar a una persona desaparecida. El estudio concluye que la inferencia activa ofrece un camino prometedor para crear máquinas adaptables y de recursos eficientes que puedan manejar la imprevisibilidad del mundo real, llevando el poder de la detección inteligente directamente al borde.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.