← Últimos artículos
💻 computer science

VISOR: A Vision-Language Model-based Test Oracle for Testing Robots

Este artículo presenta VISOR, un oráculo de pruebas basado en modelos de visión y lenguaje que automatiza la evaluación de la corrección y la calidad de las tareas de los robots mientras cuantifica la incertidumbre, demostrando que, aunque modelos como Gemini y GPT ofrecen fortalezas de rendimiento complementarias, sus estimaciones de incertidumbre actualmente no logran predecir de manera fiable la corrección de la evaluación.

Autores originales: Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini

Publicado 2026-05-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una flota de brazos robóticos en una fábrica y tu trabajo es asegurarte de que están realizando sus tareas correctamente. En los viejos tiempos, verificar si un robot había hecho un buen trabajo era como tener a un juez humano sentado frente a una pantalla, viendo cada video individual del robot trabajando. Si el robot dejaba caer una taza o fallaba un objetivo, el humano tenía que decir: "Falló". Si funcionaba, decían: "Aprobado".

Esto es lento, costoso y los humanos se cansan o se aburren, lo que lleva a juicios inconsistentes. A veces una persona piensa que un trabajo es "bueno", mientras que otra piensa que es "aceptable". Esto se conoce en el mundo tecnológico como el "problema del oráculo de prueba": determinar quién o qué decide si el software (o el robot) aprobó la prueba.

Los autores de este artículo, VISOR, intentaron resolver esto contratando a un nuevo tipo de juez: una IA que puede ver y leer.

El nuevo juez: Un modelo de "visión-idioma"

Piensa en estos modelos de IA (como GPT y Gemini) como estudiantes superinteligentes que han leído millones de libros y visto millones de videos. Pueden mirar un video de un brazo robótico recogiendo una naranja y comprender no solo qué está sucediendo, sino qué tan bien está sucediendo.

En lugar de que un humano vea el video, VISOR alimenta el video a la IA y hace dos preguntas:

  1. ¿Funcionó? (¿Éxito o fracaso?)
  2. ¿Qué tan bien funcionó? (¿Calidad alta, media o baja?)

La IA luego arroja un código JSON (un formato informático simple) diciendo "Éxito" o "Fracaso", o calificando la calidad.

El experimento: Un maratón de películas masivo

Para ver si este nuevo juez de IA era bueno, los investigadores organizaron una prueba masiva. Utilizaron un simulador (un mundo robótico virtual) para generar más de 1.000 videos de robots realizando cuatro tareas diferentes, como recoger objetos, ponerlos en una cesta o moverlos cerca de un objetivo.

Utilizaron dos "jueces de IA" diferentes:

  • Gemini: El campeón de la "Recuperación". Este juez está muy ansioso por detectar errores. Rara vez pasa por alto un fracaso, pero a veces grita "¡Lobo!" cuando el robot en realidad hizo un buen trabajo (falsas alarmas).
  • GPT: El campeón de la "Precisión". Este juez es muy estricto. Si dice "Éxito", puedes apostar a que es un éxito. Pero a veces pasa por alto fracasos sutiles, pensando que un trabajo se hizo cuando no estaba del todo bien.

El resultado: Ningún juez fue perfecto por sí solo. Gemini detectó más errores pero tuvo más falsas alarmas. GPT fue muy preciso cuando se pronunció, pero pasó por alto algunos errores. El artículo sugiere que si usas ambos juntos (como un panel de jueces votando), podrías obtener lo mejor de ambos mundos.

La trampa de la "confianza"

Aquí está el giro: los investigadores también le preguntaron a la IA: "¿Qué tan seguro estás?". midieron la "incertidumbre" de la IA (qué tan inestable es su confianza).

Esperaban que cuando la IA estuviera equivocada, se sintiera "insegura" o "nerviosa". Esperaban que la IA dijera: "No estoy 100% seguro de que este robot haya fallado", dándoles una pista de que la respuesta podría estar mal.

Pero eso no sucedió.
La IA estaba demasiado segura. Incluso cuando cometía un error, tenía un 99% de certeza de que tenía razón. Era como un estudiante que responde mal una pregunta de un examen pero levanta la mano con total confianza, insistiendo en que tiene razón. El artículo encontró que la "puntuación de confianza" de la IA fue un mal predictor de si estaba realmente en lo correcto o no. No puedes confiar en la IA solo porque diga: "¡Estoy seguro!".

La conclusión

  • Lo que funciona: Usar IA para ver videos de robots es una forma rápida y escalable de verificar si los robots están haciendo sus trabajos. Es mucho más barato que contratar a un humano para ver cada video.
  • Lo que no funciona: No puedes confiar en la "confianza" de la IA para decirte si está cometiendo un error. A menudo se siente muy segura incluso cuando está equivocada.
  • La trampa: Esta prueba se realizó en una simulación (un mundo de videojuegos), no con robots físicos reales. Los autores advierten que los robots del mundo real podrían tener cámaras desordenadas o videos borrosos que podrían confundir a la IA más de lo que lo hicieron los videos limpios de la simulación.

En resumen, VISOR es una herramienta prometedora que puede actuar como un supervisor automatizado e incansable para los robots, pero debe usarse con cuidado. Es excelente para captar la imagen general, pero puede ser tercamente segura incluso cuando está equivocada, por lo que los humanos aún necesitan mantener un ojo en la imagen general.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →