← Últimos artículos
💻 computer science

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

El artículo presenta HAMLET, un marco escalable que adapta los modelos Visión-Lenguaje-Acción (VLA) para incorporar el contexto histórico mediante tokens de momento y un módulo de memoria, logrando mejoras significativas en el rendimiento de tareas de manipulación robótica que dependen de la historia, especialmente en escenarios de largo alcance.

Autores originales: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

Publicado 2026-04-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que estás enseñando a un robot a hacer tareas domésticas, como poner la mesa o ordenar la cocina. Hasta ahora, la mayoría de los robots "inteligentes" tenían un problema grave: tenían una memoria muy corta.

Piensa en estos robots como alguien que tiene un "olvido instantáneo". Si ves a un robot agarrar una taza, ponerla en la mesa y luego intentar poner otra taza encima, un robot normal se queda confundido en el segundo paso. Se pregunta: "¿Ya puse la primera taza? ¿O todavía la tengo en la mano? ¿Dónde está la otra taza?". Solo miran la foto del momento actual, sin recordar lo que pasó hace un segundo.

Aquí es donde entra HAMLET, el nuevo método que presentan los autores de este artículo.

🧠 La Analogía: El Robot con "Notas Post-it"

Imagina que el robot es un estudiante muy inteligente que sabe mucho (porque ha leído millones de libros y visto millones de videos), pero es un poco despistado con lo que acaba de hacer.

  1. El Problema (El Robot "Amnésico"):
    Los modelos actuales (llamados VLA o Modelos Visión-Lenguaje-Acción) son como ese estudiante que solo mira la pizarra en el momento exacto. Si la pizarra está vacía, no sabe si antes había escrito algo. Si el robot ve una taza en la mesa, no sabe si él mismo la puso o si ya estaba allí. Esto hace que fallen en tareas largas o complejas.

  2. La Solución (HAMLET):
    HAMLET no le pide al robot que reescriba todo su cerebro (lo cual sería caro y lento). En su vez, le da dos herramientas sencillas pero poderosas:

    • Las "Fichas de Momento" (Moment Tokens):
      Imagina que en cada segundo que pasa, el robot escribe una pequeña nota mental (una "ficha") sobre lo más importante que vio en ese instante.

      • El truco: Estas fichas no son fotos completas (que ocupan mucho espacio), sino resúmenes inteligentes. Además, están entrenadas para ignorar lo aburrido (como la pared de fondo) y solo anotar lo importante (como "agarré el cubo azul" o "la taza se movió"). Es como si el robot tuviera un destornillador mental que solo guarda las piezas clave del rompecabezas.
    • La "Caja de Recuerdos" (Memory Module):
      Ahora, imagina una pequeña caja de madera junto al robot. Cada vez que el robot escribe una "ficha de momento", la guarda en esta caja.

      • Cuando el robot necesita decidir qué hacer ahora, no solo mira la pizarra actual, sino que echa un vistazo rápido a su caja de recuerdos. La caja no solo guarda las fichas, sino que las organiza. Si hace 5 segundos el robot vio algo importante, la caja lo resalta. Si hace 5 segundos solo vio una pared estática, la caja lo ignora.

🚀 ¿Por qué es genial esto?

En el mundo real, las tareas de robots suelen ser como una película, no como una foto estática.

  • Ejemplo: Tienes que cambiar dos cubos de lugar. Primero mueves el azul, luego el rojo.
    • Sin HAMLET: El robot mueve el azul, pero al volver por el rojo, olvida que el azul ya no está en su sitio original. Se confunde y choca.
    • Con HAMLET: El robot recuerda: "Ah, hace un momento moví el azul a la derecha. Ahora toca el rojo". ¡Éxito!

📊 Los Resultados (En palabras sencillas)

Los autores probaron esto en robots reales y en simulaciones:

  • En tareas largas: Donde antes los robots fallaban el 70% de las veces, ahora lo hacen con un 76% de éxito. ¡Es como si un estudiante que antes suspendía todo, ahora aprobara con notas excelentes!
  • Eficiencia: Lo mejor es que no tuvieron que "reprogramar" todo el cerebro del robot. Solo añadieron estas "fichas" y la "caja de recuerdos". Es como ponerle un par de gafas nuevas a alguien que ya ve bien; no necesitas darle un nuevo ojo.
  • Velocidad: A diferencia de otros métodos que intentan guardar todas las fotos pasadas (lo cual hace al robot lento y pesado), HAMLET es ligero y rápido.

En resumen

HAMLET es como darle a un robot superinteligente una agenda personal y un sistema de notas. Le permite recordar qué hizo hace un momento, ignorar lo que no importa (como el fondo de la habitación) y tomar mejores decisiones en tareas que requieren varios pasos, como cocinar, ordenar o jugar.

Es un paso enorme para que los robots dejen de ser torpes y olvidadizos y se conviertan en verdaderos ayudantes en nuestras casas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →