← Últimos artículos
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

AnyMo es un marco de trabajo consciente de la geometría e independiente de la configuración que aprovecha la simulación de IMU fundamentada en la física y la alineación con modelos de lenguaje grandes para permitir una comprensión robusta y generalizable del movimiento humano en diversos dispositivos portátiles y conjuntos de datos no vistos, superando significativamente a los métodos existentes en reconocimiento de actividades en cero disparos, recuperación multimodal y descripción de movimientos.

Autores originales: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

Publicado 2026-05-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un reloj inteligente, una pulsera de actividad o incluso un sensor en tu zapato. Estos dispositivos son excelentes para detectar cómo se mueve tu cuerpo. Pero aquí está el problema: un movimiento se ve completamente diferente dependiendo de dónde esté el sensor.

Si agitas la mano, un sensor en tu muñeca ve un balanceo grande y rápido. Un sensor en tu cadera ve un pequeño y sutil bamboleo. Un sensor en tu cabeza casi no ve nada. Los modelos de IA actuales son como estudiantes que solo estudiaron para un examen específico; si mueves el sensor a otro lugar o cambias la marca del dispositivo, la IA se confunde y falla.

El artículo introduce AnyMo, un nuevo marco de IA diseñado para ser un "traductor universal" del movimiento humano, sin importar dónde se coloque el sensor.

Así funciona AnyMo, desglosado en conceptos simples:

1. El "Gimnasio Virtual" (Simulación Consciente de la Geometría)

En lugar de intentar recolectar millones de sensores reales de cada posible lugar del cuerpo humano (lo cual es imposible), AnyMo construye un gimnasio virtual.

  • La Analogía: Imagina un maniquí digital en 3D. Los investigadores no solo colocaron un sensor en la muñeca del maniquí. Virtualmente "pintaron" miles de pequeños sensores por toda la piel del maniquí: en el codo, la rodilla, la espalda, la frente.
  • La Física: Utilizaron la física para simular exactamente cómo vibrarían y girarían esos sensores mientras el maniquí caminaba, corría o bailaba. Esto creó una vasta biblioteca de escenarios de "qué pasaría si", enseñando a la IA que una "caminata" se ve diferente en una rodilla que en un hombro, pero sigue siendo fundamentalmente la misma acción.

2. El "Rompecabezas con Vendaje" (Pre-entrenamiento Agnóstico a la Configuración)

Una vez que la IA aprendió del gimnasio virtual, necesitaban enseñarle a manejar situaciones del mundo real donde los sensores faltan o están colocados al azar.

  • La Analogía: Imagina mostrarle a la IA un rompecabezas completo de una persona caminando, pero luego vendándole los ojos para que solo pueda ver 2 o 3 piezas del rompecabezas (los sensores reales en una persona).
  • El Truco: La IA tiene que adivinar cómo se ve la imagen completa basándose solo en esas pocas piezas. Al practicar esto una y otra vez con diferentes "vendas" (diferentes configuraciones de sensores), la IA aprende la estructura central del movimiento en lugar de memorizar ubicaciones específicas de sensores. Aprende el "alma" del movimiento, no solo la "piel" de los datos del sensor.

3. El "Traductor" (Tokenización y LLM)

Los datos crudos de los sensores son solo un flujo de números (aceleración, velocidad, etc.). Los Modelos de Lenguaje Grandes (LLM), como el utilizado en este artículo, son excelentes para entender palabras, pero se ahogan con números crudos.

  • La Analogía: AnyMo actúa como un traductor. Toma el flujo desordenado y continuo de números de sensores y los comprime en "tokens de movimiento" compactos (como palabras en una oración).
  • El Resultado: En lugar de alimentar a la IA con un millón de números, le alimenta una breve oración de "palabras de movimiento". Esto permite que la IA conecte el movimiento directamente con el lenguaje.

¿Qué puede hacer AnyMo?

El artículo probó AnyMo en tres tareas principales, y superó a todos los métodos anteriores:

  1. Reconocimiento Zero-Shot (El Juego "Adivina la Actividad"):

    • Mostraron a AnyMo datos de 14 conjuntos de datos diferentes que nunca había visto antes (sensores diferentes, personas diferentes, actividades diferentes).
    • Resultado: AnyMo pudo adivinar correctamente lo que la persona estaba haciendo (por ejemplo, "cocinando", "caminando", "bailando") sin haber sido entrenada explícitamente en esos conjuntos de datos específicos. Mejoró la precisión en aproximadamente un 12% en comparación con el siguiente mejor método.
  2. Recuperación Cruzada de Modalidades (El "Motor de Búsqueda"):

    • Texto a Movimiento: Escribes "una persona está abriendo un refrigerador" y la IA encuentra el clip de video exacto o los datos del sensor que coinciden.
    • Movimiento a Texto: Subes una grabación de sensores y la IA encuentra la descripción de texto que coincide.
    • Resultado: AnyMo fue significativamente mejor encontrando la coincidencia correcta que otros modelos, incluso cuando los datos provenían de dispositivos completamente diferentes.
  3. Descripción de Movimiento (El "Narrador"):

    • Le das a la IA una grabación de sensores y escribe una oración describiendo lo que sucedió.
    • Resultado: En lugar de decir cosas genéricas como "brazo moviéndose", AnyMo escribió descripciones específicas como: "Una persona camina por un pasillo, gira a la derecha y abre un gabinete". Capturó la historia del movimiento, no solo la física.

La Conclusión

El artículo afirma que al tratar la colocación del sensor como un problema estructurado y geométrico (utilizando la forma del cuerpo) en lugar de una variable aleatoria, y al enseñar a la IA a traducir el movimiento al lenguaje, AnyMo crea un modelo de propósito general para el movimiento portátil.

No solo reconoce una actividad específica en un reloj específico; entiende el concepto del movimiento humano, lo que le permite funcionar con cualquier dispositivo, en cualquier parte del cuerpo, en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →