← Últimos artículos
🤖 AI

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

El artículo presenta NoRA, un referente visual en primera persona que comprende 1.420 clips de video anotados que evalúan los sistemas multimodales en su capacidad para generar y justificar acciones razonables mediante grafos explícitos de soporte hecho-razonamiento-acción, revelando que los modelos actuales tienen dificultades para construir el espacio de acción completo y vincular correctamente las acciones con la evidencia visible a pesar de identificar a menudo acciones individuales plausibles.

Autores originales: Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

Publicado 2026-06-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: Saber vs. Hacer

Imagina que estás enseñando a un robot a caminar por un parque concurrido.

  • Forma antigua: Le muestras al robot una lista de tres opciones: "A) Caminar a la izquierda", "B) Caminar a la derecha" o "C) Sentarse". El robot elige la "B". Tú compruebas si la "B" es la respuesta "correcta".
  • La crítica del artículo: Esto es como un examen de opción múltiple. En la vida real, nadie te entrega un menú de tres opciones. Tienes que observar la situación, determinar qué está pasando, idear tu propia lista de posibles movimientos y luego elegir el mejor.

Los autores argumentan que los modelos de IA actuales son buenos eligiendo la respuesta correcta de un menú (como un estudiante adivinando en un examen), pero son malos ideando el menú en sí mismo y explicando por qué eligieron un plato específico.

La solución: NORA (El "Gimnasio de Razonamiento")

Los autores crearon una nueva prueba llamada NORA (Razonamiento Normativo en Acción). En lugar de preguntar a una IA "¿Qué debería hacer?" y comprobar si la respuesta coincide con una clave preescrita, NORA pide a la IA que haga tres cosas simultáneamente:

  1. Ver la escena: Observar un clip de video desde una perspectiva de primera persona (como una GoPro en la cabeza de alguien).
  2. Construir un menú: Generar una lista de cosas razonables para hacer a continuación.
  3. Justificar la elección: Para cada acción en la lista, explicar por qué tiene sentido basándose en lo que es realmente visible en el video.

La analogía: Piensa en NORA no como un cuestionario de opción múltiple, sino como una competencia de cocina.

  • Pruebas antiguas: El juez te da tres ingredientes y te pregunta: "¿Cuál es el mejor?".
  • NORA: El juez te muestra una cocina con un mostrador desordenado y un invitado con hambre. Tienes que:
    • Identificar los ingredientes en el mostrador (Hechos).
    • Idear diferentes comidas que podrías cocinar (Acciones Candidatas).
    • Explicar por qué "Pasta" es una buena elección porque "El invitado tiene hambre" y "Tenemos tomates" (Razones).
    • Crucialmente: Si dices "Haré un filete", pero no hay carne en el mostrador, fallas, incluso si "filete" es una idea deliciosa.

Cómo miden el éxito: El "Grafo de Soporte"

El artículo introduce una forma específica de calificar a la IA llamada Puntuación de Razonabilidad Fundamentada. No solo miran la respuesta final; miran el "grafo de soporte".

Imagina un árbol:

  • Las Raíces (Hechos): ¿Qué es realmente visible? (ej. "Hay un niño corriendo", "El suelo está mojado").
  • El Tronco (Razones): ¿Por qué esto importa? (ej. "El niño podría resbalar", "Es peligroso correr sobre hierba mojada").
  • Los Frutos (Acciones): ¿Qué debemos hacer? (ej. "Detener al niño", "Moverse a la hierba seca").

La Puntuación:

  • Alineación de la Acción: ¿Propuso la IA una buena lista de frutos?
  • Fundamentación Fáctica: ¿Son reales las raíces? (¿Alucinó la IA un niño que no está ahí?).
  • Vinculación de Soporte: ¿Está el fruto conectado con las raíces correctas? (¿Dijo la IA "Detener al niño" debido a la hierba mojada, o debido a un perro que no está ahí?).

Lo que encontraron: La trampa de "Plausible pero Incorrecto"

Los investigadores probaron 12 modelos de IA diferentes (incluyendo nombres importantes como GPT-5 y Gemini) utilizando este nuevo gimnasio. Esto es lo que descubrieron:

  1. Son buenos describiendo la habitación: La mayoría de las IA pueden identificar correctamente los hechos visibles (ej. "Hay una cortadora de césped").
  2. Son aceptables eligiendo un fruto: A menudo eligen una acción plausible (ej. "Seguir cortando el césped").
  3. Fallan en el "Menú" y en el "Por qué":
    • Falta de Menú: Tienen dificultades para generar una lista completa de opciones razonables. A menudo omiten acciones alternativas que un humano consideraría.
    • Conexiones Laxas: A menudo eligen una buena acción pero la vinculan con la razón equivocada. Por ejemplo, pueden decir "Seguir cortando el césped" porque "Hace un día agradable", cuando la verdadera razón (visible en el video) es que "La hierba está larga y necesita ser cortada".

La metáfora: Imagina a un estudiante que levanta la mano y dice: "¡La respuesta es 42!".

  • Prueba antigua: Si 42 es la respuesta correcta, obtiene una A.
  • Prueba NORA: El profesor le pregunta: "Muestra tu procedimiento". El estudiante dice: "Porque 6 por 7 es 42".
    • Si el problema era en realidad "¿Cuál es la raíz cuadrada de 1764?", el estudiante obtiene una A por la respuesta, pero reprueba el examen porque no mostró el razonamiento correcto para este problema específico.
    • NORA encontró que las IA actuales son excelentes gritando "¡42!", pero terribles mostrando las matemáticas que demuestran por qué 42 es el movimiento correcto para este video específico.

Los tres estilos de "Prompt"

Para probar cómo piensa la IA, los investigadores hicieron las mismas preguntas de tres maneras diferentes (como cambiar las reglas de la competencia de cocina):

  1. Directo: "Solo dime qué hacer". (No se permite explicación).
  2. Deliberado: "Piensa en voz alta. Enumera algunas opciones y explícalas, luego elige una".
  3. Estructurado: "Completa este formulario específico: Enumera Hechos, Enumera Razones, Enumera Acciones, luego Elige una".

El Resultado: El enfoque "Estructurado" (completar el formulario) ayudó a los mejores modelos de IA a rendir mejor. Los obligó a ir más despacio y a conectar sus hechos con sus acciones. Sin embargo, para otros modelos, obligarlos a completar un formulario en realidad los hizo peores, como si las reglas rígidas los confundieran.

La Conclusión

El artículo concluye que, si bien la IA está mejorando en "ver" y "elegir", todavía tiene dificultades con el razonamiento justificado. A menudo puede adivinar el movimiento correcto, pero no puede explicar de manera fiable por qué ese movimiento es correcto basándose solo en lo que ve en el video.

NORA es una herramienta para medir esta brecha. Cambia la pregunta de "¿Puede la IA elegir la respuesta correcta?" a "¿Puede la IA construir un argumento lógico, visible y defendible para su acción?". Actualmente, la respuesta es: "Están llegando, pero todavía les falta la imagen completa".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →