← Últimos artículos
🤖 AI

Anti-Goal Reasoning: Rethinking the Theory of Goal Reasoning in Non-Axiomatic Logic

Este artículo aborda la ambigüedad en la representación de la evitación dentro de la Lógica No Axiomática mediante la introducción de un marco distintivo de "anti-objetivo" y una operación mental de "prevenir", resolviendo así las paradojas donde evitar un evento se confunde con perseguir su negación y permitiendo que los sistemas distingan claramente entre la persecución, la evitación pasiva, la prevención activa y la inacción.

Autores originales: Bowen Xu

Publicado 2026-07-24
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Bowen Xu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás construyendo un robot que tiene que descubrir cómo sobrevivir en un mundo que no comprende del todo. No es una supercomputadora con un mapa perfecto del universo; es más bien como un niño curioso explorando un nuevo parque de juegos con energía limitada y solo la mitad de las reglas. Este es el mundo de la Lógica No Axiomática (NAL). En este campo, los científicos intentan enseñar a las computadoras a ser "adaptables", lo que significa que pueden aprender, cambiar de opinión y tomar decisiones incluso cuando no tienen todos los hechos o no tienen tiempo suficiente para pensar.

La idea central aquí es el Razonamiento de Objetivos (Goal Reasoning). Piensa en un objetivo como un "querer". Si un robot quiere una galleta, busca la forma de conseguir una. Si ve que "caminar hacia la cocina" usualmente conduce a "conseguir una galleta", decide caminar. Pero, ¿qué pasa cuando el robot quiere evitar algo? ¿Qué pasa si quiere evitar recibir una descarga eléctrica? Durante mucho tiempo, los científicos de la computación tuvieron una forma complicada de manejar este "evitar" que accidentalmente creó una trampa lógica. Trataron "evitar una descarga" exactamente igual que "querer estar seguro". Es como decirle a un robot: "No toques el fuego", pero el robot entiende: "Busca un lugar donde no haya fuego", y luego decide que la mejor manera de encontrar una zona libre de fuego es presionar un botón porque, en general, presionar ese botón suele resultar en "no quemarse". Confuso, ¿verdad? Este artículo profundiza en esa confusión para ver si podemos arreglar el cerebro del robot para que sepa la diferencia entre huir del peligro y correr hacia la seguridad.


El Gran Lío del "No lo Hagas"

El artículo, escrito por Bowen Xu, comienza señalando un error absurdo en la forma en que le decimos a las computadoras que tengan cuidado. En el sistema actual (llamado NARS), si quieres que el robot evite un evento —llamémoslo "Daño"— escribes un comando que se ve como "¡No Daño!" (o ¬Daño!).

El problema es que la computadora se confunde con este doble negativo. Piensa: "Bien, el usuario quiere que ocurra 'No Daño'. Eso suena como un objetivo. Debo intentar hacer que ocurra 'No Daño'". Así que el robot empieza a buscar formas de crear un evento de "No Daño".

Aquí es donde la paradoja se vuelve extraña. Imagina un botón.

  • Hecho 1: Si una luz está encendida, presionar el botón suele causar Daño.
  • Hecho 2: Si simplemente presionas el botón al azar (sin la luz), suele resultar en No Daño.
  • El Objetivo: Se le dice al robot que Evite el Daño.

Debido a que el robot trata "Evitar Daño" como "Hacer que ocurra 'No Daño'", observa el Hecho 2 y piensa: "¡Oye! ¡Presionar el botón usualmente lleva a 'No Daño'! ¡Debería presionar el botón!".

¡Pero espera! Si la luz está encendida, el Hecho 1 dice que presionar el botón causa Daño. El robot está ahora en un bucle: quiere evitar el daño, así que intenta crear un "No Daño", pero en la situación específica en la que es peligroso, su propia lógica le dice que presione el botón de todos modos, lo que causa el mismísimo daño que intenta evitar. Es como una persona que intenta mantenerse seca presionando un botón porque piensa que presionar el botón suele mantenerla seca, aunque actualmente esté parada bajo un rociador que se activa cuando se presiona el botón.

La Solución: "Anti-Objetivos" y el Botón de "Prevenir"

El autor argumenta que el error proviene de tratar "evitar X" como "querer 'no X'". Para solucionar esto, el artículo propone un nuevo concepto llamado Anti-Objetivo (Anti-Goal).

Piénsalo de esta manera:

  • Un Objetivo es un imán que te atrae hacia algo que quieres (como una galleta).
  • Un Anti-Objetivo es un imán que te empuja lejos de algo que odias (como una araña).

En el sistema antiguo, el robot solo tenía imanes que atraían. Si le decías que evitara una araña, simplemente intentaba atraerse hacia "no araña", lo cual se volvía problemático. El nuevo sistema le da al robot un botón de "empuje". Cuando el robot ve una araña (el Anti-Objetivo), no intenta buscar "no araña"; sino que se empuja activamente lejos de la araña.

El artículo también introduce una operación mental especial llamada ⇑prevent (piensa en ello como un interruptor de "¡Detén eso!"). Esto ayuda al robot a entender que, a veces, para evitar algo, tienes que hacer algo específico.

Por ejemplo, si el robot aprende que "Presionar el botón cuando la luz está encendida" detiene el inicio de un incendio, puede usar el interruptor ⇑prevent. Se da cuenta de: "Quiero evitar el fuego. Presionar el botón previene el fuego. Por lo tanto, ¡debería presionar el botón!". Esto es diferente a simplemente intentar encontrar un mundo donde el fuego no exista. Es una estrategia activa.

Probando el Nuevo Cerebro

Para demostrar que esto funciona, el autor realizó simulaciones con un robot diminuto y simple. Probó cuatro escenarios diferentes para ver si el robot podía descifrar cuándo actuar y cuándo quedarse quieto:

  1. Hacer para Realizar (Do to Realize): El robot quiere comida. Aprende que presionar un botón trae comida. ¿Resultado? Presiona el botón. (¡Éxito!)
  2. No Hacer para Evitar (Not Do to Avoid): El robot quiere evitar el dolor. Aprende que presionar un botón causa dolor. ¿Resultado? No presiona el botón. (¡Éxito!)
  3. Hacer para Evitar (Do to Avoid): El robot quiere evitar el dolor. Aprende que no presionar un botón conduce al dolor, pero presionarlo detiene el dolor. ¿Resultado? Descubre que necesita presionar el botón para prevenir el dolor. (¡Éxito!)
  4. No Hacer para Realizar (Not Do to Realize): El robot quiere comida. Aprende que presionar un botón detiene la aparición de la comida. ¿Resultado? No presiona el botón, porque hacerlo arruinaría su oportunidad de obtener comida. (¡Éxito!)

Las simulaciones mostraron que con las nuevas reglas de "Anti-Objetivo" y "Prevenir", el robot dejó de cometer los errores paradójicos. Aprendió a presionar el botón cuando era útil y a contenerse cuando era perjudicial, incluso cuando la lógica era complicada.

Por qué esto importa

Este artículo no pretende haber construido un robot perfecto o haber resuelto toda la inteligencia artificial. Es más bien como un mecánico arreglando un engranaje específico y confuso en el motor. El autor sugiere que, al separar claramente "querer algo" de "evitar algo", podemos construir sistemas adaptativos más inteligentes que no se tropiecen con su propia lógica.

El artículo también señala algo interesante sobre cómo aprendemos: los humanos parecen encontrar más fácil aprender a hacer cosas por recompensas y detener cosas para evitar castigos, pero más difícil aprender a hacer cosas para evitar castigos o detener cosas para obtener recompensas. La nueva lógica computacional refleja esta dificultad, sugiriendo que la parte de "Prevención Activa" (Casos 3 y 4 del estudio) es naturalmente más difícil de aprender porque requiere un pensamiento más complejo.

En resumen, este artículo le da a los robots un mejor vocabulario para decir "No". En lugar de solo decir "Quiero 'No X'", ahora pueden decir "Estoy evitando activamente X", y ese pequeño cambio evita que presionen el botón solo porque usualmente conduce a la seguridad, incluso cuando el botón es peligroso en ese momento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →