← Últimos artículos
💬 NLP

HAL: Inducing Human-likeness in LLMs with Alignment

El artículo presenta HAL, un marco que alinea los modelos de lenguaje con rasgos conversacionales similares a los humanos mediante la derivación de una recompensa interpretable y basada en datos a partir de diálogos contrastivos, lo que permite una optimización dirigida que mejora la percepción de humanidad sin comprometer el rendimiento general.

Autores originales: Masum Hasan, Junjie Zhao, Ehsan Hoque

Publicado 2026-07-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Masum Hasan, Junjie Zhao, Ehsan Hoque

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo charlar como un humano real. El problema es que "ser humano" es un concepto difuso. No es una ecuación matemática que puedas resolver; es un sentimiento. Lo sabes cuando lo escuchas, pero no puedes escribir fácilmente una regla para ello. Por lo general, para hacer que la IA suene más humana, los desarrolladores simplemente le lanzan más dinero y potencia de cómputo al problema, con la esperanza de que el modelo tenga suerte.

Este artículo presenta un nuevo marco llamado HAL (Human Aligning LLMs) que intenta resolver esto convirtiendo el "sentirse humano" en una puntuación medible, como una nota en un boletín de calificaciones.

Así es como lo hicieron, desglosado en pasos sencillos:

1. El trabajo de detective: Encontrar el "indicador"

Primero, los investigadores necesitaban averiguar qué es lo que realmente hace que una conversación suene humana. Analizaron miles de "Pruebas de Turing" (juegos donde un juez humano intenta adivinar quién es una persona y quién es un robot).

En lugar de solo preguntar "¿Quién es humano?", le preguntaron a un detective de IA superinteligente por qué tomó su decisión. El detective encontró patrones. Por ejemplo:

  • Los humanos suelen cometer pequeños errores tipográficos o usar letras minúsculas.
  • Los humanos pueden ser un poco impacientes o terminar un chat rápidamente.
  • Los humanos usan jerga informal y no explican todo en exceso.
  • Los humanos a veces admiten que no saben algo en lugar de inventárselo.

Los investigadores tomaron cientos de estas pistas y las redujeron a una lista de verificación de 16 rasgos específicos (llamada HL16Q). Piensa en esto como una "Lista de verificación de humanidad".

2. La tarjeta de puntuación: Calificar la conversación

Una vez que tuvieron la lista de verificación, necesitaban una forma de calificar una conversación. Entrenaron un modelo matemático simple (como una escala ponderada) para que observe un chat y le asigne un número único.

  • Si el chat usa lenguaje informal y tiene algunos errores tipográficos, la puntuación sube.
  • Si el chat es excesivamente educado, perfecto y robótico, la puntuación baja.

Este número es la Puntuación HAL. Es un solo número que dice: "¿Qué tan humana se siente esta conversación?".

3. El entrenamiento: Enseñando al robot a apuntar a la puntuación

Ahora, usaron esta puntuación para entrenar diferentes modelos de IA (que van desde los pequeños hasta los muy grandes).

  • Le pidieron a la IA que tuviera una conversación.
  • Le dieron una "recompensa" si la conversación obtenía una Puntuación HAL alta.
  • Le dieron una "penalización" si la puntuación era baja.

Con el tiempo, la IA aprendió a ajustar su comportamiento para obtener una puntuación más alta. Empezó a actuar menos como una enciclopedia perfecta y más como una persona real charlando tomando un café.

4. La prueba: ¿Funcionó?

Para ver si realmente funcionaba, realizaron una "Prueba de sabor a ciegas" (similar a una Arena de Chatbots). Voluntarios humanos reales charlaron con dos IA diferentes, uno al lado del otro, y tuvieron que adivinar cuál era el humano.

  • El Resultado: La IA entrenada con HAL fue elegida como "humana" el 61.78% de las veces.
  • La Comparación: Superó a su propia versión no entrenada e incluso superó a una IA comercial muy popular y de alto nivel (GPT-4o-mini), que solo fue elegida como humana aproximadamente el 34% de las veces.

Por qué esto es importante

La mayor victoria aquí no es solo que la IA suene mejor; es que el proceso es transparente.

  • Forma antigua: "Hicimos la IA más grande, y ahora suena más humana". (Caja misteriosa).
  • Forma HAL: "Le enseñamos a la IA a ser breve, usar jerga y admitir cuando se equivoca, y por eso suena humana". (Receta clara).

Debido a que saben exactamente qué rasgos están recompensando, pueden verificar para asegurarse de que la IA no esté haciendo nada extraño o dañino para obtener esa puntuación. También verificaron que la IA no perdiera su capacidad de entender las emociones mientras aprendía a sonar humana, y no lo hizo.

En resumen: HAL es una herramienta que toma la vaga idea de "ser humano", la convierte en una lista de verificación concreta y utiliza esa lista para entrenar a la IA para que charle de forma más natural, sin perder su inteligencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →