← Últimos artículos
🤖 machine learning

KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning

KARL es un nuevo marco de aprendizaje por refuerzo que mitiga las alucinaciones en los LLM al alinear dinámicamente su capacidad de abstención con sus límites de conocimiento, logrando un equilibrio superior entre la precisión de las respuestas y la capacidad de no responder cuando no se tiene la información.

Autores originales: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

Publicado 2026-04-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El problema: El "Mentiroso Confiado" (La Alucinación)

Imagina que tienes un asistente personal muy inteligente, pero que tiene un problema de ego: le aterra decir "no lo sé".

Si le preguntas: "¿Cómo se llama el tercer hijo del rey de una isla que no existe?", en lugar de admitir que la pregunta no tiene sentido o que no tiene la información, el asistente inventará un nombre con total seguridad, con una voz tan convincente que podrías llegar a creerle. En el mundo de la Inteligencia Artificial (IA), esto se llama "alucinación".

Actualmente, cuando intentamos enseñar a la IA a ser honesta, ocurre un efecto secundario desastroso: la IA se vuelve demasiado miedosa. Se vuelve como ese estudiante que, por miedo a equivocarse en un examen, decide dejar todas las preguntas en blanco. Al final, no miente, pero tampoco te ayuda en nada.

La solución: El método KARL (El "Maestro con Brújula")

Los investigadores de la Universidad de Tsinghua han creado un nuevo método llamado KARL. Para entender cómo funciona, imagina que estamos entrenando a un aprendiz de chef.

1. La Brújula del Conocimiento (Recompensa Inteligente)

En lugar de darle al aprendiz una regla fija (como "si fallas, te castigo"), KARL le da una brújula dinámica.

Imagina que el aprendiz está cocinando.

  • Si el plato es algo que él ya sabe hacer (por ejemplo, un huevo frito) y lo hace bien, le damos una medalla. Pero si intenta hacerlo y lo quema, o si decide no cocinarlo por miedo, le quitamos puntos. ¡Queremos que practique lo que sabe!
  • Si el plato es algo que nunca ha visto (por ejemplo, un soufflé de cristal), la brújula le dice: "Está bien, no lo intentes, es mejor decir que no sabes". Aquí, decir "no lo sé" le da puntos de honestidad.

La clave es que la brújula cambia según lo que el aprendiz está aprendiendo. No es una regla estática; se adapta a su nivel de habilidad actual.

2. El Entrenamiento en Dos Etapas (El Plan de Estudios)

KARL no intenta enseñar todo a la vez. Utiliza una estrategia de dos pasos, como un entrenamiento deportivo:

  • Etapa 1: El Entrenamiento de Fuerza (Exploración). Primero, dejamos que el aprendiz cocine mucho, incluso si comete errores. El objetivo aquí no es la perfección, sino que el aprendiz recupere su confianza y aprenda todo lo que su memoria le permita. Queremos que "saque músculo" de conocimiento.
  • Etapa 2: El Entrenamiento de la Prudencia (Calibración). Una vez que el aprendiz ya es un experto en lo básico, le enseñamos el toque final: la sabiduría. Ahora le decimos: "Ya sabes cocinar mucho, pero si ves algo que claramente está fuera de tu capacidad, detente y admítelo".

¿Cuál es el resultado?

Gracias a este método, la IA logra el "equilibrio perfecto".

En los experimentos, los científicos vieron que la IA de KARL es como un experto real: es muy precisa cuando sabe la respuesta, pero es lo suficientemente humilde como para callar cuando no tiene ni idea.

En resumen: KARL logra que la IA deje de ser un "mentiroso confiado" y deje de ser un "cobarde silencioso", convirtiéndola en un asistente confiable y honesto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →