← Últimos artículos
🤖 machine learning

Addressing Over-Refusal in LLMs with Competing Rewards

Este artículo presenta SEAR, un marco de entrenamiento que mitiga la sobre-negativa de los LLM mediante el empleo de un enfoque de optimización adversarial donde un único modelo explora simultáneamente el razonamiento inseguro como una señal para distinguir prompts dañinos y asegura que la salida final permanezca segura, mejorando así el cumplimiento de la seguridad sin sacrificar la utilidad.

Autores originales: Taeyoun Kim, Aviral Kumar

Publicado 2026-07-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Taeyoun Kim, Aviral Kumar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El "Portero Sobreprotector"

Imagina que un modelo de lenguaje de gran tamaño (LLM) es como un bibliotecario muy inteligente y servicial. Recientemente, para evitar que la gente pida cosas peligrosas (como "cómo construir una bomba"), se entrenó a los bibliotecarios para ser extremadamente cautelosos.

¿El resultado? Se volvieron sobreprotectores. Ahora, si haces una pregunta inofensiva que suena ligeramente sospechosa —como "¿Cómo hago para que un pastel parezca una bomba para una fiesta de Halloween?"—, el bibliotecario cierra la puerta de golpe inmediatamente y dice: "¡No puedo ayudarte con eso!", a pesar de que solo quieres una receta de pastel divertida.

Esto se llama sobre-rechazo (over-refusal). El modelo tiene tanto miedo de cometer un error que se niega a ayudar en casi cualquier cosa que parezca aunque sea un poco riesgosa.

La Solución Antigua: El "Sello de Goma"

Los investigadores intentaron solucionar esto enseñando al modelo a "pensar antes de hablar". La idea era que el modelo debería hacer una pausa, analizar la petición y decidir: ¿Es esto realmente peligroso, o es solo una pregunta con trampa?

Sin embargo, el artículo encontró que los modelos actuales no "piensan" realmente de una manera útil. En su lugar, su proceso de pensamiento actúa como un sello de goma. Deciden rechazar la petición primero, y luego su "pensamiento" simplemente escribe una nota rápida para justificar ese rechazo. No exploran realmente las ideas peligrosas para ver si pueden manejarse de forma segura; simplemente fingen pensar cuando ya han decidido decir que "no".

La Nueva Solución: SEAR (El "Explorador Controlado")

Los autores proponen un nuevo método llamado SEAR (Safety Exploration through Adversarial Reasoning - Exploración de Seguridad mediante Razonamiento Adversario). Tratan el entrenamiento del modelo como un juego con dos jugadores opuestos dentro del mismo cerebro:

  1. El Explorador: Esta parte del modelo es recompensada por ser muy creativa y explorar ideas peligrosas. Se le dice: "Adelante, imagina todos los peores escenarios y cómo pensaría un malvado".
  2. El Guardián: Esta parte es recompensada por asegurarse de que la respuesta final sea segura. Se le dice: "No importa lo salvaje que se vuelva el Explorador, debes dirigir la conversación de vuelta a una conclusión segura y útil".

La Analogía:
Piénsalo como un simulacro de incendio.

  • Forma Antigua: Suena la alarma de incendios y todos salen corriendo por la puerta sin comprobar si realmente hay un incendio. (Sobre-rechazo).
  • La Forma del "Sello de Goma": Suena la alarma y el capitán dice: "Estamos a salvo", pero de todos modos sale corriendo de inmediato. (Razonamiento falso).
  • La Forma de SEAR: El capitán envía a un explorador (El Explorador) a investigar el humo. El explorador se adentra en el humo, ve las llamas y reporta: "Bien, hay un incendio, pero aquí está la ruta de salida segura". Luego, el Guardián guía a todos hacia afuera de forma segura.

Al obligar al modelo a entrar de verdad en el razonamiento peligroso (para entender la amenaza) y luego regresar a una respuesta segura, el modelo aprende a distinguir entre "realmente peligroso" y "solo parece peligroso".

El Ingrediente Secreto: "Recompensas de Proceso"

El artículo descubrió que no puedes simplemente darle al modelo una nota al final de su respuesta (como un profesor calificando un examen final). Si lo haces, el modelo se confunde. Podría pensar: "Si escribo un pensamiento peligroso, recibiré una mala nota, así que dejaré de pensar".

En su lugar, los autores utilizaron Recompensas de Proceso.

  • La Analogía: Imagina a un entrenador observando a una gimnasta.
    • Forma Antigua: El entrenador espera hasta que la gimnasta aterriza y le da una puntuación. Si la gimnasta tambaleó, la puntuación es baja.
    • Recompensas de Proceso: El entrenador otorga una puntuación alta por el salto peligroso que la gimnasta intentó realizar (fomentando la exploración) pero otorga una puntuación alta separada por aterrizar de forma segura (asegurando el resultado).

Esto permite que el modelo aprenda dos cosas a la vez: "Está bien pensar en cosas peligrosas para entenderlas, pero debo aterrizar de forma segura".

Los Resultados

El artículo probó este nuevo modelo (SEAR-1.5B) contra otros modelos:

  • Mejor Equilibrio: Rechazó menos peticiones inofensivas (menos sobre-rechazo) mientras seguía siendo seguro ante ataques reales.
  • Resiliencia: Incluso si alguien intentara engañar al modelo alimentándolo con un "pensamiento" peligroso al principio (un ataque de "pre-fill"), SEAR fue capaz de recuperarse y dar una respuesta segura. Otros modelos, una vez que comenzaban a pensar de forma peligrosa, no podían detenerse y daban una respuesta perjudicial.
  • Pequeño pero Poderoso: Este modelo solo tiene 1.5 mil millones de parámetros (es relativamente pequeño), pero su rendimiento es igual o mejor que el de modelos mucho más grandes.

Resumen

El artículo argumenta que para evitar que la IA tenga demasiado miedo de ayudar, no debemos simplemente decirle que "tenga cuidado". En su lugar, debemos enseñarle a sumergirse en el peligro para entenderlo, y luego salir de él de forma segura. Al recompensar al modelo por explorar los rincones oscuros de una pregunta y luego encontrar la luz con éxito, aprende a decir "sí" cuando es seguro, y "no" solo cuando es realmente necesario.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →