← Últimos artículos
💻 computer science

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

El artículo presenta RefusalBench, un benchmark de triplets emparejados que revela que las tasas de rechazo estricto clasifican erróneamente a los LLM de vanguardia en prompts de investigación biológica debido a políticas de vías de acceso específicas del proveedor y no a los pesos del modelo, al tiempo que demuestra que las métricas binarias no capturan comportamientos matizados de cumplimiento parcial y que el rendimiento de discriminación por niveles varía significativamente entre modelos.

Autores originales: Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

Publicado 2026-05-22
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: El Problema del "Portero Sobreprotector"

Imagina que eres un científico intentando desarrollar un nuevo medicamento utilizando un equipo de asistentes de IA. Estos asistentes son como porteros en un club muy exclusivo. Su trabajo es permitir la entrada de solicitudes de investigación legítimas (como "¿Cómo diseño una proteína para curar una enfermedad?") pero detener las peligrosas (como "¿Cómo fabrico una toxina mortal?").

El problema que investiga este artículo es que estos porteros están actuando de manera muy diferente. Algunos son tan estrictos que expulsan a todos, incluso a los buenos. Otros son tan laxos que dejan entrar a casi cualquiera. El artículo pregunta: ¿Quién es el mejor portero y cómo medimos eso?

Los autores crearon una prueba llamada RefusalBench para averiguarlo. Descubrieron que simplemente contar cuántas veces un portero dice "No" es una forma terrible de juzgarlos. Un portero que dice "No" a todo parece "seguro", pero en realidad es inútil porque no deja entrar a los buenos científicos.


Cómo lo Probaron: El Menú de "Tres Niveles"

Para probar a los porteros de manera justa, los investigadores crearon un menú de 141 solicitudes. Organizaron estas en 47 conjuntos de tres (tríos).

Piénsalo como pedir una hamburguesa, pero lo único que cambia es el "nivel de peligro" de los ingredientes:

  1. La Hamburguesa Benigna: Usa ingredientes seguros y cotidianos (proteínas humanas). Esta es una solicitud totalmente normal.
  2. La Hamburguesa Límite: Usa ingredientes un poco sospechosos (como bacterias que requieren laboratorios de seguridad especiales).
  3. La Hamburguesa de Doble Uso: Usa ingredientes altamente peligrosos (como toxinas o superpatógenos).

El Objetivo: Un portero perfecto debería:

  • Decir "Sí" a la Hamburguesa Benigna.
  • Quizás dudar o decir "Sí, pero ten cuidado" con la Hamburguesa Límite.
  • Decir un firme "No" a la Hamburguesa de Doble Uso.

Si un portero dice "No" a la Hamburguesa Benigna, está rehusando en exceso (teniendo demasiado miedo). Si dice "Sí" a la Hamburguesa de Doble Uso, está rehusando insuficientemente (siendo demasiado imprudente).


Los Resultados Sorprendentes

Cuando realizaron esta prueba en 19 modelos de IA diferentes (los "porteros"), encontraron diferencias masivas:

1. El Efecto "Un Proveedor"

El factor más importante no era de dónde provenía la IA (como EE. UU., China o Europa), sino quién la fabricó.

  • La Analogía: Imagina un portero en un club propiedad de la "Compañía A". No importa lo que pidas, si proviene de la Compañía A, el portero revisa tu identificación tres veces y a menudo te expulsa. Pero si vas a un club propiedad de la "Compañía B", el portero apenas te mira.
  • El Hallazgo: Una empresa específica (Anthropic) tenía porteros que decían "No" a solicitudes legítimas 21 veces más a menudo que otras empresas. Su negativa no se debía a que la IA estuviera "pensando" en el peligro; se debía a que la empresa tenía un manual de reglas rígido (un filtro) que bloqueaba automáticamente cualquier cosa que pareciera incluso ligeramente riesgosa.

2. La Trampa de la "Seguridad Falsa"

El artículo argumenta que mirar el número total de respuestas "No" es engañoso.

  • La Analogía: Imagina dos guardias de seguridad.
    • Guardia A detiene al 95% de las personas, incluido el director ejecutivo y el conserje, porque está aterrorizado por una bomba. Se ve muy "seguro", pero es terrible en su trabajo.
    • Guardia B detiene al 5% de las personas, pero solo detiene a los terroristas reales y deja pasar a todos los demás.
  • El Hallazgo: Si solo cuentas los "No", el Guardia A parece el ganador. Pero si mides la discriminación (la capacidad de distinguir entre lo bueno y lo malo), el Guardia B es el verdadero héroe.
    • En el estudio, un modelo llamado Grok 4.20 fue el mejor distinguiendo (dejó entrar las solicitudes buenas y detuvo las malas), aunque dijo "No" menos a menudo que los demás.
    • Por el contrario, un modelo llamado Kimi K2.6 dijo "No" con más frecuencia (el 94% de las veces), pero simplemente estaba diciendo "No" a todo, bueno o malo. Tenía cero capacidad para distinguir.

3. El Patrón "Equivocarse Pero Ayudar"

Algunos porteros no solo decían "No" o "Sí". Decían: "No puedo hacer eso, pero aquí tienes algunos consejos sobre cómo hacerlo de forma segura".

  • La Analogía: Le preguntas a un guardia: "¿Puedo llevar un cuchillo?". El guardia dice: "No, no puedes llevar un cuchillo. Pero aquí tienes una lista de tiendas donde puedes comprar un cuchillo de plástico muy seguro".
  • El Hallazgo: Nueve de los modelos hicieron esto. Rechazaron la solicitud directa pero aún así dieron ayuda parcial. Esta es una "zona gris" que los conteos simples de "Sí/No" pasan por completo por alto. No está claro si esto es realmente útil o si es una forma astuta de ayudar con tareas peligrosas.

4. La Tendencia "Empeorándose"

Los investigadores analizaron tres versiones del mismo modelo (Claude Opus 4.5, 4.6 y 4.7) lanzadas a lo largo del tiempo.

  • El Hallazgo: La versión más nueva (4.7) dijo "No" mucho más a menudo que las anteriores. Pero aquí está la trampa: no mejoró en absoluto deteniendo las solicitudes malas (ya estaba deteniendo el 100% de ellas). Simplemente comenzó a detener las solicitudes buenas también.
  • La Conclusión: La empresa hizo el modelo "más seguro" haciéndolo más molesto y poco útil, sin hacerlo realmente más seguro contra amenazas reales.

Por Qué Esto Importa para la Ciencia

El artículo concluye que si los científicos utilizan estos modelos de IA para ejecutar sus laboratorios automáticamente, necesitan elegir al "portero" correcto.

  • Si eligen los sobreprotectores (como los modelos de Anthropic en este estudio), sus proyectos de investigación se quedarán atascados porque la IA se negará a realizar tareas normales y seguras.
  • Si eligen los demasiado laxos, podrían generar accidentalmente instrucciones peligrosas.
  • Los mejores son los que pueden distinguir entre una solicitud segura y una peligrosa, incluso si no dicen "No" tan a menudo como los demás.

La Conclusión Final

No puedes juzgar un sistema de seguridad solo por la frecuencia con la que dice "No". Un sistema que dice "No" a todo no es seguro; simplemente está roto. La verdadera seguridad se trata de precisión: saber exactamente cuándo detenerse y cuándo dejar pasar. El artículo muestra que la forma actual en que clasificamos estos modelos de IA está rota, y necesitamos mejores formas de medir si son realmente lo suficientemente inteligentes para distinguir entre la buena ciencia y la mala ciencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →