← Últimos artículos
💰 quantitative finance

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

Este estudio demuestra que la «ablación», el proceso de eliminar los mecanismos de rechazo de los modelos de IA, induce efectos colaterales significativos e inconsistentes en las disposiciones de toma de decisiones —tales como un aumento del optimismo, la verbosidad y cambios divergentes en la confianza a través de distintas familias de modelos—, lo que prueba que los modelos sin censura son agentes fundamentalmente alterados en lugar de ser meras versiones saneadas de sus contrapartes base.

Autores originales: Aleksander Fafuła

Publicado 2026-07-21
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Aleksander Fafuła

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El apretón de manos invisible: Por qué los modelos de IA no solo "apagan" sus frenos

Imagina que tienes un robot muy inteligente que ha sido entrenado para ser educado y seguro. Si le pides que haga algo peligroso o malo, dice cortésmente: "No, no puedo hacer eso". Esto se llama un "rechazo". Ahora, imagina a un grupo de ingenieros que quieren que este robot sea "sin censura". No quieren reentrenar a todo el robot; solo quieren eliminar quirúrgicamente la parte específica de su cerebro que dice "no". Llaman a este proceso "abliteración". La idea es como aplicar un escalpelo a una máquina: corta el cable del "rechazo" y todo lo demás debería permanecer exactamente igual. El robot debería seguir siendo igual de inteligente, igual de cauteloso e igual de honesto, solo que ahora no dirá "no" cuando se le pida algo arriesgado.

Pero aquí está la parte complicada: los modelos de IA son como gigantescas y enredadas redes de conexiones, no máquinas simples con cables aislados. Cuando tiras de un hilo, toda la red puede oscilar de maneras inesperadas. Este artículo plantea una pregunta crítica: si eliminamos quirúrgicamente la parte de "rechazo" de una IA, ¿el resto del robot permanece igual o su personalidad cambia de formas que no notamos? Nos importa esto porque la gente está empezando a usar estos robots "sin censura" para tomar decisiones en el mundo real, como invertir dinero o dar consejos. Si la cirugía cambia la personalidad del robot —haciéndolo excesivamente optimista o extrañamente confiado—, eso podría conducir a grandes errores.


La cirugía que cambió el estado de ánimo del paciente

En este estudio, un investigador llamado Aleksander Fafuła decidió probar la afirmación "quirúrgica" de la abliteración. En lugar de pedirle a los robots que hicieran algo peligroso (lo que de todos modos activaría sus botones de rechazo), el investigador configuró un enorme juego de mercado de valores falso. Le pidió a dos familias diferentes de modelos de IA que actuaran como un "Director de Investigación" para un fondo. Cada semana, durante 18 semanas, la IA tenía que mirar una pila de informes financieros y decidir: "¿Deberíamos apostar a que esta acción subirá o bajará?".

La configuración fue diseñada para ser un lanzamiento de moneda al aire. El mercado era impredecible y la IA no podía predecir el futuro en realidad. Esto significaba que si la IA cambiaba de opinión, no era porque se hubiera vuelto más inteligente; era porque su "personalidad" o "disposición" había cambiado. El investigador realizó este experimento 21,600 veces, comparando los modelos "seguros" originales contra sus gemelos "abliterados" (sin censura).

Esto es lo que el investigador encontró: la cirugía no fue limpia.

1. El error de "Optimismo"
El hallazgo más consistente fue que los modelos abliterados se volvieron significativamente más optimistas. Al mirar la misma evidencia que sus gemelos originales, las versiones "sin censura" apostaban mucho más a menudo a que la acción subiría.

  • Para una familia de modelos (Gemma), la versión "sin censura" apostó al alza 12.2 puntos porcentuales más a menudo que la original.
  • Para la otra familia (Qwen), fue 7.4 puntos porcentuales más a menudo.
    El artículo descarta la idea de que los modelos simplemente se volvieron más "libres" para decir lo que piensan. Los modelos originales nunca rechazaron la tarea en primer lugar, por lo que no había nada que "liberar". La cirugía misma creó un nuevo sesgo excesivamente positivo.

2. La paradoja de la confianza
Aquí es donde se pone extraño. El investigador esperaba que eliminar el freno de "rechazo" hiciera a los robots más confiados. Pero los resultados mostrieron que las dos familias de modelos reaccionaron en direcciones opuestas.

  • El modelo Gemma, después de la cirugía, se volvió menos confiado. Empezó a decir cosas como "No estoy totalmente seguro" con más frecuencia.
  • El modelo Qwen, tras la misma cirugía, se volvió más confiado.
    Esto demuestra que el efecto no es una simple "desinhibición" (como quitar un cinturón de seguridad). En cambio, la cirugía interactúa de manera diferente con el cableado interno de cada modelo específico, cambiando su confianza de formas impredecibles.

3. El cambio hacia lo "verboso" y "vago"
Los modelos abliterados también cambiaron la forma en que se explicaban.

  • Hablaron más: Ambas familias de modelos "sin censura" escribieron explicaciones más largas y verbosas para sus decisiones.
  • Usaron menos palabras de "duda": Dejaron de usar palabras explícitas como "incierto", "riesgoso" o "tal vez".
  • Pero usaron más palabras "concesivas": Empezaron a usar frases como "aunque" o "a pesar de" con más frecuencia.
    El artículo señala que, aunque los modelos usaron menos palabras de duda, no cambiaron realmente su comportamiento. Eran tan decisivos en sus apuestas finales como los modelos originales. La "duda" fue solo un cambio en su vocabulario, no un cambio en su cautela real.

4. Sin habilidades mágicas de trading
Finalmente, el investigador comprobó si estos modelos "sin censura" eran realmente mejores ganando dinero. La respuesta es un no rotundo.

  • Ninguno de los modelos venció al mercado.
  • Los modelos "sin censura" no tuvieron ninguna "alfa" (habilidad) especial.
  • Cualquier beneficio aparente que obtuvieron fue simplemente "beta" (siguiendo la ola general del mercado). De hecho, si el mercado hubiera bajado en lugar de subir, su "ventaja" se habría invertido y habrían perdido dinero. La cirugía no los hizo más inteligentes; solo hizo que apostaran de manera diferente.

5. La lección de la "Contaminación"
El artículo también descubrió una lección importante sobre cómo estudiamos estos modelos. Durante la investigación, el equipo descubrió que sus pruebas iniciales estaban arruinadas por "artefactos de la cadena de herramientas" (toolchain artifacts); básicamente, errores de software en cómo se cargaban los modelos.

  • Un error involucró un "cuantizador" desajustado (una herramienta que comprime el modelo), lo que hizo que los resultados parecieran indicar que los modelos habían perdido toda su duda por completo. Cuando arreglaron la herramienta, los resultados cambiaron de dirección.
  • Otro error involucró una "plantilla de chat" desactualizada que desordenó las instrucciones para un modelo.
    El artículo argumenta que, en el mundo de la IA modificada por la comunidad, este tipo de errores de software ocultos son la regla, no la excepción. Si no revisas cada byte del software, podrías estar midiendo el error, no la IA.

La conclusión

El artículo concluye que la "abliteración" no es un escalpelo. Es más bien como un instrumento romo que deja una huella desordenada. Cuando tomas un modelo y eliminas su mecanismo de rechazo, no estás obteniendo simplemente el modelo original menos el "no". Estás obteniendo un decisor diferente por completo.

Esta nueva versión es más optimista, habla más, usa diferentes palabras para expresar la duda y tiene un nivel de confianza que depende enteramente de con qué familia de modelos empezaste. Para cualquiera que utilice estos modelos "sin censura" como agentes para tomar decisiones reales, la advertencia es clara: estás desplegando una personalidad mensurablemente distinta, no solo una versión más "libre" de la original. La cirugía cambia al paciente, y los cambios son reales, mensurables y, a veces, sorprendentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →