← Últimos artículos
💬 NLP

Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation

Basándose en entrevistas con profesionales, este artículo examina las prácticas socio-técnicas de creación y evaluación de los conjuntos de datos de "red teaming" para modelos de lenguaje, destacando cómo las definiciones actuales de riesgo a menudo pasan por alto el contexto y la interacción, y proponiendo oportunidades para que la investigación en HCI expanda estas prácticas.

Autores originales: Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola

Publicado 2026-02-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que los Modelos de Lenguaje Grandes (como ChatGPT) son como niños geniales pero muy curiosos que acaban de entrar al mundo. Son increíblemente inteligentes, pueden escribir poemas, resolver problemas y conversar con cualquiera. Pero, como cualquier niño nuevo, a veces dicen cosas tontas, ofensivas o peligrosas si no se les pone una "valla de seguridad".

Aquí es donde entra el "Red Teaming" (o "Equipo Rojo").

¿Qué es el "Red Teaming"?

Piensa en el Red Teaming como un grupo de "héroes del mal" o "hackers éticos" contratados para intentar engañar a ese niño genial. Su trabajo es hacerle preguntas raras, intentar convencerlo de que rompa las reglas o buscar formas de que diga algo malo. Si logran que el niño diga algo peligroso, ¡han encontrado una grieta en la valla de seguridad!

El objetivo no es destruir al niño, sino encontrar sus puntos débiles antes de que lo haga un villano real, para poder arreglarlos y hacerlo más seguro.

¿Qué descubrieron los autores de este estudio?

Los investigadores (un equipo de expertos en tecnología y sociedad) hablaron con 22 personas que hacen este trabajo de "Red Teaming". Quisieron entender cómo crean las preguntas de prueba y cómo deciden qué es "peligroso".

Aquí están sus hallazgos principales, explicados con analogías:

1. Dos formas de ver el problema (La Búsqueda vs. El Filtro)

Los practicantes se dividen en dos grupos según su formación:

  • Los Exploradores (Ingenieros de IA): Ven el Red Teaming como una búsqueda del tesoro en un océano infinito. Su meta es navegar por todas las combinaciones posibles de palabras para encontrar cualquier forma de romper el sistema. Les importa la cantidad y la velocidad de búsqueda.
  • Los Detectives (Expertos en Lenguaje): Ven el Red Teaming como clasificar basura. Su meta es identificar si una frase específica es "ofensiva" o "mala", como un filtro que separa lo bueno de lo malo. Les importa la precisión de la etiqueta.

El problema: Al enfocarse solo en la búsqueda o en la clasificación técnica, a menudo olvidan el contexto.

2. El peligro de las "Listas de Chequeo" (Los Datos)

Para probar al niño, los expertos crean "libros de preguntas" (datasets).

  • El error: Muchos expertos simplemente copian y pegan preguntas de libros de otros (datasets existentes). Es como si un chef decidiera cocinar solo con recetas que encontró en un libro antiguo, sin preguntar a la gente local qué les gusta comer hoy.
  • La consecuencia: Si el libro original no tiene preguntas sobre temas específicos (como el lenguaje de los jóvenes, dialectos locales o situaciones culturales raras), el "niño" nunca será probado en esas situaciones. La seguridad se vuelve ciega a ciertas culturas o grupos de personas.

3. La trampa de la "Conversación Real"

La mayoría de las pruebas se hacen con una sola pregunta y una sola respuesta (como un examen de opción múltiple).

  • La analogía: Es como probar la seguridad de una casa solo mirando la puerta principal. Pero en la vida real, los "villanos" no entran por la puerta principal de una vez; entran engañando al dueño en una conversación larga.
  • El hallazgo: Los expertos notaron que si alguien habla con el modelo durante 10 o 20 turnos, usando un lenguaje sutil o cambiando de tema poco a poco, el modelo puede terminar diciendo cosas terribles que nunca diría en una sola pregunta. Las pruebas actuales a menudo ignoran esta "conversación larga".

4. ¿Quién decide qué es "malo"?

Aquí está el meollo del asunto.

  • El problema: Los expertos suelen usar máquinas (otros modelos de IA) para juzgar si una respuesta es mala. Es como pedirle a un robot que juzgue si un chiste es ofensivo.
  • La realidad: Lo que es ofensivo en un país puede ser una broma en otro. Lo que es peligroso para un niño puede ser irrelevante para un adulto. Al no involucrar a expertos humanos reales (psicólogos, sociólogos, comunidades locales) en la definición de "peligro", las pruebas se vuelven muy técnicas pero poco humanas.

¿Qué proponen los autores para mejorar esto?

Los autores dicen que los expertos en tecnología (especialmente los de la comunidad HCI - Interacción Humano-Computadora) deben ayudar a cambiar las reglas del juego:

  1. Ponerle contexto a las pruebas: En lugar de preguntar "¿Puedes hacer una bomba?", las pruebas deberían simular situaciones reales: "¿Qué le diría este modelo a un niño de 10 años que está triste y busca información sobre explosivos?".
  2. Involucrar a expertos reales: No usar solo listas de palabras prohibidas. Involucrar a biólogos, abogados, educadores y comunidades locales para definir qué es realmente peligroso en su contexto.
  3. Probar la conversación, no solo la respuesta: Evaluar cómo se comporta el modelo en una charla larga, donde las intenciones maliciosas se esconden poco a poco, en lugar de solo en un golpe directo.

En resumen

Este estudio nos dice que hacer que la IA sea segura no es solo un problema de ingeniería o de código. Es un problema social.

Si tratamos la seguridad de la IA como un simple juego de "encuentra el error técnico", estaremos construyendo un castillo muy fuerte, pero con puertas abiertas para los problemas reales de la gente. Necesitamos dejar de mirar solo el código y empezar a mirar cómo interactúan las personas reales con la tecnología en su vida diaria.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →