← Últimos artículos
💬 NLP

Bye Bye Perspective API: Lessons for Measurement Infrastructure in NLP, CSS and LLM Evaluation

Este artículo critica la dependencia estructural de la investigación en PLN y LLM de la ahora clausurada API propietaria Perspective, destacando cómo sus actualizaciones opacas y su operacionalización única de la toxicidad generaron resultados irreproducibles, y aboga por el establecimiento de una infraestructura de medición independiente, válida y reproducible para prevenir riesgos epistémicos similares en el futuro.

Autores originales: David Hartmann, Manuel Tonneau, Angelie Kraft, LK Seiling, Dimitri Staufer, Pieter Delobelle, Jan Fillies, Anna Ricarda Luther, Jan Batzner, Mareike Lisker

Publicado 2026-04-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: David Hartmann, Manuel Tonneau, Angelie Kraft, LK Seiling, Dimitri Staufer, Pieter Delobelle, Jan Fillies, Anna Ricarda Luther, Jan Batzner, Mareike Lisker

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina internet como una plaza de pueblo masiva y caótica donde millones de personas gritan, discuten y comparten historias cada segundo. Para evitar que esta plaza descienda al caos total, los investigadores necesitaban una forma de detectar automáticamente los gritos maliciosos, odiosos o tóxicos.

Durante casi una década, toda la plaza confió en una única herramienta gratuita llamada Perspective API para realizar este trabajo. Era como un "Medidor de Toxicidad" universal propiedad de una empresa tecnológica (Jigsaw de Google). Todos lo utilizaban para medir cuán groseras eran las personas, para calificar qué tan "seguros" eran los nuevos chatbots de IA y para estudiar el comportamiento en línea.

Ahora, los dueños del medidor lo están apagando a finales de 2026. Este artículo argumenta que, aunque es triste perder la herramienta, el verdadero problema es que toda la comunidad de investigación construyó su casa sobre una base que no poseía, no entendía y no podía reparar.

Aquí está el desglose del argumento del artículo utilizando analogías simples:

1. El medidor de "caja negra"

Imagina que compras una báscula para pesar tus comestibles. Le confías porque es gratuita y todo el mundo la usa. Pero te das cuenta de lo siguiente:

  • Los dueños cambian los pesos: Cada pocos meses, la empresa cambia secretamente los resortes internos de la báscula sin avisarte. Un día, una bolsa de manzanas de 5 libras pesa 5 libras; al día siguiente, pesa 6 libras, pero la báscula sigue diciendo "5".
  • Las instrucciones son vagas: La empresa dice: "Esto mide la 'maldad'". Pero nunca explican qué es la maldad. ¿Es una voz alta? ¿Una palabra grosera? ¿Un tipo específico de insulto? Solo te dan un número entre 0 y 1 y dicen: "Tú decides qué es demasiado alto".
  • Falta el contexto: La báscula solo pesa la manzana de forma aislada. No sabe si la manzana fue lanzada contra alguien (tóxico) o si alguien estaba bromeando sobre una manzana (no tóxico). Trata cada frase como si flotara en un vacío.

2. La trampa "circular"

Como el medidor era tan fácil de usar, los investigadores comenzaron a utilizarlo para entrenar a otras computadoras para que fueran máquinas detectadoras de maldad.

  • El bucle: Utilizaron la API de Perspective para etiquetar datos (por ejemplo, "Esta frase es tóxica"). Luego, entrenaron nuevos modelos de IA con esos datos. Finalmente, probaron esos nuevos modelos viendo si coincidían con la API de Perspective.
  • El problema: Es como un estudiante que se toma un examen, luego usa la hoja de respuestas para calificarse a sí mismo y luego afirma ser un genio porque obtuvo el 100%. No estaban midiendo la "toxicidad"; solo estaban midiendo "qué tan bien te alineas con la definición actual de toxicidad de Google".

3. Los sesgos ocultos

Como el medidor no entendía el contexto ni la cultura, cometía errores consistentes que los investigadores no podían ver ni corregir:

  • Castigar a las víctimas: A menudo marcaba palabras utilizadas por grupos marginados (como insultos recuperados o términos LGBTQ+) como "tóxicos" porque no sabía quién las decía ni por qué.
  • Perder el verdadero odio: Se perdía el discurso de odio sutil y codificado porque solo buscaba palabras groseras superficiales.
  • Sesgo lingüístico: Era mucho más estricto con el texto en alemán que con el texto en inglés, no porque el alemán sea más grosero, sino porque las personas que entrenaron el modelo tenían diferentes sesgos culturales.

4. El shock del "apagón repentino"

Cuando la empresa anunció que iba a cerrar la API, no dejó atrás un manual, una copia de seguridad ni un historial de versiones.

  • El resultado: Todos los artículos de investigación escritos durante la última década que dependían de esta herramienta ahora son "irreproducibles". Si intentas realizar el mismo experimento hoy, no puedes obtener los mismos resultados porque la "regla" que usaron para medir ya no existe. Es como intentar medir la altura de un edificio con una regla que ha sido fundida.

5. La advertencia: No solo cambies el medidor

Los autores advierten que la solución más fácil, simplemente usar una nueva herramienta de código cerrado de otra gran empresa tecnológica (como OpenAI), es una trampa.

  • El riesgo: Estas nuevas herramientas también son "cajas negras". Podrían ser incluso menos transparentes, entrenadas con datos recopilados de trabajadores explotados y actualizadas sin aviso. Si solo cambiamos una caja negra por otra, solo estamos repitiendo los mismos errores.

La solución: Construyamos nuestra propia regla

El artículo pide a la comunidad de investigación que deje de tratar la medición como un "servicio" que proporciona otra persona. En su lugar, necesitan construir su propia infraestructura. Este nuevo sistema debe tener:

  • Código abierto: Todos pueden ver cómo funciona y revisar las matemáticas.
  • Conciencia del contexto: Necesita saber quién está hablando, con quién están hablando y la historia de la conversación.
  • Entrada de la comunidad: La definición de "toxicidad" no debería ser decidida por una sola empresa; debería involucrar a las comunidades que están siendo medidas.
  • Transparencia: Necesitamos saber exactamente cómo se etiquetaron los datos y quién los etiquetó.

En resumen: El artículo argumenta que depender de una única herramienta corporativa secreta para medir el comportamiento humano fue un error. El cierre de esa herramienta es una llamada de atención. Los investigadores deben dejar de ser usuarios pasivos de herramientas corporativas y comenzar a construir sus propias formas abiertas, justas y transparentes de medir lo que importa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →