SAGE: Scalable AI Governance & Evaluation
SAGE es un marco de gobernanza de IA escalable que operacionaliza el juicio humano de alta calidad a través de un bucle de calibración bidireccional de política, precedente y jueces subrogados de LLM, utilizando la destilación rentable para permitir la evaluación de modelos alineada con las políticas en LinkedIn Search que, en última instancia, aumentó los usuarios activos diarios en un 0.25%.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres el editor jefe de un periódico masivo (LinkedIn) que publica millones de artículos (empleos y perfiles) cada día. Tu objetivo es asegurarte de que cuando un lector busque algo específico, como "analista de datos de nivel inicial", obtenga el artículo perfecto, no solo uno al azar que simplemente contenga esas palabras.
¿El problema? Tienes demasiados artículos y demasiados lectores. No puedes pedirle a un editor humano que revise cada uno de los resultados de búsqueda para comprobar si es bueno. Si intentas usar una matemática simple (como contar cuántas personas hacen clic en un enlace), podrías dejarte engañar por artículos populares pero irrelevantes.
Esta es la historia de SAGE, un nuevo sistema que LinkedIn construyó para resolver este problema. Piensa en SAGE como un "Supereditor" que aprende a pensar como un experto humano, pero trabaja a la velocidad de un robot.
Así es como funciona, desglosado en pasos sencillos:
1. El Problema: La brecha entre el "Humano y el Robot"
Normalmente, cuando las empresas construyen motores de búsqueda, dependen de dos cosas:
- Editores Humanos: Son excelentes juzgando la calidad, pero son lentos y costosos. No pueden leer millones de resultados.
- Métricas de Interacción (Engagement): Cuentan clics y visualizaciones. Pero esto es como juzgar una película por su taquilla; una mala película puede seguir siendo popular si la gente hace clic en ella por accidente. No te dice si la película es realmente buena.
LinkedIn necesitaba una forma de obtener el juicio de calidad de un humano con la velocencia de una máquina.
2. La Solución: El marco de trabajo "SAGE"
SAGE significa Escalable AI Governance & Evaluation (Gobernanza y Evaluación de IA Escalable). Es un equipo de tres partes que trabajan juntas para crear un "libro de reglas" perfecto para juzgar los resultados de búsqueda.
Parte A: La Política (El Libro de Reglas)
Este es un conjunto de reglas escritas en lenguaje sencillo. En lugar de decir "coincidir con palabras clave", dice cosas como: "Si un usuario pide un trabajo de nivel inicial, el resultado no debe requerir 10 años de experiencia". Define exactamente qué es "bueno".
Parte B: El Precedente (Las Respuestas de Muestra)
Imagina a un profesor dando a un estudiante algunos ensayos de muestra con calificaciones perfectas y explicaciones. SAGE utiliza un conjunto pequeño y cuidadosamente seleccionado de ejemplos de "estándar de oro" creados por expertos humanos. Estos ejemplos muestran a la IA exactamente cómo aplicar el libro de reglas a situaciones complicadas.
Parte C: El Juez Sustituto (El Estudiante)
Este es un modelo de IA (un Modelo de Lenguaje Extenso o LLM) que actúa como el juez. Lee los resultados de búsqueda y los compara con el Libro de Reglas y las Respuestas de Muestra.
3. El Ingrediente Secreto: "Entrenamiento de Doble Vía"
En el pasado, simplemente le decías a la IA las reglas y esperabas que las entendiera. SAGE utiliza un Bucle de Calibración de Doble Vía.
- De Humano a IA: Los humanos enseñan las reglas a la IA y le muestran ejemplos.
- De IA a Humano: ¡La IA en realidad critica a los humanos!
- Si la IA ve que un experto humano comete un error (como pasar por alto un detalle oculto en una descripción de trabajo larga), lo señala.
- Si la IA se confunde porque las reglas son vagas, le dice a los humanos: "Oigan, su libro de reglas no cubre este caso específico".
Esto crea un ciclo donde el Libro de Reglas, los Ejemplos y el Juez de IA se vuelven más inteligentes juntos. Corregen sus errores mutuamente hasta que coinciden casi perfectamente (un 77% de acuerdo con los expertos humanos, lo cual se considera "sustancial" en este campo).
4. El Truco de Velocidad: "Destilación" (Del Maestro al Estudiante)
La IA "Maestra" (la que aprendió de los humanos) es muy inteligente pero lenta y costosa de ejecutar. Es como un profesor genio que tarda horas en calificar un examen. LinkedIn necesita calificar millones de exámenes por segundo.
Por eso, utilizaron una técnica llamada Destilación.
- Imagina que el Maestro (el profesor genio) explica su proceso de pensamiento a un Estudiante (un pasante rápido y eficiente).
- El Estudiante aprende a imitar la lógica del Maestro, pero se vuelve mucho más pequeño y rápido.
- El Resultado: El Juez Estudiante es 92 veces más barato y rápido que el Maestro, pero sigue obteniendo la respuesta correcta casi con la misma frecuencia que los expertos humanos.
5. Cómo cambió a LinkedIn
Una vez que construyeron este Juez Estudiante rápido y listo, lo usaron de tres maneras poderosas:
La Red de Seguridad (Pruebas Offline): Antes de lanzar una nueva función de búsqueda, la pasan por el Juez Estudiante. Si la IA dice: "Esta nueva función está mostrando malos resultados", pueden detenerla inmediatamente. No tienen que esperar a que los usuarios reales se quejen. Esto redujo su tiempo de prueba de 2 semanas a 3 días.
El Guardián en Tiempo Real (Servicio Online): Comprimieron la IA aún más para hacerla lo suficientemente diminuta como para ejecutarse en tiempo real. Ahora, cada vez que buscas, una versión minúscula de esta IA revisa los resultados instantáneamente para asegurar que sigan las reglas.
El Sistema de Alerta Temprana: Usaron la IA para vigilar el sistema las 24 horas del día, los 7 días de la semana. A veces, una actualización de búsqueda puede parecer bien basándose en los clics, pero la IA nota que la calidad está bajando. Detectó un problema que las métricas humanas pasaron por alto, evitando una mala experiencia para los usuarios.
La Conclusión
Al utilizar este sistema, LinkedIn no solo hizo su búsqueda "más rápida"; la hizo más inteligente y confiable.
El documento afirma que, al usar SAGE para aplicar reglas de alta calidad, observaron un aumento del 0.25% en los Usuarios Activos Diarios en LinkedIn. En el mundo de una plataforma con cientos de millones de usuarios, ese pequeño porcentaje representa un número masivo de personas que encontraron lo que buscaban, se quedaron en el sitio y siguieron regresando.
En resumen: SAGE convirtió el trabajo desordenado y subjetivo de "decidir qué es un buen resultado de búsqueda" en un proceso claro, automatizado y escalable que aprende de sus errores y mejora continuamente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.