The Attribution Contract: Feature Attribution for Generative Language Models
Este artículo introduce el "Contrato de Atribución", un marco conceptual que resuelve las ambigüedades en la atribución de características para los modelos de lenguaje generativos definiendo explícitamente la salida, las características elegibles, el proceso generativo, las condiciones fijas y la puntuación del modelo, reencuadrando así las discrepancias en la atribución como diferencias en los contratos explicativos en lugar de fallas algorítmicas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de averiguar por qué un chef cocinó un plato específico. Quieres saber qué ingredientes fueron los más importantes para el sabor final.
En los viejos tiempos (con modelos "clasificadores" simples), esto era fácil. Le dabas al chef una lista de ingredientes (la entrada), él preparaba un solo plato (la salida), y podías señalar la sal o la pimienta y decir: "Ah, la sal lo hizo salado". Los ingredientes eran estáticos, y el plato estaba terminado.
Pero con los Modelos de Lenguaje Generativos (como la IA que escribe este texto), el proceso de cocina es mucho más complicado. El chef no solo cocina un plato; cocina un banquete completo, bocado a bocado. Y aquí está la parte complicada: el primer bocado que cocina se convierte en un ingrediente para el segundo bocado.
Si el chef cocina primero un "Le" (francés para "El"), ese "Le" ahora está sentado en la encimera, esperando ser usado como ingrediente para la siguiente palabra, "chien" (perro).
El Problema: La Confusión de "Quién Hizo Qué"
El artículo argumenta que cuando intentamos explicar por qué la IA escribió una palabra específica, a menudo nos confundimos porque no estamos claros sobre qué pregunta estamos haciendo realmente.
El autor llama a esta confusión la "Falacia de la Autoatribución".
Aquí hay una analogía simple:
Imagina que estás viendo una carrera de relevos.
- Corredor A pasa el testigo al Corredor B.
- Corredor B corre rápido y gana la carrera.
Si preguntas: "¿Quién fue responsable de que Corredor B corriera rápido?"
- Pregunta A: "¿Qué ayudó a Corredor B a correr rápido ahora mismo?"
- Respuesta: ¡El testigo pasado por Corredor A! (La palabra anterior es el factor más importante).
- Pregunta B: "¿Qué parte del plan original causó que el equipo ganara?"
- *Respuesta: ¡Las instrucciones del entrenador a Corredor A! (El prompt original es el factor más importante).
El artículo dice que muchos investigadores de IA están usando la misma herramienta para responder ambas preguntas, pero se están confundiendo. Ven que "Corredor A" (la palabra anterior) es responsable de la velocidad de "Corredor B", y concluyen: "¡Las instrucciones del entrenador no importaron!". Pero eso es incorrecto. Simplemente hicieron la pregunta equivocada.
La Solución: El "Contrato de Atribución"
Para solucionar esto, el autor propone un nuevo reglamento llamado Contrato de Atribución. Piensa en esto como una orden de trabajo o una tarjeta de receta que debes llenar antes de comenzar a analizar la IA.
Antes de preguntarle a la IA "¿Por qué escribiste esto?", debes firmar un contrato que defina cinco cosas (el SCOPE):
- S (Score/Puntuación): ¿Qué estamos midiendo? (¿Es la probabilidad de la siguiente palabra? ¿La oración completa?)
- C (Conditioning/Condicionamiento): ¿Qué estamos manteniendo fijo? (¿Estamos ignorando las palabras que la IA ya escribió, o las estamos tratando como ingredientes?)
- O (Output/Salida): ¿Qué estamos explicando exactamente? (¿Solo la siguiente palabra? ¿Todo el párrafo?)
- P (Process/Proceso): ¿Cómo lo hizo la IA? (¿Escribió de izquierda a derecha? ¿Borró y reescribió como un modelo de difusión?)
- E (Eligible Features/Características Elegibles): ¿Qué nos está permitido culpar o elogiar? (¿Solo el prompt original del usuario? ¿O también las palabras anteriores de la IA?)
Por Qué Esto Importa: La Analogía de los "Gafas Mágicas"
Imagina que la IA lleva puesto un par de gafas mágicas.
- Si le pides a la IA que explique una palabra usando el Contrato A (Siguiente Token Local), las gafas te muestran que la palabra anterior brilla en rojo intenso. Está diciendo: "¡Esta palabra está aquí porque la palabra anterior la hizo probable!".
- Si le pides a la IA que explique la misma palabra usando el Contrato B (Condicionado al Prompt), las gafas apagan el brillo en la palabra anterior y hacen que el prompt original brille en rojo intenso. Está diciendo: "¡Esta palabra está aquí porque tú la pediste en el prompt!".
El punto principal del artículo es: No puedes decir que la IA está "equivocada" o "correcta" basándote en las gafas. Debes admitir que el Contrato A y el Contrato B están haciendo dos preguntas diferentes.
Si un investigador dice: "La IA está alucinando porque está ignorando el documento fuente", pero en realidad está usando el Contrato A (que mira las palabras anteriores), está malinterpretando el resultado. Necesitan cambiar al Contrato B (que mantiene fijas las palabras anteriores y mira solo la fuente) para ver si el documento fuente es realmente la causa.
La Conclusión
El artículo no inventa una nueva forma de calcular números. En cambio, inventa una nueva forma de hablar sobre los números.
Nos dice que en el mundo de la IA generativa, no hay una única "verdad" sobre qué entrada importó más. Solo existe la verdad relativa al contrato.
- Si quieres saber cómo piensa la IA paso a paso, usa el contrato "Local".
- Si quieres saber cómo tus instrucciones dieron forma a la historia final, usa el contrato "Condicionado al Prompt".
Hasta que dejemos de tratarlos como la misma cosa, seguiremos discutiendo sobre las explicaciones de la IA cuando en realidad solo estamos haciendo preguntas diferentes. El "Contrato de Atribución" es simplemente la herramienta para asegurarnos de que todos estamos haciendo la misma pregunta antes de comenzar a buscar respuestas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.