PromptSplit: Revealing Prompt-Level Disagreement in Generative Models
Autores originales: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
Autores originales: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: PromptSplit
Declaración del Problema
Los modelos de IA generativa guiados por prompts (que abarcan visión y lenguaje) se han proliferado, pero los métodos sistemáticos para comparar sus comportamientos en relación con prompts de entrada específicos siguen siendo limitados. Las métricas de evaluación existentes, como FID, Inception Score y CLIP-Score, proporcionan indicadores de calidad agregados que comprimen el comportamiento del modelo en valores escalares únicos. Estas métricas suelen oscurecer las discrepancias dependientes del prompt. Por ejemplo, dos modelos pueden generar imágenes de alta calidad para un prompt dado, pero divergir significativamente en el contenido o el estilo de la salida basándose en categorías de prompts específicas (por ejemplo, un modelo genera consistentemente figuras masculinas mientras que otro genera figuras femeninas para el prompt "una persona"). Los métodos actuales de comparación espectral y de distribución operan típicamente en un entorno libre de prompts, marginalizando sobre los prompts y fallando al aislar las categorías de entrada específicas responsables de la divergencia de comportamiento.
Metodología
Los autores proponen PromptSplit, un marco espectral no supervisado y consciente de los prompts, diseñado para detectar y analizar el desacuerdo dependiente del prompt entre dos modelos generativos.
1. Representación Conjunta de Prompt y Salida
PromptSplit construye una representación conjunta formando embeddings de producto tensorial de las características del prompt (ϕT) y las características de la salida (ϕX o ϕY). Para un prompt t y una salida x, la característica conjunta se define como:
ϕ⊗(t,x)=ϕT(t)⊗ϕX(x)
Esto induce un kernel de producto k⊗([t,x],[t′,x′])=kT(t,t′)⋅kX(x,x′), capturando interacciones multiplicativas entre los espacios de entrada y salida.
2. Diferencia de Covarianza de Kernel
Para dos conjuntos de datos DX (de un modelo X) y DY (de un modelo Y), el método calcula los operadores de covarianza de kernel conjuntos empíricos C^T⊗X y C^T⊗Y. El núcleo del análisis es el operador de diferencia de covarianza:
Λ^X,Y∣T=C^T⊗X−ηC^T⊗Y
donde η es un hiperparámetro. Los autovectores principales de este operador revelan las direcciones en el espacio conjunto donde los dos modelos exhiben las diferencias de comportamiento más significativas.
3. Truco de Kernel y Análisis Espectral
La descomposición de autovalores directa del operador de covarianza de alta dimensión es computacionalmente inviable. Los autores aplican el truco de kernel para formular una matriz de kernel de bloque KX,ηY∣T de tamaño (n+m)×(n+m), que comparte los mismos autovalores no nulos que el operador de alta dimensión. Los autovectores de esta matriz de bloque corresponden a los modos de desacuerdo en el espacio conjunto.
4. Proyección Aleatoria Escalable
Para manejar conjuntos de datos a gran escala (donde n,m superan las decenas de miles), PromptSplit emplea una aproximación de proyección aleatoria. Las características tensoriales conjuntas se proyectan a una dimensión inferior r utilizando matrices aleatorias gaussianas. Esto reduce la complejidad computacional de la descomposición espectral de O((n+m)3) a O((n+m)r2+r3).
- Garantía Teórica: El artículo demuestra que la desviación esperada de la estimación del espacio de autovectores respecto al resultado de dimensión completa está acotada por O(1/r2), asegurando que la aproximación preserva las direcciones de desacuerdo con alta probabilidad.
Contribuciones Clave
- Formulación de Comparación a Nivel de Prompt: El trabajo formula la comparación de modelos como un problema espectral de prompt-salida conjunto, yendo más allá de las métricas agregadas para identificar las categorías de prompts específicas que causan comportamientos divergentes en los modelos.
- Marco PromptSplit: Introducción de un marco basado en kernels que acopla prompts y salidas mediante embeddings de producto tensorial para analizar el espectro de autovalores de las diferencias de covarianza de kernel conjunta.
- Aproximación Escalable: Desarrollo de un método de proyección aleatoria que permite el análisis de grandes conjuntos de datos con un límite de error teórico de O(1/r2), haciendo que el método sea práctico para la evaluación de modelos generativos en el mundo real.
- Interpretabilidad: El método proporciona "modos" de desacuerdo interpretables, vinculando explícitamente clusters de prompts específicos con la naturaleza de la divergencia de la salida.
Resultados Experimentales
Los autores evaluaron PromptSplit en entornos de texto-a-imagen (T2I) y texto-a-texto (LLM):
- Validación Sintética: En entornos controlados (por ejemplo, MNIST-M con desajustes conocidos de color/escala de grises en el prompt), PromptSplit identificó con éxito las categorías de prompts de la verdad fundamental responsables del desacuerdo.
- Modelos de Texto-a-Imagen: Las comparaciones entre Stable Diffusion XL, PixArt-Σ y Kandinsky revelaron divergencias dependientes del prompt en estilo, composición y alineación. Por ejemplo, el método identificó prompts basados en ocupaciones específicas (por ejemplo, "enfermera", "carpintero") donde los modelos produjeron representaciones visuales significativamente diferentes.
- Grandes Modelos de Lenguaje (LLMs): Las comparaciones entre Qwen 3 y Gemma 3 en el conjunto de datos NQ-Open identificaron clusters distintos de preguntas (por ejemplo, sobre presidentes de EE. UU. o actores) donde los modelos generaron respuestas divergentes.
- Aplicación de Guía: Los autores demostraron el uso de PromptSplit para guiar el proceso de difusión latente, alineando con éxito la distribución de las imágenes generadas con un conjunto de datos de referencia (por ejemplo, estilos de pintura específicos) al incorporar el gradiente de desacuerdo en el proceso de muestreo.
Significado y Reivindicaciones
El artículo afirma que PromptSplit ofrece una herramienta principal e interpretable para detectar dónde y cómo discrepan los modelos generativos, abordando un vacío dejado por las métricas de calidad agregadas. Al modelar explícitamente el espacio conjunto prompt-salida, aísla las categorías de entrada específicas que impulsan las diferencias de comportamiento.
Los autores posicionan a PromptSplit como un método espectral de segundo orden basado en embeddings. Señalan modestamente que, si bien el diseño permite la escalabilidad y la interpretabilidad, no pretende caracterizar todos los aspectos de orden superior del comportamiento generativo condicional. El trabajo se presenta como un paso hacia una evaluación más granular y condicionada por prompts del creciente ecosistema de modelos de IA generativa. La implementación se pone a disposición pública para facilitar la investigación adicional en este dominio.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de AI cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.