LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints
Este artículo presenta RealInstruct, un referente para evaluar LLMs en instrucciones del mundo real con múltiples restricciones, y propone DeCRIM, un proceso de autocorrección que permite a los modelos de código abierto superar a GPT-4 mediante la descomposición de instrucciones, la crítica de respuestas y el refinamiento de resultados.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Autocorrección de LLM con DECRIM
Planteamiento del Problema
Aunque los Grandes Modelos de Lenguaje (LLMs) han demostrado capacidades impresionantes en el seguimiento de instrucciones, estudios recientes indican que tienen dificultades significativas con instrucciones que contienen múltiples restricciones simultáneas (por ejemplo, un tono específico, longitud y restricciones negativas como "sin hashtags"). Los benchmarks existentes para evaluar esta capacidad dependen en gran medida de datos sintéticos, lo que puede no capturar la complejidad, el matiz y la dificultad artificial de las solicitudes de usuarios del mundo real. Además, los enfoques actuales de autocorrección a menudo asumen la independencia de las restricciones o se centran en tipos de restricciones específicos, lo que limita su aplicabilidad en escenarios de múltiples restricciones abiertos. También existe una brecha en métodos de evaluación fiables y rentables para estas instrucciones complejas, ya que la evaluación basada en reglas suele ser inviable para tareas abiertas.
Metodología
1. Benchmark REALINSTRUCT
Para abordar la dependencia de los datos sintéticos, los autores introducen REALINSTRUCT, el primer benchmark diseñado para evaluar LLMs en instrucciones multiconstraint del mundo real.
- Fuente de Datos: Derivada de consultas reales de usuarios a asistentes de IA (obtenidas de ShareGPT), filtrada para retener solo instrucciones en inglés que contengan restricciones.
- Estructura: Cada instrucción se descompone en una Tarea (objetivo principal), Contexto y una lista de Restricciones granulares.
- Escala: El conjunto de prueba contiene 302 instrucciones con 1,055 restricciones; el conjunto de validación contiene 842 instrucciones con 2,500 restricciones.
- Protocolo de Evaluación: Debido a la naturaleza abierta de los datos, el benchmark emplea un enfoque de LLM-como-Juez (LLM-as-a-Judge). Las restricciones se evalúan individualmente y los resultados se agregan en una métrica de precisión a nivel de instrucción.
2. Validación mediante LLM-como-Juez
Los autores investigan la fiabilidad del uso de LLMs para evaluar la satisfacción de restricciones, comparando modelos propietarios (GPT-4, GPT-4-Turbo, GPT-3.5-Turbo) y modelos de código abierto (Mistral, Vicuna, Zephyr) frente a anotaciones humanas.
- Dataset EvalJudge: Un conjunto de prueba de 1,000 tríos de instrucción-restricción-respuesta con etiquetas de verdad fundamental verificadas por humanos.
- Estrategias: Se probaron varias estrategias de adaptación, incluyendo el Aprendizaje en Contexto (ICL) con prompting de Cadena de Pensamiento (CoT) y el ajuste fino débilmente supervisado para modelos de código abierto.
- Hallazgo: GPT-4-Turbo con prompting de CoT surgió como el evaluador más rentable y fiable, superando significativamente a los modelos de código abierto en la detección de restricciones no satisfechas.
3. Pipeline DECRIM (Descomponer, Criticar y Refinar)
Para cerrar la brecha de rendimiento entre los modelos de código abierto y los propietarios, los autores proponen DECRIM, un pipeline de autocorrección basado en enfoques de Sistema 2. Opera sin asumir la independencia de las restricciones y consta de cuatro pasos iterativos:
- Respuesta Inicial: El LLM genera una respuesta a la instrucción original.
- Descomposición: Un modelo Descomponedor desglosa la instrucción original en una lista de restricciones granulares que deben seguirse.
- Crítica: Un modelo Crítico evalúa la respuesta frente a cada restricción. Si todas se satisfacen, el proceso termina. Si no, el Crítico proporciona retroalimentación en lenguaje natural especificando qué restricciones fueron violadas.
- Refinamiento: El LLM subyacente utiliza la retroalimentación, la instrucción original y la respuesta previa para generar una salida mejorada.
Este ciclo se repite hasta que se cumplen las restricciones o se alcanza un número máximo de iteraciones ().
Contribuciones Clave
- REALINSTRUCT: Un nuevo benchmark que comprende solicitudes reales de usuarios a asistentes de IA, ofreciendo una evaluación más realista del seguimiento de instrucciones con múltiples restricciones en comparación con los conjuntos de datos sintéticos.
- Pipeline DECRIM: Un marco de autocorrección que descompone las instrucciones, critica las respuestas mediante un modelo Crítico dedicado y refina las salidas. Es el primer enfoque de Sistema 2 para instrucciones con restricciones que opera sin asumir la independencia de las restricciones.
- Análisis Sistemático de LLM-como-Juez: La primera evaluación sistemática de modelos de código abierto y propietarios como jueces para la satisfacción de restricciones, identificando a GPT-4-Turbo con CoT como una alternativa fiable y rentable a la anotación humana.
Resultados
Rendimiento del Benchmark (REALINSTRUCT & IFEval)
- Limitaciones de la Línea Base: Incluso el modelo propietario GPT-4 falla en cumplir al menos una restricción en más del 21% de las instrucciones en REALINSTRUCT. Los modelos de código abierto (por ejemplo, Mistral 7B) generalmente rinden por debajo de GPT-4, aunque superan a GPT-3.5.
- Eficacia de DECRIM:
- Retroalimentación Débil: Utilizando un Mistral débilmente supervisado como Crítico (sin datos externos), DECRIM mejoró el rendimiento de instrucción de Mistral en un 7.3% en REALINSTRUCT y un 8.0% en IFEval en comparación con una línea base de "Asegúrate de que" (Make sure).
- Retroalimentación Fuerte: Cuando se le proporcionó retroalimentación fuerte (Crítico Oráculo o GPT-4), los LLMs de código abierto con DECRIM superaron a GPT-4 en ambos benchmarks. Específicamente, con un Crítico Oráculo, Mistral alcanzó una precisión de instrucción del 93.7% en REALINSTRUCT (frente al 78.8% de GPT-4) y un 80.4% en IFEval (frente al 79.3% de GPT-4).
- Límites de la Autocorrección: El refinamiento estándar (usar el propio modelo como su propio crítico) produjo ganancias mínimas o caídas en el rendimiento, lo que resalta la necesidad de un modelo Crítico externo o distinto.
Fiabilidad de la Evaluación
- GPT-4-Turbo: Con el prompting de CoT, redujo los costes de evaluación en un 57% en comparación con GPT-4, mientras mejoraba el Macro F1 en un 7.0% y el F1 Negativo (detección de violaciones) en un 19.0%.
- Jueces de Código Abierto: Los modelos de código abierto vanilla fueron jueces poco fiables, mostrando a menudo un comportamiento de permisividad o aleatorio. Sin embargo, el ajuste fino débilmente supervisado sobre rastros de razonamiento de GPT-4 mejoró significativamente su capacidad para detectar restricciones no satisfechas.
Significado y Reivindicaciones
El artículo afirma que seguir instrucciones del mundo real con múltiples restricciones sigue siendo un desafío significativo para los modelos de vanguardia, con incluso GPT-4 fallando frecuentemente. Los autores postulan que el pipeline DECRIM aborda esto eficazmente al desacoplar la generación de la respuesta del proceso de evaluación y refinamiento.
El trabajo demuestra que:
- Los datos del mundo real son distintos: Los benchmarks sintéticos no capturan plenamente los desafíos de las restricciones reales de los usuarios, lo que hace necesario benchmarks como REALINSTRUCT.
- La calidad de la retroalimentación es primordial: El éxito de la autocorrección depende fuertemente de la calidad de la retroalimentación del Crítico. Mientras que los modelos de código abierto luchan por autocorregirse, pueden alcanzar un rendimiento superior a los modelos propietarios cuando se les proporciona retroalimentación externa de alta calidad.
- Viabilidad del Sistema 2: El enfoque DECRIM valida la utilidad de las técnicas de Sistema 2 (descomposición y refinamiento iterativo) para el seguimiento de instrucciones complejas, sugiriendo que los modelos de código abierto pueden ser competitivos con sus contrapartes propietarias si están equipados con pipelines de corrección robustos.
Los autores concluyen que, aunque DECRIM introduce una carga computacional, ofrece un camino viable para mejorar las capacidades de seguimiento de instrucciones, particularmente cuando existen mecanismos de retroalimentación fuertes disponibles. Se sugiere como trabajo futuro refinar los componentes del pipeline e integrar DECRIM con otros enfoques de Sistema 2 como la auticonsistencia.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.