← Últimos artículos
💬 NLP

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

El artículo propone DIRECT, un marco que mejora el rendimiento y la eficiencia de los modelos de lenguaje extensos para el etiquetado de secuencias al combinar la Optimización de Preferencia Directa para un mejor alineamiento con un mecanismo de decodificación de llenado de plantillas controlado que minimiza la computación redundante.

Autores originales: Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

Publicado 2026-07-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot superinteligente que ha leído casi todos los libros de internet. Puede escribir poemas, resolver problemas matemáticos y charlar como un humano. Esto es lo que los científicos llaman un "Modelo de Lenguaje Grande" (LLM, por sus siglas en inglés). Pero aquí está el truco: aunque este robot es un genio en la conversación general, puede ser un desastre cuando le pides que realice trabajos muy específicos y basados en reglas estrictas. Uno de estos trabajos es el "etiquetado de secuencias". Piensa en esto como un juego de "atrapadas" donde tienes que recorrer una oración y pegar una etiqueta específica en cada palabra. ¿Es "Apple" una empresa? ¿Es "Tim" una persona? ¿Es "Marzo" una fecha? El robot necesita que cada una de las etiquetas sea correcta, en el orden exacto, sin palabras extra ni etiquetas faltantes.

El problema es que estos robots están acostumbrados a ser creativos y fluidos. Cuando les pides que sigan reglas estrictas, a veces se confunden, olvidan el formato o simplemente inventan cosas. Además, como son tan habladores, tardan mucho tiempo en procesar cada una de las palabras, lo que los hace lentos y costosos de ejecutar. Los científicos han estado tratando de enseñar a estos robots a seguir mejor las reglas y a ser más rápidos en su trabajo, pero ha sido como intentar enseñarle a un golden retriever a realizar una cirugía de precisión.

Aquí es donde entra un nuevo método llamado DIRECT. Los investigadores detrás de este artículo querían solucionar dos grandes dolores de cabeza: el hecho de que el robot no sigue las instrucciones lo suficientemente bien y que el robot es demasiado lento. No solo intentaron enseñarle al robot de forma más intensa; cambiaron cómo el robot aprende y cómo piensa.

Primero, le dieron al robot un tipo especial de entrenamiento llamado Optimización de Preferencia Directa (DPO). Imagina que le estás enseñando a un perro a traer la pelota. En lugar de solo decirle "Ve a buscar la pelota", le muestras dos formas diferentes en las que podría traerla: una en la que trae la pelota perfectamente y otra en la que la suelta a mitad de camino. Luego le dices al perro: "Me gusta mucho más la primera". Al mostrarle al robot miles de estos ejemplos de "bueno vs. malo", este aprende a entender exactamente qué prefieren los humanos, haciendo que sea mucho más probable que haga el trabajo bien a la primera.

Segundo, y esta es la parte realmente ingeniosa, cambiaron la forma en que el robot escribe su respuesta durante la prueba real. Normalmente, un robot tiene que volver a escribir toda la oración palabra por palabra, incluyendo las palabras que ya conoce. Es como pedirle a un estudiante que vuelva a escribir toda la historia de "Cenicienta" solo para cambiar el color del vestido al final. DIRECT evita este desperdicio. En lugar de reescribir toda la historia, se le da al robot una plantilla de "completar los espacios en blanco". Solo tiene que escribir las etiquetas específicas (las etiquetas) y saltarse el resto. La computadora recuerda el resto de la historia instantáneamente, ahorrando una enorme cantidad de tiempo y energía.

Los resultados de este nuevo enfoque son bastante impresionantes. Los investigadores probaron DIRECT en ocho conjuntos de datos diferentes, que son como diferentes conjuntos de problemas de práctica que involucran cosas como encontrar nombres de personas, lugares y organizaciones. Descubrieron que DIRECT no solo era más preciso que otros métodos de vanguardia, sino también significativamente más rápido. De hecho, en algunas pruebas, fue hasta 9 veces más rápido que los mejores métodos existentes.

Cuando analizaron de cerca por qué funcionaba tan bien, descubrieron que ambas partes de su plan eran esenciales. Si eliminaban el entrenamiento especial (DPO), el robot cometía más errores. Si eliminaban el truco de velocidad de "completar los espacios en blanco", el robot obtenía las respuestas correctas pero tardaba una eternidad en hacerlo. Al combinar el entrenamiento de seguimiento de reglas estrictas con una forma inteligente de saltarse el trabajo innecesario, DIRECT logró lo mejor de ambos mundos: un robot que es tanto un perfeccionista como un velocista.

El artículo muestra que, con el entrenamiento adecuado y un poco de trucos de ingeniería, podemos hacer que estas poderosas herramientas de IA sean mucho más útiles para tareas que requieren precisión. No se trata solo de hacer al robot más inteligente; se trata de enseñarle cómo concentrarse y cómo trabajar de manera eficiente, convirtiendo a un genio hablador en un trabajador confiable y rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →