← Últimos artículos
🤖 machine learning

Mitigating Errors in LLM-Generated Web API Invocations via Retrieval-Augmented Generation and Constrained Decoding

Este artículo propone y evalúa la Generación Aumentada por Recuperación (RAG) y la Decodificación Restringida (CD) como estrategias complementarias para mejorar la exactitud de las invocaciones de API web generadas por LLM, encontrando que mientras RAG reduce eficazmente las alucinaciones en la generación de la invocación completa, CD proporciona una prevención más fiable de parámetros ilegales y aumenta significativamente la exactitud general en diferentes escenarios.

Autores originales: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir una casa, pero en lugar de contratar a un arquitecto maestro, le pides a un asistente muy inteligente, culto, pero un poco distraído (el Modelo de Lenguaje Extenso, o LLM) que escriba los planos por ti.

El problema es que las "reglas" para construir esta casa no están dentro de la cabeza del asistente. Están escritas en un manual masivo y complejo llamado Especificación OpenAPI (un documento que te dice exactamente qué puertas abrir, qué llaves usar y de qué tamaño pedir los ladrillos).

Si solo le pides al asistente que "construya una puerta", podría adivinar el tamaño equivocado, usar la llave incorrecta o inventar una puerta que no existe en el manual. Esto se llama alucinación.

Este artículo trata sobre darle a ese asistente dos herramientas específicas para evitar que invente reglas y comience a seguir el manual perfectamente.

El Problema: El "Juego de Adivinar"

Los investigadores descubrieron que cuando pedían a los modelos de IA que escribieran código para conectarse a servicios web (como enviar un mensaje a Slack o revisar un Google Calendar), la IA cometía errores constantemente.

  • Elegía la "puerta" equivocada (endpoint).
  • Intentaba usar una llave que no existía.
  • Inventaba funciones que no estaban en el manual.

La Solución: Dos Nuevas Herramientas

El artículo pone a prueba dos formas diferentes de solucionar esto, utilizando un conjunto de datos de tareas de codificación del mundo real.

Herramienta 1: La "Hoja de Trucos" (Generación Aumentada por Recuperación - RAG)

La Analogía: Imagina que estás haciendo un examen, pero se te permite llevar una página específica del libro de texto a la sala. Antes de que la IA escriba su respuesta, un robot bibliotecario (el Recuperador) busca en el enorme manual, encuentra la página exacta sobre la "Puerta" que necesitas y se la entrega a la IA.

  • Cómo funcionó: Los investigadores construyeron un sistema que toma la parte relevante del manual de la API y la pega en el prompt de la IA.
  • El Resultado: Fue un éxito a medias.
    • Bueno: Cuando la IA no sabía qué puerta elegir, la hoja de trucos la ayudó a encontrar la correcta. Evitó que la IA inventara puertas falsas.
    • Malo: Cuando la IA ya sabía qué puerta elegir, la hoja de trucos a veces la confundía. La IA veía una lista de 20 llaves posibles en la hoja de trucos y pensaba: "¡Probablemente debería usar todas ellas!", aunque la tarea solo requería una. Esto hacía que el código fuera desordenado e incorrecto.
    • Veredicto: Ayuda a encontrar el camino correcto, pero puede hacer que la IA sea "demasiado entusiasta" al usar opciones extra que no necesita.

Herramienta 2: Las "Vías de Tren" (Decodificación Restringida - CD)

La Analogía: Imagina que la IA es un tren. Normalmente, el tren puede ir a cualquier parte del mapa, incluso fuera de las vías hacia un pantano (alucinaciones). La Decodificación Restringida es como colocar vías de acero que solo van a destinos válidos. El tren físicamente no puede salirse de las vías.

  • Cómo funcionó: Los investigadores tomaron el manual y lo convirtieron en un conjunto de reglas estrictas (como un laberinto). Mientras la IA intentaba escribir la siguiente palabra de código, el sistema verificaba: "¿Está permitida esta palabra por las reglas?". Si la IA intentaba escribir una puerta falsa o una llave incorrecta, el sistema la bloqueaba y la obligaba a elegir una opción válida.
  • El Resultado: Esta fue la clara ganadora.
    • Cero Alucinaciones: La IA no pudo inventar ni una sola URL, método o argumento falso. Era matemáticamente imposible que rompiera las reglas.
    • Mejor Precisión: Debido a que no podía inventar cosas, el código que escribía tenía muchas más probabilidades de ser correcto.
    • Veredicto: Esta es la herramienta más fiable. Fuerza a la IA a ser obediente al manual.

El Combo: "Hoja de Trucos" + "Vías de Tren"

Los investigadores probaron usar ambas herramientas a la vez.

  • El Resultado: Funcionó muy bien para algunos modelos, obteniendo las puntuaciones más altas. Sin embargo, no fue consistente. A veces, la "Hoja de Trucos" hacía que la IA intentara usar demasiadas opciones, y aunque las "Vías de Tren" la detenían de hacer movimientos ilegales, seguía realizando movimientos innecesarios.
  • Veredicto: Es potente, pero las "Vías de Tren" por sí solas son más seguras y consistentes.

La Conclusión

El artículo concluye que, si bien la IA es excelente escribiendo código, es pésima siguiendo libros de reglas externos y complejos por su cuenta.

  • RAG (La Hoja de Trucos) es como darle a la IA un libro de referencia. Ayuda, pero la IA puede distraerse con demasiada información.
  • CD (Las Vías de Tren) es como construir una jaula alrededor de la IA que solo permite movimientos válidos. Es la forma más eficaz de evitar que la IA invente reglas.

Los investigadores dicen que si quieres que una IA escriba código que se conecte a servicios web sin romperse, no debes confiar solo en la memoria de la IA. Necesitas o bien darle el manual correcto (RAG) o, mejor aún, forzarla a seguir las reglas estrictamente (CD). El enfoque de las "Vías de Tren" es la forma más fiable de asegurar que el código realmente funcione.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →