← Últimos artículos
💻 computer science

Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode

Este estudio demuestra que las serializaciones de JSON Schema equivalentes en validación pueden inducir cambios estadísticamente significativos y prácticamente significativos en las distribuciones de salida de los modelos de lenguaje, revelando que la equivalencia de validación por sí sola es un oráculo de regresión insuficiente para garantizar la robustez distributiva en sistemas desplegados.

Autores originales: Shengyao Sun

Publicado 2026-08-07
📖 4 min de lectura☕ Lectura para el café

Autores originales: Shengyao Sun

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás dando a un robot muy inteligente, pero ligeramente literal, un conjunto de instrucciones para construir un tipo específico de sándwich. Escribes las instrucciones en una hoja de papel. Ahora, imagina que tienes un sello mágico que dice: "Este sándwich es perfecto". Este sello comprueba si tienes todos los ingredientes correctos (pan, queso, jamón) y si no olvidaste accidentalmente la mostaza. Pero aquí está el truco: al sello no le importa el orden en el que escribiste los pasos. Ya sea que digas "Pon el jamón sobre el pan, luego el queso" o "Pon el queso sobre el pan, luego el jamón", el sello da el mismo pulgar arriba de "Perfecto" porque el sándwich final tiene las mismas partes.

En el mundo de la informática, este "sello" se llama JSON Schema. Es un libro de reglas que le dice a los programas informáticos cómo debe ser un fragmento de datos. Cuando le pedimos a la Inteligencia Artificial (IA) que escriba código u organice información, a menudo le entregamos este libro de reglas como un conjunto de instrucciones. La gran pregunta que los investigadores se han estado haciendo es: si barajamos el orden de las instrucciones en el papel —sin cambiar las reglas reales o el sello de "perfecto"—, ¿construye la IA exactamente el mismo sándwich? O bien, ¿se confunde la IA con el nuevo orden y sirve algo ligeramente diferente, aunque todavía pase la prueba del sello? Esto es importante porque si la IA cambia de opinión solo porque reorganizamos las palabras, se vuelve poco fiable para trabajos importantes como registros médicos o informes financieros.

Este artículo es como una historia de detectives donde el autor, Shengyao Sun, investiga si el "cerebro" de la IA es sensible al orden de las palabras en estos libros de reglas. El estudio probó esto pidiendo a diferentes modelos de IA que resolvieran los mismos acertijos usando los mismos libros de reglas, pero con las instrucciones escritas en diferentes órdenes. No lo preguntaron solo una vez; lo preguntaron cinco veces por cada versión para asegurarse de que cualquier cambio no fuera solo cuestión de suerte. Descubrieron que, para algunos sistemas de IA, el orden de las palabras importaba. Cuando se intercambiaba el orden de las propiedades (como "nombre" o "edad"), la IA empezaba a dar respuestas diferentes, aunque las respuestas fueran técnicamente "correctas" según el libro de reglas.

Sin embargo, la historia no es la misma para cada IA. El autor descubrió que esta "sensibilidad al orden" depende enteramente de qué sistema de IA específico estés utilizando. Para los sistemas "Sonnet" y "Qwen", el barajado causó cambios notables en las respuestas —entre un 5% y un 12% más de desacuerdo de lo habitual. Pero para los sistemas "GPT" y "DeepSeek", el barajado apenas marcó la diferencia. El estudio también comprobó si un "Modo JSON" especial (una configuración que le dice a la IA que sea extra cuidadosa con el formato) solucionaría el problema. Sorprendentemente, no lo hizo; la IA seguía confundiéndose por el orden de las palabras incluso en este modo estricto.

La conclusión más importante es que, solo porque un programa informático diga que un conjunto de instrucciones es "válido" o "correcto", no significa que la IA se comportará de la misma manera si retocas el formato. El autor sugiere que ya no debemos confiar solo en el "sello". En su lugar, debemos tratar estos conjuntos de instrucciones como código de software: debemos bloquearlos en un orden estándar (como listar siempre los ingredientes alfabéticamente) y probarlos cuidadosamente antes de dejarlos funcionar en el mundo real. El estudio demuestra que la validación no es suficiente; necesitamos comprobar si el comportamiento de la IA se mantiene estable cuando se reorganizan las instrucciones, porque para algunas IA, el orden de las palabras es secretamente parte de la receta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →