← Últimos artículos
💻 computer science

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

El artículo presenta CoRE, un punto de referencia de razonamiento de código fino que evalúa los modelos de lenguaje grandes en la invariancia de implementación y la transparencia del proceso, revelando que los modelos actuales a menudo carecen de robustez entre implementaciones de código equivalentes y dependen de una ejecución superficial en lugar de un razonamiento genuino sobre el estado intermedio.

Autores originales: Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

Publicado 2026-04-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: ¿Realmente los programadores de IA están "pensando"?

Imagina que contratas a un estudiante brillante para resolver un problema de matemáticas. Anota la respuesta final y es correcta. Le das una estrella de oro.

Pero luego, le pides que explique cómo llegó allí. Empieza a inventar números, a mezclar pasos y a confundirse con la mitad del proceso. Sin embargo, de alguna manera, aún llegó al número final correcto.

El Problema: Las pruebas actuales para la IA (Modelos de Lenguaje Grande o LLM) son como esa estrella de oro. Solo verifican la respuesta final. Si la IA obtiene la salida correcta, asumimos que "comprendió" el código. Los autores de este artículo argumentan que esto es una trampa. La IA podría estar adivinando o usando atajos (heurísticas) en lugar de simular realmente cómo se ejecuta el código en su "mente".

La Solución: CoRE (La "Prueba de Honestidad" para el Código)

Los autores crearon una nueva referencia llamada CoRE (Razonamiento de Código). En lugar de simplemente preguntar: "¿Cuál es la respuesta?", CoRE hace dos preguntas mucho más difíciles:

  1. ¿Importa cómo se pregunta? (Invarianza de Implementación)
  2. ¿Sabes qué pasó en el medio? (Transparencia del Proceso)

Analogía 1: "El mismo pastel, diferentes recetas" (Invarianza de Implementación)

Imagina que le pides a un chef que hornee un pastel de chocolate.

  • Prueba Estándar: Le das una receta específica (Receta A). Lo hornea. Sabe bien. Aprobado.
  • Prueba CoRE: Le das cuatro recetas diferentes para el mismo pastel de chocolate exacto.
    • Receta 1: Usa cacao en polvo.
    • Receta 2: Usa barras de chocolate derretido.
    • Receta 3: Usa un orden diferente de mezcla en el bol.
    • Receta 4: Usa una temperatura de horno diferente.

Si el chef es realmente un maestro, debería poder hornear un pastel perfecto independientemente de qué receta use.
El Hallazgo del Artículo: Los modelos de IA fallaron en esto. Eran excelentes horneando el pastel cuando usaban una receta que se parecía a la que ellos solían escribir (su propio "estilo"). Pero cuando se les daba una receta escrita por una IA diferente (un "estilo" diferente), a menudo se equivocaban, aunque las matemáticas fueran idénticas. Estaban "obsesionados con el estilo" en lugar de obsesionados con la lógica.

Analogía 2: El "Director de Cine" vs. El "Spoiler" (Transparencia del Proceso)

Imagina que estás viendo una película.

  • Prueba Estándar: Se le pregunta a la IA: "¿Quién gana la película?". Dice: "El héroe gana". ¡Correcto!
  • Prueba CoRE: Se le pregunta a la IA: "En el minuto 45, cuando el héroe se esconde en el armario, ¿qué está sosteniendo el villano? Y en el minuto 60, ¿cuál es la puntuación del héroe?".

Esto está verificando los estados intermedios.
El Hallazgo del Artículo: Los modelos de IA a menudo acertaban la pregunta de "¿Quién gana?", pero alucinaban los detalles del medio. Adivinaban el final basándose en patrones, pero en realidad no estaban "viendo" la película paso a paso. Estaban ejecutando el código superficialmente sin comprender realmente el viaje.

Cómo Construyeron CoRE

Para hacer esta prueba justa y difícil, los investigadores hicieron dos cosas principales:

  1. Generaron Muchas Versiones: Usaron diferentes modelos de IA para escribir código para los mismos 60 problemas. Esto creó una biblioteca de 255 versiones diferentes de código. Algunas eran largas y desordenadas; otras eran cortas y astutas. Pero todas hacían exactamente lo mismo.
  2. Crearon Preguntas de "Repaso Sorpresa": Para cada pieza de código, generaron preguntas sobre la mitad del proceso.
    • Aritmética: "¿Cuál es el número exacto en esta variable ahora mismo?"
    • Lógica: "¿Es esta condición verdadera o falsa?"
    • Estado: "¿Cuántas veces se ha ejecutado este bucle hasta ahora?"
    • Límite: "¿Qué sucede justo cuando el bucle se detiene?"

Lo que Encontraron (Los Resultados)

Probó 8 de los modelos de IA más inteligentes disponibles (como GPT-5, Claude, DeepSeek, etc.) usando esta nueva referencia. Los resultados fueron sorprendentes:

  • La Brecha de "Sesgo de Estilo": Los modelos eran mucho mejores entendiendo el código escrito por su propia "familia" (por ejemplo, los modelos de OpenAI entendían mejor el código de OpenAI) que el código escrito por otros. Esto sugiere que están memorizando estilos, no aprendiendo lógica universal.
  • La Brecha de "Ejecución Superficial": Muchos modelos obtuvieron la respuesta final correcta pero fallaron en el "repaso sorpresa" sobre los pasos intermedios. Estaban adivinando el destino sin conocer el camino.
  • La Puntuación "RCS": Los autores crearon una nueva puntuación llamada Puntuación de Consistencia de Razonamiento (RCS). Esta puntuación castiga a los modelos que obtienen la respuesta correcta por las razones equivocadas. Si obtienes la respuesta correcta pero fallas en los pasos intermedios, tu puntuación baja a cero.

La Conclusión

El artículo concluye que obtener la respuesta correcta no es suficiente. Solo porque una IA pueda predecir la salida final de un fragmento de código no significa que entienda cómo funciona el código.

Los modelos de IA actuales son como actores que memorizan la última línea de una obra pero olvidan el diálogo entre bastidores. CoRE es la nueva prueba que los obliga a mostrar su trabajo, demostrando que realmente están "pensando" a través del código, no solo adivinando el final.

En resumen: CoRE expone que las IAs más inteligentes de hoy que escriben código a menudo están "fingiendo" al depender de patrones y estilos en lugar de un razonamiento genuino, paso a paso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →