← Últimos artículos
💻 computer science

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

Este estudio evalúa cinco modelos de lenguaje de código de pesos abiertos en la generación de una aplicación React Native en hardware GH200, revelando que las clasificaciones de SWE-Bench no predicen el rendimiento, identificando hallazgos novedosos sobre la configuración de temperatura y la adaptación web, y demostrando que la escuela de eficiencia arquitectónica ofrece resultados equivalentes a un séptimo del costo de hardware comparado con la escuela de escala.

Autores originales: Alex Potanin

Publicado 2026-04-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Alex Potanin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que eres un jefe de construcción que quiere construir una casa (una aplicación móvil) usando cinco arquitectos diferentes. Todos estos arquitectos son "Inteligencias Artificiales" muy famosas y, según sus diplomas (los rankings de pruebas como SWE-Bench), deberían ser los mejores del mundo.

El autor de este artículo, Alex, decidió ponerlos a prueba en un fin de semana real, usando una computadora superpotente (una NVIDIA GH200) en Australia. El objetivo no era que resolvieran un examen teórico, sino que construyeran una aplicación real que cumpliera tres reglas simples:

  1. Que los usuarios puedan crearse una cuenta y entrar.
  2. Que cuenten cuántos canguros ve cada persona cada día.
  3. Que funcione tanto en el móvil como en la web.

Aquí te explico qué pasó, usando analogías sencillas:

1. El Gran Engaño de los Diplomas (Los Rankings)

Lo más sorprendente es que los arquitectos con los mejores diplomas fallaron, y el que tenía un diploma "más modesto" ganó.

  • El ganador: Un modelo llamado Kimi-K2.5 (en una versión comprimida). No era el más grande ni el más famoso en las pruebas teóricas, pero entregó la casa lista para habitar, con todas las luces encendidas.
  • Los perdedores: Modelos como GLM-5.1 y DeepSeek-V3.2, que tenían las puntuaciones más altas en los exámenes oficiales, construyeron casas que no se podían usar.
    • Analogía: Es como si el arquitecto con el premio Nobel de Ingeniería diseñara una casa que requiere que el dueño traiga su propia tubería de gas y su propia electricidad desde la calle para que funcione (demasiado complejo), mientras que el arquitecto "menos premiado" te entrega la casa con todo conectado y listo.

2. Tres Problemas "Invisibles" que nadie vio venir

Durante el experimento, Alex descubrió tres problemas técnicos que los rankings no detectan, pero que arruinan el trabajo en la vida real:

  • El problema del "Silencio Mortal" (Temperatura 0):
    Las herramientas de programación suelen configurar a las IAs para que sean "deterministas" (que no se arriesguen), poniéndolas en modo "temperatura cero". Pero para los modelos que "piensan" mucho (como Kimi), esto es como pedirle a un actor que recite un monólogo sin respirar ni moverse. ¡Se quedaban congelados!

    • Lección: A veces, para que una IA "razone" bien, hay que dejarle un poco de libertad (temperatura alta), o se queda en un bucle infinito pensando sin escribir nada.
  • El problema del "Chisme que se mete en el plano" (Filtración de pensamientos):
    Algunos modelos (como DeepSeek) tienen una fase de "pensamiento" antes de escribir el código. A veces, el modelo empieza a hablarle al usuario ("Vamos a empezar con App.js...") y la herramienta de construcción confunde ese chisme con el nombre del archivo.

    • Analogía: Es como si el arquitecto escribiera en el plano: "¡Hola! Vamos a construir la cocina", y la máquina constructora, confundida, llamara a la cocina "¡Hola! Vamos a construir la cocina" en lugar de "Cocina". El resultado: la casa se construye en un callejón sin salida y nadie puede entrar.
  • El problema del "Traductor que no sabe de Web" (Alert.alert):
    Todos los modelos usaron una función nativa de móviles para mostrar mensajes de error (como una ventana emergente). El problema es que en la web, esa función no hace nada; es como un botón que no tiene cable.

    • Analogía: Todos los arquitectos instalaron una alarma de incendios que solo funciona si hay humo de leña, pero como la casa es eléctrica, la alarma nunca suena. El código es perfecto, pero la casa no es segura. Nadie en los exámenes teóricos había probado esto.

3. La Granja de Computadoras vs. La Computadora de Casa

El artículo también habla de dinero y hardware.

  • Hay dos tipos de modelos: los "Gigantes" (que necesitan computadoras de millones de dólares, como la que usaron en Australia) y los "Eficientes" (que funcionan en computadoras de gama alta de consumidores).
  • El hallazgo: Los modelos "Eficientes" (como MiniMax) rinden igual de bien que los "Gigantes" en tareas reales, pero cuestan 7 veces menos en hardware.
  • Analogía: ¿Por qué comprar un camión de carga gigante (Hardware costoso) para llevar una sola caja de herramientas a la oficina, si una camioneta pequeña (Hardware eficiente) hace el mismo trabajo y gasta mucha menos gasolina?

Conclusión: ¿Qué nos enseña esto?

Si quieres contratar a una IA para que escriba tu software en 2026:

  1. No te fíes ciegamente de los rankings: Un modelo puede ser el rey de los exámenes teóricos y ser un desastre en la práctica.
  2. Pruébalo en tu propio trabajo: Antes de gastar dinero en hardware, pide a la IA que haga una tarea pequeña y real de tu proyecto.
  3. La calidad no es solo tamaño: A veces, un modelo más pequeño y bien ajustado (como el Kimi en 3 bits) es más inteligente y útil que un gigante mal configurado.

En resumen: Los rankings te dicen quién sabe la teoría, pero solo la prueba real te dice quién sabe construir.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →