← Últimos artículos
🤖 AI

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

Este artículo presenta Imaging-101, un referente de 57 tareas de imagen computacional verificadas por expertos a través de seis dominios científicos diseñado para evaluar agentes de codificación de LLM, revelando que los modelos de frontera actuales tienen dificultades con desafíos específicos del dominio como la selección de algoritmos y el manejo de convenciones físicas, destacando así la necesidad de agentes especializados y aumentados por habilidades para permitir el descubrimiento científico confiable.

Autores originales: Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una caja mágica capaz de convertir una foto borrosa y con ruido de un objeto secreto en una imagen cristalina. En el mundo real de la ciencia, esto no es magia; se llama imágenes computacionales. Los científicos utilizan esto para ver cosas que no pueden tocar directamente, como el interior de un agujero negro, la estructura de un virus o lo que está sucediendo en las profundidades del subsuelo. Pero construir la "receta" para convertir ese desastre borroso en una imagen clara es increíblemente difícil. Requiere un entendimiento de nivel de doctorado en física, matemáticas y programación, además de mucha paciencia para corregir los errores diminutos que arruinan toda la imagen.

Presentamos Imaging-101, un nuevo "examen de conducir" para la Inteligencia Artificial. Los investigadores crearon un desafío con 57 acertijos diferentes (tareas) tomados de artículos científicos reales de seis campos: astronomía, biología, química, ciencias de la tierra, medicina y física. No solo le pidieron a la IA que escribiera código; le pidieron que construyera una máquina completa y funcional que pudiera resolver estos acertijos de principio a fin.

La prueba de tres partes

Para ver si la IA era realmente inteligente o solo tenía suerte, los investigadores le dieron tres formas diferentes de realizar el examen:

  1. El Plan: Primero, la IA tenía que escribir un plano. ¿Podría deducir las matemáticas y los pasos correctos antes de escribir una sola línea de código?
  2. Los Bloques de Lego: Después, tenía que construir partes específicas de la máquina (como los bloques de "preprocesamiento" o "solucionador") y pasar pruebas unitarias pequeñas y estrictas para cada uno.
  3. La Conducción Completa: Finalmente, tenía que ensamblar toda la máquina, ejecutarla y producir una imagen lo suficientemente precisa como para pasar un control de calidad estricto.

Los resultados: La IA es buena hablando, pero mala en física

Los investigadores probaron siete de los modelos de IA más inteligentes disponibles. Esto fue lo que encontraron:

  • El "Plan" estuvo bien: Las IA fueron sorprendentemente buenas escribiendo el plano. El 52,6% de las veces, los modelos superiores (GPT-5.4 y Kimi-k2.5) captaron la idea general correctamente. Pudieron nombrar el tipo de matemáticas adecuado para usar.
  • Los "Bloques de Lego" fueron inestables: Cuando llegó el momento de construir las partes, las cosas se complicaron. La tasa de éxito para construir todas las partes correctamente a la vez cayó entre el 1,8% y el 22,8%.
  • La "Conducción Completa" fue lo más difícil: Solo el 29,8% de las veces el mejor modelo de IA (Claude-4.6-Opus) logró construir una máquina que realmente funcionara y produjera una buena imagen. Los otros lo hicieron mucho peor, con algunos teniendo éxito solo el 7% de las veces.

Las trampas "invisibles"

La parte más interesante del estudio es por qué fallaron las IA. No fallaron porque no pudieran escribir código; fallaron porque pasaron por alto las "reglas secretas" de la física que los científicos aprenden tras años de experiencia.

El artículo denomina a esto "deriva de convención numérica". Imagina que estás horneando un pastel. La IA sabe que la receta dice "añadir harina", pero olvida que en esta cocina específica, debes medir la harina en gramos, no en tazas, y que primero debes tamizarla. El pastel de la IA parece un pastel y huele a pastel, pero tiene el tamaño y la textura incorrectos.

En el estudio, las IA cometieron estos errores específicos:

  • Unidades incorrectas: En una tarea relacionada con la dispersión de la luz, la IA olvidó convertir la "intensidad" (qué tan brillante es la luz) en "amplitud" (qué tan fuerte es la onda). Era como intentar medir la velocidad de un coche en "brillo" en lugar de "millas por hora".
  • Solucionadores incorrectos: La IA elegía una herramienta matemática genérica (como un martillo estándar) cuando el trabajo requería una herramienta especializada (como un escalpelo láser). Decía: "Usaré este método común", a pesar de que el artículo que seguía requería específicamente uno raro y complejo.
  • Falta de normalización: En las exploraciones de resonancia magnética (MRI), la IA olvidó ajustar el hecho de que algunas partes del cuerpo están más cerca del sensor que otras. Esto hizo que la imagen final pareciera tener una sombra extraña, aunque el código se ejecutara sin errores.

La sorpresa de la "Caja Negra"

Los investigadores también probaron un agente de "caja negra" (Claude Code) que tiene acceso a una terminal de computadora real, puede instalar software y puede ver archivos. Este agente lo hizo mucho mejor, teniendo éxito el 56,1% de las veces. Esto sugiere que dar a la IA más libertad para explorar y corregir sus propios errores ayuda, pero incluso con esta ventaja, todavía no es perfecta.

Lo que esto significa

El artículo deja claro que, si bien la IA está mejorando en la escritura de código, todavía lucha con el conocimiento tácito profundo de las imágenes científicas. Es como un estudiante que puede recitar las reglas del béisbol pero no sabe cómo atrapar una bola curva.

Los investigadores descubrieron que las IA a menudo fallan porque dependen de lo que es "estadísticamente común" en sus datos de entrenamiento, en lugar de lo que es físicamente correcto para el problema específico en cuestión. Sugieren que, para solucionar esto, podríamos necesitar construir asistentes de IA que vengan con un "maletín de herramientas" de habilidades específicas de dominio ya verificadas, en lugar de esperar que descubran cada regla de la física desde cero.

En resumen, la IA puede escribir la historia de cómo resolver el acertijo, pero todavía necesita a un experto humano que revise las matemáticas y se asegure de que la física realmente cuadre. El sueño de una máquina de descubrimiento científico totalmente automatizada es todavía un trabajo en progreso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →