← Últimos artículos
💻 computer science

Testing the capability and performance of Claude Sonnet 4 on the GRE physics test

Este artículo demuestra que Claude Sonnet 4 logró una puntuación escalada perfecta de 990 en un examen de práctica de GRE Physics de 70 preguntas, superando significativamente la hipótesis de los autores de un 90% de precisión y resaltando las sólidas capacidades del modelo en la resolución de problemas científicos complejos.

Autores originales: Theodore Hamilton

Publicado 2026-07-20
📖 1 min de lectura☕ Lectura para el café

Autores originales: Theodore Hamilton

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Evaluación de Rendimiento de Claude Sonnet 4 en el Examen de Física del GRE

Planteamiento del Problema
A medida que la inteligencia artificial (IA) se integra cada vez más en la educación de nivel K–12 y postsecundario, surge la necesidad de evaluar las capacidades de los Modelos de Lenguaje Extensos (LLM) para resolver problemas científicos complejos y demostrar pensamiento crítico. Si bien investigaciones previas indican que las IA de propósito general suelen tener dificultades con problemas de física de nivel universitario superior (alcanzando solo un 35–39% de precisión en campos como la óptica y la termodinámica), los nuevos modelos especializados mejorados con capacidades de procesamiento avanzadas sugieren un potencial de mejora. Este estudio buscó evaluar el rendimiento de Claude Sonnet 4, un LLM desarrollado por Anthropic, frente a una evaluación de física estandarizada de nivel de posgrado para determinar si podía superar una tasa de precisión del 90% en tareas complejas de resolución de problemas.

Metodología
Los investigadores utilizaron un examen de práctica de la física del GRE de 70 preguntas (Formulario GR1775) disponible públicamente, proporcionado por el Educational Testing Service (ETS). El estudio empleó el siguiente protocolo:

  • Modelo: Claude Sonnet 4, identificado en ese momento como el modelo gratuito más avanzado de Anthropic.
  • Entrada: Cada una de las 70 preguntas fue enviada individualmente al modelo mediante una captura de pantalla, sin proporcionar texto o contexto adicional.
  • Protocolo de Calificación: Las respuestas se compararon con la clave de respuestas oficial de la ETS. Debido a los límites de mensajes, se iniciaron múltiples sesiones de chat para procesar todas las preguntas. Se otorgó crédito parcial si el modelo respondía incorrectamente en el primer intento pero correctamente en un segundo intento; de lo contrario, las preguntas se marcaban como totalmente incorrectas.
  • Análisis: Se contabilizó el número total de respuestas correctas y se convirtió a una puntuación escalada utilizando la hoja de conversión oficial del GRE. El estudio también analizó el rendimiento en áreas de contenido específicas (Mecánica Clásica, Electromagnetismo, Mecánica Cuántica, Física Atómica, etc.) y comparó el rendimiento del modelo contra la media de precisión de los examinados humanos para preguntas específicas.

Resultados Clave
El estudio arrojó los siguientes hallazgos cuantitativos y cualitativos:

  • Rendimiento General: Claude Sonnet 4 respondió correctamente 65 de las 70 preguntas, logrando una tasa de precisión de aproximadamente el 93%. Esto corresponde a una puntuación escalada de 990, que es la puntuación máxima posible en el examen de física del GRE.
  • Desglose por Área de Contenido:
    • Mecánica Cuántica y Física Atómica: El modelo alcanzó una precisión del 100% (16/16 preguntas).
    • Electromagnetismo: El modelo obtuvo 12.5/13 correctas.
    • Mecánica Clásica: Esta fue el área más débil del modelo, con una puntuación de 12.5/14 correctas (89% de precisión).
  • Correlación con el Rendimiento Humano: No se encontró correlación entre el rendimiento del modelo y la media de precisión de los examinados humanos. Para las 17 preguntas donde la precisión humana estaba entre el 20–30%, el modelo perdió solo 0.5 puntos en un solo problema.
  • Análisis de Errores: Cuando ocurrieron errores, estos se atribuyeron a una síntesis incorrecta, como el cálculo erróneo de proporciones o el análisis defectuoso de detalles específicos dentro del enunciado del problema, en lugar de una falta de comprensión conceptual. El modelo proporcionó consistentemente explicaciones detalladas para sus respuestas elegidas, lo que facilitó la identificación de errores de razonamiento específicos.

Significancia y Reivindicaciones
El documento sostiene que los resultados respaldan la hipótesis de que los LLM de grado de consumo pueden resolver y explicar preguntas en dominios científicos avanzados con alta competencia. Los autores concluyen que:

  1. Capacidad de Alto Nivel: Los LLM son capaces de alcanzar puntuaciones máximas en exámenes de física de posgrado, lo que sugiere un potencial transformador para el estudio y la educación científica.
  2. Utilidad Educativa: Estos modelos sirven como herramientas poderosas para trabajar problemas complejos sin error humano, siempre que se reconozcan sus limitaciones en el razonamiento de conceptos filosóficos o cuestiones cosmológicas no resueltas.
  3. Trayectoria Futura: A través del aprendizaje automático continuo y el entrenamiento del usuario, los autores sugieren que los modelos podrían alcanzar eventualmente el 100% de precisión. También señalan que el rendimiento puede variar según las versiones del modelo (por ejemplo, Opus vs. Sonnet) y que las suscripciones pagas pueden ofrecer ventajas adicionales en cuanto a asignación de uso y calidad del modelo.

El estudio enfatiza que, si bien la IA demuestra una promesa significativa, sigue sujeta a limitaciones en la síntesis detallada y aún no posee las capacidades generativas completas (como la generación de imágenes o video) que se encuentran en otros modelos competidores como ChatGPT.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →