← Últimos artículos
💬 NLP

PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation

Este artículo presenta PeruMedQA, un conjunto de datos de 8.380 preguntas de exámenes médicos peruanos en español, y demuestra que si bien el modelo MedGemma de 27 mil millones de parámetros alcanza la mayor precisión de referencia, el ajuste fino del modelo MedGemma más pequeño de 4 mil millones de parámetros mediante LoRA mejora significamente su rendimiento para rivalizar con modelos mucho más grandes, ofreciendo una solución rentable para la IA médica en contextos hispanohablantes de América Latina.

Autores originales: Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

Publicado 2026-06-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El panorama general: Un desafío de examen médico en Perú

Imagina una enorme biblioteca de preguntas médicas utilizadas en Perú para evaluar a los médicos que desean convertirse en especialistas (como cirujanos cardíacos o pediatras). Estas preguntas están escritas en español y cubren desde enfermedades tropicales raras hasta condiciones crónicas comunes.

Los autores de este artículo querían ver si la Inteligencia Artificial (IA) podía aprobar estos exámenes. No se limitaron a preguntar a una sola IA; reunieron una "clase" de diez modelos de IA diferentes (que van desde modelos pequeños y ligeros hasta modelos masivos y de alta potencia) y les pidieron que realizaran la prueba.

La configuración: Construcción del conjunto de datos "PeruMedQA"

Antes de que la IA pudiera realizar el examen, los investigadores tuvieron que construir el examen mismo.

  • La fuente: Descargaron archivos PDF oficiales de exámenes del Consejo Nacional de Residencias Médicas de Perú (CONAREME) que abarcan desde 2018 hasta 2025.
  • La limpieza: Utilizaron código informático para convertir estos PDF en una lista digital de 8,380 preguntas. Incluso un humano verificó las respuestas para asegurar que la computadora no cometiera errores (solo falló en 16 de 8,380, lo cual es increíblemente preciso).
  • La estandarización: Algunos años tenían 4 opciones de respuesta (A, B, C, D) y otros tenían 5 (A, B, C, D, E). Para que fuera una carrera justa, añadieron una opción de "Ninguna de las anteriores" a las preguntas de 4 opciones, de modo que cada pregunta tuviera exactamente 5 opciones.
  • El resultado: Crearon un nuevo conjunto de datos de acceso abierto llamado PeruMedQA. Piensa en esto como un "Examen de la Junta Médica Peruana" estandarizado para la IA.

La carrera: Modelos de IA pequeños vs. grandes

Los investigadores sometieron a los diez modelos de IA a este conjunto de datos. Así fue cómo se desempeñaron los diferentes "atletas":

  1. Los pesos pesados (Los modelos grandes):

    • La estrella: El modelo medgemma-27b (un modelo de 27 mil millones de parámetros) fue el claro campeón. Obtuvo las puntuaciones más altas en casi todas las especialidades, alcanzando casi el 90% de precisión en Psiquiatría. Fue como el medallista de oro olímpico.
    • El gigante: El Llama3-OpenBioLLM-70B (un modelo de 70 mil millones de parámetros) era enorme y potente, pero no siempre vencía al modelo ligeramente más pequeño de 27 mil millones. Demostró que "más grande no siempre es mejor" si los datos de entrenamiento no son los adecuados.
    • El especialista: El OctoMed-7B (un modelo de 7 mil millones) fue sorprendentemente fuerte. En dos áreas específicas —Neurocirugía y Radiología— superó de hecho al gigante de 27 mil millones. Fue como un velocista que vence al corredor de maratón en una carrera corta.
  2. Los pesos ligeros (Los modelos pequeños):

    • La mayoría de los modelos con menos de 10 mil millones de parámetros tuvieron dificultades. A menudo puntuaron por debajo del 50%, lo que apenas es mejor que adivinar.
    • El problema de las alucinaciones: Algunos de estos modelos más pequeños estaban tan confundidos que ni siquiera seguían las reglas. En lugar de decir "A, B, C, D o E", inventaban nuevas letras (como "K") o escribían ensayos largos en lugar de elegir una respuesta. Esto se llama "alucinación". ¡El modelo meditron-7b fue el peor de los casos, fallando al dar una respuesta válida el 66% de las veces!

El arma secreta: El ajuste fino (Fine-Tuning)

Los investigadores tomaron el modelo más pequeño y con menos recursos (medgemma-4b-it) y le dieron una sesión de entrenamiento especial. Este proceso se llama Ajuste Fino (específicamente utilizando una técnica llamada LoRA).

  • La analogía: Imagina a un estudiante inteligente que sabe medicina general pero que nunca ha visto un examen peruano. Los investigadores tomaron a este estudiante y le dieron un curso intensivo usando solo las últimas 8,000 preguntas peruanas (excluyendo el examen de 2025).
  • El resultado: Esta versión "entrenada" del modelo pequeño (medgemma-4b-it-FT) se convirtió en un superhéroe.
    • Dejó de alucinar por completo.
    • Superó a todos los demás modelos pequeños.
    • Incluso venció al modelo masivo de 70 mil millones de parámetros en varias pruebas.
    • Fue el único modelo capaz de resolver de forma única preguntas que ninguna otra IA pudo responder.

Las conclusiones clave

  • El contexto importa: Los modelos de IA entrenados principalmente con datos de EE. UU. o en inglés tienen dificultades con la mezcla específica de enfermedades y estilos médicos que se encuentran en Perú.
  • El tamaño no lo es todo: Un modelo masivo de 70 mil millones de parámetros no ganó automáticamente. Un modelo de 27 mil millones con mejores datos de entrenamiento, o un diminuto modelo de 4 mil millones que fue específicamente "ajustado" con datos locales, funcionaron mejor.
  • El ganador: Para cualquier persona en Perú o países similares de habla hispana que necesite IA médica, el artículo recomienda usar medgemma-27b-text-it para obtener el mejor rendimiento general. Sin embargo, si necesitas algo que se ejecute en computadoras más pequeñas, el medgemma-4b-it ajustado (fine-tuned) es una alternativa fantástica y eficiente que rivaliza con los gigantes.

Lo que el artículo no dice

El artículo evalúa estrictamente qué tan bien pueden estas IA responder preguntas de opción múltiple. No afirma que estas IA estén listas para diagnosticar pacientes reales, reemplazar a los médicos o ser utilizadas en hospitales todavía. Es una prueba de referencia (benchmark), no el lanzamiento de una herramienta médica. Los autores enfatizan que, antes de usar estos modelos en el mundo real, deben probarse cuidadosamente para asegurar que no cometan errores peligrosos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →