← Últimos artículos
💬 NLP

PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark

Este artículo presenta PersianMedQA, un conjunto de datos bilingüe a gran escala de 20.785 preguntas de exámenes médicos en persa validadas por expertos, para evaluar 41 modelos de lenguaje de última generación y revelar que, aunque los modelos generales de pesos cerrados superan a los modelos especializados en persa, los matices culturales y clínicos en el idioma original siguen siendo críticos para un razonamiento médico preciso.

Autores originales: Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Publicado 2026-05-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un grupo de estudiantes cómo ser médicos, pero tienes que evaluarlos en dos idiomas diferentes: persa (su lengua materna) e inglés (el idioma de la mayoría de los libros de texto médicos).

Este artículo, llamado PersianMedQA, es como un archivo masivo de exámenes de 14 años de antigüedad de Irán. Contiene más de 20.000 preguntas de opción múltiple que cubren 23 especialidades médicas diferentes, desde cirugía cardíaca hasta pediatría. Los autores utilizaron este "banco de exámenes" para ver qué tan bien diferentes "estudiantes" de IA (Modelos de Lenguaje Grandes) pueden responder preguntas médicas en ambos idiomas.

Aquí está el desglose de lo que encontraron, utilizando algunas analogías simples:

1. Los "Estudiantes Estrella" vs. Los "Locales que Luchan"

Los investigadores probaron 41 modelos de IA diferentes.

  • Los "Superestrellas" (Modelos Cerrados): Los mejores resultados fueron como los estudiantes de élite de escuelas privadas que tienen acceso a los mejores recursos. Específicamente, GPT-4.1 (un modelo cerrado y de pago) respondió correctamente aproximadamente el 83% de las preguntas en persa y el 80% de las preguntas en inglés. Fue el ganador claro.
  • Los "Héroes Locales" (Modelos en Persa): Los autores se sorprendieron al descubrir que los modelos construidos específicamente para hablar persa (como Dorna) funcionaron terriblemente. Obtuvieron puntuaciones alrededor del 35%, lo cual es apenas mejor que adivinar. Es como si un estudiante que creció hablando el idioma hubiera olvidado cómo leer los libros de texto médicos en ese mismo idioma. Lucharon para seguir instrucciones y no pudieron razonar a través de los problemas.
  • Los "Estudiantes Especializados" (Modelos Médicos): Los modelos entrenados específicamente con datos médicos tampoco funcionaron tan bien como las "Superestrellas" generales. Ser un "IA médica" no los hizo automáticamente mejores en preguntas médicas en persa.

2. La "Trampa de la Traducción"

Podrías pensar: "Si una IA es inteligente en inglés, simplemente traduce las preguntas en persa al inglés y funcionará".

  • La Realidad: El artículo encontró que, aunque la IA generalmente funciona mejor en inglés, del 3% al 10% de las preguntas solo pueden responderse correctamente en persa.
  • La Analogía: Imagina una receta que dice: "Añade una pizca de azafrán". Si la traduces al inglés, solo dice "azafrán". Pero en el contexto original persa, la receta podría implicar un tipo específico de azafrán cultivado en un pueblo iraní específico que es más barato y común allí. Si traduces la pregunta, pierdes ese contexto local.
  • El Resultado: En algunos casos, la IA dio la respuesta correcta en persa porque entendió las reglas locales (como qué vacunas se administran a qué edad en Irán), pero se equivocó en inglés porque la traducción hizo que pareciera una regla occidental.

3. Más Grande No Siempre Es Mejor

Los investigadores verificaron si hacer el "cerebro" de la IA más grande (más parámetros) ayudaba.

  • El Hallazgo: Para los modelos generales de "Superestrella", más grande era mejor. Pero para los modelos médicos o en persa especializados, simplemente hacerlos más grandes no ayudó. Es como darle a un estudiante una mochila más grande; si no tiene los libros adecuados dentro, una bolsa más grande no lo hace más inteligente. Necesitan los datos correctos, no solo más datos.

4. La Prueba del "Engaño"

Para ver si las IAs estaban realmente pensando o simplemente adivinando basándose en patrones, los investigadores probaron un truco: mostraron a la IA solo las opciones de respuesta sin la pregunta.

  • El Resultado: En la sección de "Ética Médica", la IA obtuvo puntuaciones sorprendentemente altas solo mirando las respuestas. Aprendió que las respuestas que contenían palabras como "autonomía del paciente" o "consentimiento" solían ser las correctas. Fue como un estudiante que no estudió la lección pero sabía que si una respuesta suena muy educada y formal, probablemente sea la correcta. Esto sugiere que las pruebas podrían estar sobreestimando qué tan bien la IA entiende realmente la ética.

5. El Experimento del "Trabajo en Equipo"

Dado que ningún modelo individual era perfecto, los investigadores probaron hacer que los 3 o 5 mejores modelos votaran por la respuesta juntos (como un jurado).

  • El Resultado: Este enfoque de "equipo" ayudó a los modelos de código abierto a mejorar sus puntuaciones ligeramente, pero aún no pudo alcanzar al único modelo "Superestrella" (GPT-4.1).

La Conclusión

El artículo concluye que no puedes simplemente traducir exámenes médicos del inglés a otros idiomas y esperar que la IA funcione bien.

  • El conocimiento médico está profundamente ligado a la cultura local, las leyes y los hábitos (como los calendarios de vacunación).
  • Los modelos de IA actuales, incluso aquellos entrenados en persa, aún no son lo suficientemente confiables para ser confiados con preguntas médicas de alto riesgo en ese idioma.
  • Necesitamos construir una IA mejor y culturalmente consciente específicamente para idiomas de recursos limitados, en lugar de simplemente traducir modelos en inglés.

Nota Importante de los Autores: El artículo establece explícitamente que estos modelos no están listos para ser utilizados como médicos reales. Actualmente solo están siendo probados en preguntas de exámenes y no deben implementarse en hospitales reales sin una supervisión humana estricta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →