← Últimos artículos
💬 NLP

FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts

El artículo presenta la participación del equipo FMI@SU en la tarea compartida ToxHabits, donde demostraron que el uso de *few-shot prompting* con GPT-4.1 logra un rendimiento prometedor (F1 de 0.65) en la extracción y clasificación de entidades de hábitos tóxicos en textos clínicos en español.

Autores originales: Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva

Publicado 2026-04-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que este artículo es la historia de un equipo de detectives digitales (de la Universidad de Sofía, en Bulgaria) que se enfrentó a un misterio muy específico: encontrar y clasificar los "vicios" o hábitos tóxicos (como fumar, beber alcohol o usar drogas) dentro de miles de historias médicas escritas en español.

Aquí te lo explico como si fuera una aventura, usando analogías sencillas:

1. El Problema: La Biblioteca del Caos

Imagina que tienes una biblioteca gigante llena de historias médicas (informes de pacientes). El problema es que el 80% de estas historias no están ordenadas en fichas; son como manuscritos escritos a mano, desordenados y llenos de palabras técnicas.

Los investigadores querían encontrar rápidamente frases como "fumaba 20 cigarrillos al día" o "consumió cocaína". Hacerlo a mano sería como buscar una aguja en un pajar, pero con millones de pajas. Además, el idioma es español, lo que añade otra capa de dificultad para las máquinas.

2. La Misión: El Reto "ToxHabits"

El equipo participó en una competencia llamada ToxHabits. La misión era simple pero difícil:

  • Subtarea 1 (La que ellos hicieron): Encontrar las frases que mencionan el vicio (el "disparador") y decir de qué tipo es: ¿Es tabaco? ¿Alcohol? ¿Cannabis? ¿Odrogas?
  • Subtarea 2: (No la hicieron por falta de tiempo) Analizar detalles como "cuánto", "con qué frecuencia" o "desde cuándo".

3. Las Herramientas: El "Cerebro" vs. El "Diccionario"

Para resolver el misterio, probaron dos enfoques muy diferentes:

  • El Enfoque del Diccionario (La vieja escuela): Imagina que tienes una lista de palabras prohibidas (fumar, alcohol, cocaína) y un robot que busca esas palabras exactas en el texto. Es rápido, pero a veces se confunde. Por ejemplo, si el texto dice "no fumador", el robot podría pensar que es un fumador porque vio la palabra "fumador".
  • El Enfoque del "Cerebro" (IA Moderna): Usaron un modelo de Inteligencia Artificial muy avanzado llamado GPT-4.1. Piensa en este modelo como un estudiante brillante que ha leído millones de libros. En lugar de solo buscar palabras, el modelo "lee" y "entiende" el contexto.

4. El Truco Maestro: El "Few-Shot" (Aprendizaje con Ejemplos)

Aquí está la parte más interesante. Al principio, le dijeron al modelo: "Busca vicios" (esto se llama zero-shot). El modelo intentó, pero no fue muy preciso.

Luego, probaron el truco del "Few-Shot" (Pocos ejemplos). Imagina que le das al estudiante brillante un pequeño cuaderno con 5 ejemplos de cómo se ven los vicios en los textos médicos, junto con la respuesta correcta.

  • Ejemplo: "El paciente fumaba" -> Etiqueta: Tabaco.
  • Ejemplo: "Bebió dos copas" -> Etiqueta: Alcohol.

Al darle estos 5 ejemplos antes de pedirle que busque en el resto del texto, el modelo entendió perfectamente la tarea. ¡Funcionó mucho mejor que el diccionario y mejor que el modelo sin ejemplos!

5. Los Resultados: ¿Quién ganó?

  • El Campeón: El modelo GPT-4.1 con los 5 ejemplos (few-shot) fue el mejor. Logró un puntaje de éxito (F1) de 0.65.
  • El Problema de los Límites: Aunque el modelo encontraba la idea correcta, a veces era un poco "glotón".
    • La analogía: Si el texto dice "fuma mucho", el modelo a veces escribía "fuma mucho" en lugar de solo "fuma". O si decía "no fumador", a veces incluía el "no".
    • El modelo a veces atrapaba la frase correcta dentro de una frase más larga, como si quisiera incluir todo el contexto en lugar de solo la palabra clave.

6. ¿Por qué es importante esto?

Este trabajo es como un paso gigante para la medicina en español.

  • Antes, las máquinas eran muy malas entendiendo textos médicos en español.
  • Ahora, con esta técnica, podemos usar una IA que "aprende rápido" con pocos ejemplos para organizar información vital sobre el consumo de drogas.
  • Esto ayuda a los médicos a entender mejor los patrones de salud de la población y a crear mejores tratamientos.

En Resumen

El equipo de la Universidad de Sofía demostró que, si le das a una Inteligencia Artificial un pequeño manual de instrucciones con ejemplos claros (como enseñarle a un niño con dibujos), puede leer textos médicos complejos en español y encontrar los vicios de los pacientes casi tan bien como un experto humano, aunque a veces necesite un poco de ayuda para no incluir palabras de más.

¡Es una prueba de que la IA puede ser una gran aliada para limpiar y organizar el caos de los datos médicos!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →