← Últimos artículos
💻 computer science

Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch

Este artículo evalúa la efectividad de un conjunto de votación de Modelos de Lenguaje de Gran Escala para filtrar el ruido de los registros de conceptos matemáticos derivados de Wikidata del proyecto Mathswitch, identificando patrones de desacuerdo específicos para informar futuras estrategias de remediación.

Autores originales: Katja Berčič, Slobodan Stanojevikj

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Katja Berčič, Slobodan Stanojevikj

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una biblioteca masiva y caótica llamada Mathswitch. Su objetivo es reunir cada libro, nota y diagrama sobre matemáticas de todo internet —desde libros de texto formales hasta artículos casuales de Wikipedia— y ponerlos todos en un mismo estante para que puedas encontrarlos todos a la vez.

¿El problema? La biblioteca está intentando extraer estos libros de un tablero de anuncios gigante y público llamado Wikidata. Este tablero de anuncios es editado por todo el mundo, así que es un poco desordenado. A veces, una publicación sobre un "árbol" (el tipo de árbol que puedes escalar) se mezcla con una publicación sobre un "árbre" (el tipo de estructura matemática). A veces, una publicación sobre una "función" (el trabajo que haces) se mezcla con una publicación sobre una "función" (una fórmula matemática).

Si la biblioteca simplemente tomara todo lo que se parece un poco a las matemáticas, los estantes estarían abarrotados de basura que no es matemática, lo que dificultaría encontrar lo que realmente importa.

La Solución: Un Panel de Jueces de IA

Para limpiar el desastre, los autores de este artículo construyeron un panel de votación de jueces de IA. Imagina un tribunal con tres jueces diferentes (específicamente, tres modelos de IA distintos: DeepSeek, Gemma y Qwen).

Así es como funciona el proceso:

  1. El Juicio: Cuando llega un nuevo elemento de Wikidata, el sistema le muestra el elemento a los tres jueces de IA.
  2. La Evidencia: Los jueces ven el nombre del elemento, una breve descripción, algunas palabras clave y un fragmento del texto del artículo.
  3. El Veredicto: Cada juez pregunta: "¿Es esto un concepto matemático real?". Votan o No y dan un puntaje de confianza.
  4. La Regla de la Mayoría: Si dos de los tres jueces dicen "Sí", el elemento se queda en el estante de matemáticas. Si dos dicen "No", el elemento se desecha.

Cómo lo Probaron

Los autores necesitaban saber si sus jueces de IA realmente eran buenos en su trabajo. Realizaron algunas pruebas:

  • La Prueba "Fácil" (Control Positivo): Tomaron 1,000 elementos que ya se sabía que eran de matemáticas porque tenían una etiqueta especial de "MathWorld" (como un sello de oro de aprobación). Les pidieron a los jueces de IA que clasificaran estos elementos.

    • Resultado: Los jueces fueron increíblemente precisos, identificando correctamente el 98.2% de estos elementos como matemáticas. Incluso cuando los autores ocultaron la etiqueta "MathWorld" para que los jueces no pudieran hacer trampa buscando el sello, los jueces lo hicieron bien casi siempre. Esto demostró que los jueces realmente estaban leyendo el contenido, no solo buscando atajos.
  • La Prueba "Difícil" (Control Negativo): Tomaron 500 elementos sobre Física (como la "órbita de Kepler" o la "entropía").

    • Resultado: Los jueces dijeron correctamente "No, esto no es matemáticas" para la mayoría de ellos. Sin embargo, para los 10 elementos que estaban en la línea borrosa entre la física y las matemáticas (como las ecuaciones complejas utilizadas en ambos campos), los jueces dijeron con confianza "Sí". Esto demostró que los jueces entienden que la matemática y la física a menudo se traslapan, en lugar de simplemente rechazar ciegamente cualquier cosa que no sea matemática pura.

Dónde se Confundieron los Jueces

El artículo también analizó las pocas veces que los jueces cometieron errores o no estuvieron de acuerdo con el "estándar de oro" (MathWorld). Encontraron tres razones principales para la confusión:

  1. El Problema de la "Descripción Vacía": A veces, una entrada de Wikidata solo dice "Concepto Matemático" como su descripción. Es como un libro con una portada en blanco. Los jueces, al no tener contexto, adivinaron basándose solo en el título. Por ejemplo, pensaron que "Wiener sausage" (salchicha de Wiener) era comida y "Fence" (cerca/valla) era construcción, sin darse cuenta de que eran nombres de conceptos matemáticos oscuros. ¿La solución? Dar a los jueces más contexto antes de que voten.
  2. El Sesgo de "Demasiado Estricto": Uno de los jueces (Gemma) era muy estricto. Si un concepto matemático se utiliza en el mundo real (como en la biología o la ingeniería), este juez pensaba: "Eso es una aplicación, no la matemática en sí misma", y votaba "No". Los otros jueces eran más flexibles y lo reconocían como matemática.
  3. El Desajuste de "Alcance": A veces, la enciclopedia MathWorld incluye cosas que están relacionadas con las matemáticas (como herramientas de procesamiento de señales o curiosidades históricas) que los jueces de IA consideraron que estaban demasiado alejadas para ser llamadas "conceptos matemáticos". Esto no fue un error de los jueces; fue simplemente una diferencia de opinión sobre qué tan estrictamente se define la "matemática".

La Conclusión

El artículo concluye que usar un panel de votación de jueces de IA es una forma práctica y efectiva de filtrar el ruido de Wikidata. No necesita ser enseñado con un conjunto masivo de datos de ejemplos etiquetados; la IA ya sabe cómo suena la matemática.

Al usar este sistema, Mathswitch puede limpiar automáticamente su biblioteca, manteniendo los conceptos matemáticos reales y desechando la basura que no es matemática, mientras aprende de sus errores para mejorar en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →