A Pathway for Assessing Grey Literature: Leveraging AI to Extract Conference Metadata and Organiser Information from Calls for Papers
Este artículo presenta COCI, un marco de trabajo basado en IA que aprovecha los Modelos de Lenguaje Extensos para automatizar la extracción y estructuración de metadatos granulares a partir de convocatorias de artículos (Calls for Papers) no estructuradas, permitiendo así el análisis sistemático de metaciencia de la literatura gris previamente pasada por alto.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
A menudo se imagina la ciencia como una colección de libros terminados, ordenados meticulosamente en los estantes de una biblioteca, donde los investigadores estudian el pasado leyendo lo que ya se ha publicado. Pero una vasta cantidad de conocimiento importante existe fuera de estos canales formales. Esto se denomina "literatura gris", un término para informes, documentos de trabajo y documentos que nunca llegan a las revistas estándar. Entre los más vitales de estos se encuentran las "convocatorias de artículos" (calls for papers), que son anuncios que invitan a los investigadores a presentar su trabajo a próximas conferencias. Estos documentos son el sistema de alerta temprana de la ciencia, revelando nuevas tendencias y campos emergentes antes de que lleguen a escribirse en un artículo final. Sin embargo, debido a que estos anuncios están dispersos por la web en formatos desordenados y no estandarizados, ha sido casi imposible estudiarlos a gran escala. Las herramientas informáticas tradicionales tienen dificultades para leerlos, dejando un enorme vacío en nuestra comprensión de cómo se forman y evolucionan realmente las comunidades científicas.
Para cerrar esta brecha, un equipo de investigadores ha desarrollado un nuevo sistema llamado COCI, que utiliza inteligencia artificial avanzada para leer y organizar estos anuncios caóticos. El sistema actúa como un archivista digital, tomando el texto bruto y no estructurado de una invitación a una conferencia y convirtiéndolo en una lista de hechos limpia y organizada. Identifica el nombre del evento, el año y la ubicación, y, lo más importante, a las personas que dirigen el espectáculo. No solo enumera nombres; determina quiénes son estas personas, a qué instituciones pertenecen y qué roles específicos desempeñan, como organizar un taller o gestionar la publicidad. Al hacer esto, el sistema transforma un revoltijo de texto en una base de datos estructurada que los científicos pueden utilizar realmente para analizar el panorama de la investigación.
Los investigadores probaron este sistema alimentándolo con cuarenta anuncios de conferencias diferentes de una amplia variedad de campos, que van desde la informática e ingeniería hasta la odontología y la arqueología. El objetivo era ver si el sistema podía manejar la realidad desordenada de Internet, donde una conferencia podría enumerar sus organizadores en un párrafo simple y otra podría ocultar la información en una tabla compleja. El sistema extrajo con éxito los detalles clave de los cuarenta documentos. Identificó la serie de conferencias, la edición específica y la ubicación geográfica. También extrajo los nombres de cada persona en el comité organizador y los vinculó con registros científicos públicos para verificar sus identidades y afiliaciones. Este proceso permite al sistema distinguir entre diferentes personas que podrían compartir el mismo nombre y confirmar qué universidad u organización representan actualmente.
Uno de los logros más significativos del sistema es su capacidad para dar sentido a los temas que cubren estas conferencias. Cuando un anuncio de conferencia enumera sus áreas de interés, a menudo utiliza un lenguaje informal o frases únicas. El sistema traduce estas en conceptos científicos estándar, creando un puente entre el lenguaje casual del anuncio y el vocabulario formal utilizado por los investigadores de todo el mundo. También vincula el nombre de la conferencia con bases de datos globales existentes, asegurando que el evento sea identificado correctamente incluso si el nombre es ligeramente diferente o si la conferencia se ha celebrado bajo varios títulos a lo largo de los años. Esto crea un mapa fiable del evento dentro del mundo más amplio de la ciencia.
Sin embargo, los investigadores fueron cuidadosos al señalar que el sistema no es perfecto y requiere supervisión humana para detectar sus errores. En un caso de prueba, el sistema asumió incorrectamente que cada miembro de un comité organizador pertenecía a la misma universidad porque el texto original no especificaba sus afiliaciones individuales. Los investigadores incorporaron un control de seguridad en el sistema para detectar este tipo de error, reconociendo que es altamente improbable que un comité entero provenga de una sola institución. En otro caso, el sistema vinculó a un investigador con la persona equivocada en una base de datos pública porque la propia base de datos contenía información contradictoria. Estos ejemplos muestran que, si bien la herramienta es poderosa, todavía depende de la calidad de los datos a los que accede y de la lógica de las reglas que sigue.
El objetivo final de este trabajo es desplazar el enfoque del análisis científico hacia estos eventos no tradicionales. Al hacer posible el estudio sistemático de las convocatorias de artículos, el sistema abre la puerta a la comprensión de cómo se construyen las comunidades de investigación desde sus cimientos. Permite el seguimiento de las tendencias emergentes antes de que aparezcan en revistas formales y proporciona una forma de reconocer las contribuciones de las muchas personas que organizan y dan forma a estos eventos, pero que a menudo pasan desapercibidas en las métricas tradicionales. Los investigadores han puesto su herramienta a disposición del público como un proyecto de código abierto, invitando a otros a usarla y mejorarla. Este enfoque sugiere un futuro donde se pueda ver la imagen completa y diversa de la actividad científica, no solo los resultados finales pulidos, sino el proceso dinámico y evolutivo del descubrimiento mismo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.