← Últimos artículos
💬 NLP

FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models

El artículo presenta FormalTCS, un referente validado por expertos que utiliza investigación de vanguardia en la teoría de la computación (TCS) de 2025–2026 para revelar que los modelos de lenguaje extensos actuales presentan dificultades significativas con la investigación automatizada de extremo a extremo, debido principalmente a severas limitaciones en la autoformalización y en la capacidad de generar afirmaciones matemáticas novedosas y de alta calidad.

Autores originales: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

Publicado 2026-08-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La informática teórica es el estudio de cómo se procesa la información y los límites fundamentales de lo que puede ser computado. Es el cimiento de la tecnología moderna, proporcionando las reglas matemáticas que determinan qué problemas pueden ser resueltos por máquinas y con qué eficiencia pueden resolverse. Durante décadas, este campo ha dependido de matemáticos humanos para elaborar definiciones precisas, construir argumentos lógicos y demostrar que sus conclusiones son inamovibles. Recientemente, ha surgido un nuevo tipo de herramienta: los modelos de lenguaje de gran tamaño. Estos son sistemas de inteligencia artificial entrenados en vastas cantidades de texto que pueden leer, escribir y razonar sobre temas complejos. A medida que estos sistemas se han vuelto más potentes, los investigadores han comenzado a preguntarse si pueden hacer algo más que simplemente responder preguntas o resumir textos. ¿Podrían realmente llevar a cabo investigación científica por sí mismos, descubriendo nuevas verdades sobre la computación y demostrándolas con el mismo rigor que un experto humano?

Un equipo de investigadores del Instituto de Tecnología de Harbin se propuso responder a esta pregunta construyendo un nuevo campo de pruebas llamado FORMALTCS. Querían ir más allá de simples cuestionarios o ejercicios de libros de texto y ver si estas inteligencias artificiales podían manejar la realidad desordenada y difícil de la investigación de vanguardia. Para ello, recopilaron 175 problemas reales de las conferencias más prestigiosas del campo, cubriendo temas como algoritmos, complejidad y teoría del aprendizaje automático. Estos no eran problemas inventados; eran los descubrimientos centrales reales de artículos aceptados en 2025 y 2026. Los investigadores trabajaron luego con expertos humanos para traducir estos descubrimientos a un formato que una computadora pudiera verificar, creando un estándar riguroso contra el cual medir la inteligencia artificial.

Los resultados de este experimento revelaron una división marcada entre lo que estos modelos pueden entender y lo que realmente pueden hacer. Cuando los investigadores pidieron a los modelos que leyeran un resumen de alto nivel de un hallazgo de investigación y explicaran la lógica detrás de este en lenguaje sencillo, los modelos se desempeñaron bastante bien. Podían captar la visión general y describir la estrategia de una demostración con una precisión razonable. Sin embargo, en el momento en que la tarea cambió de traducir esas ideas a un lenguaje matemático formal que una computadora pudiera verificar, los modelos chocaron contra un muro. Este proceso, conocido como autoformalización, es el paso donde un investigador humano convierte una idea vaga en un conjunto preciso de reglas y definiciones. En esta etapa crítica, los mejores modelos de inteligencia artificial lograron tener éxito solo aproximadamente el 11.5 por ciento de las veces. Por el contrario, cuando los investigadores les dieron las definiciones matemáticas precisas con las que trabajar, los modelos fueron capaces de construir la demostración final aproximadamente el 28.6 por ciento de las veces.

Esta brecha sugiere que el obstáculo principal para la inteligencia artificial en este campo no es la capacidad de seguir un camino lógico una vez que este ha sido trazado, sino la capacidad de construir el camino mismo. Los modelos luchan por tomar una descripción en lenguaje natural de un problema y convertirla en las definiciones específicas e inequívocas requeridas para que una computadora verifique la solución. Es como si los modelos pudieran leer un mapa y comprender el destino, pero no pudieran dibujar el mapa ellos mismos. Además, cuando los investigadores construyeron un sistema que permitía a los modelos intentar generar sus propias ideas de investigación nuevas desde cero, los resultados fueron aún más reveladores. De 64 nuevas afirmaciones generadas por el sistema, solo seis fueron consideradas por expertos humanos como lo suficientemente novedosas y valiosas como para valer la pena ser perseguidas. El resto eran demasiado similares al trabajo existente, carecían de importancia real o simplemente no podían ser probadas.

El estudio concluye que, si bien estos sistemas de inteligencia artificial se están volviendo mejores en la comprensión y discusión de la informática teórica, todavía están lejos de poder realizar investigación independiente. Carecen del "gusto" o la intuición necesarios para identificar qué nuevas ideas son verdaderamente dignas de exploración, y luchan con la traducción precisa de ideas a reglas formales. El camino hacia el descubrimiento científico totalmente autónomo en este campo requiere resolver dos problemas distintos: mejorar la capacidad de traducir ideas a un lenguaje matemático riguroso y desarrollar un sentido más profundo de lo que hace que una idea de investigación sea valiosa. Hasta que estos obstáculos se superen, el papel de la inteligencia artificial en este campo seguirá siendo el de un asistente poderoso en lugar de un investigador independiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →