← Últimos artículos
🤖 machine learning

Probabilistic indirect models for undrained shear strength: addressing significant data missing and variability with advanced imputation and machine learning techniques

Este estudio propone un modelo indirecto probabilístico robusto para predecir la resistencia al corte no drenada integrando técnicas de imputación múltiple para gestionar datos faltantes con una red neuronal mejorada por atención de múltiples cabezales, demostrando una precisión y cuantificación de la incertidumbre superiores en comparación con los métodos convencionales.

Autores originales: Haibin Xiong, Shaoheng Dai, Peng Lan, Xuzhen He, Chenxi Tong, Sheng Zhang, Daichao Sheng

Publicado 2026-08-17
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Haibin Xiong, Shaoheng Dai, Peng Lan, Xuzhen He, Chenxi Tong, Sheng Zhang, Daichao Sheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar construir un rascacielos sobre un parche de tierra que nunca has visto antes. No puedes simplemente adivinar; necesitas saber qué tan fuerte es el suelo, o todo podría hundirse o deslizarse. Este es el trabajo de los ingenieros geotécnicos, quienes estudian la "resistencia al corte no drenada" del suelo; básicamente, cuánta fuerza puede soportar la tierra antes de deslizarse cuando el agua queda atrapada en su interior. Es un poco como intentar averiguar cuánto peso puede sostener una esponja mojada antes de aplastarse. El problema es que obtener esta información es caótico. A veces no se puede probar el suelo directamente porque es demasiado profundo o demasiado costoso, por lo que los ingenieros tienen que adivinar basándose en otras pistas, como la pegajosidad del suelo o cómo un cono lo penetra. Pero estas suposiciones suelen estar llenas de huecos, tanto literal como figuradamente. Los datos faltan, los números varían enormemente de un lugar a otro y las viejas formas de adivinar suelen ser demasiado inciertas para ser seguras.

Este artículo es como un equipo de detectives tratando de resolver el caso de los datos de suelo desaparecidos. Tomaron un archivo masivo y global de "personas desaparecidas" para el suelo arcilloso llamado la base de datos CLAY/10/7490. Este archivo tiene información de 30 países diferentes, pero es un desastre: solo alrededor del 34% de la información está realmente presente. El resto está en blanco, como un rompecabezas al que le han arrancado la mayoría de las piezas. Los investigadores querían ver si podían usar trucos informáticos avanzados para llenar esos espacios en blanco y luego usar esos rompecabezas completados para predecir la resistencia del suelo de manera más precisa que nunca. Probaron tres formas diferentes de adivinar las piezas faltantes y construyeron dos nuevos tipos de "superpronosticadores" para ver qué combinación funcionaba mejor.

La gran búsqueda de las piezas faltantes

El equipo comenzó revisando su gigantesca base de datos, que contenía 7,490 filas de datos sobre arcilla. Pero aquí está el truco: la mayoría de las filas estaban incompletas. Algunas columnas, como los "límites de Atterberg" (que miden qué tan pegajosa y plástica es la arcilla), perdían información solo un 40% de las veces. ¡Pero las columnas sobre mediciones de "CPTU" (que provienen de empujar un cono en el suelo) perdían más del 90% de las veces! Era como intentar resolver un crimen donde el testigo olvidó el 90% de lo que vio.

Primero, probaron un método sencillo y tradicional llamado el modelo Multivariante Normal (MN). Piensa en esto como un profesor que sabe que los estudiantes que son buenos en matemáticas suelen ser buenos en ciencias también. Si a un estudiante le falta una nota de ciencias, el profesor la deduce basándose en su nota de matemáticas. Los investigadores usaron esta lógica para completar los datos faltantes del suelo. Descubrieron que, si bien este método mantenía la "forma" general de los datos, no hacía que las predicciones finales fueran mucho mejores por sí solo. Era como completar el rompecabezas con piezas que parecían correctas pero que no encajaban del todo en la imagen.

Luego, probaron dos métodos más sofisticados: MICE y Miss Forest (MF).

  • MICE es como un grupo de detectives que se turnan para adivinar la información faltante. Un detective adivina un valor basado en las pistas, luego el siguiente detective usa esa suposición para hacer su propia suposición, y siguen y siguen hasta que todos están de acuerdo.
  • Miss Forest es como un equipo de detectives de IA superinteligentes que utilizan un "bosque" de árboles de decisión para descifrar las piezas faltantes. Observan patrones complejos que la matemática simple podría pasar por alto.

Cuando compararon estos métodos, descubrieron que MICE era el mejor para mantener los datos parecidos al suelo original del mundo real. No creaba valores atípicos extraños ni patrones falsos y era el más fiel a la distribución estadística original. Miss Forest estaba bien, pero a veces se volvía un poco demasiado creativa con sus suposiciones. El método MN simple fue el menos preciso para preservar la verdadera naturaleza de los datos, produciendo a menudo resultados que eran "excesivamente concentrados" en comparación con la realidad desordenada original.

Los superpronosticadores

Una vez que tuvieron sus bases de datos "completadas", los investigadores construyeron dos nuevos tipos de modelos de predicción para ver si podían adivinar la resistencia del suelo mejor que los métodos antiguos.

  1. El PXGB (Gradient Boosting Extremo Probabilístico): Imagina un equipo de 100 expertos que votan sobre la respuesta. Si un experto se equivoca, los demás lo corrigen. Este modelo es excelente para manejar datos desordenados, pero sigue siendo solo una máquina de "votación" estándar.
  2. El MHA-PNN (Red Neuronal Probabilística de Atención de Múltiples Cabezales): Este es la estrella del espectáculo. Piensa en este modelo como un detective con un superpoder: la Atención. Al igual que puedes concentrarte en un detalle específico en una habitación llena de gente mientras ignoras el ruido, este modelo tiene "cabezales" que pueden enfocarse en las pistas más importantes de los datos del suelo e ignorar las que no sirven. No solo mira los datos; entiende las relaciones entre las diferentes pistas.

La gran revelación

Los resultados fueron claros. Cuando los investigadores probaron estos modelos, el modelo MHA-PNN aplastó a la competencia, pero la elección de cómo llenar los datos faltantes importaba de una manera específica.

  • Precisión: El modelo MHA-PNN cometió errores que fueron aproximadamente un 72% menores que el modelo PXGB cuando se utilizó la mejor técnica de completado de datos.
  • Confianza: No solo adivinaba el número; daba un rango de valores probables (incertidumbre). Las suposiciones del MHA-PNN eran mucho más ajustadas y fiables. Su "intervalo de confianza" (el rango de posibles respuestas) fue aproximadamente un 96% más estrecho que el del PXGB, lo que significa que estaba mucho más seguro de su respuesta sin equivocarse.
  • El problema de lo "faltante": También descubrieron algo importante: si solo tienes pocas pistas (menos de cuatro piezas de datos), incluso el mejor modelo tiene dificultades. Es como intentar adivinar la trama de una película con solo una escena. Pero una vez que tuvieron suficientes pistas, el modelo MHA-PNN brilló.

Aquí está el giro: Aunque MICE fue el claro ganador en preservar la forma estadística de los datos (haciendo que el rompecabezas completado se pareciera más al mundo real), no era el compañero perfecto para la predicción final. Sorprendentemente, el modelo MHA-PNN logró su mejor desempeño absoluto cuando se combinó con el método de imputación MN. Los investigadores descubrieron que el MN ofrecía el mejor equilibrio para este modelo avanzado específico. Aunque el MN no preservaba la distribución de los datos tan perfectamente como MICE, proporcionó la base más precisa para que el MHA-PNN construyera sus predicciones. Así, la "mejor" combinación no se trataba de elegir el mejor imputador individual o el mejor modelo individual, sino de encontrar la pareja específica donde el modelo de "super-atención" avanzada pudiera realizar su mejor trabajo.

Por qué esto es importante

Este estudio sugiere que podemos construir modelos mucho más seguros y fiables para predecir la resistencia del suelo, incluso cuando nuestros datos son incompletos y desordenados. Al utilizar estas técnicas avanzadas de "atención" y encontrar al compañero adecuado para completar los datos —incluso si el método de completado no es estadísticamente perfecto por sí solo—, los ingenieros podrían tomar mejores decisiones al construir cimientos, túneles y taludes sin necesidad de probar cada centímetro de suelo. Sin embargo, los autores advierten que esto no es una varita mágica que reemplaza las pruebas en el mundo real. Es una herramienta poderosa para obtener una buena primera estimación, especialmente cuando los datos escasean, pero para los proyectos más críticos, todavía es necesario verificar el terreno por cuenta propia.

En resumen, el artículo muestra que, al enseñar a las computadoras a prestar atención a las pistas correctas y a completar inteligentemente los espacios en blanco —incluso si el método de completado no es estadísticamente perfecto por sí mismo—, podemos convertir un rompecabezas desordenado e incompleto en una imagen clara del suelo bajo nuestros pies.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →