Dual Soft-Adaptive Aggregation for Long-Context LLMs_ Mitigating Sequence-and-Depth Information Dilution
Este artículo propone un marco de agregación suave-adaptativo unificado que mitiga la dilución de la información de secuencia y profundidad en los LLM de contexto largo mediante la introducción de Soft-ChunkAttn para la fragmentación semántica diferenciable y Virtual Dynamic Block-AttnRes para la fusión de capas adaptativa a la entrada, todo ello preservando el grafo de computación original para un despliegue eficiente en GPU.