Dual Soft-Adaptive Aggregation for Long-Context LLMs_ Mitigating Sequence-and-Depth Information Dilution
Dieses Paper schlägt ein einheitliches Framework für die weiche adaptive Aggregation vor, das die Verdünnung von Sequenz- und Tiefeninformationen in Long-Context-LLMs durch die Einführung von Soft-ChunkAttn für differenzierbares semantisches Chunking sowie Virtual Dynamic Block-AttnRes für input-adaptive Layer-Merging mildert, während gleichzeitig der ursprüngliche Rechengraph für eine effiziente GPU-Bereitstellung bewahrt wird.