大模型部署

FlagAttention (FlagOpen)

国产 FlashAttention 加速库,支持 Ampere 及以上 N 卡,降低 attention 显存与延迟

免费开源支持中文

FlagAttention 是 FlagOpen 团队推出的国产高性能 FlashAttention 加速库,把 FlashAttention 系列的显存与延迟优化能力封装成可即插即用的库,支持 NVIDIA Ampere 及以上架构(A100、A800、4090 等),帮助推理引擎把 attention 计算的显存占用和计算延迟降下来。它的价值在于:很多自研推理引擎或国产引擎在 attention 这一层性能吃亏,接上 FlagAttention 就能把这一层的计算效率拉起来,减少显存往返、加速长上下文生成。项目开源、迭代活跃,被多个国产推理框架作为底层加速组件引用,适合作为"给现有引擎加一层 attention 加速"的轻量补丁使用。