Flash attention
8 papers in this thread, across 5 domains.
Progress0 of 7
- 2026READ MOREInference Optimization2603.05451Together AIMar 5, 2026~113 minInference Optimization
- 2025Why Low-Precision Transformer Training Fails: An Analysis on Flash AttentionTraining Methods2510.04212Tsinghua UniversityOct 5, 2025score 9~125 minTraining Methods
- 2025FlashInfer: Efficient and Customizable Attention Engine for LLM Inference ServingServing2501.01005Jan 2, 2025~136 minServing
- 2024Enhancing Performance and Scalability of Large-Scale Recommendation Systems with Jagged Flash Attentionno summary yetcs lg2409.15373Meta / FAIR1 citesSep 19, 2024cs lg
- 2024FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precisionInference Optimization2407.08608DropboxJul 11, 2024~111 minInference Optimization
- 2023FlashAttention-2: Faster Attention with Better Parallelism and Work PartitioningInference Optimization2307.08691Jul 17, 2023~110 minInference Optimization
- 2023Faster Causal Attention Over Large Sequences Through Sparse Flash AttentionArchitecture2306.01160Jun 1, 2023score 9~101 minArchitecture
- 2022READ MOREInference Optimization2205.14135Together AIMay 27, 2022~127 minInference Optimization