Speculative decoding
21 papers in this thread, across 8 domains.
Progress0 of 20
- 2026BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decodingno summary yetcs cl2606.31315Alibaba0 citesJun 30, 2026cs cl
- 2026Accelerating Speculative Decoding with Block Diffusion Draft TreesInference Optimization2604.12989Apr 14, 2026~107 minInference Optimization
- 2026Accelerating RL Post-Training Rollouts via System-Integrated Speculative DecodingRL Training2604.26779NVIDIAApr 29, 2026~133 minRL Training
- 2026DFlash: Block Diffusion for Flash Speculative DecodingInference Optimization2602.06036Feb 5, 2026~116 minInference Optimization
- 2026SPEED-Bench: A Unified and Diverse Benchmark for Speculative DecodingInference Optimization2604.09557NVIDIAFeb 10, 2026score 9~89 minInference Optimization
- 2025Beat the long tail: Distribution-Aware Speculative Decoding for RL TrainingTraining Methods2511.13841Together AINov 17, 2025~98 minTraining Methods
- 2025Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language ModelsMultimodal2504.15271NVIDIAApr 21, 2025score 9~103 minMultimodal
- 2025EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time TestInference Optimization2503.01840Mar 3, 2025score 10~123 minInference Optimization
- 2025Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language ModelsMultimodal2501.14818Jan 20, 2025~133 minMultimodal
- 2025Reward-Guided Speculative Decoding for Efficient LLM ReasoningReasoning2501.19324SalesforceJan 31, 2025score 9~129 minReasoning
- 2024Clover: Regressive Lightweight Speculative Decoding with Sequential KnowledgeInference Optimization2405.00263May 1, 2024score 9~105 minInference Optimization
- 2024Nearest Neighbor Speculative Decoding for LLM Generation and AttributionLLM Systems2405.19325May 29, 2024score 9~103 minLLM Systems
- 2024Eagle and Finch: RWKV with Matrix-Valued States and Dynamic RecurrenceArchitecture2404.05892Apr 8, 2024score 9~133 minArchitecture
- 2024LayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingInference Optimization2404.16710Apr 25, 2024score 9~107 minInference Optimization
- 2024Kangaroo: Lossless Self-Speculative Decoding via Double Early ExitingInference Optimization2404.18911HUAWEI Noah's Ark LabApr 29, 2024score 9~106 minInference Optimization
- 2024Recurrent Drafter for Fast Speculative Decoding in Large Language ModelsLLM Systems2403.09919AppleMar 14, 2024~125 minLLM Systems
- 2024Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative DecodingInference Optimization2402.13720Feb 21, 2024score 9~105 minInference Optimization
- 2024Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding HeadsInference Optimization2401.10774Jan 19, 2024score 10~108 minInference Optimization
- 2024EAGLE: Speculative Sampling Requires Rethinking Feature UncertaintyInference Optimization2401.15077Jan 26, 2024~133 minInference Optimization
- 2023Accelerating LLM Inference with Staged Speculative DecodingInference Optimization2308.04623Aug 8, 2023~104 minInference Optimization
- 2022Fast Inference from Transformers via Speculative DecodingInference Optimization2211.17192Nov 30, 2022~104 minInference Optimization