GRPO / RLVR group methods
29 papers in this thread, across 7 domains.
Progress0 of 26
- 2026Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Modelsno summary yetcs lg2607.02869NYU0 citesJul 3, 2026cs lg
- 2026Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiationsno summary yetcs lg2607.05863MIT0 citesJul 7, 2026cs lg
- 2026FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speechno summary yeteess as2606.23190Alibaba0 citesJun 22, 2026eess as
- 2026Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVRRL Training2605.10781Microsoft ResearchMay 11, 2026~103 minRL Training
- 2026The Unlearnability Phenomenon in RLVR for Language ModelsRL Training2605.16787May 16, 2026~129 minRL Training
- 2026Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response SimplexTraining Methods2605.06139Tencent HunyuanMay 7, 2026~112 minTraining Methods
- 2026How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss ContinuumRL Training2604.25907GoogleApr 28, 2026~131 minRL Training
- 2026On the Direction of RLVR Updates for LLM Reasoning: Identification and ExploitationRL Training2603.22117QwenMar 23, 2026score 9~121 minRL Training
- 2026Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMsRL Training2603.22446QwenMar 23, 2026score 9~112 minRL Training
- 2026UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual GenerationRL Training2603.23500ByteDance SeedMar 24, 2026score 9~101 minRL Training
- 2026How Far Can Unsupervised RLVR Scale LLM Training?Training Methods2603.08660Tsinghua UniversityMar 9, 2026~126 minTraining Methods
- 2026iGRPO: Self-Feedback-Driven LLM ReasoningRL Training2602.09000NVIDIAFeb 9, 2026~120 minRL Training
- 2026F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the RareTraining Methods2602.06717T-TechFeb 6, 2026score 9~113 minTraining Methods
- 2026GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL OptimizationRL Training2601.05242Jan 8, 2026~109 minRL Training
- 2026DenseGRPO: From Sparse to Dense Reward for Flow Matching Model AlignmentTraining Methods2601.20218TongyiLabJan 28, 2026score 6~100 minTraining Methods
- 2026Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet TextTraining Methods2601.22975NVIDIAJan 30, 2026score 9~105 minTraining Methods
- 2025Evaluating Parameter Efficient Methods for RLVRRL Training2512.23165DeepSeekDec 29, 2025~105 minRL Training
- 2025Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious RewardTraining Methods2512.16912Columbia UniversityDec 18, 2025score 9~105 minTraining Methods
- 2025The Path Not Taken: RLVR Provably Learns Off the PrincipalsRL Training2511.08567AI at MetaNov 11, 2025score 9~110 minRL Training
- 2025DRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code GenerationTraining Methods2511.06307OpenAINov 9, 2025score 8~114 minTraining Methods
- 2025Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable RewardRL Training2510.03222TencentOct 3, 2025score 9~107 minRL Training
- 2025Fine-Grained GRPO for Precise Preference Alignment in Flow ModelsTraining Methods2510.01982IXCLab@Shanghai AI LabOct 2, 2025score 8~101 minTraining Methods
- 2025RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable RewardsAlignment2509.21319NVIDIASep 25, 2025score 9~105 minAlignment
- 2025Quantile Advantage Estimation: Stabilizing RLVR for LLM ReasoningReasoning2509.22611Sep 26, 2025score 9~119 minReasoning
- 2025DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree SearchTraining Methods2509.25454Stanford NLPSep 29, 2025score 10~122 minTraining Methods
- 2025Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVRRL Training2508.14029Aug 19, 2025score 9~128 minRL Training
- 2025The Invisible Leash: Why RLVR May or May Not Escape Its OriginEvaluation2507.14843Jul 20, 2025score 10~137 minEvaluation
- 2025RLPR: Extrapolating RLVR to General Domains without VerifiersRL Training2506.18254OpenBMBJun 23, 2025score 9~83 minRL Training
- 2025REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable RewardsReasoning2505.24760May 30, 2025score 9~109 minReasoning