Reasoning via RL
32 papers in this thread, across 12 domains.
Progress0 of 30
- 2026When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Modelsno summary yetcs ai2606.30852Stanford0 citesJun 29, 2026cs ai
- 2026MolmoAct2: Action Reasoning Models for Real-world DeploymentAgents2605.02881Allen Institute for AIMay 4, 2026~118 minAgents
- 2026Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy DistillationTraining Methods2604.13010NVIDIAApr 14, 2026~132 minTraining Methods
- 2026Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool UseAlignment2603.03205Microsoft ResearchMar 3, 2026score 8~111 minAlignment
- 2026Reasoning Models Struggle to Control their Chains of ThoughtAlignment2603.05706OpenAIMar 5, 2026score 9~99 minAlignment
- 2026Does Your Reasoning Model Implicitly Know When to Stop Thinking?Inference Optimization2602.08354ByteDanceFeb 9, 2026score 7~98 minInference Optimization
- 2026D-CORE: Incentivizing Task Decomposition in Large Reasoning Models for Complex Tool UseTraining Methods2602.02160alibaba-incFeb 2, 2026score 9~101 minTraining Methods
- 2026Lost in the Noise: How Reasoning Models Fail with Contextual DistractorsReasoning2601.07226KAIST AIJan 12, 2026score 3~106 minReasoning
- 2025Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning ModelsReasoning2512.13607NVIDIADec 15, 2025score 9~112 minReasoning
- 2025Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning ModelsAlignment2510.21978AI at MetaOct 24, 2025score 10~112 minAlignment
- 2025R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?Reasoning2510.08189OpenAIOct 9, 2025score 8~107 minReasoning
- 2025Large Reasoning Models Learn Better Alignment from Flawed ThinkingSafety2510.00938Oct 1, 2025~96 minSafety
- 2025Distractor Injection Attacks on Large Reasoning Models: Characterization and DefenseSafety2510.16259Amazon ScienceOct 17, 2025score 6~101 minSafety
- 2025A Survey of Reinforcement Learning for Large Reasoning ModelsReasoning2509.08827Sep 10, 2025~123 minReasoning
- 2025Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement LearningReasoning2510.03259KAIST AISep 26, 2025score 9~119 minReasoning
- 2025NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning ModelReasoning2508.14444NVIDIAAug 20, 2025score 10~119 minReasoning
- 2025MolmoAct: Action Reasoning Models that can Reason in SpaceUncategorized2508.07917Aug 11, 2025~111 minUncategorized
- 2025OpenThoughts: Data Recipes for Reasoning ModelsData2506.04178DeepSeekJun 4, 2025score 9~121 minData
- 2025MagistralReasoning2506.10910MistralJun 12, 2025~105 minReasoning
- 2025100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language ModelsReasoning2505.00551DeepSeekMay 1, 2025score 9~118 minReasoning
- 2025Llama-Nemotron: Efficient Reasoning ModelsReasoning2505.00949DeepSeekMay 2, 2025~96 minReasoning
- 2025QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement LearningRL Training2505.17667May 23, 2025score 9~118 minRL Training
- 2025DeepSeek-R1 Thoughtology: Let's think about LLM ReasoningReasoning2504.07128DeepSeekApr 2, 2025score 10~120 minReasoning
- 2025Competitive Programming with Large Reasoning ModelsRL Training2502.06807OpenAIFeb 3, 2025~127 minRL Training
- 2025rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep ThinkingReasoning2501.04519OpenAIJan 8, 2025score 9~115 minReasoning
- 2025DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learningRL Training2501.12948DeepSeekJan 22, 2025score 10~129 minRL Training
- 2025o3-mini vs DeepSeek-R1: Which One is Safer?Safety2501.18438OpenAIJan 30, 2025score 3~96 minSafety
- 2024OpenAI o1 System CardSafety2412.16720OpenAIDec 21, 2024score 9~170 minSafety
- 2024A Comparative Study on Reasoning Patterns of OpenAI's o1 ModelReasoning2410.13639Oct 17, 2024score 9~110 minReasoning
- 2024A Case Study of Web App Coding with OpenAI Reasoning ModelsCode2409.13773Sep 19, 2024score 8~108 minCode
- 2024MUTUAL REASONING MAKES SMALLER LLMS STRONGER PROBLEM-SOLVERSReasoning2408.06195Aug 12, 2024~115 minReasoning
- 2019DMRM: A Dual-channel Multi-hop Reasoning Model for Visual Dialogno summary yetcs cl1912.08360Tencent1 citesDec 18, 2019cs cl