2026
117- MayToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agentsagents2605.12481TongyiLabMay 12, 2026~122 min
- MayHINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agentsagents2605.17873KAIST AIMay 18, 2026~112 min
- MayConditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignmentalignment2605.20834May 20, 2026~103 min
- MayOpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agentsmultimodal2605.05185Tencent HunyuanMay 6, 2026~104 min
- MayReinforcing Multimodal Reasoning Against Visual Degradationmultimodal2605.09262Tencent HunyuanMay 10, 2026~119 min
- MayHeavySkill: Heavy Thinking as the Inner Skill in Agentic Harnessreasoning2605.02396LongCatMay 4, 2026~97 min
- MayLearning from Language Feedback via Variational Policy Distillationreasoning2605.15113Salesforce AI ResearchMay 14, 2026~108 min
- MayAEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learningrl-training2605.00425BAIDUMay 1, 2026~125 min
- MayRebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVRrl-training2605.10781Microsoft ResearchMay 11, 2026~103 min
- MayDebiased Model-based Representations for Sample-efficient Continuous Controlrl-training2605.11711Tencent HunyuanMay 12, 2026~113 min
- MayThe Unlearnability Phenomenon in RLVR for Language Modelsrl-training2605.16787May 16, 2026~129 min
- MayListwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplextraining-methods2605.06139Tencent HunyuanMay 7, 2026~112 min
- MayDeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verificationtraining-methods2605.09269Tencent HunyuanMay 10, 2026~113 min
- MayAdaptive Teacher Exposure for Self-Distillation in LLM Reasoningtraining-methods2605.11458ByteDanceMay 12, 2026~124 min
- AprAgent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligenceagents2604.18292ByteDance SeedApr 20, 2026~108 min
- AprLeveraging Verifier-Based Reinforcement Learning in Image Editingllm-systems2604.27505ByteDance SeedApr 30, 2026~121 min
- AprGLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agentsmultimodal2604.26752Z.aiApr 29, 2026~127 min
- AprLearning to Hint for Reinforcement Learningrl-training2604.00698SnowflakeApr 1, 2026score 9~123 min
- AprUnifying Group-Relative and Self-Distillation Policy Optimization via Sample Routingrl-training2604.02288Apr 2, 2026score 10~101 min
- AprModeling Multiple Support Strategies within a Single Turn for Emotional Support Conversationsrl-training2604.17972Qwen DianJinApr 20, 2026~118 min
- AprWorld-R1: Reinforcing 3D Constraints for Text-to-Video Generationrl-training2604.24764Microsoft ResearchApr 27, 2026~117 min
- AprHow Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuumrl-training2604.25907GoogleApr 28, 2026~131 min
- AprAccelerating RL Post-Training Rollouts via System-Integrated Speculative Decodingrl-training2604.26779NVIDIAApr 29, 2026~133 min
- AprSandMLE: A Multi-Agent Framework that Generates Synthetic Sandbox Environments for Training Machine Learning Engineering Agentstraining-methods2604.04872AI at MetaApr 6, 2026score 9~97 min
- AprRAGEN-2: Reasoning Collapse in Agentic RLtraining-methods2604.06268MLL LabApr 7, 2026score 9~118 min
- AprFP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scalingtraining-methods2604.06916NVIDIAApr 8, 2026~116 min
- AprSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervisiontraining-methods2604.12002Princeton UniversityApr 13, 2026score 9~122 min
- AprLightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillationtraining-methods2604.13010NVIDIAApr 14, 2026~132 min
- AprPre-train Space Reinforcement Learning: From P(y|x) to P(y)training-methods2604.14142Chinese Academic of Science Institute of AutomationApr 15, 2026score 9~101 min
- MarTRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemasagents2603.16448meituanMar 17, 2026score 9~98 min
- MarProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agentsagents2603.18815NVIDIAMar 19, 2026~99 min
- MarA Subgoal-driven Framework for Improving Long-Horizon LLM Agentsagents2603.19685DeepmindMar 20, 2026score 10~135 min
- MarCharacterFlywheel: Scaling Iterative Improvement of Engaging and Steerable LLMs in Productionalignment2603.01973Meta LlamaMar 2, 2026score 9~140 min
- MarLearning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Usealignment2603.03205Microsoft ResearchMar 3, 2026score 8~111 min
- MarScaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problemsdata2603.07779Microsoft ResearchMar 8, 2026score 9~118 min
- MarIntern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scalemultimodal2603.25040InternLM / Shanghai AI LabMar 26, 2026~113 min
- MarBeyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Modelsreasoning2603.01571Tencent HunyuanMar 2, 2026score 9~108 min
- MarHopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoningreasoning2603.17024QwenMar 17, 2026score 9~135 min
- MarLongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learningreasoning2603.21065Meituan LongCatMar 22, 2026score 9~110 min
- MarHeterogeneous Agent Collaborative Reinforcement Learningrl-training2603.02604ByteDanceMar 3, 2026score 9~112 min
- MarBreaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Modelsrl-training2603.07777Microsoft ResearchMar 8, 2026score 9~119 min
- MarCode-Space Response Oracles: Generating Interpretable Multi-Agent Policies with Large Language Modelsrl-training2603.10098DeepmindMar 10, 2026score 9~109 min
- Mar$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rolloutsrl-training2603.10848LongCatMar 11, 2026score 9~123 min
- MarAI Can Learn Scientific Tasterl-training2603.14473OpenMOSSMar 15, 2026~105 min
- MarComplementary Reinforcement Learningrl-training2603.17621alibaba-incMar 18, 2026score 9~129 min
- MarFIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimizationrl-training2603.19835QwenMar 20, 2026score 10~109 min
- MarPivotRL: High Accuracy Agentic Post-Training at Low Compute Costrl-training2603.21383NVIDIAMar 22, 2026~123 min
- MarOn the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitationrl-training2603.22117QwenMar 23, 2026score 9~121 min
- MarSparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMsrl-training2603.22446QwenMar 23, 2026score 9~112 min
- MarUniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generationrl-training2603.23500ByteDance SeedMar 24, 2026score 9~101 min
- MarLearn Hard Problems During RL with Reference Guided Fine-tuningtraining-methods2603.01223ByteDance SeedMar 1, 2026score 9~119 min
- MarScaling Agentic Capabilities, Not Context: Efficient Reinforcement Finetuning for Large Toolspacestraining-methods2603.06713Microsoft ResearchMar 5, 2026score 9~112 min
- MarIn-Context Reinforcement Learning for Tool Use in Large Language Modelstraining-methods2603.08068National University of SingaporeMar 9, 2026~114 min
- MarHow Far Can Unsupervised RLVR Scale LLM Training?training-methods2603.08660Tsinghua UniversityMar 9, 2026~126 min
- MarMM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Datatraining-methods2603.09206NVIDIAMar 10, 2026score 9~112 min
- MarMeta-Reinforcement Learning with Self-Reflection for Agentic Searchtraining-methods2603.11327Ai2Mar 11, 2026~97 min
- MarSupervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Modelstraining-methods2603.13985AmazonMar 14, 2026~117 min
- MarOnline Experiential Learning for Language Modelstraining-methods2603.16856Microsoft ResearchMar 17, 2026score 9~121 min
- MarNemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillationtraining-methods2603.19220NVIDIAMar 19, 2026~94 min
- MarRoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Modelstraining-methods2603.21341KAIST AIMar 22, 2026score 9~108 min
- MarManifold-Aware Exploration for Reinforcement Learning in Video Generationtraining-methods2603.21872Tencent HunyuanMar 23, 2026score 9~110 min
- MarDreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learningvision2603.12257TongyiLabMar 12, 2026score 4~107 min
- MarVisual-ERM: Reward Modeling for Visual Equivalencevision2603.13224InternLM / Shanghai AI LabMar 13, 2026score 9~127 min
- FebTRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenariosagents2602.01675meituanFeb 2, 2026score 3~122 min
- FebProAct: Agentic Lookahead in Interactive Environmentsagents2602.05327Tencent HunyuanFeb 5, 2026score 8~95 min
- FebAgent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learningagents2602.10090SnowflakeFeb 10, 2026score 9~111 min
- FebMobile-Agent-v3.5: Multi-platform Fundamental GUI Agentsagents2602.16855TongyiLabFeb 15, 2026score 2~131 min
- FebDecoding ML Decision: An Agentic Reasoning Framework for Large-Scale Ranking Systemagents2602.18640Feb 20, 2026~114 min
- FebDr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generationscode2602.05885Feb 5, 2026~111 min
- FebComposition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Modelsdata2602.12036Tencent HunyuanFeb 12, 2026score 5~100 min
- FebHow2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMsevaluation2602.08808Ai2Feb 9, 2026score 3~131 min
- FebDoes Your Reasoning Model Implicitly Know When to Stop Thinking?inference-optimization2602.08354ByteDanceFeb 9, 2026score 7~98 min
- FebWhen to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoningllm-systems2602.10560ByteDance SeedFeb 11, 2026score 8~103 min
- FebStep 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parametersmoe2602.10604StepFunFeb 11, 2026score 8~135 min
- FebKimi K2.5: Visual Agentic Intelligencemultimodal2602.02276Moonshot / KimiFeb 2, 2026score 8~145 min
- FebERNIE 5.0 Technical Reportmultimodal2602.04705Feb 4, 2026~138 min
- FebOn the Optimal Reasoning Length for RL-Trained Language Modelsreasoning2602.09591DeepSeekFeb 10, 2026~137 min
- FebGood SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learningrl-training2602.01058Feb 1, 2026~103 min
- FebCoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMsrl-training2602.03048LongCatFeb 3, 2026score 6~95 min
- FebSearch-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaborationrl-training2602.03647Feb 3, 2026~113 min
- FebiGRPO: Self-Feedback-Driven LLM Reasoningrl-training2602.09000NVIDIAFeb 9, 2026~120 min
- FebWorldCompass: Reinforcement Learning for Long-Horizon World Modelsrl-training2602.09022Tencent HunyuanFeb 9, 2026score 8~114 min
- FebD-CORE: Incentivizing Task Decomposition in Large Reasoning Models for Complex Tool Usetraining-methods2602.02160alibaba-incFeb 2, 2026score 9~101 min
- FebTraining LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalabilitytraining-methods2602.02477Microsoft ResearchFeb 2, 2026score 8~105 min
- FebSelf-Hinting Language Models Enhance Reinforcement Learningtraining-methods2602.03143Feb 3, 2026~121 min
- FebReinforcement World Model Learning for LLM-based Agentstraining-methods2602.05842Microsoft ResearchFeb 5, 2026score 3~88 min
- FebSeeUPO: Sequence-Level Agentic-RL with Convergence Guaranteestraining-methods2602.06554Tongyi-MAIFeb 6, 2026score 9~111 min
- FebF-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Raretraining-methods2602.06717T-TechFeb 6, 2026score 9~113 min
- FebLLaDA2.1: Speeding Up Text Diffusion via Token Editingtraining-methods2602.08676Feb 9, 2026~106 min
- FebLearning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolationtraining-methods2602.12125Tencent HunyuanFeb 12, 2026score 9~91 min
- FebNanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Actstraining-methods2602.13367Feb 13, 2026~100 min
- FebCUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generationtraining-methods2602.24286ByteDance SeedFeb 27, 2026score 9~110 min
- FebQwen3-Coder-Next Technical Reporttraining-methods2603.00729QwenFeb 28, 2026score 9~123 min
- FebGLM-5: from Vibe Coding to Agentic Engineeringuncategorized2602.15763Zhipu / GLMFeb 17, 2026~148 min
- FebTOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Roboticsuncategorized2602.19313Ai2Feb 22, 2026score 3~97 min
- FebMedXIAOHE: A Comprehensive Recipe for Building Medical MLLMsvision2602.12705ByteDanceFeb 13, 2026score 7~121 min
- JanThinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalizationagents2601.05432alibaba-incJan 8, 2026score 3~115 min
- JanVLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memoryagents2601.08665ByteDance SeedJan 13, 2026score 3~124 min
- JanAgentic Reasoning for Large Language Modelsagents2601.12538University of Illinois at Urbana-ChampaignJan 18, 2026score 9~116 min
- JanLongCat-Flash-Thinking-2601 Technical Reportagents2601.16725LongCatJan 23, 2026score 9~101 min
- JanX-Coder: Advancing Competitive Programming with Fully Synthetic Tasks, Solutions, and Testscode2601.06953Microsoft ResearchJan 11, 2026score 8~97 min
- JanFP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learninglow-precision2601.18150NVIDIAJan 26, 2026score 9~102 min
- JanNextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generationmultimodal2601.02204ByteDanceJan 5, 2026score 9~124 min
- JanMultiplex Thinking: Reasoning via Token-wise Branch-and-Mergereasoning2601.08808Microsoft ResearchJan 13, 2026score 9~92 min
- JanThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editingrl-training2601.03467ByteDanceJan 6, 2026score 2~98 min
- JanGDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimizationrl-training2601.05242Jan 8, 2026~109 min
- JanArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Rankingrl-training2601.06487Alibaba DAMOJan 10, 2026score 9~120 min
- JanYour Group-Relative Advantage Is Biasedrl-training2601.08521Jan 13, 2026~113 min
- JanJet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flowrl-training2601.14243NVIDIAJan 20, 2026score 9~104 min
- JanHow AI Impacts Skill Formationrl-training2601.20245AnthropicJan 28, 2026score 1~107 min
- JanLess Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purificationrl-training2601.21244BAIDUJan 29, 2026score 8~98 min
- JanVAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generationtraining-methods2601.02256ByteDanceJan 5, 2026score 5~115 min
- JanChaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewardstraining-methods2601.06021Z.aiJan 9, 2026score 9~112 min
- JanTranslateGemma Technical Reporttraining-methods2601.09012Google ResearchJan 13, 2026~107 min
- JanDenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignmenttraining-methods2601.20218TongyiLabJan 28, 2026score 6~100 min
- JanGolden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Texttraining-methods2601.22975NVIDIAJan 30, 2026score 9~105 min
- JanUrban Socio-Semantic Segmentation with Vision-Language Reasoningvision2601.10477alibaba-incJan 15, 2026score 3~102 min
2025
146- DecSIMA 2: A Generalist Embodied Agent for Virtual Worldsagents2512.04797DeepmindDec 4, 2025score 9~116 min
- DecLong-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solvingagents2512.10739Dec 11, 2025~115 min
- DecSAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learningagents2512.13874Ai2Dec 15, 2025score 9~119 min
- DecSeed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experienceagents2512.17260ByteDance SeedDec 19, 2025score 8~129 min
- DecMAI-UI Technical Report: Real-World Centric Foundation GUI Agentsagents2512.22047TongyiLabDec 26, 2025score 4~124 min
- DecLet It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystemagents2512.24873alibaba-incDec 31, 2025score 9~130 min
- DecNVIDIA Nemotron 3: Efficient and Open Intelligencearchitecture2512.20856NVIDIADec 24, 2025~74 min
- DecReasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMsinference-optimization2512.17206alibaba-incDec 19, 2025score 9~117 min
- DecDeepSeek-V3.2: Pushing the Frontier of Open Large Language Modelsllm-systems2512.02556DeepSeekDec 2, 2025~127 min
- DecSeedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Modelmultimodal2512.13507ByteDance SeedDec 15, 2025score 3~94 min
- DecNemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Modelsreasoning2512.13607NVIDIADec 15, 2025score 9~112 min
- DecStabilizing Reinforcement Learning with LLMs: Formulation and Practicesrl-training2512.01374Dec 1, 2025~126 min
- DecGR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulationrl-training2512.01801ByteDance SeedDec 1, 2025score 2~116 min
- DecARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoningrl-training2512.05111Intern Large ModelsDec 4, 2025score 8~102 min
- DecZoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-inrl-training2512.14273NVIDIADec 16, 2025score 8~102 min
- DecJustRL: Scaling a 1.5B LLM with a Simple RL Reciperl-training2512.16649OpenBMBDec 18, 2025~120 min
- DecEvaluating Parameter Efficient Methods for RLVRrl-training2512.23165DeepSeekDec 29, 2025~105 min
- DecSpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RLtraining-methods2512.04069NVIDIADec 3, 2025score 7~118 min
- DecOn the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Modelstraining-methods2512.07783CMU-LTIDec 8, 2025score 9~115 min
- DecQwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Managementtraining-methods2512.12967Dec 15, 2025~110 min
- DecExploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Rewardtraining-methods2512.16912Columbia UniversityDec 18, 2025score 9~105 min
- DecFaithLens: Detecting and Explaining Faithfulness Hallucinationtraining-methods2512.20182Tsinghua NLP GroupDec 23, 2025score 6~102 min
- DecMasking Teacher and Reinforcing Student for Distilling Vision-Language Modelstraining-methods2512.22238NVIDIADec 23, 2025score 9~102 min
- DecDiversity or Precision? A Deep Dive into Next Token Predictiontraining-methods2512.22955Dec 28, 2025~107 min
- DecLongCat-Image Technical Reportvision2512.07584Meituan LongCatDec 8, 2025score 6~124 min
- NovScaling Agent Learning via Experience Synthesisagents2511.03773Nov 5, 2025~120 min
- NovRobot Learning from a Physical World Modelagents2511.07416DeepmindNov 10, 2025score 2~105 min
- NovGeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalizationagents2511.15705Tencent HunyuanNov 19, 2025score 7~96 min
- NovVideo Generation Models Are Good Latent Reward Modelsalignment2511.21541Tencent HunyuanNov 26, 2025score 8~104 min
- NovLong Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scaledata2511.05705NVIDIANov 7, 2025score 9~105 min
- NovMMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generationdiffusion2511.09611ByteDanceNov 12, 2025score 9~109 min
- NovMusic Flamingo: Scaling Music Understanding in Audio Language Modelsmultimodal2511.10289NVIDIANov 13, 2025score 6~121 min
- NovHunyuanOCR Technical Reportmultimodal2511.19575Tencent HunyuanNov 24, 2025score 9~146 min
- NovDeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoningreasoning2511.22570Nov 27, 2025~110 min
- NovSAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuningrl-training2511.02280BytedanceDouyinContentNov 4, 2025score 9~130 min
- NovTimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learningrl-training2511.05489ByteDanceNov 7, 2025score 9~106 min
- NovThe Path Not Taken: RLVR Provably Learns Off the Principalsrl-training2511.08567AI at MetaNov 11, 2025score 9~110 min
- NovWMPO: World Model-based Policy Optimization for Vision-Language-Action Modelsrl-training2511.09515ByteDance SeedNov 12, 2025score 5~128 min
- NovSoft Adaptive Policy Optimizationrl-training2511.20347QwenNov 25, 2025score 9~108 min
- NovReinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMstraining-methods2511.05933Meta AINov 8, 2025score 9~116 min
- NovDRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code Generationtraining-methods2511.06307OpenAINov 9, 2025score 8~114 min
- NovToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestrationtraining-methods2511.21689NVIDIANov 26, 2025score 9~106 min
- NovVisual Spatial Tuningvision2511.05491ByteDance SeedNov 7, 2025score 9~119 min
- OctAgent Learning via Early Experienceagents2510.08558Oct 9, 2025~108 min
- OctDemystifying Reinforcement Learning in Agentic Reasoningagents2510.11701Oct 13, 2025score 9~127 min
- OctScaling Long-Horizon LLM Agent via Context-Foldingagents2510.11967ByteDance SeedOct 13, 2025score 8~108 min
- OctBeyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Modelsalignment2510.21978AI at MetaOct 24, 2025score 10~112 min
- OctCode Aesthetics with Agentic Reward Feedbackcode2510.23272Microsoft ResearchOct 27, 2025score 9~110 min
- OctWebscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levelsdata2510.06499SalesforceOct 7, 2025score 10~115 min
- OctDocReward: A Document Reward Model for Structuring and Stylizingdata2510.11391Microsoft ResearchOct 13, 2025score 6~95 min
- OctBoundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Modelsinference-optimization2510.11683Z.aiOct 13, 2025score 9~120 min
- OctRL makes MLLMs see better than SFTmultimodal2510.16333NAVER AI LabOct 18, 2025score 9~100 min
- OctolmOCR 2: Unit Test Rewards for Document OCRmultimodal2510.19817Ai2Oct 22, 2025score 9~115 min
- OctR-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?reasoning2510.08189OpenAIOct 9, 2025score 8~107 min
- OctAttention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimizationreasoning2510.13554alibaba-incOct 15, 2025score 9~117 min
- OctLoongRL: Reinforcement Learning for Advanced Reasoning over Long Contextsreasoning2510.19363Microsoft ResearchOct 22, 2025score 9~114 min
- OctOpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidencereasoning2510.20579OpenAIOct 23, 2025score 9~97 min
- OctBroRL: Scaling Reinforcement Learning via Broadened Explorationrl-training2510.01180NVIDIAOct 1, 2025score 9~106 min
- OctLow-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Rewardrl-training2510.03222TencentOct 3, 2025score 9~107 min
- OctVerifier-free Test-Time Sampling for Vision Language Action Modelsrl-training2510.05681KAIST AIOct 7, 2025score 9~106 min
- OctQeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMsrl-training2510.11696NVIDIAOct 13, 2025score 10~124 min
- OctThe Art of Scaling Reinforcement Learning Compute for LLMsrl-training2510.13786Oct 15, 2025~139 min
- OctLaSeR: Reinforcement Learning with Last-Token Self-Rewardingrl-training2510.14943Tencent HunyuanOct 16, 2025score 10~101 min
- OctDLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learningrl-training2510.15110OpenAIOct 16, 2025score 9~119 min
- OctRepurposing Synthetic Data for Fine-grained Search Agent Supervisionrl-training2510.24694TongyiLabOct 28, 2025score 9~105 min
- OctLarge Reasoning Models Learn Better Alignment from Flawed Thinkingsafety2510.00938Oct 1, 2025~96 min
- OctFine-Grained GRPO for Precise Preference Alignment in Flow Modelstraining-methods2510.01982IXCLab@Shanghai AI LabOct 2, 2025score 8~101 min
- OctPairUni: Pairwise Training for Unified Multimodal Language Modelstraining-methods2510.25682ByteDanceOct 29, 2025score 8~110 min
- OctDefeating the Training-Inference Mismatch via FP16training-methods2510.26788Sea AI LabOct 30, 2025score 9~127 min
- OctLongCat-Video Technical Reportuncategorized2510.22200Meituan LongCatOct 25, 2025score 9~122 min
- OctSpatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learningvision2510.27606InternLM / Shanghai AI LabOct 31, 2025score 9~124 min
- OctWorld Simulation with Video Foundation Models for Physical AIvision2511.00062NVIDIAOct 28, 2025score 4~128 min
- SepUI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learningagents2509.02544ByteDance SeedSep 2, 2025score 6~126 min
- SepThe Landscape of Agentic Reinforcement Learning for LLMs: A Surveyagents2509.02547Sep 2, 2025~127 min
- SepRLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewardsalignment2509.21319NVIDIASep 25, 2025score 9~105 min
- SepMultiplayer Nash Preference Optimizationalignment2509.23102Sep 27, 2025~110 min
- SepHunyuan-MT Technical Reportllm-systems2509.05209Tencent HunyuanSep 5, 2025score 3~99 min
- SepCapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learningmultimodal2509.22647InternLM / Shanghai AI LabSep 26, 2025score 6~114 min
- SepLLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Trainingmultimodal2509.23661Sep 28, 2025score 9~125 min
- SepRLP: Reinforcement as a Pretraining Objectivepretraining2510.01265NVIDIASep 26, 2025score 9~100 min
- SepA Survey of Reinforcement Learning for Large Reasoning Modelsreasoning2509.08827Sep 10, 2025~123 min
- SepNo Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shapingreasoning2509.21880KAIST AISep 26, 2025score 10~103 min
- SepQuantile Advantage Estimation: Stabilizing RLVR for LLM Reasoningreasoning2509.22611Sep 26, 2025score 9~119 min
- SepMeta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learningreasoning2510.03259KAIST AISep 26, 2025score 9~119 min
- SepSPARK: Synergistic Policy And Reward Co-Evolving Frameworkrl-training2509.22624InternLM / Shanghai AI LabSep 26, 2025score 9~110 min
- SepSharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharingtraining-methods2509.08721DeepSeekSep 10, 2025score 10~108 min
- SepBenefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspectivetraining-methods2509.22613Microsoft ResearchSep 26, 2025score 9~95 min
- SepDeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Searchtraining-methods2509.25454Stanford NLPSep 29, 2025score 10~122 min
- SepTruthRL: Incentivizing Truthful LLMs via Reinforcement Learningtraining-methods2509.25760Sep 30, 2025~100 min
- SepKnapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocationtraining-methods2509.25849ByteDance SeedSep 30, 2025score 9~111 min
- SepCARE: Cognitive-reasoning Augmented Reinforcement for Emotional Support Conversationtraining-methods2510.05122Qwen DianJinSep 30, 2025score 1~100 min
- SepRobix: A Unified Model for Robot Interaction, Reasoning and Planninguncategorized2509.01106ByteDance SeedSep 1, 2025score 9~108 min
- AugFin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Modelsagents2508.15202Qwen DianJinAug 21, 2025score 9~111 min
- AugWebWatcher: Breaking New Frontier of Vision-Language Deep Research Agentmultimodal2508.05748Alibaba DAMOAug 7, 2025score 9~109 min
- AugIntern-S1: A Scientific Multimodal Foundation Modelmultimodal2508.15763InternLM / Shanghai AI LabAug 21, 2025~122 min
- AugInternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiencymultimodal2508.18265Aug 25, 2025score 10~107 min
- AugBeyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVRrl-training2508.14029Aug 19, 2025score 9~128 min
- AugOn the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectificationtraining-methods2508.05629Aug 7, 2025score 9~107 min
- AugTreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modelingtraining-methods2508.17445ByteDance SeedAug 24, 2025score 9~105 min
- JulThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planningagents2507.16815NVIDIAJul 22, 2025score 9~110 min
- JulThe Invisible Leash: Why RLVR May or May Not Escape Its Originevaluation2507.14843Jul 20, 2025score 10~137 min
- JulGLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learningmultimodal2507.01006Zhipu / GLMJul 1, 2025score 10~109 min
- JulScaling RL to Long Videosrl-training2507.07966Jul 10, 2025~98 min
- JulGSPO: Towards Scalable Reinforcement Learning for Language Modelsrl-training2507.18071Qwen / Alibaba CloudJul 24, 2025~94 min
- JulAgentic Reinforced Policy Optimizationrl-training2507.19849Jul 26, 2025~95 min
- JulGeometric-Mean Policy Optimizationrl-training2507.20673Jul 28, 2025score 9~105 min
- JulCUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learningtraining-methods2507.14111Jul 18, 2025score 10~138 min
- JulARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shortstraining-methods2507.20939TencentJul 28, 2025score 9~125 min
- JunReinforcement Pre-Trainingpretraining2506.08007Jun 9, 2025~106 min
- JunMagistralreasoning2506.10910MistralJun 12, 2025~105 min
- JunMiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attentionreasoning2506.13585DeepSeekJun 16, 2025score 9~132 min
- JunRLPR: Extrapolating RLVR to General Domains without Verifiersrl-training2506.18254OpenBMBJun 23, 2025score 9~83 min
- JunBeyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoningtraining-methods2506.01939Jun 2, 2025score 9~123 min
- MayMMaDA: Multimodal Large Diffusion Language Modelsmultimodal2505.15809May 21, 2025~136 min
- May100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Modelsreasoning2505.00551DeepSeekMay 1, 2025score 9~118 min
- MayLlama-Nemotron: Efficient Reasoning Modelsreasoning2505.00949DeepSeekMay 2, 2025~96 min
- MayREASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewardsreasoning2505.24760May 30, 2025score 9~109 min
- MayQwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learningrl-training2505.17667May 23, 2025score 9~118 min
- MayZeroSearch: Incentivize the Search Capability of LLMs without Searchingtraining-methods2505.04588Alibaba DAMOMay 7, 2025~114 min
- MayG1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learningtraining-methods2505.13426Moonshot AIMay 19, 2025score 9~102 min
- MayThe Entropy Mechanism of Reinforcement Learning for Reasoning Language Modelstraining-methods2505.22617May 28, 2025score 9~125 min
- AprMulti-SWE-bench: A Multilingual Benchmark for Issue Resolvingevaluation2504.02605ByteDance SeedApr 3, 2025score 9~99 min
- AprLearning Adaptive Parallel Reasoning with Language Modelsreasoning2504.15466Apr 21, 2025~108 min
- AprDianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Modelsreasoning2504.15716Qwen DianJinApr 22, 2025score 9~106 min
- AprPhi-4-reasoning Technical Reportreasoning2504.21318Microsoft ResearchApr 30, 2025~123 min
- AprReinforcement Learning from Human Feedbackrl-training2504.12501Apr 16, 2025~84 min
- AprDoes Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?rl-training2504.13837Apr 18, 2025score 9~107 min
- AprLearning to Reason under Off-Policy Guidancerl-training2504.14945Apr 21, 2025score 8~116 min
- AprTTRL: Test-Time Reinforcement Learningrl-training2504.16084Apr 22, 2025score 9~93 min
- AprInference-Time Scaling for Generalist Reward Modelingscaling-laws2504.02495Apr 3, 2025~101 min
- AprNEMOTRON-CROSSTHINK: Scaling Self-Learning beyond Math Reasoningtraining-methods2504.13941Apr 15, 2025~105 min
- AprReinforcement Learning for Reasoning in Large Language Models with One Training Exampletraining-methods2504.20571Apr 29, 2025score 10~117 min
- MarUnderstanding R1-Zero-Like Training: A Critical Perspectivereasoning2503.20783DeepSeekMar 26, 2025score 9~108 min
- MarOpen-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Modelreasoning2503.24290DeepSeekMar 31, 2025score 9~116 min
- MarDAPO: An Open-Source LLM Reinforcement Learning System at Scalerl-training2503.14476OpenAIMar 18, 2025~111 min
- MarSearch-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learningtraining-methods2503.09516Mar 12, 2025score 10~105 min
- FebProcess Reinforcement through Implicit Rewardsrl-training2502.01456Feb 3, 2025score 9~110 min
- FebCompetitive Programming with Large Reasoning Modelsrl-training2502.06807OpenAIFeb 3, 2025~127 min
- FebPartition Tree Weighting for Non-Stationary Stochastic Banditsrl-training2502.19325DeepMindFeb 26, 2025~120 min
- FebSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolutiontraining-methods2502.18449DeepSeekFeb 25, 2025score 9~116 min
- JanInternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Modelalignment2501.12368InternLM / Shanghai AI LabJan 21, 2025score 9~95 min
- JanSFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-trainingalignment2501.17161Jan 28, 2025score 10~103 min
- JanrStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinkingreasoning2501.04519OpenAIJan 8, 2025score 9~115 min
- JanKimi k1.5: Scaling Reinforcement Learning with LLMsreasoning2501.12599Jan 22, 2025~107 min
- JanREINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalizationrl-training2501.03262Jan 4, 2025score 9~107 min
- JanDeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learningrl-training2501.12948DeepSeekJan 22, 2025score 10~129 min
2024
40- Dec2 OLMo 2 Furiouspretraining2501.00656Allen Institute for AIDec 31, 2024~111 min
- DecOffline Reinforcement Learning for LLM Multi-Step Reasoningreasoning2412.16145Dec 20, 2024score 9~122 min
- DecOpenAI o1 System Cardsafety2412.16720OpenAIDec 21, 2024score 9~170 min
- DecB-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasonerstraining-methods2412.17256Dec 23, 2024score 9~118 min
- NovSample-Efficient Alignment for LLMsalignment2411.01493Nov 3, 2024score 8~124 min
- NovTülu 3: Pushing Frontiers in Open Language Model Post-Trainingtraining-methods2411.15124Allen Institute for AINov 22, 2024~132 min
- OctMA-RLHF: Reinforcement Learning from Human Feedback with Macro Actionsrl-training2410.02743BAIDUOct 3, 2024score 8~117 min
- OctAsynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Modelsrl-training2410.18252Oct 23, 2024score 9~117 min
- OctUFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Functiontraining-methods2410.21438Oct 28, 2024~111 min
- SepTowards a Unified View of Preference Learning for Large Language Models: A Surveyalignment2409.02795Sep 4, 2024score 10~110 min
- SepCoffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Coderl-training2409.19715Sep 29, 2024score 8~111 min
- SepTraining Language Models to Self-Correct via Reinforcement Learningtraining-methods2409.12917Sep 19, 2024~103 min
- AugAchieving Human Level Competitive Robot Table Tennisarchitecture2408.03906DeepMindAug 7, 2024score 2~120 min
- AugDeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Searchreasoning2408.08152DeepSeekAug 15, 2024score 9~112 min
- JunBootstrapping Language Models with DPO Implicit Rewardsalignment2406.09760Jun 14, 2024score 9~116 min
- JunWPO: Enhancing RLHF with Weighted Preference Optimizationrl-training2406.11827Zoom AIJun 17, 2024score 9~112 min
- MaySelf-Play Preference Optimization for Language Model Alignmentalignment2405.00675May 1, 2024score 9~96 min
- MayUnderstanding the performance gap between online and offline alignment algorithmsalignment2405.08448May 14, 2024score 9~107 min
- MayOpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Frameworkalignment2405.11143May 20, 2024score 9~99 min
- MaySuper-Exponential Regret for UCT, AlphaGo and Variantsrl-training2405.04407DeepMindMay 7, 2024~118 min
- MayOffline Regularised Reinforcement Learning for Large Language Models Alignmentrl-training2405.19107May 29, 2024score 8~97 min
- MayRLHF Workflow: From Reward Modeling to Online RLHFtraining-methods2405.07863SalesforceMay 13, 2024score 10~96 min
- AprAdvancing LLM Reasoning Generalists with Preference Treesreasoning2404.02078OpenBMBApr 2, 2024score 9~115 min
- AprIterative Reasoning Preference Optimizationreasoning2404.19733Apr 30, 2024score 9~101 min
- AprChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipelinetraining-methods2404.02893Apr 3, 2024score 8~99 min
- AprLearn Your Reference Model for Real Good Alignmenttraining-methods2404.09656Apr 15, 2024score 9~83 min
- MarRewardBench: Evaluating Reward Models for Language Modelingevaluation2403.13787InternLM / Shanghai AI LabMar 20, 2024~124 min
- MarTeaching Large Language Models to Reason with Reinforcement Learningrl-training2403.04642Mar 7, 2024score 9~115 min
- MarParameter Efficient Reinforcement Learning from Human Feedbacktraining-methods2403.10704Mar 15, 2024score 8~106 min
- MarInternLM2 Technical Reporttraining-methods2403.17297InternLM / Shanghai AI LabMar 26, 2024score 9~92 min
- FebODIN: Disentangled Reward Mitigates Hacking in RLHFalignment2402.07319Feb 11, 2024score 9~112 min
- FebDeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Modelsreasoning2402.03300DeepSeekFeb 5, 2024score 10~130 min
- FebDirect Language Model Alignment from Online AI Feedbackrl-training2402.04792Feb 7, 2024score 9~100 min
- FebNear-Minimax-Optimal Distributional Reinforcement Learning with a Generative Modelrl-training2402.07598DeepMindFeb 12, 2024~95 min
- FebA Distributional Analogue to the Successor Representationrl-training2402.08530DeepMindFeb 13, 2024~115 min
- FebLearning to Learn Faster from Human Feedback with Language Model Predictive Controltraining-methods2402.11450DeepMindFeb 18, 2024score 9~104 min
- JanSecrets of RLHF in Large Language Models Part II: Reward Modelingalignment2401.06080Jan 11, 2024score 9~130 min
- JanSelf-Rewarding Language Modelsalignment2401.10020Jan 18, 2024score 9~116 min
- JanNeural Population Learning beyond Symmetric Zero-sum Gamesrl-training2401.05133DeepMindJan 10, 2024~107 min
- JanWARM: On the Benefits of Weight Averaged Reward Modelstraining-methods2401.12187Jan 22, 2024score 9~112 min
2023
23- DecReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agentagents2312.10003Dec 15, 2023score 9~107 min
- DecNash Learning from Human Feedbackalignment2312.00886Dec 1, 2023score 9~110 min
- DecHelping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hackingalignment2312.09244Dec 14, 2023score 9~116 min
- DecWeak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervisionalignment2312.09390Dec 14, 2023score 9~115 min
- NovEverything of Thoughts: Defying the Law of Penrose Triangle for Thought Generationreasoning2311.04254Nov 7, 2023score 9~116 min
- OctSafe RLHF: Safe Reinforcement Learning from Human Feedbackalignment2310.12773Oct 19, 2023score 9~114 min
- OctControlled Decoding from Language Modelsalignment2310.17022Oct 25, 2023score 9~110 min
- OctContrastive Prefence Learning: Learning from Human Feedback without RLrl-training2310.13639Oct 20, 2023score 9~109 min
- OctModel-free Posterior Sampling via Learning Rate Randomizationrl-training2310.18186DeepMind0 citesOct 27, 2023~108 min
- SepRLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedbackalignment2309.00267Sep 1, 2023score 9~119 min
- SepStabilizing RLHF through Advantage Model and Selective Rehearsalalignment2309.10202Sep 18, 2023score 9~119 min
- SepGated recurrent neural networks discover attentionrl-training2309.01775Sep 4, 2023score 9~157 min
- SepStatistical Rejection Sampling Improves Preference Optimizationrl-training2309.06657Sep 13, 2023score 9~114 min
- SepEfficient RLHF: Reducing the Memory Usage of PPOtraining-methods2309.00754Sep 1, 2023score 9~102 min
- AugDeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scalesllm-systems2308.01320Aug 2, 2023score 9~96 min
- AugRetroformer: Retrospective Large Language Agents with Policy Gradient Optimizationrl-training2308.02151Aug 4, 2023score 9~111 min
- JulOpen Problems and Fundamental Limitations of Reinforcement Learning from Human Feedbackalignment2307.15217Jul 27, 2023score 9~121 min
- JulSecrets of RLHF in Large Language Models: Part I: PPOrl-training2307.04964Jul 11, 2023~131 min
- JulRLCD: Reinforcement Learning from Contrast Distillation for Language Model Alignmentrl-training2307.12950Jul 24, 2023score 9~85 min
- JunPreference Ranking Optimization for Human Alignmentalignment2306.17492Jun 30, 2023score 9~118 min
- MaySLiC-HF: Sequence Likelihood Calibration with Human Feedbackalignment2305.10425May 17, 2023score 9~108 min
- MayMassively Scalable Inverse Reinforcement Learning in Google Mapsrl-training2305.11290DeepMindMay 18, 2023~99 min
- MayDirect Preference Optimization: Your Language Model is Secretly a Reward Modeltraining-methods2305.18290Stability AIMay 29, 2023~122 min
2022
3- DecConstitutional AI: Harmlessness from AI Feedbackalignment2212.08073Dec 15, 2022~123 min
- AprTraining a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedbackalignment2204.05862Apr 12, 2022~132 min
- MarTraining language models to follow instructions with human feedbackalignment2203.02155Berkeley BAIRMar 4, 2022~125 min
2021
22020
3- SepLearning to summarize from human feedbackrl-training2009.01325Sep 2, 2020~94 min
- JunConservative Q-Learning for Offline Reinforcement Learningrl-training2006.0477935 citesJun 8, 2020~107 min
- AprNever Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learningrl-training2004.1019013 citesApr 21, 2020~116 min
2019
3- NovMuZero (Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model)rl-training1911.082651,088 citesNov 19, 2019~123 min
- SepControlling Text Generation with Plug and Play Language Modelsrl-training1909.08593UberSep 18, 2019~120 min
- JanNatural Questions: A Benchmark for Question Answering Researchrl-training1901.04473Jan 12, 2019~127 min
2018
6- DecSoft Actor-Critic Algorithms and Applicationsrl-training1812.05905Dec 13, 2018~118 min
- DecOff-Policy Deep Reinforcement Learning without Explorationtraining-methods1812.02900Dec 7, 2018~110 min
- JulRepresentation Learning with Contrastive Predictive Codingpretraining1807.037483,768 citesJul 10, 2018~112 min
- FebIMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architecturesrl-training1802.01561612 citesFeb 5, 2018~119 min
- FebAddressing Function Approximation Error in Actor-Critic Methodsrl-training1802.09477Feb 26, 2018~111 min
- JanSoft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actorrl-training1801.01290Jan 4, 2018~116 min
2017
6- DecRay: A Distributed Framework for Emerging AI Applicationsdistributed-training1712.05889Dec 16, 2017~127 min
- DecA general reinforcement learning algorithm that masters chess, shogi, and Go through self-playrl-training1712.01815Dec 5, 2017~122 min
- OctRainbow: Combining Improvements in Deep Reinforcement Learningrl-training1710.02298428 citesOct 6, 2017~111 min
- JulFiber: Distributed Computing for AI Made Simplerl-training1707.06347UberJul 20, 2017~130 min
- JunDeep reinforcement learning from human preferencesrl-training1706.03741Jun 12, 2017~104 min
- MarMeta-Graph: Few-Shot Link Prediction Using Meta-Learningtraining-methods1703.03400Uber5,791 citesMar 9, 2017~118 min
2016
4- NovGenerative Teaching Networks: Accelerating Neural Architecture Search by Learning to Generate Synthetic Training Dataarchitecture1611.01578Uber909 citesNov 5, 2016~96 min
- JunCooperative Inverse Reinforcement Learningalignment1606.03137Jun 9, 2016~106 min
- JunOpenAI Gymcode1606.01540Jun 5, 2016~95 min
- FebAsynchronous Methods for Deep Reinforcement Learningrl-training1602.01783Feb 4, 2016~138 min
2015
5- NovDueling Network Architectures for Deep Reinforcement Learningarchitecture1511.065811,816 citesNov 20, 2015~96 min
- NovPrioritized Experience Replayrl-training1511.05952Stitch Fix2,045 citesNov 18, 2015~101 min
- SepDeep Reinforcement Learning with Double Q-learningrl-training1509.06461Stitch Fix3,521 citesSep 22, 2015~96 min
- AprEnd-to-End Training of Deep Visuomotor Policiesrl-training1504.00702Apr 2, 2015~109 min
- FebTrust Region Policy Optimizationrl-training1502.05477Feb 19, 2015~108 min
2013
12012
12000
8- —Mastering the game of Go without human knowledgerl-training~144 min
- —Bootstrapped Thompson Sampling and Deep Explorationrl-training~132 min
- —Deterministic Policy Gradient Algorithmsrl-training~115 min
- —Human-level control through deep reinforcement learningrl-training~136 min
- —Apprenticeship Learning via Inverse Reinforcement Learningrl-training~128 min
- —Trust Region Policy Optimizationrl-training~121 min
- —Finite-time Analysis of the Multiarmed Bandit Problemrl-training~110 min
- —Bandit Based Monte-Carlo Planningrl-training~114 min