334 papers
Reasoning
0/334CoT, chain-of-thought, test-time compute.
Progress0 of 334
2026
94- MayMolmoAct2: Action Reasoning Models for Real-world Deploymentagents2605.02881Allen Institute for AIMay 4, 2026~118 min
- Mayoptimize_anything: A Universal API for Optimizing any Text Parameterarchitecture2605.19633May 19, 2026~111 min
- MayPlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Modelsdata2605.20873Tencent HunyuanMay 20, 2026~120 min
- MaySoohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMsevaluation2605.09063EleutherAIMay 9, 2026~115 min
- MayMEME: Multi-entity & Evolving Memory Evaluationevaluation2605.12477KAIST AIMay 12, 2026~130 min
- MayHeavySkill: Heavy Thinking as the Inner Skill in Agentic Harnessreasoning2605.02396LongCatMay 4, 2026~97 min
- MayLLMs Improving LLMs: Agentic Discovery for Test-Time Scalingreasoning2605.08083GoogleMay 8, 2026~135 min
- MayLearning from Language Feedback via Variational Policy Distillationreasoning2605.15113Salesforce AI ResearchMay 14, 2026~108 min
- MayETCHR: Editing To Clarify and Harness Reasoningreasoning2605.23897InternLM / Shanghai AI LabMay 22, 2026~135 min
- MayRebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVRrl-training2605.10781Microsoft ResearchMay 11, 2026~103 min
- MayThe Unlearnability Phenomenon in RLVR for Language Modelsrl-training2605.16787May 16, 2026~129 min
- MayListwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplextraining-methods2605.06139Tencent HunyuanMay 7, 2026~112 min
- MayDeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verificationtraining-methods2605.09269Tencent HunyuanMay 10, 2026~113 min
- MayAdaptive Teacher Exposure for Self-Distillation in LLM Reasoningtraining-methods2605.11458ByteDanceMay 12, 2026~124 min
- AprInCoder-32B-Thinking: Industrial Code World Model for Thinkingcode2604.03144Apr 3, 2026score 9~100 min
- AprDiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domainevaluation2604.10425meituanApr 12, 2026score 3~113 min
- AprDo Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understandingevaluation2604.11177VideoDBApr 13, 2026score 8~119 min
- AprMind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMsevaluation2604.16054Microsoft ResearchApr 17, 2026~137 min
- AprTriAttention: Efficient Long Reasoning with Trigonometric KV Compressioninference-optimization2604.04921NVIDIAApr 6, 2026~116 min
- AprEXAONE 4.5 Technical Reportmultimodal2604.08644LG EXAONEApr 9, 2026score 9~90 min
- AprAudio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Musicmultimodal2604.10905NVIDIAApr 13, 2026score 9~106 min
- AprQwen3.5-Omni Technical Reportmultimodal2604.15804Apr 17, 2026~123 min
- AprRethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capabilityreasoning2604.06628AI45ResearchApr 8, 2026score 9~124 min
- AprProcess Reward Agents for Steering Knowledge-Intensive Reasoningreasoning2604.09482ETH ZurichApr 10, 2026score 9~100 min
- AprTowards Autonomous Mechanistic Reasoning in Virtual Cellsreasoning2604.11661KAIST AIApr 13, 2026score 3~115 min
- AprGeneral365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasksreasoning2604.11778LongCatApr 13, 2026score 9~125 min
- AprLearning to Hint for Reinforcement Learningrl-training2604.00698SnowflakeApr 1, 2026score 9~123 min
- AprHow Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuumrl-training2604.25907GoogleApr 28, 2026~131 min
- AprRAGEN-2: Reasoning Collapse in Agentic RLtraining-methods2604.06268MLL LabApr 7, 2026score 9~118 min
- AprSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervisiontraining-methods2604.12002Princeton UniversityApr 13, 2026score 9~122 min
- AprLightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillationtraining-methods2604.13010NVIDIAApr 14, 2026~132 min
- AprPre-train Space Reinforcement Learning: From P(y|x) to P(y)training-methods2604.14142Chinese Academic of Science Institute of AutomationApr 15, 2026score 9~101 min
- AprTCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agentstraining-methods2604.24005TongyiLabApr 27, 2026~112 min
- AprThink in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoningvision2604.04746AI at MetaApr 6, 2026score 9~98 min
- MarLLM2Vec-Gen: Generative Embeddings from Large Language Modelsagents2603.10913McGill NLP GroupMar 11, 2026~94 min
- MarTRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemasagents2603.16448meituanMar 17, 2026score 9~98 min
- MarReasoning Models Struggle to Control their Chains of Thoughtalignment2603.05706OpenAIMar 5, 2026score 9~99 min
- MarStrategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collectionsevaluation2603.12180SnowflakeMar 12, 2026score 9~134 min
- MarMMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videosevaluation2603.14145NVIDIAMar 14, 2026score 9~133 min
- MarECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretationevaluation2603.14326KAIST AIMar 15, 2026score 9~120 min
- MarConsistency Amplifies: How Behavioral Variance Shapes Agent Accuracyevaluation2603.25764SnowflakeMar 26, 2026score 9~98 min
- MarViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?evaluation2603.25823meituanMar 26, 2026score 9~108 min
- MarFrom Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoningmultimodal2603.03825QwenMar 4, 2026score 9~124 min
- MarBeyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Modelsreasoning2603.01571Tencent HunyuanMar 2, 2026score 9~108 min
- MarEndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Modelsreasoning2603.12252InternLM / Shanghai AI LabMar 12, 2026score 9~121 min
- MarUnderstanding Reasoning in LLMs through Strategic Information Allocation under Uncertaintyreasoning2603.15500Microsoft ResearchMar 16, 2026score 9~160 min
- MarHopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoningreasoning2603.17024QwenMar 17, 2026score 9~135 min
- MarLongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learningreasoning2603.21065Meituan LongCatMar 22, 2026score 9~110 min
- MarWhy Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?reasoning2603.24472Microsoft ResearchMar 25, 2026score 9~109 min
- Mar$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rolloutsrl-training2603.10848LongCatMar 11, 2026score 9~123 min
- MarFIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimizationrl-training2603.19835QwenMar 20, 2026score 10~109 min
- MarOn the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitationrl-training2603.22117QwenMar 23, 2026score 9~121 min
- MarSparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMsrl-training2603.22446QwenMar 23, 2026score 9~112 min
- MarLearn Hard Problems During RL with Reference Guided Fine-tuningtraining-methods2603.01223ByteDance SeedMar 1, 2026score 9~119 min
- MarLaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrievaltraining-methods2603.01425Alibaba DAMOMar 2, 2026score 2~116 min
- MarMM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Datatraining-methods2603.09206NVIDIAMar 10, 2026score 9~112 min
- MarNemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillationtraining-methods2603.19220NVIDIAMar 19, 2026~94 min
- MarRoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Modelstraining-methods2603.21341KAIST AIMar 22, 2026score 9~108 min
- MarSpatialBoost: Enhancing Visual Representation through Language-Guided Reasoningtraining-methods2603.22057KAIST AIMar 23, 2026score 6~115 min
- FebAgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Researchagents2602.06540OpenBMBFeb 6, 2026score 9~98 min
- FebRynnBrain: Open Embodied Foundation Modelsagents2602.14979Alibaba DAMOFeb 13, 2026score 9~112 min
- FebDecoding ML Decision: An Agentic Reasoning Framework for Large-Scale Ranking Systemagents2602.18640Feb 20, 2026~114 min
- FebMobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenariosagents2602.22638alibaba-incFeb 26, 2026score 3~104 min
- FebComposition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Modelsdata2602.12036Tencent HunyuanFeb 12, 2026score 5~100 min
- FebBABE: Biology Arena BEnchmarkevaluation2602.05857ByteDance SeedFeb 5, 2026score 9~111 min
- FebHow2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMsevaluation2602.08808Ai2Feb 9, 2026score 3~131 min
- FebDoes Your Reasoning Model Implicitly Know When to Stop Thinking?inference-optimization2602.08354ByteDanceFeb 9, 2026score 7~98 min
- FebWhen to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoningllm-systems2602.10560ByteDance SeedFeb 11, 2026score 8~103 min
- FebAccelerating Scientific Research with Gemini: Case Studies and Common Techniquesreasoning2602.03837Feb 3, 2026score 2~123 min
- FebOn the Optimal Reasoning Length for RL-Trained Language Modelsreasoning2602.09591DeepSeekFeb 10, 2026~137 min
- FebThinking with Drafting: Optical Decompression via Logical Reconstructionreasoning2602.11731ByteDanceFeb 12, 2026score 3~102 min
- FebGood SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learningrl-training2602.01058Feb 1, 2026~103 min
- FebCoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMsrl-training2602.03048LongCatFeb 3, 2026score 6~95 min
- FebSearch-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaborationrl-training2602.03647Feb 3, 2026~113 min
- FebiGRPO: Self-Feedback-Driven LLM Reasoningrl-training2602.09000NVIDIAFeb 9, 2026~120 min
- FebD-CORE: Incentivizing Task Decomposition in Large Reasoning Models for Complex Tool Usetraining-methods2602.02160alibaba-incFeb 2, 2026score 9~101 min
- FebTraining LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalabilitytraining-methods2602.02477Microsoft ResearchFeb 2, 2026score 8~105 min
- FebNanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Actstraining-methods2602.13367Feb 13, 2026~100 min
- JanFast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planningagents2601.09708NVIDIAJan 14, 2026score 3~113 min
- JanAgentic Reasoning for Large Language Modelsagents2601.12538University of Illinois at Urbana-ChampaignJan 18, 2026score 9~116 min
- JanFantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigationagents2601.13976Alibaba AMAP CV LabJan 20, 2026score 3~126 min
- JanLongCat-Flash-Thinking-2601 Technical Reportagents2601.16725LongCatJan 23, 2026score 9~101 min
- JanDeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraintsagents2601.18137QwenJan 26, 2026score 2~101 min
- JanStable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Modelcode2601.15892ByteDance SeedJan 22, 2026score 8~142 min
- JanRetrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilitiesevaluation2601.21937ByteDance SeedJan 29, 2026score 2~117 min
- JanThe Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoningreasoning2601.06002ByteDanceJan 9, 2026score 8~152 min
- JanLost in the Noise: How Reasoning Models Fail with Contextual Distractorsreasoning2601.07226KAIST AIJan 12, 2026score 3~106 min
- JanMultiplex Thinking: Reasoning via Token-wise Branch-and-Mergereasoning2601.08808Microsoft ResearchJan 13, 2026score 9~92 min
- JanDistribution-Aligned Sequence Distillation for Superior Long-CoT Reasoningreasoning2601.09088Alibaba Cloud Apsara Lab Jan 14, 2026score 6~88 min
- JanVisual Generation Unlocks Human-Like Reasoning through Multimodal World Modelsreasoning2601.19834ByteDance SeedJan 27, 2026score 3~111 min
- JanThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editingrl-training2601.03467ByteDanceJan 6, 2026score 2~98 min
- JanYour Group-Relative Advantage Is Biasedrl-training2601.08521Jan 13, 2026~113 min
- JanGolden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Texttraining-methods2601.22975NVIDIAJan 30, 2026score 9~105 min
- JanUrban Socio-Semantic Segmentation with Vision-Language Reasoningvision2601.10477alibaba-incJan 15, 2026score 3~102 min
2025
152- DecLong-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solvingagents2512.10739Dec 11, 2025~115 min
- DecSeed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experienceagents2512.17260ByteDance SeedDec 19, 2025score 8~129 min
- DecNemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoningarchitecture2512.20848NVIDIADec 23, 2025~114 min
- DecDAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycleevaluation2512.04324ByteDance SeedDec 3, 2025score 8~111 min
- DecEcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerceevaluation2512.08868TongyiLabDec 9, 2025score 7~95 min
- DecMMGR: Multi-Modal Generative Reasoningevaluation2512.14691Dec 16, 2025~123 min
- DecProbing Scientific General Intelligence of LLMs with Scientist-Aligned Workflowsevaluation2512.16969Dec 18, 2025score 9~138 min
- DecReasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMsinference-optimization2512.17206alibaba-incDec 19, 2025score 9~117 min
- DecDeepSeek-V3.2: Pushing the Frontier of Open Large Language Modelsllm-systems2512.02556DeepSeekDec 2, 2025~127 min
- DecBolmo: Byteifying the Next Generation of Language Modelsllm-systems2512.15586Allen Institute for AIDec 17, 2025~120 min
- DecUniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Drivingmultimodal2512.09864ByteDance SeedDec 10, 2025score 2~109 min
- DecSpatialTree: How Spatial Abilities Branch Out in MLLMsmultimodal2512.20617ByteDance SeedDec 23, 2025score 8~112 min
- DecOlmo 3pretraining2512.13961Allen Institute for AIDec 15, 2025~105 min
- DecNemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Modelsreasoning2512.13607NVIDIADec 15, 2025score 9~112 min
- DecFantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning Processreasoning2512.23988Dec 30, 2025~119 min
- DecZoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-inrl-training2512.14273NVIDIADec 16, 2025score 8~102 min
- DecJustRL: Scaling a 1.5B LLM with a Simple RL Reciperl-training2512.16649OpenBMBDec 18, 2025~120 min
- DecEvaluating Parameter Efficient Methods for RLVRrl-training2512.23165DeepSeekDec 29, 2025~105 min
- DecOn the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Modelstraining-methods2512.07783CMU-LTIDec 8, 2025score 9~115 min
- DecQwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Managementtraining-methods2512.12967Dec 15, 2025~110 min
- DecNemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervisiontraining-methods2512.15489NVIDIADec 17, 2025score 8~103 min
- DecExploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Rewardtraining-methods2512.16912Columbia UniversityDec 18, 2025score 9~105 min
- DecDiversity or Precision? A Deep Dive into Next Token Predictiontraining-methods2512.22955Dec 28, 2025~107 min
- NovCodeClash: Benchmarking Goal-Oriented Software Engineeringcode2511.00839Nov 2, 2025~100 min
- NovLong Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scaledata2511.05705NVIDIANov 7, 2025score 9~105 min
- NovWhen Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thoughtevaluation2511.02779ByteDance SeedNov 4, 2025score 8~114 min
- NovMME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacitymultimodal2511.03146ByteDance SeedNov 5, 2025score 9~107 min
- NovVADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Modelsmultimodal2511.07299NVIDIANov 10, 2025score 2~110 min
- NovMusic Flamingo: Scaling Music Understanding in Audio Language Modelsmultimodal2511.10289NVIDIANov 13, 2025score 6~121 min
- NovQwen3-VL Technical Reportmultimodal2511.21631Nov 26, 2025~107 min
- NovThink Visually, Reason Textually: Vision-Language Synergy in ARCreasoning2511.15703Intern Large ModelsNov 19, 2025score 9~105 min
- NovDeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoningreasoning2511.22570Nov 27, 2025~110 min
- NovSAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuningrl-training2511.02280BytedanceDouyinContentNov 4, 2025score 9~130 min
- NovTimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learningrl-training2511.05489ByteDanceNov 7, 2025score 9~106 min
- NovReinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMstraining-methods2511.05933Meta AINov 8, 2025score 9~116 min
- NovRevisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalizationtraining-methods2511.22586ByteDance SeedNov 27, 2025score 9~113 min
- NovDeep Research: A Systematic Surveyuncategorized2512.02038Nov 24, 2025~129 min
- OctTongyi DeepResearch Technical Reportagents2510.24701Oct 28, 2025~115 min
- OctLess is More: Recursive Reasoning with Tiny Networksarchitecture2510.04871Samsung AI Lab (SAIL) MontrealOct 6, 2025score 9~116 min
- OctEvery Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoningarchitecture2510.19338Ant GroupOct 22, 2025score 10~141 min
- OctScaling Latent Reasoning via Looped Language Modelsarchitecture2510.25741ByteDance SeedOct 29, 2025~96 min
- OctProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judgeevaluation2510.18941NVIDIAOct 21, 2025score 9~101 min
- OctSTAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligenceevaluation2510.24693Intern Large ModelsOct 28, 2025score 6~114 min
- OctAMO-Bench: Large Language Models Still Struggle in High School Math Competitionsevaluation2510.26768LongCatOct 30, 2025score 9~107 min
- OctEvery Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundationmoe2510.22115inclusionAIOct 25, 2025score 10~127 min
- OctGenerative Universal Verifier as Multimodal Meta-Reasonermultimodal2510.13804ByteDance SeedOct 15, 2025score 8~106 min
- OctGrasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMsmultimodal2510.18876ByteDanceOct 21, 2025score 4~92 min
- OctR-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?reasoning2510.08189OpenAIOct 9, 2025score 8~107 min
- OctTracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoningreasoning2510.10494Microsoft ResearchOct 12, 2025score 9~120 min
- OctLanguage Models Model Languagereasoning2510.12766SnowflakeOct 14, 2025score 3~120 min
- OctAttention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimizationreasoning2510.13554alibaba-incOct 15, 2025score 9~117 min
- OctLoongRL: Reinforcement Learning for Advanced Reasoning over Long Contextsreasoning2510.19363Microsoft ResearchOct 22, 2025score 9~114 min
- OctUI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoningreasoning2510.20286TongyiLabOct 23, 2025score 6~107 min
- OctOpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidencereasoning2510.20579OpenAIOct 23, 2025score 9~97 min
- OctBroRL: Scaling Reinforcement Learning via Broadened Explorationrl-training2510.01180NVIDIAOct 1, 2025score 9~106 min
- OctLow-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Rewardrl-training2510.03222TencentOct 3, 2025score 9~107 min
- OctLaSeR: Reinforcement Learning with Last-Token Self-Rewardingrl-training2510.14943Tencent HunyuanOct 16, 2025score 10~101 min
- OctDLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learningrl-training2510.15110OpenAIOct 16, 2025score 9~119 min
- OctLarge Reasoning Models Learn Better Alignment from Flawed Thinkingsafety2510.00938Oct 1, 2025~96 min
- OctDistractor Injection Attacks on Large Reasoning Models: Characterization and Defensesafety2510.16259Amazon ScienceOct 17, 2025score 6~101 min
- OctParallelMuse: Agentic Parallel Thinking for Deep Information Seekingtraining-methods2510.24698TongyiLabOct 28, 2025score 9~120 min
- OctDSI-Bench: A Benchmark for Dynamic Spatial Intelligencevision2510.18873alibaba-incOct 21, 2025score 8~102 min
- SepReviewScore: Misinformed Peer Review Detection with Large Language Modelsevaluation2509.21679KAIST AISep 25, 2025score 3~108 min
- SepSAIL-VL2 Technical Reportmultimodal2509.14033Sep 17, 2025~130 min
- SepQwen3-Omni Technical Reportmultimodal2509.17765Sep 22, 2025~129 min
- SepVideo models are zero-shot learners and reasonersmultimodal2509.20328DeepMindSep 24, 2025~135 min
- SepThinking Augmented Pre-trainingpretraining2509.20186Sep 24, 2025~103 min
- SepRLP: Reinforcement as a Pretraining Objectivepretraining2510.01265NVIDIASep 26, 2025score 9~100 min
- SepA Survey of Reinforcement Learning for Large Reasoning Modelsreasoning2509.08827Sep 10, 2025~123 min
- SepNo Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shapingreasoning2509.21880KAIST AISep 26, 2025score 10~103 min
- SepQuantile Advantage Estimation: Stabilizing RLVR for LLM Reasoningreasoning2509.22611Sep 26, 2025score 9~119 min
- SepMeta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learningreasoning2510.03259KAIST AISep 26, 2025score 9~119 min
- SepSIM-CoT: Supervised Implicit Chain-of-Thoughttraining-methods2509.20317InternLM / Shanghai AI LabSep 24, 2025score 8~131 min
- SepBenefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspectivetraining-methods2509.22613Microsoft ResearchSep 26, 2025score 9~95 min
- SepSocratic-Zero : Bootstrapping Reasoning via Data-Free Agent Co-evolutiontraining-methods2509.24726alibaba-incSep 29, 2025score 9~105 min
- SepDeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Searchtraining-methods2509.25454Stanford NLPSep 29, 2025score 10~122 min
- SepKnapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocationtraining-methods2509.25849ByteDance SeedSep 30, 2025score 9~111 min
- SepFront-Loading Reasoning: The Synergy between Pretraining and Post-Training Datatraining-methods2510.03264NVIDIASep 26, 2025score 9~115 min
- SepCARE: Cognitive-reasoning Augmented Reinforcement for Emotional Support Conversationtraining-methods2510.05122Qwen DianJinSep 30, 2025score 1~100 min
- SepRobix: A Unified Model for Robot Interaction, Reasoning and Planninguncategorized2509.01106ByteDance SeedSep 1, 2025score 9~108 min
- SepV2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughtsvision2509.18053NVIDIASep 22, 2025score 3~97 min
- AugFin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Modelsagents2508.15202Qwen DianJinAug 21, 2025score 9~111 min
- AugOpen Data Synthesis For Deep Researchdata2509.00375Aug 30, 2025~139 min
- AugLiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queriesevaluation2508.15760Zoom AIAug 21, 2025score 7~104 min
- AugLess Is More: Training-Free Sparse Attention with Global Locality for Efficient Reasoninginference-optimization2508.07101Aug 9, 2025score 9~111 min
- AugGLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Modelsllm-systems2508.06471Zhipu / GLMAug 8, 2025~138 min
- AugSeeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memorymultimodal2508.09736ByteDance SeedAug 13, 2025score 8~110 min
- AugInternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiencymultimodal2508.18265Aug 25, 2025score 10~107 min
- AugIs Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lensreasoning2508.01191Aug 2, 2025~140 min
- AugNVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Modelreasoning2508.14444NVIDIAAug 20, 2025score 10~119 min
- AugBeyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVRrl-training2508.14029Aug 19, 2025score 9~128 min
- AugDuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimizationtraining-methods2508.14460ByteDance SeedAug 20, 2025score 9~112 min
- AugHermes 4 Technical Reporttraining-methods2508.18255Aug 25, 2025~110 min
- AugMolmoAct: Action Reasoning Models that can Reason in Spaceuncategorized2508.07917Aug 11, 2025~111 min
- AugFutureX: An Advanced Live Benchmark for LLM Agents in Future Predictionuncategorized2508.11987ByteDance SeedAug 16, 2025score 8~116 min
- JulThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planningagents2507.16815NVIDIAJul 22, 2025score 9~110 min
- JulThe Invisible Leash: Why RLVR May or May Not Escape Its Originevaluation2507.14843Jul 20, 2025score 10~137 min
- JulGemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilitiesllm-systems2507.06261Jul 7, 2025score 10~104 min
- JulTraceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodologymultimodal2507.07999OpenAIJul 10, 2025score 8~99 min
- JulEXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modesreasoning2507.11407LG EXAONEJul 15, 2025score 10~110 min
- JulThe Imitation Game: Turing Machine Imitator is Length Generalizable Reasonerreasoning2507.13332Intern Large ModelsJul 17, 2025score 9~106 min
- JulGeometric-Mean Policy Optimizationrl-training2507.20673Jul 28, 2025score 9~105 min
- JulDoes More Inference-Time Compute Really Help Robustness?safety2507.15974DeepSeekJul 21, 2025~111 min
- JulFast and Simplex: 2-Simplicial Attention in Tritonscaling-laws2507.02754Jul 3, 2025score 10~112 min
- JunMultiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generationarchitecture2506.09991Jun 11, 2025score 9~114 min
- JunOpenThoughts: Data Recipes for Reasoning Modelsdata2506.04178DeepSeekJun 4, 2025score 9~121 min
- JunInference-Time Hyper-Scaling with KV Cache Compressioninference-optimization2506.05345NVIDIAJun 5, 2025score 9~102 min
- JunMagistralreasoning2506.10910MistralJun 12, 2025~105 min
- JunMiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attentionreasoning2506.13585DeepSeekJun 16, 2025score 9~132 min
- JunRLPR: Extrapolating RLVR to General Domains without Verifiersrl-training2506.18254OpenBMBJun 23, 2025score 9~83 min
- JunBeyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoningtraining-methods2506.01939Jun 2, 2025score 9~123 min
- MayQwen3 Technical Reportllm-systems2505.09388Qwen / Alibaba CloudMay 14, 2025~128 min
- MayMMaDA: Multimodal Large Diffusion Language Modelsmultimodal2505.15809May 21, 2025~136 min
- May100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Modelsreasoning2505.00551DeepSeekMay 1, 2025score 9~118 min
- MayLlama-Nemotron: Efficient Reasoning Modelsreasoning2505.00949DeepSeekMay 2, 2025~96 min
- MayREASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewardsreasoning2505.24760May 30, 2025score 9~109 min
- MayQwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learningrl-training2505.17667May 23, 2025score 9~118 min
- MayThe Entropy Mechanism of Reinforcement Learning for Reasoning Language Modelstraining-methods2505.22617May 28, 2025score 9~125 min
- AprDeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization?evaluation2504.08120OpenAIApr 10, 2025score 8~97 min
- AprHogwild! Inference: Parallel LLM Generation via Concurrent Attentioninference-optimization2504.06261Apr 8, 2025score 9~116 min
- AprSleep-time Compute: Beyond Inference Scaling at Test-timeinference-optimization2504.13171Apr 17, 2025~127 min
- AprKimi-VL Technical Reportmultimodal2504.07491NVIDIAApr 10, 2025~121 min
- AprDeepSeek-R1 Thoughtology: Let's think about LLM Reasoningreasoning2504.07128DeepSeekApr 2, 2025score 10~120 min
- AprLearning Adaptive Parallel Reasoning with Language Modelsreasoning2504.15466Apr 21, 2025~108 min
- AprDianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Modelsreasoning2504.15716Qwen DianJinApr 22, 2025score 9~106 min
- AprPhi-4-reasoning Technical Reportreasoning2504.21318Microsoft ResearchApr 30, 2025~123 min
- AprDoes Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?rl-training2504.13837Apr 18, 2025score 9~107 min
- AprLearning to Reason under Off-Policy Guidancerl-training2504.14945Apr 21, 2025score 8~116 min
- AprTTRL: Test-Time Reinforcement Learningrl-training2504.16084Apr 22, 2025score 9~93 min
- AprNEMOTRON-CROSSTHINK: Scaling Self-Learning beyond Math Reasoningtraining-methods2504.13941Apr 15, 2025~105 min
- AprReinforcement Learning for Reasoning in Large Language Models with One Training Exampletraining-methods2504.20571Apr 29, 2025score 10~117 min
- MarPhi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAsmultimodal2503.01743Microsoft ResearchMar 3, 2025score 10~111 min
- MarUnderstanding R1-Zero-Like Training: A Critical Perspectivereasoning2503.20783DeepSeekMar 26, 2025score 9~108 min
- MarOpen-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Modelreasoning2503.24290DeepSeekMar 31, 2025score 9~116 min
- MarDAPO: An Open-Source LLM Reinforcement Learning System at Scalerl-training2503.14476OpenAIMar 18, 2025~111 min
- MarSearch-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learningtraining-methods2503.09516Mar 12, 2025score 10~105 min
- FebLM2: Large Memory Modelsarchitecture2502.06049Feb 9, 2025~93 min
- FebSuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplinesevaluation2502.14739ByteDance SeedFeb 20, 2025score 9~86 min
- FebCan 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scalinginference-optimization2502.06703Feb 10, 2025score 9~110 min
- FebChain of Draft: Thinking Faster by Writing Lessprompting2502.18600Zoom AIFeb 25, 2025score 8~88 min
- FebLIMO: Less is More for Reasoningreasoning2502.03387Feb 5, 2025~123 min
- FebGold-medalist Performance in Solving Olympiad Geometry with AlphaGeometry2reasoning2502.03544Feb 5, 2025score 10~127 min
- FebProcess Reinforcement through Implicit Rewardsrl-training2502.01456Feb 3, 2025score 9~110 min
- FebCompetitive Programming with Large Reasoning Modelsrl-training2502.06807OpenAIFeb 3, 2025~127 min
- JanEvolving Deeper LLM Thinkingagents2501.09891DeepMindJan 17, 2025~119 min
- JanrStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinkingreasoning2501.04519OpenAIJan 8, 2025score 9~115 min
- JanKimi k1.5: Scaling Reinforcement Learning with LLMsreasoning2501.12599Jan 22, 2025~107 min
- JanTrading Inference-Time Compute for Adversarial Robustnessreasoning2501.18841OpenAIJan 31, 2025score 10~141 min
- JanReward-Guided Speculative Decoding for Efficient LLM Reasoningreasoning2501.19324SalesforceJan 31, 2025score 9~129 min
- Jans1: Simple test-time scalingreasoning2501.19393OpenAIJan 31, 2025~112 min
- JanDeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learningrl-training2501.12948DeepSeekJan 22, 2025score 10~129 min
- JanThe Lessons of Developing Process Reward Models in Mathematical Reasoningtraining-methods2501.07301Qwen / Alibaba CloudJan 13, 2025score 10~115 min
2024
47- DecExponential Speedups by Rerooting Levin Tree Searchreasoning2412.05196DeepMindDec 6, 2024~112 min
- DecTraining Large Language Models to Reason in a Continuous Latent Spacereasoning2412.06769Dec 9, 2024~126 min
- DecOffline Reinforcement Learning for LLM Multi-Step Reasoningreasoning2412.16145Dec 20, 2024score 9~122 min
- DecHunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Provingreasoning2412.20735Dec 30, 2024score 9~119 min
- DecOpenAI o1 System Cardsafety2412.16720OpenAIDec 21, 2024score 9~170 min
- DecEfficiently Serving LLM Reasoning Programs with Certaindexserving2412.20993Dec 30, 2024score 9~106 min
- DecPhi-4 Technical Reporttraining-methods2412.08905Microsoft ResearchDec 12, 2024~112 min
- DecB-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasonerstraining-methods2412.17256Dec 23, 2024score 9~118 min
- NovUnderstanding Chain-of-Thought in LLMs through Information Theoryreasoning2411.11984Nov 18, 2024~105 min
- NovLLaVA-o1: Let Vision Language Models Reason Step-by-Steptraining-methods2411.10440Nov 15, 2024score 10~100 min
- OctRATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoningreasoning2410.01044Oct 1, 2024score 9~110 min
- OctNot All LLM Reasoners Are Created Equalreasoning2410.01748Oct 2, 2024~109 min
- OctDiffusion Model Predictive Controlreasoning2410.05364DeepMindOct 7, 2024~101 min
- OctA Comparative Study on Reasoning Patterns of OpenAI's o1 Modelreasoning2410.13639Oct 17, 2024score 9~110 min
- SepCan LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchersagents2409.04109Sep 6, 2024score 10~118 min
- SepQwen2.5-Coder Technical Reportcode2409.12186Qwen / Alibaba CloudSep 18, 2024~110 min
- SepA Case Study of Web App Coding with OpenAI Reasoning Modelscode2409.13773Sep 19, 2024score 8~108 min
- SepSource2Synth: Synthetic Data Generation and Curation Grounded in Real Data Sourcesdata2409.08239Sep 12, 2024score 10~112 min
- SepMMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmarkevaluation2409.02813Sep 4, 2024score 9~99 min
- SepAttention Heads of Large Language Models: A Surveyreasoning2409.03752Sep 5, 2024~127 min
- SepTraining Language Models to Self-Correct via Reinforcement Learningtraining-methods2409.12917Sep 19, 2024~103 min
- AugWriting in the Margins: Better Inference Pattern for Long Context Retrievalinference-optimization2408.14906Aug 27, 2024score 8~108 min
- AugTo Code, or Not To Code? Exploring Impact of Code in Pre-trainingpretraining2408.10914Aug 20, 2024~120 min
- AugMUTUAL REASONING MAKES SMALLER LLMS STRONGER PROBLEM-SOLVERSreasoning2408.06195Aug 12, 2024~115 min
- AugDeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Searchreasoning2408.08152DeepSeekAug 15, 2024score 9~112 min
- AugPhysics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math Problemstraining-methods2408.16293Aug 29, 2024score 9~120 min
- JulOn scalable oversight with weak LLMs judging strong LLMssafety2407.04622Jul 5, 2024~137 min
- JulLarge Language Monkeys: Scaling Inference Compute with Repeated Samplingscaling-laws2407.21787Jul 31, 2024~130 min
- JunMMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmarkevaluation2406.01574MistralJun 3, 2024score 10~94 min
- JunDeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligencepretraining2406.11931DeepSeekJun 17, 2024score 10~11 min
- JunUnderstanding and Mitigating Tokenization Bias in Language Modelsreasoning2406.16829Jun 24, 2024~102 min
- MayDeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Datareasoning2405.14333DeepSeekMay 23, 2024score 9~101 min
- AprCapabilities of Gemini Models in Medicinemultimodal2404.18416Apr 29, 2024score 9~125 min
- AprAdvancing LLM Reasoning Generalists with Preference Treesreasoning2404.02078OpenBMBApr 2, 2024score 9~115 min
- AprIterative Reasoning Preference Optimizationreasoning2404.19733Apr 30, 2024score 9~101 min
- AprChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipelinetraining-methods2404.02893Apr 3, 2024score 8~99 min
- AprStream of Search (SoS): Learning to Search in Languagetraining-methods2404.03683Apr 1, 2024score 9~121 min
- AprBetter & Faster Large Language Models via Multi-token Predictiontraining-methods2404.19737Apr 30, 2024~103 min
- MarQuiet-STaR: Language Models Can Teach Themselves to Think Before Speakingreasoning2403.09629Mar 14, 2024score 9~107 min
- MarTeaching Large Language Models to Reason with Reinforcement Learningrl-training2403.04642Mar 7, 2024score 9~115 min
- FebSelf-Discover: Large Language Models Self-Compose Reasoning Structuresprompting2402.03620DeepMindFeb 6, 2024score 9~88 min
- FebDeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Modelsreasoning2402.03300DeepSeekFeb 5, 2024score 10~130 min
- FebPremise Order Matters in Reasoning with Large Language Modelsreasoning2402.08939DeepMindFeb 14, 2024~116 min
- FebChain-of-Thought Reasoning without Promptingreasoning2402.10200Feb 15, 2024~113 min
- FebResonance RoPE: Improving Context Length Generalization of Large Language Modelsreasoning2403.00071Feb 29, 2024score 9~100 min
- FebInternLM-Math: Open Math Large Language Models Toward Verifiable Reasoninguncategorized2402.06332InternLM / Shanghai AI LabFeb 9, 2024score 9~97 min
- JanFrom GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalitiesevaluation2401.15071Jan 26, 2024score 8~96 min
2023
25- DecReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agentagents2312.10003Dec 15, 2023score 9~107 min
- DecGemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Modelsevaluation2312.17661Dec 29, 2023score 3~127 min
- DecGemini: A Family of Highly Capable Multimodal Modelsmultimodal2312.11805Google ResearchDec 19, 2023~123 min
- DecBeyond Human Data: Scaling Self-Training for Problem-Solving with Language Modelstraining-methods2312.06585Dec 11, 2023score 10~116 min
- NovMMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmarkevaluation2311.1650201-AINov 27, 2023~97 min
- NovSystem 2 Attention (is something you might need too)prompting2311.11829Nov 20, 2023score 9~121 min
- NovEverything of Thoughts: Defying the Law of Penrose Triangle for Thought Generationreasoning2311.04254Nov 7, 2023score 9~116 min
- NovThe ART of LLM Refinement: Ask, Refine, and Trustreasoning2311.07961Nov 14, 2023score 9~98 min
- NovOrca 2: Teaching Small Language Models How to Reasonreasoning2311.11045Microsoft ResearchNov 18, 2023score 9~101 min
- NovUniversal Self-Consistency for Large Language Model Generationreasoning2311.17311DeepMindNov 29, 2023~108 min
- OctLlemma: An Open Language Model For Mathematicspretraining2310.10631Stability AIOct 16, 2023score 9~105 min
- OctLarge Language Models as Analogical Reasonersprompting2310.01714DeepMindOct 3, 2023score 9~83 min
- OctLarge Language Models Cannot Self-Correct Reasoning Yetreasoning2310.01798DeepMindOct 3, 2023score 8~111 min
- OctDemocratizing Reasoning Ability: Tailored Learning from Large Language Modelreasoning2310.13332Oct 20, 2023score 9~110 min
- SepGated recurrent neural networks discover attentionrl-training2309.01775Sep 4, 2023score 9~157 min
- AugScaling Relationship on Learning Mathematical Reasoning with Large Language Modelsscaling-laws2308.01825Aug 3, 2023score 9~111 min
- JulSelf-consistency for open-ended generationsreasoning2307.06857Jul 11, 2023score 8~118 min
- JunRead Moreinference-optimization2306.17806EleutherAIJun 30, 2023~115 min
- JunOrca: Progressive Learning from Complex Explanation Traces of GPT-4reasoning2306.02707Stability AIJun 5, 2023score 9~91 min
- MayPaLM 2 Technical Reportpretraining2305.10403May 17, 2023~108 min
- MayTree of Thoughts: Deliberate Problem Solving with Large Language Modelsreasoning2305.10601May 17, 2023score 9~122 min
- MayCan Transformers Learn to Solve Problems Recursively?reasoning2305.14699EleutherAIMay 24, 2023~111 min
- MayLet's Verify Step by Stepreasoning2305.20050May 31, 2023~124 min
- AprGenerative Agents: Interactive Simulacra of Human Behavioragents2304.03442Apr 7, 2023~119 min
- MarSparks of Artificial General Intelligence: Early experiments with GPT-4evaluation2303.12712Mar 22, 2023~117 min
2022
7- NovProgram of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasksprompting2211.12588Nov 22, 2022~106 min
- OctReAct: Synergizing Reasoning and Acting in Language Modelsagents2210.03629Qwen / Alibaba CloudOct 6, 2022~104 min
- OctScaling Instruction-Finetuned Language Modelsalignment2210.11416SalesforceOct 20, 2022~105 min
- MayLarge Language Models are Zero-Shot Reasonersreasoning2205.11916May 24, 2022~102 min
- MarSelf-Consistency Improves Chain of Thought Reasoning in Language Modelsreasoning2203.11171Mar 21, 2022~99 min
- MarSTaR: Bootstrapping Reasoning With Reasoningreasoning2203.14465Mar 28, 2022~94 min
- JanMonte Carlo, Puppetry and Laughter: The Unexpected Joys of Prompt Engineeringreasoning2201.11903InstacartJan 28, 2022~119 min