Timeline
Every summarized paper grouped by publication year. Tap a row to open the summary; the bullet dot lights up once you mark it read.
2026
436 papers- MayAdaptive Teacher Exposure for Self-Distillation in LLM ReasoningTraining Methods2605.11458ByteDanceMay 12, 2026~124 min
- MayAEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement LearningRL Training2605.00425BAIDUMay 1, 2026~125 min
- MayBEAM: Binary Expert Activation Masking for Dynamic Routing in MoEMixture of Experts2605.14438alibaba-incMay 14, 2026~112 min
- MayConditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable AlignmentAlignment2605.20834May 20, 2026~103 min
- MayContext Training with Active Information SeekingContext Optimization2605.13050DeepmindMay 13, 2026~123 min
- MayContinuous Latent Diffusion Language ModelLLM Systems2605.06548ByteDance SeedMay 7, 2026~125 min
- MayContinuous-Time Distribution Matching for Few-Step Diffusion DistillationTraining Methods2605.06376alibaba-incMay 7, 2026~110 min
- MayCovering Human Action Space for Computer Use: Data Synthesis and BenchmarkData2605.12501MicrosoftMay 12, 2026~108 min
- MayCUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use AgentsAgents2605.25624May 25, 2026~120 min
- MayDebiased Model-based Representations for Sample-efficient Continuous ControlRL Training2605.11711Tencent HunyuanMay 12, 2026~113 min
- MayDECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side DevicesMixture of Experts2605.10933Tsinghua NLP GroupMay 11, 2026~105 min
- MayDeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and VerificationTraining Methods2605.09269Tencent HunyuanMay 10, 2026~113 min
- MayEMO: Pretraining Mixture of Experts for Emergent ModularityMixture of Experts2605.06663Allen Institute for AIMay 7, 2026~100 min
- MayEnd-to-End Autoregressive Image Generation with 1D Semantic TokenizerTraining Methods2605.00503ByteDance SeedMay 1, 2026~115 min
- MayEndPrompt: Efficient Long-Context Extension via Terminal AnchoringTraining Methods2605.14589BAIDUMay 14, 2026~127 min
- MayEnhancing Train-Free Infinite-Frame Generation for Consistent Long VideosInference Optimization2605.18233alibaba-incMay 18, 2026~99 min
- MayETCHR: Editing To Clarify and Harness ReasoningReasoning2605.23897InternLM / Shanghai AI LabMay 22, 2026~135 min
- MayFast 4D Mesh Generation by Spatio-Temporal Attention ChainsVision2605.19786NVIDIAMay 19, 2026~109 min
- MayFlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie MatchingVision2605.20910KAIST AIMay 20, 2026~133 min
- MayFrom Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent SkillsEvaluation2605.23899Microsoft ResearchMay 22, 2026~120 min
- MayFull Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training StepsInference Optimization2605.16928RTP-LLMMay 16, 2026~132 min
- MayGated DeltaNet-2: Decoupling Erase and Write in Linear AttentionArchitecture2605.22791NVIDIAMay 21, 2026~109 min
- MayHeavySkill: Heavy Thinking as the Inner Skill in Agentic HarnessReasoning2605.02396LongCatMay 4, 2026~97 min
- MayHINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon AgentsAgents2605.17873KAIST AIMay 18, 2026~112 min
- MayIt Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMsAlignment2605.20258KAIST AIMay 18, 2026~122 min
- MayKernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU KernelsCode2605.04956Tsinghua UniversityMay 6, 2026~132 min
- MayLearning from Language Feedback via Variational Policy DistillationReasoning2605.15113Salesforce AI ResearchMay 14, 2026~108 min
- MayLearning to Foresee: Unveiling the Unlocking Efficiency of On-Policy DistillationTraining Methods2605.11739Tencent HunyuanMay 12, 2026~113 min
- MayLens: Rethinking Training Efficiency for Foundational Text-to-Image ModelsDiffusion2605.21573Microsoft ResearchMay 20, 2026~117 min
- MayLet ViT Speak: Generative Language-Image Pre-trainingVision2605.00809ByteDanceMay 1, 2026~95 min
- MayListwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response SimplexTraining Methods2605.06139Tencent HunyuanMay 7, 2026~112 min
- MayLiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMsVision2605.17260DeepmindMay 17, 2026~106 min
- MayLLMs Improving LLMs: Agentic Discovery for Test-Time ScalingReasoning2605.08083GoogleMay 8, 2026~135 min
- MayLongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video GenerationArchitecture2605.18739NVIDIAMay 18, 2026~131 min
- MayMeasuring Maximum Activations in Open Large Language ModelsServing2605.15572BAIDUMay 15, 2026~113 min
- MayMEME: Multi-entity & Evolving Memory EvaluationEvaluation2605.12477KAIST AIMay 12, 2026~130 min
- MayMemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language ModelsMultimodal2605.14906NVIDIAMay 14, 2026~125 min
- MayMolmoAct2: Action Reasoning Models for Real-world DeploymentAgents2605.02881Allen Institute for AIMay 4, 2026~118 min
- MayMSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video GenerationEvaluation2605.20183TongyiLabMay 19, 2026~122 min
- MayOpenSearch-VL: An Open Recipe for Frontier Multimodal Search AgentsMultimodal2605.05185Tencent HunyuanMay 6, 2026~104 min
- Mayoptimize_anything: A Universal API for Optimizing any Text ParameterArchitecture2605.19633May 19, 2026~111 min
- MayOrchard: An Open-Source Agentic Modeling FrameworkAgents2605.15040Microsoft ResearchMay 14, 2026~130 min
- MayOSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache QuantizationInference Optimization2605.17757TogetherMay 18, 2026~114 min
- MayPiD: Fast and High-Resolution Latent Decoding with Pixel DiffusionDiffusion2605.23902NVIDIAMay 22, 2026~112 min
- MayPlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language ModelsData2605.20873Tencent HunyuanMay 20, 2026~120 min
- MayPREPING: Building Agent Memory without TasksAgents2605.13880KAIST AIMay 11, 2026~94 min
- MayQwen-Image-2.0 Technical ReportArchitecture2605.10730QwenMay 11, 2026~115 min
- MayQwen-Image-VAE-2.0 Technical ReportVision2605.13565QwenMay 13, 2026~110 min
- MayQwen-Scope: Turning Sparse Features into Development Tools for Large Language ModelsAlignment2605.11887Qwen / Alibaba CloudMay 12, 2026~138 min
- MayRebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVRRL Training2605.10781Microsoft ResearchMay 11, 2026~103 min
- MayReinforcing Multimodal Reasoning Against Visual DegradationMultimodal2605.09262Tencent HunyuanMay 10, 2026~119 min
- MayRethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?Retrieval2605.10848May 11, 2026~110 min
- MayRetrieval from Within: An Intrinsic Capability of Attention-Based ModelsRetrieval2605.05806NVIDIAMay 7, 2026~119 min
- MaySANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion TransformerVision2605.15178NVIDIAMay 14, 2026~113 min
- MaySee What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object UnderstandingTraining Methods2605.18018TongyiLabMay 18, 2026~118 min
- MaySetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept PredictionVision2605.20110May 19, 2026~113 min
- MaySkillOpt: Executive Strategy for Self-Evolving Agent SkillsAgents2605.23904Microsoft ResearchMay 22, 2026~125 min
- MaySlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-trainingArchitecture2605.08738May 9, 2026~106 min
- MaySoohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMsEvaluation2605.09063EleutherAIMay 9, 2026~115 min
- MayThe Unlearnability Phenomenon in RLVR for Language ModelsRL Training2605.16787May 16, 2026~129 min
- MayToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use AgentsAgents2605.12481TongyiLabMay 12, 2026~122 min
- MayTraining Long-Context Vision-Language Models Effectively with Generalization Beyond 128K ContextMultimodal2605.13831ByteDance SeedMay 13, 2026~98 min
- MayUniPool: A Globally Shared Expert Pool for Mixture-of-ExpertsMixture of Experts2605.06665CUHKMay 7, 2026~113 min
- MayUniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic SparsificationInference Optimization2605.06221TencentMay 7, 2026~123 min
- MayWildClawBench: A Benchmark for Real-World, Long-Horizon Agent EvaluationAgents2605.10912Intern Large ModelsMay 11, 2026~116 min
- AprA Survey of On-Policy Distillation for Large Language ModelsTraining Methods2604.00626Apr 1, 2026~136 min
- AprAccelerating RL Post-Training Rollouts via System-Integrated Speculative DecodingRL Training2604.26779NVIDIAApr 29, 2026~133 min
- AprAccelerating Speculative Decoding with Block Diffusion Draft TreesInference Optimization2604.12989Apr 14, 2026~107 min
- AprActionParty: Multi-Subject Action Binding in Generative Video GamesVision2604.02330Snap ResearchApr 2, 2026score 9~102 min
- AprAgent-World: Scaling Real-World Environment Synthesis for Evolving General Agent IntelligenceAgents2604.18292ByteDance SeedApr 20, 2026~108 min
- AprAJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware EvaluationEvaluation2604.18240LongCatApr 20, 2026~107 min
- AprAttention Sink in Transformers: A Survey on Utilization, Interpretation, and MitigationContext Optimization2604.10098LongCatApr 11, 2026score 9~127 min
- AprAudio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and MusicMultimodal2604.10905NVIDIAApr 13, 2026score 9~106 min
- AprBeyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language ModelsEvaluation2604.02315Salesforce AI ResearchApr 2, 2026score 7~112 min
- AprCoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-GenerationDiffusion2604.19636alibaba-incApr 21, 2026~120 min
- AprContinuous Adversarial Flow ModelsTraining Methods2604.11521ByteDance SeedApr 13, 2026score 8~119 min
- AprCORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended DiscoveryAgents2604.01658Massachusetts Institute of TechnologyApr 2, 2026score 9~131 min
- AprDiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary DomainEvaluation2604.10425meituanApr 12, 2026score 3~113 min
- AprDMax: Aggressive Parallel Decoding for dLLMsInference Optimization2604.08302National University of SingaporeApr 9, 2026~108 min
- AprDo Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene UnderstandingEvaluation2604.11177VideoDBApr 13, 2026score 8~119 min
- AprDual-View Training for Instruction-Following Information RetrievalRetrieval2604.18845SnowflakeApr 20, 2026~95 min
- AprELT: Elastic Looped Transformers for Visual GenerationVision2604.09168DeepmindApr 10, 2026score 9~111 min
- AprElucidating the SNR-t Bias of Diffusion Probabilistic ModelsDiffusion2604.16044alibaba-incApr 17, 2026~105 min
- AprEXAONE 4.5 Technical ReportMultimodal2604.08644LG EXAONEApr 9, 2026score 9~90 min
- AprFP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout ScalingTraining Methods2604.06916NVIDIAApr 8, 2026~116 min
- AprGeneral365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging TasksReasoning2604.11778LongCatApr 13, 2026score 9~125 min
- AprGLM-5V-Turbo: Toward a Native Foundation Model for Multimodal AgentsMultimodal2604.26752Z.aiApr 29, 2026~127 min
- AprGPA: Learning GUI Process Automation from DemonstrationsAgents2604.01676Salesforce AI ResearchApr 2, 2026score 9~114 min
- AprHierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics ModelingCode2604.05072Tencent HunyuanApr 6, 2026score 3~120 min
- AprHow Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss ContinuumRL Training2604.25907GoogleApr 28, 2026~131 min
- AprHY-Embodied-0.5: Embodied Foundation Models for Real-World AgentsUncategorized2604.07430Tencent HunyuanApr 8, 2026score 9~127 min
- AprImage Generators are Generalist Vision LearnersMultimodal2604.20329DeepMindApr 22, 2026~135 min
- AprInCoder-32B-Thinking: Industrial Code World Model for ThinkingCode2604.03144Apr 3, 2026score 9~100 min
- AprLARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action AlignmentEvaluation2604.11689LongCatApr 13, 2026~111 min
- AprLeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step TrajectoriesTraining Methods2604.15311ByteDance SeedApr 16, 2026score 8~110 min
- AprLearning to Hint for Reinforcement LearningRL Training2604.00698SnowflakeApr 1, 2026score 9~123 min
- AprLeveraging Verifier-Based Reinforcement Learning in Image EditingLLM Systems2604.27505ByteDance SeedApr 30, 2026~121 min
- AprLightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy DistillationTraining Methods2604.13010NVIDIAApr 14, 2026~132 min
- AprLyra 2.0: Explorable Generative 3D WorldsVision2604.13036NVIDIAApr 14, 2026score 3~102 min
- AprMemory Transfer Learning: How Memories are Transferred Across Domains in Coding AgentsAgents2604.14004KAIST AIApr 15, 2026score 8~113 min
- AprMind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMsEvaluation2604.16054Microsoft ResearchApr 17, 2026~137 min
- AprMiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal InteractionMultimodal2604.27393OpenBMBApr 30, 2026~120 min
- AprMM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage GenerationAgents2604.15309Microsoft ResearchApr 16, 2026score 3~94 min
- AprModeling Multiple Support Strategies within a Single Turn for Emotional Support ConversationsRL Training2604.17972Qwen DianJinApr 20, 2026~118 min
- AprMolmoWeb: Open Visual Web Agent and Open Data for the Open WebLLM Systems2604.08516Apr 9, 2026~100 min
- AprMoRight: Motion Control Done RightVision2604.07348NVIDIAApr 8, 2026score 3~110 min
- AprNemotron 3 Nano Omni: Efficient and Open Multimodal IntelligenceMultimodal2604.24954NVIDIAApr 27, 2026~116 min
- AprNemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic ReasoningArchitecture2604.12374NVIDIAApr 14, 2026score 10~121 min
- AprOccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World ModelsEvaluation2604.10866QwenApr 13, 2026score 8~104 min
- AprOmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video GenerationMultimodal2604.11804ByteDanceApr 13, 2026score 3~110 min
- AprPre-train Space Reinforcement Learning: From P(y|x) to P(y)Training Methods2604.14142Chinese Academic of Science Institute of AutomationApr 15, 2026score 9~101 min
- AprProcess Reward Agents for Steering Knowledge-Intensive ReasoningReasoning2604.09482ETH ZurichApr 10, 2026score 9~100 min
- AprProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI EvaluationEvaluation2604.23099DeepMindApr 25, 2026~137 min
- AprQwen3.5-Omni Technical ReportMultimodal2604.15804Apr 17, 2026~123 min
- AprRAGEN-2: Reasoning Collapse in Agentic RLTraining Methods2604.06268MLL LabApr 7, 2026score 9~118 min
- AprReducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency RegularizationUncategorized2604.19079Apr 21, 2026~102 min
- AprRethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model CapabilityReasoning2604.06628AI45ResearchApr 8, 2026score 9~124 min
- AprRethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and RecipeTraining Methods2604.13016OpenBMBApr 14, 2026score 10~136 min
- AprRoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist PoliciesEvaluation2604.09860NVIDIAApr 10, 2026~118 min
- AprSandMLE: A Multi-Agent Framework that Generates Synthetic Sandbox Environments for Training Machine Learning Engineering AgentsTraining Methods2604.04872AI at MetaApr 6, 2026score 9~97 min
- AprSeedance 2.0: Advancing Video Generation for World ComplexityDiffusion2604.14148ByteDance SeedApr 15, 2026score 3~127 min
- AprSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionTraining Methods2604.12002Princeton UniversityApr 13, 2026score 9~122 min
- AprStochastic KV Routing: Enabling Adaptive Depth-Wise Cache SharingInference Optimization2604.22782AppleApr 3, 2026~101 min
- AprSynthetic Computers at Scale for Long-Horizon Productivity SimulationAgents2604.28181MicrosoftApr 30, 2026~128 min
- AprTCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous AgentsTraining Methods2604.24005TongyiLabApr 27, 2026~112 min
- AprThe Illusion of Certainty: Decoupling Capability and Calibration in On-Policy DistillationTraining Methods2604.16830Salesforce AI ResearchApr 18, 2026~115 min
- AprThink in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved ReasoningVision2604.04746AI at MetaApr 6, 2026score 9~98 min
- AprToward Scalable Terminal Task Synthesis via Skill GraphsAgents2604.25727Tencent HunyuanApr 28, 2026~130 min
- AprTowards Autonomous Mechanistic Reasoning in Virtual CellsReasoning2604.11661KAIST AIApr 13, 2026score 3~115 min
- AprTrain-to-Test (T2) Scaling Laws: Integrating Pretraining and Test-Time ComputeScaling Laws2604.01411University of Wisconsin-MadisonApr 1, 2026score 9~122 min
- AprTriAttention: Efficient Long Reasoning with Trigonometric KV CompressionInference Optimization2604.04921NVIDIAApr 6, 2026~116 min
- AprTstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion ItemsVision2604.19748alibaba-incApr 21, 2026~107 min
- AprTuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and GenerationMultimodal2604.24763Meta AIApr 27, 2026~119 min
- AprUnifying Group-Relative and Self-Distillation Policy Optimization via Sample RoutingRL Training2604.02288Apr 2, 2026score 10~101 min
- AprUniversal YOCO for Efficient Depth ScalingArchitecture2604.01220Microsoft ResearchApr 1, 2026score 9~105 min
- AprWildDet3D: Scaling Promptable 3D Detection in the WildVision2604.08626Allen Institute for AIApr 9, 2026score 3~124 min
- AprWorld-R1: Reinforcing 3D Constraints for Text-to-Video GenerationRL Training2604.24764Microsoft ResearchApr 27, 2026~117 min
- Mar$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL RolloutsRL Training2603.10848LongCatMar 11, 2026score 9~123 min
- MarA Subgoal-driven Framework for Improving Long-Horizon LLM AgentsAgents2603.19685DeepmindMar 20, 2026score 10~135 min
- MarAI Can Learn Scientific TasteRL Training2603.14473OpenMOSSMar 15, 2026~105 min
- MarArtLLM: Generating Articulated Assets via 3D LLMMultimodal2603.01142Tencent HunyuanMar 1, 2026score 2~105 min
- MarAttention ResidualsArchitecture2603.15031Moonshot AIMar 16, 2026score 9~110 min
- MarBenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMsSafety2603.16557LG AI ResearchMar 17, 2026score 8~101 min
- MarBeyond Language Modeling: An Exploration of Multimodal PretrainingMultimodal2603.03276AI at MetaMar 3, 2026score 9~119 min
- MarBeyond Length Scaling: Synergizing Breadth and Depth for Generative Reward ModelsReasoning2603.01571Tencent HunyuanMar 2, 2026score 9~108 min
- MarBeyond Single Tokens: Distilling Discrete Diffusion Models via Discrete MMDTraining Methods2603.20155DeepmindMar 20, 2026score 9~109 min
- MarBizGenEval: A Systematic Benchmark for Commercial Visual Content GenerationEvaluation2603.25732Microsoft ResearchMar 26, 2026score 3~121 min
- MarBreaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding ModelsRL Training2603.07777Microsoft ResearchMar 8, 2026score 9~119 min
- MarCan Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge StreamsEvaluation2603.07392KAIST AIMar 8, 2026score 9~117 min
- MarCharacterFlywheel: Scaling Iterative Improvement of Engaging and Steerable LLMs in ProductionAlignment2603.01973Meta LlamaMar 2, 2026score 9~140 min
- MarCode-Space Response Oracles: Generating Interpretable Multi-Agent Policies with Large Language ModelsRL Training2603.10098DeepmindMar 10, 2026score 9~109 min
- MarCodePercept: Code-Grounded Visual STEM Perception for MLLMsMultimodal2603.10757QwenMar 11, 2026score 9~103 min
- MarComplementary Reinforcement LearningRL Training2603.17621alibaba-incMar 18, 2026score 9~129 min
- MarConsistency Amplifies: How Behavioral Variance Shapes Agent AccuracyEvaluation2603.25764SnowflakeMar 26, 2026score 9~98 min
- MarDA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion ModelsVision2603.23499KAIST AIMar 24, 2026score 2~104 min
- MardaVinci-LLM:Towards the Science of PretrainingPretraining2603.27164SII-GAIRMar 28, 2026score 9~110 min
- MarDreamLite: A Lightweight On-Device Unified Model for Image Generation and EditingMultimodal2603.28713ByteDanceMar 30, 2026score 6~111 min
- MarDreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement LearningVision2603.12257TongyiLabMar 12, 2026score 4~107 min
- MarECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG InterpretationEvaluation2603.14326KAIST AIMar 15, 2026score 9~120 min
- MarEgo2Web: A Web Agent Benchmark Grounded in Egocentric VideosEvaluation2603.22529DeepmindMar 23, 2026score 8~120 min
- MarEndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion ModelsReasoning2603.12252InternLM / Shanghai AI LabMar 12, 2026score 9~121 min
- MarFinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context ProtocolEvaluation2603.24943Qwen DianJinMar 26, 2026score 3~111 min
- MarFIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy OptimizationRL Training2603.19835QwenMar 20, 2026score 10~109 min
- MarFrom Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal ReasoningMultimodal2603.03825QwenMar 4, 2026score 9~124 min
- MarGLM-OCR Technical ReportMultimodal2603.10910Zhipu / GLMMar 11, 2026~111 min
- MarGrounding World Simulation Models in a Real-World MetropolisVision2603.15583NAVER AI LabMar 16, 2026score 9~120 min
- MarHelios: Real Real-Time Long Video Generation ModelVision2603.04379NVIDIAMar 4, 2026score 9~109 min
- MarHeterogeneous Agent Collaborative Reinforcement LearningRL Training2603.02604ByteDanceMar 3, 2026score 9~112 min
- MarHiAR: Efficient Autoregressive Long Video Generation via Hierarchical DenoisingVision2603.08703Tencent HunyuanMar 9, 2026score 9~125 min
- MarHiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product ImagesVision2603.02210ByteDanceMar 2, 2026score 3~97 min
- MarHopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language ReasoningReasoning2603.17024QwenMar 17, 2026score 9~135 min
- MarHow Controllable Are Large Language Models? A Unified Evaluation across Behavioral GranularitiesEvaluation2603.02578alibaba-incMar 3, 2026score 6~107 min
- MarHow Far Can Unsupervised RLVR Scale LLM Training?Training Methods2603.08660Tsinghua UniversityMar 9, 2026~126 min
- MarHY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image EditingTraining Methods2603.07236Tencent HunyuanMar 7, 2026score 6~135 min
- MarIn-Context Reinforcement Learning for Tool Use in Large Language ModelsTraining Methods2603.08068National University of SingaporeMar 9, 2026~114 min
- MarIndexCache: Accelerating Sparse Attention via Cross-Layer Index ReuseInference Optimization2603.12201DeepSeekMar 12, 2026~129 min
- MarIntern-S1-Pro: Scientific Multimodal Foundation Model at Trillion ScaleMultimodal2603.25040InternLM / Shanghai AI LabMar 26, 2026~113 min
- MarKernel-Smith: A Unified Recipe for Evolutionary Kernel OptimizationCode2603.28342NVIDIAMar 30, 2026~139 min
- MarLaSER: Internalizing Explicit Reasoning into Latent Space for Dense RetrievalTraining Methods2603.01425Alibaba DAMOMar 2, 2026score 2~116 min
- MarLearn Hard Problems During RL with Reference Guided Fine-tuningTraining Methods2603.01223ByteDance SeedMar 1, 2026score 9~119 min
- MarLearning to Retrieve from Agent TrajectoriesRetrieval2604.04949RUC-GSAI-IIRLabMar 30, 2026score 9~118 min
- MarLearning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool UseAlignment2603.03205Microsoft ResearchMar 3, 2026score 8~111 min
- MarLingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cellsUncategorized2603.25240DAMO AcademyMar 26, 2026score 2~128 min
- MarLLM2Vec-Gen: Generative Embeddings from Large Language ModelsAgents2603.10913McGill NLP GroupMar 11, 2026~94 min
- MarLoGeR: Long-Context Geometric Reconstruction with Hybrid MemoryVision2603.03269DeepmindMar 3, 2026score 9~132 min
- MarLongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement LearningReasoning2603.21065Meituan LongCatMar 22, 2026score 9~110 min
- MarLongCat-Next: Lexicalizing Modalities as Discrete TokensMultimodal2603.27538Meituan LongCatMar 29, 2026score 9~113 min
- MarLumosX: Relate Any Identities with Their Attributes for Personalized Video GenerationAgents2603.20192Alibaba DAMOMar 20, 2026score 4~109 min
- MarMA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied AgentsEvaluation2603.09827KAIST AIMar 10, 2026score 3~119 min
- MarMamba-3: Improved Sequence Modeling using State Space PrinciplesArchitecture2603.15569Together AIMar 16, 2026~121 min
- MarManifold-Aware Exploration for Reinforcement Learning in Video GenerationTraining Methods2603.21872Tencent HunyuanMar 23, 2026score 9~110 min
- MarMASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language ModelsMultimodal2603.04800alibaba-incMar 5, 2026score 9~125 min
- MarMeta-Reinforcement Learning with Self-Reflection for Agentic SearchTraining Methods2603.11327Ai2Mar 11, 2026~97 min
- MarMixture-of-Depths AttentionArchitecture2603.15619ByteDance SeedMar 16, 2026score 9~111 min
- MarMM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero DataTraining Methods2603.09206NVIDIAMar 10, 2026score 9~112 min
- MarMMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World VideosEvaluation2603.14145NVIDIAMar 14, 2026score 9~133 min
- MarMolmoB0T: Large-Scale Simulation Enables Zero-Shot ManipulationUncategorized2603.16861Ai2Mar 17, 2026score 9~120 min
- MarNemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy DistillationTraining Methods2603.19220NVIDIAMar 19, 2026~94 min
- MarOmni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World ModelsEvaluation2603.22212alibaba-incMar 23, 2026score 6~118 min
- MarOn the Direction of RLVR Updates for LLM Reasoning: Identification and ExploitationRL Training2603.22117QwenMar 23, 2026score 9~121 min
- MarOn-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion TransformersDiffusion2603.28762Snap ResearchMar 30, 2026score 6~104 min
- MarOnline Experiential Learning for Language ModelsTraining Methods2603.16856Microsoft ResearchMar 17, 2026score 9~121 min
- MarPivotRL: High Accuracy Agentic Post-Training at Low Compute CostRL Training2603.21383NVIDIAMar 22, 2026~123 min
- MarPOLCA: Stochastic Generative Optimization with LLMCode2603.14769DeepmindMar 16, 2026score 9~113 min
- MarPolyglot-Lion: Efficient Multilingual ASR for Singapore via Balanced Fine-Tuning of Qwen3-ASRArchitecture2603.16184Knovel EngineeringMar 17, 2026score 3~116 min
- MarProact-VL: A Proactive VideoLLM for Real-Time AI CompanionsAgents2603.03447Microsoft ResearchMar 3, 2026score 9~94 min
- MarProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM AgentsAgents2603.18815NVIDIAMar 19, 2026~99 min
- MarQianfan-OCR: A Unified End-to-End Model for Document IntelligenceMultimodal2603.13398BAIDUMar 11, 2026score 9~134 min
- MarREAD MOREInference Optimization2603.05451Together AIMar 5, 2026~113 min
- MarRealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task EvaluationEvaluation2603.25804QwenMar 26, 2026score 4~89 min
- MarReasoning Models Struggle to Control their Chains of ThoughtAlignment2603.05706OpenAIMar 5, 2026score 9~99 min
- MarRepresentation Alignment for Just Image Transformers is not Easier than You ThinkTraining Methods2603.14366KAIST AIMar 15, 2026score 8~128 min
- MarRepurposing Geometric Foundation Models for Multi-view DiffusionVision2603.22275KAIST AIMar 23, 2026score 3~90 min
- MarRethinking Training Targets, Architectures and Data Quality for Universal Speech EnhancementTraining Methods2603.02641Mar 3, 2026~97 min
- MarRoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action ModelsTraining Methods2603.21341KAIST AIMar 22, 2026score 9~108 min
- MarRubricBench: Aligning Model-Generated Rubrics with Human StandardsEvaluation2603.01562Tencent HunyuanMar 2, 2026score 9~105 min
- MarSAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video EditingVision2603.19228BAIDUMar 19, 2026score 3~105 min
- MarScaling Agentic Capabilities, Not Context: Efficient Reinforcement Finetuning for Large ToolspacesTraining Methods2603.06713Microsoft ResearchMar 5, 2026score 9~112 min
- MarScaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging ProblemsData2603.07779Microsoft ResearchMar 8, 2026score 9~118 min
- MarSIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLMUncategorized2603.23386ByteDance SeedMar 24, 2026score 3~116 min
- MarSNAP: Speaker Nulling for Artifact Projection in Speech Deepfake DetectionSafety2603.20686KAIST AIMar 21, 2026score 3~120 min
- MarSommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language ModelsData2603.25750KAIST AIMar 20, 2026score 6~111 min
- MarSparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMsRL Training2603.22446QwenMar 23, 2026score 9~112 min
- MarSparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured SparsityLow Precision2603.05168Microsoft ResearchMar 5, 2026score 9~79 min
- MarSpatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time TrainingMultimodal2603.12255Tencent HunyuanMar 12, 2026score 9~139 min
- MarSpatialBoost: Enhancing Visual Representation through Language-Guided ReasoningTraining Methods2603.22057KAIST AIMar 23, 2026score 6~115 min
- MarStrategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document CollectionsEvaluation2603.12180SnowflakeMar 12, 2026score 9~134 min
- MarSupervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language ModelsTraining Methods2603.13985AmazonMar 14, 2026~117 min
- MarT-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary SearchAgents2603.22341KAIST AIMar 21, 2026score 9~112 min
- MarTAPS: Task Aware Proposal Distributions for Speculative SamplingInference Optimization2603.27027Image and Video Understanding LabMar 27, 2026score 9~125 min
- MarTimer-S1: A Billion-Scale Time Series Foundation Model with Serial ScalingLLM Systems2603.04791ByteDanceMar 5, 2026score 3~108 min
- MarTRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown SchemasAgents2603.16448meituanMar 17, 2026score 9~98 min
- MarUnderstand and Accelerate Memory Processing Pipeline for Large Language Model InferenceInference Optimization2603.29002Mar 30, 2026score 9~128 min
- MarUnderstanding by Reconstruction: Reversing the Software Development Process for LLM PretrainingPretraining2603.11103ByteDance SeedMar 11, 2026score 9~111 min
- MarUnderstanding Reasoning in LLMs through Strategic Information Allocation under UncertaintyReasoning2603.15500Microsoft ResearchMar 16, 2026score 9~160 min
- MarUnderstanding the Challenges in Iterative Generative Optimization with LLMsTraining Methods2603.23994DeepmindMar 25, 2026score 9~94 min
- MarUniCom: Unified Multimodal Modeling via Compressed Continuous Semantic RepresentationsMultimodal2603.10702Tencent HunyuanMar 11, 2026score 6~110 min
- MarUnified Spatio-Temporal Token Scoring for Efficient Video VLMsInference Optimization2603.18004Ai2Mar 18, 2026score 9~114 min
- MarUnify-Agent: A Unified Multimodal Agent for World-Grounded Image SynthesisAgents2603.29620Tencent HunyuanMar 31, 2026score 8~107 min
- MarUniGRPO: Unified Policy Optimization for Reasoning-Driven Visual GenerationRL Training2603.23500ByteDance SeedMar 24, 2026score 9~101 min
- MarV-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised LearningPretraining2603.14482Meta LlamaMar 15, 2026score 7~123 min
- MarVersatile Editing of Video Content, Actions, and Dynamics without TrainingDiffusion2603.17989DeepmindMar 18, 2026score 3~122 min
- MarViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?Evaluation2603.25823meituanMar 26, 2026score 9~108 min
- MarVision2Web: A Hierarchical Benchmark for Visual Website Development with Agent VerificationAgents2603.26648Z.aiMar 27, 2026score 9~132 min
- MarVisual-ERM: Reward Modeling for Visual EquivalenceVision2603.13224InternLM / Shanghai AI LabMar 13, 2026score 9~127 min
- MarWhy Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?Reasoning2603.24472Microsoft ResearchMar 25, 2026score 9~109 min
- FebA Mixed Diet Makes DINO An Omnivorous Vision EncoderMultimodal2602.24181DeepmindFeb 27, 2026score 6~109 min
- FebABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold LearningTraining Methods2602.11236Alibaba AMAP CV LabFeb 11, 2026score 2~111 min
- FebAccelerating Scientific Research with Gemini: Case Studies and Common TechniquesReasoning2602.03837Feb 3, 2026score 2~123 min
- FebAdapting Vision-Language Models for E-commerce Understanding at ScaleMultimodal2602.11733Feb 12, 2026~133 min
- FebAgent World Model: Infinity Synthetic Environments for Agentic Reinforcement LearningAgents2602.10090SnowflakeFeb 10, 2026score 9~111 min
- FebAgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep ResearchAgents2602.06540OpenBMBFeb 6, 2026score 9~98 min
- FebArcee Trinity Large Technical ReportMixture of Experts2602.17004Feb 19, 2026~114 min
- FebArcFlow: Unleashing 2-Step Text-to-Image Generation via High-Precision Non-Linear Flow DistillationDiffusion2602.09014Fudan UniversityFeb 9, 2026score 8~99 min
- FebBABE: Biology Arena BEnchmarkEvaluation2602.05857ByteDance SeedFeb 5, 2026score 9~111 min
- FebBitDance: Scaling Autoregressive Generative Models with Binary TokensUncategorized2602.14041ByteDanceFeb 15, 2026score 9~104 min
- FebCanzona: A Unified, Asynchronous, and Load-Balanced Framework for Distributed Matrix-based OptimizersTraining Methods2602.06079QwenFeb 4, 2026score 5~119 min
- FebCC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question AnsweringMultimodal2602.23952Alibaba CloudFeb 27, 2026score 2~95 min
- FebCoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMsRL Training2602.03048LongCatFeb 3, 2026score 6~95 min
- FebComposition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language ModelsData2602.12036Tencent HunyuanFeb 12, 2026score 5~100 min
- FebCUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel GenerationTraining Methods2602.24286ByteDance SeedFeb 27, 2026score 9~110 min
- FebD-CORE: Incentivizing Task Decomposition in Large Reasoning Models for Complex Tool UseTraining Methods2602.02160alibaba-incFeb 2, 2026score 9~101 min
- FebData Science and Technology Towards AGI Part I: Tiered Data ManagementData2602.09003OpenBMBFeb 9, 2026score 8~115 min
- FebDecoding ML Decision: An Agentic Reasoning Framework for Large-Scale Ranking SystemAgents2602.18640Feb 20, 2026~114 min
- FebDFlash: Block Diffusion for Flash Speculative DecodingInference Optimization2602.06036Feb 5, 2026~116 min
- FebDoes Your Reasoning Model Implicitly Know When to Stop Thinking?Inference Optimization2602.08354ByteDanceFeb 9, 2026score 7~98 min
- FebDr. Kernel: Reinforcement Learning Done Right for Triton Kernel GenerationsCode2602.05885Feb 5, 2026~111 min
- FebDreamDojo: A Generalist Robot World Model from Large-Scale Human VideosUncategorized2602.06949NVIDIAFeb 6, 2026score 2~117 min
- FebDreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video GenerationMultimodal2602.12160ByteDanceFeb 12, 2026score 3~121 min
- FebDualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM InferenceServing2602.21548DeepSeekFeb 25, 2026score 9~109 min
- FebERNIE 5.0 Technical ReportMultimodal2602.04705Feb 4, 2026~138 min
- FebF-GRPO: Don't Let Your Policy Learn the Obvious and Forget the RareTraining Methods2602.06717T-TechFeb 6, 2026score 9~113 min
- FebFASA: Frequency-aware Sparse AttentionInference Optimization2602.03152Feb 3, 2026~117 min
- FebFrom Scale to Speed: Adaptive Test-Time Scaling for Image EditingDiffusion2603.00141alibaba-incFeb 24, 2026score 6~106 min
- FebFSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent SpaceArchitecture2602.02092ByteDanceFeb 2, 2026score 9~118 min
- FebGLM-5: from Vibe Coding to Agentic EngineeringUncategorized2602.15763Zhipu / GLMFeb 17, 2026~148 min
- FebGood SFT Optimizes for SFT, Better SFT Prepares for Reinforcement LearningRL Training2602.01058Feb 1, 2026~103 min
- FebHow2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMsEvaluation2602.08808Ai2Feb 9, 2026score 3~131 min
- FebHY3D-Bench: Generation of 3D AssetsData2602.03907Tencent HunyuanFeb 3, 2026score 2~113 min
- FebHySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache SharingArchitecture2602.03560Xiaomi MiMoFeb 3, 2026score 9~105 min
- FebiGRPO: Self-Feedback-Driven LLM ReasoningRL Training2602.09000NVIDIAFeb 9, 2026~120 min
- Febjina-embeddings-v5-text: Task-Targeted Embedding DistillationTraining Methods2602.15547Feb 17, 2026~106 min
- FebK-Search: LLM Kernel Generation via Co-Evolving Intrinsic World ModelLLM Systems2602.19128Feb 22, 2026~109 min
- FebKimi K2.5: Visual Agentic IntelligenceMultimodal2602.02276Moonshot / KimiFeb 2, 2026score 8~145 min
- FebLate-to-Early Training: LET LLMs Learn Earlier, So Faster and BetterTraining Methods2602.05393ByteDance SeedFeb 5, 2026score 8~112 min
- FebLearning beyond Teacher: Generalized On-Policy Distillation with Reward ExtrapolationTraining Methods2602.12125Tencent HunyuanFeb 12, 2026score 9~91 min
- FebLIVE: Long-horizon Interactive Video World ModelingUncategorized2602.03747Microsoft ResearchFeb 3, 2026score 3~103 min
- FebLLaDA2.1: Speeding Up Text Diffusion via Token EditingTraining Methods2602.08676Feb 9, 2026~106 min
- FebLycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse DecodingInference Optimization2602.04541Feb 4, 2026~104 min
- FebMedXIAOHE: A Comprehensive Recipe for Building Medical MLLMsVision2602.12705ByteDanceFeb 13, 2026score 7~121 min
- FebMiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context ModelingArchitecture2602.11761Feb 12, 2026~104 min
- FebMobile-Agent-v3.5: Multi-platform Fundamental GUI AgentsAgents2602.16855TongyiLabFeb 15, 2026score 2~131 min
- FebMobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility ScenariosAgents2602.22638alibaba-incFeb 26, 2026score 3~104 min
- FebMode Seeking meets Mean Seeking for Fast Long Video GenerationVision2602.24289NVIDIAFeb 27, 2026score 2~106 min
- FebMolHIT: Advancing Molecular-Graph Generation with Hierarchical Discrete Diffusion ModelsPretraining2602.17602KAIST AIFeb 19, 2026score 2~123 min
- FebNanbeige4.1-3B: A Small General Model that Reasons, Aligns, and ActsTraining Methods2602.13367Feb 13, 2026~100 min
- FebNarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective ControlMultimodal2602.09070ByteDanceFeb 9, 2026score 2~110 min
- FebOmniMoE: An Efficient MoE by Orchestrating Atomic Experts at ScaleMixture of Experts2602.05711Feb 5, 2026~115 min
- FebOn Data Engineering for Scaling LLM Terminal CapabilitiesData2602.21193NVIDIAFeb 24, 2026score 3~102 min
- FebOn the Optimal Reasoning Length for RL-Trained Language ModelsReasoning2602.09591DeepSeekFeb 10, 2026~137 min
- FebOPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every IterationData2602.05400QwenFeb 5, 2026score 7~121 min
- FebOutcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward ModelsAlignment2602.04649QwenFeb 4, 2026score 9~109 min
- FebP-GenRM: Personalized Generative Reward Model with Test-time User-based ScalingAlignment2602.12116Tongyi-ConvAIFeb 12, 2026score 9~115 min
- FebParallel Track Transformers: Enabling Fast GPU Inference with Reduced SynchronizationArchitecture2602.07306AppleFeb 7, 2026~107 min
- FebPhyCritic: Multimodal Critic Models for Physical AITraining Methods2602.11124NVIDIAFeb 11, 2026score 6~105 min
- FebPrincipled Synthetic Data Enables the First Scaling Laws for LLMs in RecommendationLLM Systems2602.07298AI at MetaFeb 7, 2026score 4~120 min
- FebPrivasis: Synthesizing the Largest "Public" Private Dataset from ScratchData2602.03183NVIDIAFeb 3, 2026score 2~109 min
- FebProAct: Agentic Lookahead in Interactive EnvironmentsAgents2602.05327Tencent HunyuanFeb 5, 2026score 8~95 min
- FebProtein Autoregressive Modeling via Multiscale Structure GenerationDiffusion2602.04883ByteDance SeedFeb 4, 2026score 1~107 min
- FebQwen3-Coder-Next Technical ReportTraining Methods2603.00729QwenFeb 28, 2026score 9~123 min
- FebRecurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative ReasoningArchitecture2602.07845Ai2Feb 8, 2026score 6~107 min
- FebReinforcement World Model Learning for LLM-based AgentsTraining Methods2602.05842Microsoft ResearchFeb 5, 2026score 3~88 min
- FebRoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot LearningData2602.18742KAIST AIFeb 21, 2026score 2~101 min
- FebRynnBrain: Open Embodied Foundation ModelsAgents2602.14979Alibaba DAMOFeb 13, 2026score 9~112 min
- FebSAGE: Scalable Agentic 3D Scene Generation for Embodied AIAgents2602.10116NVIDIAFeb 10, 2026score 2~115 min
- FebScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent TrainingAgents2602.06820LongCatFeb 6, 2026score 9~103 min
- FebScaling Search Relevance: Augmenting App Store Ranking with LLM-Generated JudgmentsScaling Laws2602.23234AppleFeb 26, 2026~104 min
- FebSEAD: Self-Evolving Agent for Multi-Turn Service DialogueAgents2602.03548meituanFeb 3, 2026score 5~110 min
- FebSearch-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner CollaborationRL Training2602.03647Feb 3, 2026~113 min
- FebSeeUPO: Sequence-Level Agentic-RL with Convergence GuaranteesTraining Methods2602.06554Tongyi-MAIFeb 6, 2026score 9~111 min
- FebSelf-Hinting Language Models Enhance Reinforcement LearningTraining Methods2602.03143Feb 3, 2026~121 min
- FebSemantic Search At LinkedInLLM Systems2602.07309LinkedInFeb 7, 2026~139 min
- FebSingle-minus gluon tree amplitudes are nonzeroAgents2602.12176OpenAIFeb 12, 2026score 1~121 min
- FebSLA2: Sparse-Linear Attention with Learnable Routing and QATDiffusion2602.12675Feb 13, 2026~115 min
- FebSpanning the Visual Analogy Space with a Weight Basis of LoRAsVision2602.15727NVIDIAFeb 17, 2026score 2~110 min
- FebSpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-TuningInference Optimization2602.13515Feb 13, 2026~108 min
- FebSPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive LearningPretraining2602.02472ByteDance SeedFeb 2, 2026score 2~112 min
- FebSPEED-Bench: A Unified and Diverse Benchmark for Speculative DecodingInference Optimization2604.09557NVIDIAFeb 10, 2026score 9~89 min
- FebStep 3.5 Flash: Open Frontier-Level Intelligence with 11B Active ParametersMixture of Experts2602.10604StepFunFeb 11, 2026score 8~135 min
- FebSWE-Universe: Scale Real-World Verifiable Environments to MillionsAgents2602.02361QwenFeb 2, 2026score 4~109 min
- FebTest-Time Training with KV Binding Is Secretly Linear AttentionLLM Systems2602.21204NVIDIAFeb 24, 2026score 9~131 min
- FebThe Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI SocietiesSafety2602.09877AnthropicFeb 10, 2026score 3~121 min
- FebThinking with Drafting: Optical Decompression via Logical ReconstructionReasoning2602.11731ByteDanceFeb 12, 2026score 3~102 min
- FebTOPReward: Token Probabilities as Hidden Zero-Shot Rewards for RoboticsUncategorized2602.19313Ai2Feb 22, 2026score 3~97 min
- FebTraining LLMs for Divide-and-Conquer Reasoning Elevates Test-Time ScalabilityTraining Methods2602.02477Microsoft ResearchFeb 2, 2026score 8~105 min
- FebTRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World ScenariosAgents2602.01675meituanFeb 2, 2026score 3~122 min
- FebUniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language ModelArchitecture2602.14178ByteDanceFeb 15, 2026score 9~131 min
- FebUntied Ulysses: Memory-Efficient Context Parallelism via Headwise ChunkingLLM Systems2602.21196TogetherFeb 24, 2026score 9~105 min
- FebVGG-T$^3$: Offline Feed-Forward 3D Reconstruction at ScaleVision2602.23361NVIDIAFeb 26, 2026score 2~97 min
- FebVideoWorld 2: Learning Transferable Knowledge from Real-world VideosPretraining2602.10102ByteDance SeedFeb 10, 2026score 2~107 min
- FebVLS: Steering Pretrained Robot Policies via Vision-Language ModelsAlignment2602.03973Ai2Feb 3, 2026score 2~100 min
- FebWebWorld: A Large-Scale World Model for Web Agent TrainingAgents2602.14721Qwen / Alibaba CloudFeb 16, 2026score 9~101 min
- FebWhen to Memorize and When to Stop: Gated Recurrent Memory for Long-Context ReasoningLLM Systems2602.10560ByteDance SeedFeb 11, 2026score 8~103 min
- FebWhy Steering Works: Toward a Unified View of Language Model Parameter DynamicsAlignment2602.02343alibabaFeb 2, 2026score 4~107 min
- FebWorld Action Models are Zero-shot PoliciesUncategorized2602.15922NVIDIA Deep Imagination ResearchFeb 17, 2026score 2~101 min
- FebWorld Guidance: World Modeling in Condition Space for Action GenerationTraining Methods2602.22010ByteDance SeedFeb 25, 2026score 2~102 min
- FebWorldCompass: Reinforcement Learning for Long-Horizon World ModelsRL Training2602.09022Tencent HunyuanFeb 9, 2026score 8~114 min
- Jan"TODO: Fix the Mess Gemini Created": Towards Understanding GenAI-Induced Self-Admitted Technical DebtCode2601.07786Jan 12, 2026score 2~97 min
- Jan360Anything: Geometry-Free Lifting of Images and Videos to 360°Uncategorized2601.16192DeepmindJan 22, 2026score 2~106 min
- JanA Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5Safety2601.10527Jan 15, 2026score 4~118 min
- JanAACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level ContextCode2601.19494AoneJan 27, 2026score 3~111 min
- JanAgentic Reasoning for Large Language ModelsAgents2601.12538University of Illinois at Urbana-ChampaignJan 18, 2026score 9~116 min
- JanArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative RankingRL Training2601.06487Alibaba DAMOJan 10, 2026score 9~120 min
- JanBuilding Production-Ready Probes For GeminiSafety2601.11516Jan 16, 2026score 3~145 min
- JanChaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric RewardsTraining Methods2601.06021Z.aiJan 9, 2026score 9~112 min
- JanComputer Environments Elicit General Agentic Intelligence in LLMsAgents2601.16206Microsoft ResearchJan 22, 2026score 5~94 min
- JanConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute AllocationArchitecture2601.21420ByteDance SeedJan 29, 2026score 3~103 min
- JanCosmos Policy: Fine-Tuning Video Models for Visuomotor Control and PlanningUncategorized2601.16163NVIDIAJan 22, 2026score 2~115 min
- JanDecouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-trainingTraining Methods2602.00747Jan 31, 2026~121 min
- JanDeep Delta LearningArchitecture2601.00417Jan 1, 2026~93 min
- JanDeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable ConstraintsAgents2601.18137QwenJan 26, 2026score 2~101 min
- JanDeepSeek-OCR 2: Visual Causal FlowArchitecture2601.20552DeepSeekJan 28, 2026score 8~118 min
- JanDenseGRPO: From Sparse to Dense Reward for Flow Matching Model AlignmentTraining Methods2601.20218TongyiLabJan 28, 2026score 6~100 min
- JanDIFFA-2: A Practical Diffusion Large Language Model for General Audio UnderstandingMultimodal2601.23161LongCatJan 30, 2026score 5~125 min
- JanDistribution-Aligned Sequence Distillation for Superior Long-CoT ReasoningReasoning2601.09088Alibaba Cloud Apsara Lab Jan 14, 2026score 6~88 min
- JanDreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context LearningVision2601.21716ByteDanceJan 29, 2026score 2~112 min
- JanDreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion TransformerVision2601.01425ByteDanceJan 4, 2026score 2~125 min
- JanDreamStyle: A Unified Framework for Video StylizationDiffusion2601.02785ByteDanceJan 6, 2026score 2~109 min
- JanEfficient Autoregressive Video Diffusion with Dummy HeadInference Optimization2601.20499Microsoft ResearchJan 28, 2026score 7~106 min
- JanEvasionBench: A Large-Scale Benchmark for Detecting Managerial Evasion in Earnings Call Q&AEvaluation2601.09142Jan 14, 2026score 2~119 min
- JanEverything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image ModelsEvaluation2601.20354alibaba-incJan 28, 2026score 2~100 min
- JanEvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic ExperienceAgents2601.15876meituanJan 22, 2026score 9~120 min
- JanExpSeek: Self-Triggered Experience Seeking for Web AgentsAgents2601.08605TongyiLabJan 13, 2026score 5~99 min
- JanFantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language NavigationAgents2601.13976Alibaba AMAP CV LabJan 20, 2026score 3~126 min
- JanFast KVzip: Efficient and Accurate LLM Inference with Gated KV EvictionInference Optimization2601.17668NAVER AI LabJan 25, 2026score 9~116 min
- JanFast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent PlanningAgents2601.09708NVIDIAJan 14, 2026score 3~113 min
- JanFine-tuning Small Language Models as Efficient Enterprise Search Relevance LabelersEvaluation2601.03211Jan 6, 2026~113 min
- JanFlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice CloningArchitecture2601.11141FlashLabsJan 16, 2026score 2~112 min
- JanFlowAct-R1: Towards Interactive Humanoid Video GenerationVision2601.10103ByteDanceJan 15, 2026score 3~101 min
- JanFP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement LearningLow Precision2601.18150NVIDIAJan 26, 2026score 9~102 min
- JanGDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL OptimizationRL Training2601.05242Jan 8, 2026~109 min
- JanGolden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet TextTraining Methods2601.22975NVIDIAJan 30, 2026score 9~105 min
- JanHow AI Impacts Skill FormationRL Training2601.20245AnthropicJan 28, 2026score 1~107 min
- JanHow Do Large Language Models Learn Concepts During Continual Pre-Training?Training Methods2601.03570Jan 7, 2026score 4~121 min
- JanHybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long ContextsArchitecture2601.22156OpenBMBJan 29, 2026score 9~127 min
- JaniFSQ: Improving FSQ for Image Generation with 1 Line of CodeVision2601.17124Tencent HunyuanJan 23, 2026score 2~134 min
- JanImplicit Neural Representation Facilitates Unified Universal Vision EncodingArchitecture2601.14256TikTokJan 20, 2026score 2~109 min
- JanJet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision FlowRL Training2601.14243NVIDIAJan 20, 2026score 9~104 min
- JanK-EXAONE Technical ReportMixture of Experts2601.01739LG EXAONEJan 5, 2026~112 min
- JanLess Noise, More Voice: Reinforcement Learning for Reasoning via Instruction PurificationRL Training2601.21244BAIDUJan 29, 2026score 8~98 min
- JanLongCat-Flash-Thinking-2601 Technical ReportAgents2601.16725LongCatJan 23, 2026score 9~101 min
- JanLost in the Noise: How Reasoning Models Fail with Contextual DistractorsReasoning2601.07226KAIST AIJan 12, 2026score 3~106 min
- JanMegaFlow: Large-Scale Distributed Orchestration System for the Agentic EraServing2601.07526QwenJan 12, 2026score 6~109 min
- JanMEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software EngineeringAgents2601.22859ernie-researchJan 30, 2026score 5~120 min
- JanMHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-HeadArchitecture2601.07832DAGroup-PKUJan 12, 2026score 9~105 min
- JanMoEBlaze: Breaking the Memory Wall for Efficient MoE Training on Modern GPUsDistributed Training2601.05296Jan 8, 2026~113 min
- JanMolmo2: Open Weights and Data for Vision-Language Models with Video Understanding and GroundingVision2601.10611Jan 15, 2026score 9~97 min
- JanMotion Attribution for Video GenerationData2601.08828NVIDIAJan 13, 2026score 2~115 min
- JanMultiplex Thinking: Reasoning via Token-wise Branch-and-MergeReasoning2601.08808Microsoft ResearchJan 13, 2026score 9~92 min
- JanNextFlow: Unified Sequential Modeling Activates Multimodal Understanding and GenerationMultimodal2601.02204ByteDanceJan 5, 2026score 9~124 min
- JanNitroGen: An Open Foundation Model for Generalist Gaming AgentsAgents2601.02427NVIDIAJan 4, 2026score 2~125 min
- JanOmniTransfer: All-in-one Framework for Spatio-temporal Video TransferVision2601.14250ByteDanceJan 20, 2026score 2~97 min
- JanOpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene UnderstandingVision2601.09575NVIDIAJan 14, 2026score 2~107 min
- JanOver-Searching in Search-Augmented Large Language ModelsAgents2601.05503AppleJan 9, 2026score 3~131 min
- JanPlenoptic Video GenerationVision2601.05239NVIDIAJan 8, 2026score 2~110 min
- JanPost-LayerNorm Is Back: Stable, ExpressivE, and DeepArchitecture2601.19895ByteDance SeedJan 27, 2026score 5~108 min
- JanQuantifying the Effect of Test Set Contamination on Generative EvaluationsUncategorized2601.04301EleutherAIJan 7, 2026~128 min
- JanQuartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient EstimationTraining Methods2601.22813NVIDIAJan 30, 2026score 9~112 min
- JanQwen3-ASR Technical ReportTraining Methods2601.21337Qwen / Alibaba CloudJan 29, 2026score 2~125 min
- JanQwen3-TTS Technical ReportArchitecture2601.15621Qwen / Alibaba CloudJan 22, 2026score 2~120 min
- JanQwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and RankingMultimodal2601.04720Qwen / Alibaba CloudJan 8, 2026~114 min
- JanRethinking Video Generation Model for the Embodied WorldMultimodal2601.15282ByteDance SeedJan 21, 2026score 2~104 min
- JanRetrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning CapabilitiesEvaluation2601.21937ByteDance SeedJan 29, 2026score 2~117 min
- JanRigMo: Unifying Rig and Motion Learning for Generative AnimationArchitecture2601.06378SnapJan 10, 2026score 1~115 min
- JanSAMTok: Representing Any Mask with Two WordsArchitecture2601.16093ByteDanceJan 22, 2026score 9~122 min
- JanScaling Embeddings Outperforms Scaling Experts in Language ModelsArchitecture2601.21204Meituan LongCatJan 29, 2026score 8~115 min
- JanShaping capabilities with token-level data filteringSafety2601.21571AnthropicJan 29, 2026score 3~110 min
- JanStable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language ModelCode2601.15892ByteDance SeedJan 22, 2026score 8~142 min
- JanSWE-Pruner: Self-Adaptive Context Pruning for Coding AgentsCode2601.16746ByteDanceJan 23, 2026score 8~126 min
- JanTAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-ExpertsMixture of Experts2601.08881Tencent HunyuanJan 12, 2026score 7~101 min
- JanThe Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought ReasoningReasoning2601.06002ByteDanceJan 9, 2026score 8~152 min
- JanThe Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video GenerationAgents2601.17737Tencent HunyuanJan 25, 2026score 2~118 min
- JanThinking with Map: Reinforced Parallel Map-Augmented Agent for GeolocalizationAgents2601.05432alibaba-incJan 8, 2026score 3~115 min
- JanThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image EditingRL Training2601.03467ByteDanceJan 6, 2026score 2~98 min
- JanTowards Pixel-Level VLM Perception via Simple Points PredictionVision2601.19228Moonshot AIJan 27, 2026score 4~100 min
- JanTransition Matching Distillation for Fast Video GenerationInference Optimization2601.09881NVIDIAJan 14, 2026score 9~115 min
- JanTranslateGemma Technical ReportTraining Methods2601.09012Google ResearchJan 13, 2026~107 min
- JanUncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction TuningTraining Methods2601.13697alibaba-incJan 20, 2026score 9~129 min
- JanUnlocking Implicit Experience: Synthesizing Tool-Use Trajectories from TextAgents2601.10355LongCatJan 15, 2026score 9~111 min
- JanUrban Socio-Semantic Segmentation with Vision-Language ReasoningVision2601.10477alibaba-incJan 15, 2026score 3~102 min
- JanVAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive GenerationTraining Methods2601.02256ByteDanceJan 5, 2026score 5~115 min
- JanVisual Generation Unlocks Human-Like Reasoning through Multimodal World ModelsReasoning2601.19834ByteDance SeedJan 27, 2026score 3~111 min
- JanVLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic MemoryAgents2601.08665ByteDance SeedJan 13, 2026score 3~124 min
- JanWorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language ModelsEvaluation2602.02537Moonshot AIJan 28, 2026score 5~108 min
- JanX-Coder: Advancing Competitive Programming with Fully Synthetic Tasks, Solutions, and TestsCode2601.06953Microsoft ResearchJan 11, 2026score 8~97 min
- JanYour Group-Relative Advantage Is BiasedRL Training2601.08521Jan 13, 2026~113 min
2025
613 papers- Dec4D-RGPT: Toward Region-level 4D Understanding via Perceptual DistillationMultimodal2512.17012NVIDIADec 18, 2025score 6~109 min
- DecAligned but Stereotypical? The Hidden Influence of System Prompts on Social Bias in LVLM-Based Text-to-Image ModelsAlignment2512.04981KAIST AIDec 4, 2025score 4~119 min
- DecARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual ReasoningRL Training2512.05111Intern Large ModelsDec 4, 2025score 8~102 min
- DecBlurDM: A Blur Diffusion Model for Image DeblurringArchitecture2512.03979NVIDIADec 3, 2025score 1~106 min
- DecBolmo: Byteifying the Next Generation of Language ModelsLLM Systems2512.15586Allen Institute for AIDec 17, 2025~120 min
- DecBridging Your Imagination with Audio-Video Generation via a Unified DirectorMultimodal2512.23222ByteDanceDec 29, 2025score 6~102 min
- DecConfucius Code Agent: Scalable Agent Scaffolding for Real-World CodebasesCode2512.10398Meta ResearchDec 11, 2025score 9~112 min
- DecCosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World ModelingUncategorized2512.23162NVIDIADec 29, 2025score 2~99 min
- DecCoupling Experts and Routers in Mixture-of-Experts via an Auxiliary LossMixture of Experts2512.23447Dec 29, 2025~111 min
- DecCUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement LearningTraining Methods2512.02551NVIDIADec 2, 2025~96 min
- DecDAComp: Benchmarking Data Agents across the Full Data Intelligence LifecycleEvaluation2512.04324ByteDance SeedDec 3, 2025score 8~111 min
- DecDataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AIData2512.16676Peking UniversityDec 18, 2025score 9~98 min
- DecDeepSeek-V3.2: Pushing the Frontier of Open Large Language ModelsLLM Systems2512.02556DeepSeekDec 2, 2025~127 min
- DecDEER: Draft with Diffusion, Verify with Autoregressive ModelsInference Optimization2512.15176Dec 17, 2025score 10~125 min
- DecDirectional Textual Inversion for Personalized Text-to-Image GenerationTraining Methods2512.13672KAIST AIDec 15, 2025score 5~102 min
- DecDiversity or Precision? A Deep Dive into Next Token PredictionTraining Methods2512.22955Dec 28, 2025~107 min
- DecDivide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video UnderstandingVision2512.04000Microsoft ResearchDec 3, 2025score 8~110 min
- DecDreamOmni3: Scribble-based Editing and GenerationVision2512.22525ByteDanceDec 27, 2025score 5~119 min
- DecDreaMontage: Arbitrary Frame-Guided One-Shot Video GenerationVision2512.21252ByteDanceDec 24, 2025score 2~96 min
- DecDynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic SpaceArchitecture2512.24617ByteDance SeedDec 31, 2025score 9~113 min
- DecEasyV2V: A High-quality Instruction-based Video Editing FrameworkMultimodal2512.16920Snap ResearchDec 18, 2025score 2~105 min
- DecEcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerceEvaluation2512.08868TongyiLabDec 9, 2025score 7~95 min
- DecEfficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in SpeedTraining Methods2512.14067NVIDIADec 16, 2025score 9~107 min
- DecEgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video EditingDiffusion2512.06065SnapDec 5, 2025score 2~105 min
- DecEgoX: Egocentric Video Generation from a Single Exocentric VideoVision2512.08269KAIST AIDec 9, 2025score 2~115 min
- DecEnd-to-End Test-Time Training for Long ContextTraining Methods2512.23675Dec 29, 2025~120 min
- DecEnd-to-End Training for Autoregressive Video Diffusion via Self-ResamplingDiffusion2512.15702ByteDance SeedDec 17, 2025score 10~101 min
- DecEvaluating Gemini Robotics Policies in a Veo World SimulatorVision2512.10675DeepmindDec 11, 2025score 4~115 min
- DecEvaluating Parameter Efficient Methods for RLVRRL Training2512.23165DeepSeekDec 29, 2025~105 min
- DecExploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious RewardTraining Methods2512.16912Columbia UniversityDec 18, 2025score 9~105 min
- DecFaithLens: Detecting and Explaining Faithfulness HallucinationTraining Methods2512.20182Tsinghua NLP GroupDec 23, 2025score 6~102 min
- DecFantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning ProcessReasoning2512.23988Dec 30, 2025~119 min
- DecFast and Accurate Causal Parallel Decoding using Jacobi ForcingInference Optimization2512.14681Dec 16, 2025score 9~104 min
- DecFast-FoundationStereo: Real-Time Zero-Shot Stereo MatchingArchitecture2512.11130NVIDIADec 11, 2025score 4~108 min
- DecFew-Step Distillation for Text-to-Image Generation: A Practical GuideDiffusion2512.13006Alibaba DAMODec 15, 2025score 6~86 min
- DecFour Over Six: More Accurate NVFP4 Quantization with Adaptive Block ScalingInference Optimization2512.02010Dec 1, 2025~116 min
- DecGR-Dexter Technical ReportAgents2512.24210ByteDance SeedDec 30, 2025score 2~103 min
- DecGR-RL: Going Dexterous and Precise for Long-Horizon Robotic ManipulationRL Training2512.01801ByteDance SeedDec 1, 2025score 2~116 min
- DecImage Diffusion Preview with Consistency SolverDiffusion2512.13592DeepmindDec 15, 2025score 7~99 min
- DecInfinite-Homography as Robust Conditioning for Camera-Controlled Video GenerationVision2512.17040KAIST AIDec 18, 2025score 5~111 min
- DecInsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object InsertionVision2512.17504KAIST AIDec 19, 2025score 2~120 min
- DecInsight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural LanguageMultimodal2512.11251Dec 12, 2025~108 min
- DecJustRL: Scaling a 1.5B LLM with a Simple RL RecipeRL Training2512.16649OpenBMBDec 18, 2025~120 min
- DecKascade: A Practical Sparse Attention Method for Long-Context LLM InferenceInference Optimization2512.16391Dec 18, 2025~109 min
- DecKernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at MetaAgents2512.23236Dec 29, 2025~128 min
- DecKnot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait AnimationDiffusion2512.21734TongyiLabDec 25, 2025score 9~120 min
- DecLet It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning EcosystemAgents2512.24873alibaba-incDec 31, 2025score 9~130 min
- DecLLaDA2.0: Scaling Up Diffusion Language Models to 100BDiffusion2512.15745Dec 10, 2025~122 min
- DecLLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System DynamicsEvaluation2512.21010ByteDance SeedDec 24, 2025score 9~109 min
- DecLong-horizon Reasoning Agent for Olympiad-Level Mathematical Problem SolvingAgents2512.10739Dec 11, 2025~115 min
- DecLongCat-Image Technical ReportVision2512.07584Meituan LongCatDec 8, 2025score 6~124 min
- DecMAI-UI Technical Report: Real-World Centric Foundation GUI AgentsAgents2512.22047TongyiLabDec 26, 2025score 4~124 min
- DecMasking Teacher and Reinforcing Student for Distilling Vision-Language ModelsTraining Methods2512.22238NVIDIADec 23, 2025score 9~102 min
- DecMemory in the Age of AI AgentsAgents2512.13564Dec 15, 2025score 9~101 min
- DecmHC: Manifold-Constrained Hyper-ConnectionsArchitecture2512.24880DeepSeekDec 31, 2025score 5~125 min
- DecMMGR: Multi-Modal Generative ReasoningEvaluation2512.14691Dec 16, 2025~123 min
- DecMobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented EnvironmentsEvaluation2512.19432TongyiLabDec 22, 2025score 6~122 min
- DecNative and Compact Structured Latents for 3D GenerationVision2512.14692Microsoft ResearchDec 16, 2025~96 min
- DecNemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic ReasoningArchitecture2512.20848NVIDIADec 23, 2025~114 min
- DecNemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning ModelsReasoning2512.13607NVIDIADec 15, 2025score 9~112 min
- DecNemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode SupervisionTraining Methods2512.15489NVIDIADec 17, 2025score 8~103 min
- DecNested Browser-Use Learning for Agentic Information SeekingUncategorized2512.23647TongyiLabDec 29, 2025score 9~115 min
- DecNVIDIA Nemotron 3: Efficient and Open IntelligenceArchitecture2512.20856NVIDIADec 24, 2025~74 min
- DecOlmo 3Pretraining2512.13961Allen Institute for AIDec 15, 2025~105 min
- DecOmni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept PersonalizationMultimodal2512.10955Snap ResearchDec 11, 2025score 5~100 min
- DecOn the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language ModelsTraining Methods2512.07783CMU-LTIDec 8, 2025score 9~115 min
- DecProbing Scientific General Intelligence of LLMs with Scientist-Aligned WorkflowsEvaluation2512.16969Dec 18, 2025score 9~138 min
- DecQuantile Rendering: Efficiently Embedding High-dimensional Feature on 3D Gaussian SplattingVision2512.20927NVIDIADec 24, 2025score 3~128 min
- DecQwen-Image-Layered: Towards Inherent Editability via Layer DecompositionDiffusion2512.15603Qwen / Alibaba CloudDec 17, 2025score 6~110 min
- DecQwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory ManagementTraining Methods2512.12967Dec 15, 2025~110 min
- DecReasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMsInference Optimization2512.17206alibaba-incDec 19, 2025score 9~117 min
- DecSAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement LearningAgents2512.13874Ai2Dec 15, 2025score 9~119 min
- DecSCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose RepresentationsVision2512.05905Zhipu / GLMDec 5, 2025score 2~109 min
- DecSeed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from ExperienceAgents2512.17260ByteDance SeedDec 19, 2025score 8~129 min
- DecSeedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation ModelMultimodal2512.13507ByteDance SeedDec 15, 2025score 3~94 min
- DecSIMA 2: A Generalist Embodied Agent for Virtual WorldsAgents2512.04797DeepmindDec 4, 2025score 9~116 min
- DecSonicMoE: Accelerating MoE with IO and Tile-aware OptimizationsMixture of Experts2512.14080Dec 16, 2025~105 min
- DecSpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RLTraining Methods2512.04069NVIDIADec 3, 2025score 7~118 min
- DecSpatialTree: How Spatial Abilities Branch Out in MLLMsMultimodal2512.20617ByteDance SeedDec 23, 2025score 8~112 min
- DecStabilizing Reinforcement Learning with LLMs: Formulation and PracticesRL Training2512.01374Dec 1, 2025~126 min
- DecStoryMem: Multi-shot Long Video Storytelling with MemoryVision2512.19539ByteDanceDec 22, 2025score 3~115 min
- DecStronger Normalization-Free TransformersArchitecture2512.10938Dec 11, 2025~114 min
- DecTaxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language ModelsSafety2512.05339RobloxDec 5, 2025score 5~96 min
- DecThe FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model FactualityEvaluation2512.10791DeepmindDec 11, 2025score 9~127 min
- DecTowards a Science of Scaling Agent SystemsAgents2512.08296Dec 9, 2025~118 min
- DecTowards Scalable Pre-training of Visual Tokenizers for GenerationDiffusion2512.13687MiniMaxDec 15, 2025~122 min
- DecTurboDiffusion: Accelerating Video Diffusion Models by 100-200 TimesInference Optimization2512.16093University of California, BerkeleyDec 18, 2025score 10~99 min
- DecUnderstanding and Harnessing Sparsity in Unified Multimodal ModelsMixture of Experts2512.02351ByteDance SeedDec 2, 2025score 9~121 min
- DecUniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous DrivingMultimodal2512.09864ByteDance SeedDec 10, 2025score 2~109 min
- DecVector Prism: Animating Vector Graphics by Stratifying Semantic StructureVision2512.14336KAIST AIDec 16, 2025score 3~113 min
- DecWan-Move: Motion-controllable Video Generation via Latent Trajectory GuidanceVision2512.08765TongyiLabDec 9, 2025score 2~110 min
- DecWeb World ModelsArchitecture2512.23676Dec 29, 2025~112 min
- DecZoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-inRL Training2512.14273NVIDIADec 16, 2025score 8~102 min
- NovAccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel OptimizationCode2511.15915Stanford UniversityNov 19, 2025~115 min
- NovAdversarial Flow ModelsDiffusion2511.22475ByteDance SeedNov 27, 2025score 3~110 min
- NovBeat the long tail: Distribution-Aware Speculative Decoding for RL TrainingTraining Methods2511.13841Together AINov 17, 2025~98 min
- NovBlack-Box On-Policy Distillation of Large Language ModelsTraining Methods2511.10643Nov 13, 2025~100 min
- NovBlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video GenerationDiffusion2511.22973DAMO AcademyNov 28, 2025score 7~116 min
- NovCDLM: Consistency Diffusion Language Models For Faster SamplingInference Optimization2511.19269Together AINov 24, 2025~102 min
- NovCodeClash: Benchmarking Goal-Oriented Software EngineeringCode2511.00839Nov 2, 2025~100 min
- NovDecoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the ShieldDiffusion2511.22677Tongyi-MAINov 27, 2025score 4~114 min
- NovDeep Research: A Systematic SurveyUncategorized2512.02038Nov 24, 2025~129 min
- NovDeepSeekMath-V2: Towards Self-Verifiable Mathematical ReasoningReasoning2511.22570Nov 27, 2025~110 min
- NovDepth Anything 3: Recovering the Visual Space from Any ViewsVision2511.10647Nov 13, 2025~100 min
- NovDiscoX: Benchmarking Discourse-Level Translation task in Expert DomainsEvaluation2511.10984ByteDance SeedNov 14, 2025score 5~111 min
- NovDRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code GenerationTraining Methods2511.06307OpenAINov 9, 2025score 8~114 min
- NovDynamic Reflections: Probing Video Representations with Text AlignmentAlignment2511.02767DeepMindNov 4, 2025score 9~115 min
- NovFara-7B: An Efficient Agentic Model for Computer UseAgents2511.19663Microsoft ResearchNov 24, 2025score 6~124 min
- NovFP8-Flow-MoE: A Casting-Free FP8 Recipe without Double Quantization ErrorTraining Methods2511.02302Nov 4, 2025~122 min
- NovGeoVista: Web-Augmented Agentic Visual Reasoning for GeolocalizationAgents2511.15705Tencent HunyuanNov 19, 2025score 7~96 min
- NovHarmony: Harmonizing Audio and Video Generation through Cross-Task SynergyMultimodal2511.21579Tencent HunyuanNov 26, 2025score 5~107 min
- NovHunyuanOCR Technical ReportMultimodal2511.19575Tencent HunyuanNov 24, 2025score 9~146 min
- NovHunyuanVideo 1.5 Technical ReportVision2511.18870Tencent HunyuanNov 24, 2025score 5~112 min
- NovInferix: A Block-Diffusion based Next-Generation Inference Engine for World SimulationInference Optimization2511.20714DAMO AcademyNov 25, 2025score 9~100 min
- NovInstruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale DatasetVision2511.15186KAIST AINov 19, 2025score 2~116 min
- NovKitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision BoostLLM Systems2511.18643Together AINov 23, 2025~108 min
- NovKLASS: KL-Guided Fast Inference in Masked Diffusion ModelsInference Optimization2511.05664KAIST AINov 7, 2025score 8~114 min
- NovLearning Vision-Driven Reactive Soccer Skills for Humanoid RobotsUncategorized2511.03996ByteDance SeedNov 6, 2025score 2~136 min
- NovLlama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual TasksLLM Systems2511.07025NVIDIANov 10, 2025score 9~99 min
- NovLong Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at ScaleData2511.05705NVIDIANov 7, 2025score 9~105 min
- NovLumine: An Open Recipe for Building Generalist Agents in 3D Open WorldsAgents2511.08892ByteDance SeedNov 12, 2025score 6~115 min
- NovMixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-InteractionArchitecture2512.07846Nov 25, 2025~117 min
- NovMMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and GenerationDiffusion2511.09611ByteDanceNov 12, 2025score 9~109 min
- NovMME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive CapacityMultimodal2511.03146ByteDance SeedNov 5, 2025score 9~107 min
- NovMusic Flamingo: Scaling Music Understanding in Audio Language ModelsMultimodal2511.10289NVIDIANov 13, 2025score 6~121 min
- NovNaTex: Seamless Texture Generation as Latent Color DiffusionVision2511.16317Tencent HunyuanNov 20, 2025score 2~101 min
- NovNemotron Elastic: Towards Efficient Many-in-One Reasoning LLMsTraining Methods2511.16664NVIDIANov 20, 2025score 9~127 min
- NovNemotron-Flash: Towards Latency-Optimal Hybrid Small Language ModelsArchitecture2511.18890NVIDIANov 24, 2025score 9~106 min
- NovNVIDIA Nemotron Nano V2 VLMultimodal2511.03929NVIDIANov 6, 2025score 9~122 min
- NovNVIDIA Nemotron Parse 1.1Multimodal2511.20478NVIDIANov 25, 2025score 9~127 min
- NovOlmoEarth: Stable Latent Image Modeling for Multimodal Earth ObservationPretraining2511.13655Ai2Nov 17, 2025score 6~130 min
- NovParallelKittens: Systematic and Practical Simplification of Multi-GPU AI KernelsDistributed Training2511.13940Together AINov 17, 2025~135 min
- NovPart-X-MLLM: Part-aware 3D Multimodal Large Language ModelAgents2511.13647Tencent HunyuanNov 17, 2025score 9~107 min
- NovPixelDiT: Pixel Diffusion Transformers for Image GenerationVision2511.20645NVIDIANov 25, 2025score 9~106 min
- NovQwen3-VL Technical ReportMultimodal2511.21631Nov 26, 2025~107 min
- NovReinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMsTraining Methods2511.05933Meta AINov 8, 2025score 9~116 min
- NovReusing Pre-Training Data at Test Time is a Compute MultiplierPretraining2511.04234AppleNov 6, 2025~116 min
- NovRevisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning GeneralizationTraining Methods2511.22586ByteDance SeedNov 27, 2025score 9~113 min
- NovRobot Learning from a Physical World ModelAgents2511.07416DeepmindNov 10, 2025score 2~105 min
- NovRynnVLA-002: A Unified Vision-Language-Action and World ModelUncategorized2511.17502DAMO AcademyNov 21, 2025score 6~109 min
- NovSAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL TuningRL Training2511.02280BytedanceDouyinContentNov 4, 2025score 9~130 min
- NovScaling Agent Learning via Experience SynthesisAgents2511.03773Nov 5, 2025~120 min
- NovSoft Adaptive Policy OptimizationRL Training2511.20347QwenNov 25, 2025score 9~108 min
- NovSSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature SpaceTraining Methods2511.20102Nov 25, 2025score 9~129 min
- NovThe Collaboration GapAgents2511.02687Microsoft ResearchNov 4, 2025score 6~123 min
- NovThe Path Not Taken: RLVR Provably Learns Off the PrincipalsRL Training2511.08567AI at MetaNov 11, 2025score 9~110 min
- NovThink Visually, Reason Textually: Vision-Language Synergy in ARCReasoning2511.15703Intern Large ModelsNov 19, 2025score 9~105 min
- NovTiDAR: Think in Diffusion, Talk in AutoregressionArchitecture2511.08923NVIDIANov 12, 2025score 9~120 min
- NovTimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement LearningRL Training2511.05489ByteDanceNov 7, 2025score 9~106 min
- NovToolOrchestra: Elevating Intelligence via Efficient Model and Tool OrchestrationTraining Methods2511.21689NVIDIANov 26, 2025score 9~106 min
- NovUniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible FeedbackDiffusion2511.01678Alibaba DAMONov 3, 2025score 2~115 min
- NovVADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language ModelsMultimodal2511.07299NVIDIANov 10, 2025score 2~110 min
- NovVideo Generation Models Are Good Latent Reward ModelsAlignment2511.21541Tencent HunyuanNov 26, 2025score 8~104 min
- NovVirtual Width NetworksArchitecture2511.11238ByteDance SeedNov 14, 2025score 9~112 min
- NovVisual Spatial TuningVision2511.05491ByteDance SeedNov 7, 2025score 9~119 min
- NovWhat Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation DiversityAgents2511.15593Nov 19, 2025~125 min
- NovWhen Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-ThoughtEvaluation2511.02779ByteDance SeedNov 4, 2025score 8~114 min
- NovWMPO: World Model-based Policy Optimization for Vision-Language-Action ModelsRL Training2511.09515ByteDance SeedNov 12, 2025score 5~128 min
- NovWUSH: Near-Optimal Adaptive Transforms for LLM QuantizationAlignment2512.00956 IST Austria Distributed Algorithms and Systems LabNov 30, 2025score 9~117 min
- NovZ-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion TransformerVision2511.22699Tongyi-MAINov 27, 2025score 9~108 min
- OctA Pragmatic View of AI PersonhoodSafety2510.26396DeepMindOct 30, 2025~115 min
- OctAgent Learning via Early ExperienceAgents2510.08558Oct 9, 2025~108 min
- OctAgentFold: Long-Horizon Web Agents with Proactive Context ManagementAgents2510.24699TongyiLabOct 28, 2025score 9~101 min
- OctAgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data SynthesisData2510.24695TongyiLabOct 28, 2025score 9~113 min
- OctAgentic Context Engineering: Evolving Contexts for Self-Improving Language ModelsLLM Systems2510.04618Oct 6, 2025score 9~107 min
- OctAlphaFlow: Understanding and Improving MeanFlow ModelsDiffusion2510.20771SnapOct 23, 2025score 5~115 min
- OctAMO-Bench: Large Language Models Still Struggle in High School Math CompetitionsEvaluation2510.26768LongCatOct 30, 2025score 9~107 min
- OctAny-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-DepthSafety2510.18081ByteDance SeedOct 20, 2025score 8~133 min
- OctArtificial Hippocampus Networks for Efficient Long-Context ModelingArchitecture2510.07318ByteDance SeedOct 8, 2025score 9~123 min
- OctAttention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy OptimizationReasoning2510.13554alibaba-incOct 15, 2025score 9~117 min
- OctBeyond Correctness: Evaluating Subjective Writing Preferences Across CulturesEvaluation2510.14616ByteDance SeedOct 16, 2025score 8~104 min
- OctBeyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning ModelsAlignment2510.21978AI at MetaOct 24, 2025score 10~112 min
- OctBitNet DistillationTraining Methods2510.13998Microsoft ResearchOct 15, 2025score 9~127 min
- OctBoundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language ModelsInference Optimization2510.11683Z.aiOct 13, 2025score 9~120 min
- OctBroRL: Scaling Reinforcement Learning via Broadened ExplorationRL Training2510.01180NVIDIAOct 1, 2025score 9~106 min
- OctCarleman Estimates for Backward Anisotropic Stochastic Parabolic Equations with General Dynamic Boundary Conditions and ApplicationsTraining Methods2510.12345Oct 14, 2025~132 min
- OctChronoEdit: Towards Temporal Reasoning for Image Editing and World SimulationVision2510.04290NVIDIAOct 5, 2025score 2~105 min
- OctCode Aesthetics with Agentic Reward FeedbackCode2510.23272Microsoft ResearchOct 27, 2025score 9~110 min
- OctDaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone AgentsTraining Methods2510.19336OPPOOct 22, 2025score 8~104 min
- OctDCP: Addressing Input Dynamism In Long-Context Training via Dynamic Context ParallelismTraining Methods2510.10620Oct 12, 2025~99 min
- OctDeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web SearchLLM Systems2510.12801AppleOct 14, 2025~14 min
- OctDeepSeek-OCR: Contexts Optical CompressionVision2510.18234DeepSeekOct 21, 2025score 9~115 min
- OctDefeating the Training-Inference Mismatch via FP16Training Methods2510.26788Sea AI LabOct 30, 2025score 9~127 min
- OctDemystifying Reinforcement Learning in Agentic ReasoningAgents2510.11701Oct 13, 2025score 9~127 min
- OctDiffusion Transformers with Representation AutoencodersArchitecture2510.11690Oct 13, 2025~117 min
- OctDistractor Injection Attacks on Large Reasoning Models: Characterization and DefenseSafety2510.16259Amazon ScienceOct 17, 2025score 6~101 min
- OctDLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement LearningRL Training2510.15110OpenAIOct 16, 2025score 9~119 min
- OctDocReward: A Document Reward Model for Structuring and StylizingData2510.11391Microsoft ResearchOct 13, 2025score 6~95 min
- OctDSI-Bench: A Benchmark for Dynamic Spatial IntelligenceVision2510.18873alibaba-incOct 21, 2025score 8~102 min
- OctE2Rank: Your Text Embedding can Also be an Effective and Efficient Listwise RerankerTraining Methods2510.22733Alibaba DAMOOct 26, 2025score 9~108 min
- OctEfficient Long-context Language Model Training by Core Attention DisaggregationTraining Methods2510.18121Oct 20, 2025score 10~105 min
- OctEvery Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language FoundationMixture of Experts2510.22115inclusionAIOct 25, 2025score 10~127 min
- OctEvery Attention Matters: An Efficient Hybrid Architecture for Long-Context ReasoningArchitecture2510.19338Ant GroupOct 22, 2025score 10~141 min
- OctExploring Conditions for Diffusion models in Robotic ControlAgents2510.15510NAVER AI LabOct 17, 2025score 2~102 min
- OctFine-Grained GRPO for Precise Preference Alignment in Flow ModelsTraining Methods2510.01982IXCLab@Shanghai AI LabOct 2, 2025score 8~101 min
- OctFrom Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation PriorsUncategorized2510.17439ByteDance SeedOct 20, 2025score 9~122 min
- OctGame-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game AgentsAgents2510.23691ByteDanceOct 27, 2025score 8~124 min
- OctGenerative Universal Verifier as Multimodal Meta-ReasonerMultimodal2510.13804ByteDance SeedOct 15, 2025score 8~106 min
- OctGrasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMsMultimodal2510.18876ByteDanceOct 21, 2025score 4~92 min
- OctHeptapod: Language Modeling on Visual SignalsPretraining2510.06673ByteDance SeedOct 8, 2025score 9~128 min
- OctHigh-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian SplattingUncategorized2510.10637DAMO AcademyOct 12, 2025score 3~114 min
- OctHigher-order Linear AttentionArchitecture2510.27258Oct 31, 2025~112 min
- OctINT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization FormatsInference Optimization2510.25602NVIDIAOct 29, 2025score 10~113 min
- OctJanusCoder: Towards a Foundational Visual-Programmatic Interface for Code IntelligenceCode2510.23538InternLM / Shanghai AI LabOct 27, 2025score 6~97 min
- OctKimi Linear: An Expressive, Efficient Attention ArchitectureArchitecture2510.26692Moonshot / KimiOct 30, 2025~98 min
- OctLanguage Models Model LanguageReasoning2510.12766SnowflakeOct 14, 2025score 3~120 min
- OctLarge Reasoning Models Learn Better Alignment from Flawed ThinkingSafety2510.00938Oct 1, 2025~96 min
- OctLaSeR: Reinforcement Learning with Last-Token Self-RewardingRL Training2510.14943Tencent HunyuanOct 16, 2025score 10~101 min
- OctLayerComposer: Multi-Human Personalized Generation via Layered CanvasVision2510.20820Snap ResearchOct 23, 2025score 3~109 min
- OctLearning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon TasksAgents2510.08002KnowledgeXLab@Shanghai AI LabOct 9, 2025score 9~110 min
- OctLess is More: Recursive Reasoning with Tiny NetworksArchitecture2510.04871Samsung AI Lab (SAIL) MontrealOct 6, 2025score 9~116 min
- OctLongCat-Flash-Omni Technical ReportMultimodal2511.00279Meituan LongCatOct 31, 2025score 9~117 min
- OctLongCat-Video Technical ReportUncategorized2510.22200Meituan LongCatOct 25, 2025score 9~122 min
- OctLongCodeZip: Compress Long Context for Code Language ModelsCode2510.00446Oct 1, 2025~119 min
- OctLoongRL: Reinforcement Learning for Advanced Reasoning over Long ContextsReasoning2510.19363Microsoft ResearchOct 22, 2025score 9~114 min
- OctLow-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable RewardRL Training2510.03222TencentOct 3, 2025score 9~107 min
- OctMagentic Marketplace: An Open-Source Environment for Studying Agentic MarketsAgents2510.25779Microsoft ResearchOct 27, 2025score 8~114 min
- OctMemory Retrieval and Consolidation in Large Language Models through Function TokensUncategorized2510.08203ByteDance SeedOct 9, 2025score 7~115 min
- OctMoGA: Mixture-of-Groups Attention for End-to-End Long Video GenerationArchitecture2510.18692ByteDanceOct 21, 2025score 9~116 min
- OctMultimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMsMultimodal2510.09201KAIST AIOct 10, 2025score 3~134 min
- OctolmOCR 2: Unit Test Rewards for Document OCRMultimodal2510.19817Ai2Oct 22, 2025score 9~115 min
- OctOmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLMMultimodal2510.15870NVIDIAOct 17, 2025score 10~108 min
- OctOpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal EvidenceReasoning2510.20579OpenAIOct 23, 2025score 9~97 min
- OctOSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use AgentsEvaluation2510.24563TongyiLabOct 28, 2025score 5~111 min
- OctPaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language ModelMultimodal2510.14528Baidu ResearchOct 16, 2025~118 min
- OctPairUni: Pairwise Training for Unified Multimodal Language ModelsTraining Methods2510.25682ByteDanceOct 29, 2025score 8~110 min
- OctParallel Loop Transformer for Efficient Test-Time Computation ScalingArchitecture2510.24824ByteDance SeedOct 28, 2025score 9~123 min
- OctParallelMuse: Agentic Parallel Thinking for Deep Information SeekingTraining Methods2510.24698TongyiLabOct 28, 2025score 9~120 min
- OctProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and JudgeEvaluation2510.18941NVIDIAOct 21, 2025score 9~101 min
- OctQeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMsRL Training2510.11696NVIDIAOct 13, 2025score 10~124 min
- OctQuantum simulation of electronic structure via quantum fast multipole methodContext Optimization2510.07380Google ResearchOct 8, 2025~117 min
- OctQwen3Guard Technical ReportSafety2510.14276Qwen / Alibaba CloudOct 16, 2025score 8~136 min
- OctR-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?Reasoning2510.08189OpenAIOct 9, 2025score 8~107 min
- OctRDMA Point-to-Point Communication for LLM SystemsServing2510.27656Oct 31, 2025~117 min
- OctRepurposing Synthetic Data for Fine-grained Search Agent SupervisionRL Training2510.24694TongyiLabOct 28, 2025score 9~105 min
- OctRevisiting Multimodal Positional Encoding in Vision-Language ModelsMultimodal2510.23095QwenOct 27, 2025score 10~105 min
- OctRL makes MLLMs see better than SFTMultimodal2510.16333NAVER AI LabOct 18, 2025score 9~100 min
- OctSAIL-Embedding Technical Report: Omni-modal Embedding Foundation ModelMultimodal2510.12709ByteDanceOct 14, 2025score 9~151 min
- OctScalable In-context Ranking with Generative ModelsTraining Methods2510.05396DeepmindOct 6, 2025score 8~107 min
- OctScaling Language-Centric Omnimodal Representation LearningMultimodal2510.11693DAMO AcademyOct 13, 2025score 8~128 min
- OctScaling Latent Reasoning via Looped Language ModelsArchitecture2510.25741ByteDance SeedOct 29, 2025~96 min
- OctScaling Laws Meet Model Architecture: Toward Inference-Efficient LLMsScaling Laws2510.18245Oct 21, 2025~103 min
- OctScaling Long-Horizon LLM Agent via Context-FoldingAgents2510.11967ByteDance SeedOct 13, 2025score 8~108 min
- OctScaling Up Efficient Small Language Models Serving and Deployment for Semantic Job SearchServing2510.22101LinkedInOct 25, 2025~111 min
- OctSeed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D AssetsVision2510.19944ByteDance SeedOct 22, 2025score 5~112 min
- OctSelf-Forcing++: Towards Minute-Scale High-Quality Video GenerationDiffusion2510.02283ByteDance SeedOct 2, 2025score 10~133 min
- OctSimPoly: Simulation of Polymers with Machine Learning Force Fields Derived from First PrinciplesScaling Laws2510.13696Microsoft ResearchOct 15, 2025~127 min
- OctSpatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement LearningVision2510.27606InternLM / Shanghai AI LabOct 31, 2025score 9~124 min
- OctSprint: Sparse-Dense Residual Fusion for Efficient Diffusion TransformersDiffusion2510.21986SnapOct 24, 2025score 9~110 min
- OctSTAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D IntelligenceEvaluation2510.24693Intern Large ModelsOct 28, 2025score 6~114 min
- OctTC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion ControlLLM Systems2510.09561NVIDIAOct 10, 2025score 3~86 min
- OctTemporal Alignment Guidance: On-Manifold Sampling in Diffusion ModelsDiffusion2510.11057KAIST AIOct 13, 2025score 5~129 min
- OctThe Art of Scaling Reinforcement Learning Compute for LLMsRL Training2510.13786Oct 15, 2025~139 min
- OctThe End of Manual Decoding: Towards Truly End-to-End Language ModelsUncategorized2510.26697Oct 30, 2025~126 min
- OctTongyi DeepResearch Technical ReportAgents2510.24701Oct 28, 2025~115 min
- OctTowards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid CurriculumVision2510.27571Alibaba DAMOOct 31, 2025score 8~135 min
- OctTrace Anything: Representing Any Video in 4D via Trajectory FieldsVision2510.13802ByteDance SeedOct 15, 2025score 2~108 min
- OctTracing the Traces: Latent Temporal Signals for Efficient and Accurate ReasoningReasoning2510.10494Microsoft ResearchOct 12, 2025score 9~120 min
- OctUI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-ReasoningReasoning2510.20286TongyiLabOct 23, 2025score 6~107 min
- OctUnified Reinforcement and Imitation Learning for Vision-Language ModelsTraining Methods2510.19307NVIDIAOct 22, 2025score 9~87 min
- OctVerifier-free Test-Time Sampling for Vision Language Action ModelsRL Training2510.05681KAIST AIOct 7, 2025score 9~106 min
- OctVibe Checker: Aligning Code Evaluation with Human PreferenceEvaluation2510.07315Oct 8, 2025~114 min
- OctVideo-As-Prompt: Unified Semantic Control for Video GenerationDiffusion2510.20888ByteDance SeedOct 23, 2025score 5~122 min
- OctVLA-0: Building State-of-the-Art VLAs with Zero ModificationArchitecture2510.13054NVIDIAOct 15, 2025score 6~100 min
- OctVoMP: Predicting Volumetric Mechanical Property FieldsMultimodal2510.22975NVIDIAOct 27, 2025score 2~122 min
- OctWebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich SeekingAgents2510.24697TongyiLabOct 28, 2025score 9~124 min
- OctWebscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining LevelsData2510.06499SalesforceOct 7, 2025score 10~115 min
- OctWhen to Ensemble: Identifying Token-Level Points for Stable and Fast LLM EnsemblingLLM Systems2510.15346KAIST AIOct 17, 2025score 5~120 min
- OctWhy Low-Precision Transformer Training Fails: An Analysis on Flash AttentionTraining Methods2510.04212Tsinghua UniversityOct 5, 2025score 9~125 min
- OctWorld Simulation with Video Foundation Models for Physical AIVision2511.00062NVIDIAOct 28, 2025score 4~128 min
- SepA Survey of Reinforcement Learning for Large Reasoning ModelsReasoning2509.08827Sep 10, 2025~123 min
- SepApertus: Democratizing Open and Compliant LLMs for Global Language EnvironmentsPretraining2509.14233Swiss AI InitiativeSep 17, 2025score 9~107 min
- SepAstra: A Multi-Agent System for GPU Kernel Performance OptimizationAgents2509.07506Sep 9, 2025~102 min
- SepAToken: A Unified Tokenizer for VisionVision2509.14476AppleSep 17, 2025~104 min
- SepBenefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical PerspectiveTraining Methods2509.22613Microsoft ResearchSep 26, 2025score 9~95 min
- SepBridging the Gap Between Promise and Performance for Microscaling FP4 QuantizationInference Optimization2509.23202NVIDIASep 27, 2025score 9~99 min
- SepCanary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and ASTUncategorized2509.14128NVIDIASep 17, 2025~108 min
- SepCapRL: Stimulating Dense Image Caption Capabilities via Reinforcement LearningMultimodal2509.22647InternLM / Shanghai AI LabSep 26, 2025score 6~114 min
- SepCARE: Cognitive-reasoning Augmented Reinforcement for Emotional Support ConversationTraining Methods2510.05122Qwen DianJinSep 30, 2025score 1~100 min
- SepDA$^{2}$: Depth Anything in Any DirectionScaling Laws2509.26618Tencent HunyuanSep 30, 2025score 9~100 min
- SepDC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent SpaceDiffusion2509.25180NVIDIASep 29, 2025score 8~99 min
- SepDC-VideoGen: Efficient Video Generation with Deep Compression Video AutoencoderVision2509.25182NVIDIASep 29, 2025score 6~105 min
- SepDeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree SearchTraining Methods2509.25454Stanford NLPSep 29, 2025score 10~122 min
- SepEmbeddingGemma: Powerful and Lightweight Text RepresentationsLLM Systems2509.20354DeepMindSep 24, 2025~107 min
- SepFantastic Pretraining Optimizers and Where to Find ThemTraining Methods2509.02046Sep 2, 2025~121 min
- SepFast-dLLM v2: Efficient Block-Diffusion LLMLLM Systems2509.26328Sep 30, 2025~114 min
- SepFront-Loading Reasoning: The Synergy between Pretraining and Post-Training DataTraining Methods2510.03264NVIDIASep 26, 2025score 9~115 min
- SepHunyuan-MT Technical ReportLLM Systems2509.05209Tencent HunyuanSep 5, 2025score 3~99 min
- SepHunyuan3D Studio: End-to-End AI Pipeline for Game-Ready 3D Asset GenerationDiffusion2509.12815Sep 16, 2025score 3~119 min
- SepHunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D AssetsArchitecture2509.21245Tencent HunyuanSep 25, 2025score 3~93 min
- SepHunyuanImage 3.0 Technical ReportMixture of Experts2509.23951Tencent HunyuanSep 28, 2025score 9~121 min
- SepInfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long AdaptationArchitecture2509.24663OpenBMBSep 29, 2025score 9~116 min
- SepInverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?Evaluation2509.04292ByteDance SeedSep 4, 2025score 6~97 min
- SepKnapsack RL: Unlocking Exploration of LLMs via Optimizing Budget AllocationTraining Methods2509.25849ByteDance SeedSep 30, 2025score 9~111 min
- SepLIMI: Less is More for AgencyAgents2509.17567Sep 22, 2025~104 min
- SepLLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal TrainingMultimodal2509.23661Sep 28, 2025score 9~125 min
- SepLongLive: Real-time Interactive Long Video GenerationLLM Systems2509.22622NVIDIASep 26, 2025score 6~111 min
- SepLynx: Towards High-Fidelity Personalized Video GenerationVision2509.15496ByteDance SeedSep 19, 2025score 6~96 min
- SepManipulation as in Simulation: Enabling Accurate Geometry Perception in RobotsUncategorized2509.02530ByteDance SeedSep 2, 2025score 2~106 min
- SepMeta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement LearningReasoning2510.03259KAIST AISep 26, 2025score 9~119 min
- SepMetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late InteractionMultimodal2509.18095Sep 22, 2025score 9~117 min
- SepMultiplayer Nash Preference OptimizationAlignment2509.23102Sep 27, 2025~110 min
- SepMuon Outperforms Adam in Tail-End Associative Memory LearningTraining Methods2509.26030Sep 30, 2025~124 min
- SepNo Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage ShapingReasoning2509.21880KAIST AISep 26, 2025score 10~103 min
- SepP3-SAM: Native 3D Part SegmentationVision2509.06784Tencent HunyuanSep 8, 2025score 6~116 min
- SepPixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured ImagesLLM Systems2509.25185Sep 29, 2025~105 min
- SepPre-training under infinite computePretraining2509.14786Sep 18, 2025~106 min
- SepPretraining Large Language Models with NVFP4Pretraining2509.25149Sep 29, 2025~126 min
- SepQuantile Advantage Estimation: Stabilizing RLVR for LLM ReasoningReasoning2509.22611Sep 26, 2025score 9~119 min
- SepQwen3-Omni Technical ReportMultimodal2509.17765Sep 22, 2025~129 min
- SepReviewScore: Misinformed Peer Review Detection with Large Language ModelsEvaluation2509.21679KAIST AISep 25, 2025score 3~108 min
- SepRLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable RewardsAlignment2509.21319NVIDIASep 25, 2025score 9~105 min
- SepRLP: Reinforcement as a Pretraining ObjectivePretraining2510.01265NVIDIASep 26, 2025score 9~100 min
- SepRobix: A Unified Model for Robot Interaction, Reasoning and PlanningUncategorized2509.01106ByteDance SeedSep 1, 2025score 9~108 min
- SepRPG: A Repository Planning Graph for Unified and Scalable Codebase GenerationCode2509.16198Sep 19, 2025score 10~108 min
- SepSAIL-VL2 Technical ReportMultimodal2509.14033Sep 17, 2025~130 min
- SepSANA-Video: Efficient Video Generation with Block Linear Diffusion TransformerArchitecture2509.24695NVIDIASep 29, 2025score 8~105 min
- SepScaling Agents via Continual Pre-trainingTraining Methods2509.13310Sep 16, 2025~117 min
- SepScaling Generalist Data-Analytic AgentsAgents2509.25084QwenSep 29, 2025score 9~103 min
- SepSet Block Decoding is a Language Model Inference AcceleratorInference Optimization2509.04185Sep 4, 2025score 9~102 min
- SepSharing is Caring: Efficient LM Post-Training with Collective RL Experience SharingTraining Methods2509.08721DeepSeekSep 10, 2025score 10~108 min
- SepSIM-CoT: Supervised Implicit Chain-of-ThoughtTraining Methods2509.20317InternLM / Shanghai AI LabSep 24, 2025score 8~131 min
- SepSLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear AttentionArchitecture2509.24006Tsinghua UniversitySep 28, 2025score 10~110 min
- SepSocratic-Zero : Bootstrapping Reasoning via Data-Free Agent Co-evolutionTraining Methods2509.24726alibaba-incSep 29, 2025score 9~105 min
- SepSPARK: Synergistic Policy And Reward Co-Evolving FrameworkRL Training2509.22624InternLM / Shanghai AI LabSep 26, 2025score 9~110 min
- SepThe Landscape of Agentic Reinforcement Learning for LLMs: A SurveyAgents2509.02547Sep 2, 2025~127 min
- SepThe Pitfalls of KV Cache CompressionInference Optimization2510.00231Sep 30, 2025~125 min
- SepThinking Augmented Pre-trainingPretraining2509.20186Sep 24, 2025~103 min
- SepTowards General Agentic Intelligence via Environment ScalingAgents2509.13311Sep 16, 2025~114 min
- SepTruthRL: Incentivizing Truthful LLMs via Reinforcement LearningTraining Methods2509.25760Sep 30, 2025~100 min
- SepUI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement LearningAgents2509.02544ByteDance SeedSep 2, 2025score 6~126 min
- SepV2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-ThoughtsVision2509.18053NVIDIASep 22, 2025score 3~97 min
- SepVideo models are zero-shot learners and reasonersMultimodal2509.20328DeepMindSep 24, 2025~135 min
- SepVitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world ApplicationsEvaluation2509.26490LongCatSep 30, 2025score 6~136 min
- SepWhy Language Models HallucinateAlignment2509.04664Sep 4, 2025~118 min
- SepWinning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-TuningTraining Methods2509.23873alibabaSep 28, 2025score 9~104 min
- SepZero-Shot Multi-Spectral Learning: Reimagining a Generalist Multimodal Gemini 2.5 Model for Remote Sensing ApplicationsVision2509.19087Sep 23, 2025score 3~112 min
- AugA Survey on Diffusion Language ModelsLLM Systems2508.10875Aug 14, 2025~126 min
- AugAutoregressive Universal Video Segmentation ModelVision2508.19242Aug 26, 2025~108 min
- AugBeyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVRRL Training2508.14029Aug 19, 2025score 9~128 min
- AugDeep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMsPretraining2508.06601Aug 8, 2025score 6~110 min
- AugDINOv3Vision2508.10104Meta AI / FAIRAug 13, 2025~120 min
- AugDuPO: Enabling Reliable LLM Self-Verification via Dual Preference OptimizationTraining Methods2508.14460ByteDance SeedAug 20, 2025score 9~112 min
- AugEvaluating, Synthesizing, and Enhancing for Customer Support ConversationData2508.04423Qwen DianJinAug 6, 2025score 3~117 min
- AugFin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language ModelsAgents2508.15202Qwen DianJinAug 21, 2025score 9~111 min
- AugFutureX: An Advanced Live Benchmark for LLM Agents in Future PredictionUncategorized2508.11987ByteDance SeedAug 16, 2025score 8~116 min
- AugGLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation ModelsLLM Systems2508.06471Zhipu / GLMAug 8, 2025~138 min
- AugHermes 4 Technical ReportTraining Methods2508.18255Aug 25, 2025~110 min
- AugIntern-S1: A Scientific Multimodal Foundation ModelMultimodal2508.15763InternLM / Shanghai AI LabAug 21, 2025~122 min
- AugInternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and EfficiencyMultimodal2508.18265Aug 25, 2025score 10~107 min
- AugIs Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution LensReasoning2508.01191Aug 2, 2025~140 min
- AugLess Is More: Training-Free Sparse Attention with Global Locality for Efficient ReasoningInference Optimization2508.07101Aug 9, 2025score 9~111 min
- AugLiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging QueriesEvaluation2508.15760Zoom AIAug 21, 2025score 7~104 min
- AugMemento: Fine-tuning LLM Agents without Fine-tuning LLMsAgents2508.16153Aug 22, 2025score 9~114 min
- AugMolmoAct: Action Reasoning Models that can Reason in SpaceUncategorized2508.07917Aug 11, 2025~111 min
- AugNVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning ModelReasoning2508.14444NVIDIAAug 20, 2025score 10~119 min
- AugOn the Generalization of SFT: A Reinforcement Learning Perspective with Reward RectificationTraining Methods2508.05629Aug 7, 2025score 9~107 min
- AugOn the Theoretical Limitations of Embedding-Based RetrievalRetrieval2508.21038Aug 28, 2025~102 min
- AugOpen Data Synthesis For Deep ResearchData2509.00375Aug 30, 2025~139 min
- AugPerch 2.0: The Bittern Lesson for BioacousticsUncategorized2508.04665Aug 6, 2025~118 min
- AugQwen-Image Technical ReportMultimodal2508.02324Qwen / Alibaba CloudAug 4, 2025~137 min
- AugREINA: Regularized Entropy Information-Based Loss for Efficient Simultaneous Speech TranslationUncategorized2508.04946Roblox CorporationAug 7, 2025score 2~114 min
- AugReportBench: Evaluating Deep Research Agents via Academic Survey TasksEvaluation2508.15804ByteDanceAug 14, 2025score 6~112 min
- AugSeed Diffusion: A Large-Scale Diffusion Language Model with High-Speed InferenceCode2508.02193Aug 4, 2025score 9~115 min
- AugSeeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term MemoryMultimodal2508.09736ByteDance SeedAug 13, 2025score 8~110 min
- AugSemantic IDs for Joint Generative Search and RecommendationPretraining2508.10478DoorDashAug 14, 2025score 3~123 min
- AugTaming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM InferenceServing2508.19559Aug 27, 2025score 9~115 min
- AugTowards Affordance-Aware Robotic Dexterous Grasping with Human-like PriorsUncategorized2508.08896DAMO AcademyAug 12, 2025score 2~120 min
- AugTPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode InferenceServing2508.15881DeepSeekAug 21, 2025score 9~117 min
- AugTreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based ModelingTraining Methods2508.17445ByteDance SeedAug 24, 2025score 9~105 min
- AugUniversal Deep Research: Bring Your Own Model and StrategyAgents2509.00244Aug 29, 2025~92 min
- AugVibeVoice Technical ReportInference Optimization2508.19205Microsoft ResearchAug 26, 2025~119 min
- AugWebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentMultimodal2508.05748Alibaba DAMOAug 7, 2025score 9~109 min
- JulA Survey of Context Engineering for Large Language ModelsPrompting2507.13334Jul 17, 2025~88 min
- JulA Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super IntelligenceAgents2507.21046Jul 28, 2025score 10~120 min
- JulA Systematic Analysis of Hybrid Linear AttentionArchitecture2507.06457Jul 8, 2025score 9~92 min
- JulAgentic Reinforced Policy OptimizationRL Training2507.19849Jul 26, 2025~95 min
- JulAI-Generated Video Detection via Perceptual StraighteningVision2507.00583DeepMindJul 1, 2025~130 min
- JulARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World ShortsTraining Methods2507.20939TencentJul 28, 2025score 9~125 min
- JulAXLearn: Modular Large Model Training on Heterogeneous InfrastructureTraining Methods2507.05411AppleJul 7, 2025score 8~94 min
- JulCUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement LearningTraining Methods2507.14111Jul 18, 2025score 10~138 min
- JulDecoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long GenerationArchitecture2507.06607Microsoft ResearchJul 9, 2025score 9~109 min
- JulDoes More Inference-Time Compute Really Help Robustness?Safety2507.15974DeepSeekJul 21, 2025~111 min
- JulEvaluating Morphological Alignment of Tokenizers in 70 LanguagesEvaluation2507.06378Jul 8, 2025~112 min
- JulEvaluating SAE interpretability without explanationsEvaluation2507.08473Jul 11, 2025~108 min
- JulEXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning ModesReasoning2507.11407LG EXAONEJul 15, 2025score 10~110 min
- JulFalcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and PerformanceArchitecture2507.22448Jul 30, 2025score 10~132 min
- JulFast and Simplex: 2-Simplicial Attention in TritonScaling Laws2507.02754Jul 3, 2025score 10~112 min
- JulFlexOlmo: Open Language Models for Flexible Data UseMixture of Experts2507.07024Jul 9, 2025~105 min
- JulGemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic CapabilitiesLLM Systems2507.06261Jul 7, 2025score 10~104 min
- JulGeometric-Mean Policy OptimizationRL Training2507.20673Jul 28, 2025score 9~105 min
- JulGLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement LearningMultimodal2507.01006Zhipu / GLMJul 1, 2025score 10~109 min
- JulGR-3 Technical ReportUncategorized2507.15493ByteDance SeedJul 21, 2025score 5~104 min
- JulGSPO: Towards Scalable Reinforcement Learning for Language ModelsRL Training2507.18071Qwen / Alibaba CloudJul 24, 2025~94 min
- JulHelix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM DecodingServing2507.07120Jul 7, 2025~95 min
- JulHunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or PixelsVision2507.21809Tencent HunyuanJul 29, 2025score 3~105 min
- JulLocality-aware Parallel Decoding for Efficient Autoregressive Image GenerationInference Optimization2507.01957Jul 2, 2025score 9~111 min
- JulMeta CLIP 2: A Worldwide Scaling RecipeMultimodal2507.22062Jul 29, 2025score 10~113 min
- JulScaling RL to Long VideosRL Training2507.07966Jul 10, 2025~98 min
- JulStreaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time OrderingArchitecture2507.18446NVIDIAJul 24, 2025~117 min
- JulSWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?Code2507.12415Jul 16, 2025score 10~126 min
- JulThe Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane AlgorithmLLM Systems2507.18553 IST Austria Distributed Algorithms and Systems LabJul 24, 2025score 9~149 min
- JulThe Imitation Game: Turing Machine Imitator is Length Generalizable ReasonerReasoning2507.13332Intern Large ModelsJul 17, 2025score 9~106 min
- JulThe Invisible Leash: Why RLVR May or May Not Escape Its OriginEvaluation2507.14843Jul 20, 2025score 10~137 min
- JulThe Landscape of Memorization in LLMs: Mechanisms, Measurement, and MitigationSafety2507.05578Jul 8, 2025score 9~120 min
- JulThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent PlanningAgents2507.16815NVIDIAJul 22, 2025score 9~110 min
- JulToken Bottleneck: One Token to Remember DynamicsTraining Methods2507.06543NAVER AI LabJul 9, 2025score 5~116 min
- JulTraceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and MethodologyMultimodal2507.07999OpenAIJul 10, 2025score 8~99 min
- JulVoxtralMultimodal2507.13264MistralJul 17, 2025~111 min
- JulWebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationData2507.15061Alibaba DAMOJul 20, 2025score 9~109 min
- JulZeCO: Zero Communication Overhead Sequence Parallelism for Linear AttentionDistributed Training2507.01004Jul 1, 2025score 9~111 min
- JunAccurate and scalable exchange-correlation with deep learningPretraining2506.14665MicrosoftJun 17, 2025~145 min
- JunBeyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM ReasoningTraining Methods2506.01939Jun 2, 2025score 9~123 min
- JunBeyond the Buzz: A Pragmatic Take on Inference DisaggregationServing2506.05508Jun 5, 2025~100 min
- JunCyberV: Cybernetics for Test-time Scaling in Video UnderstandingVision2506.07971ByteDanceJun 9, 2025score 8~125 min
- JunGenRecal: Generation after Recalibration from Large to Small Vision-Language ModelsLLM Systems2506.15681NVIDIAJun 18, 2025score 9~102 min
- JunGUI-Actor: Coordinate-Free Visual Grounding for GUI AgentsVision2506.03143Microsoft ResearchJun 3, 2025score 9~98 min
- JunHunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History ConditionVision2506.17201Tencent HunyuanJun 20, 2025score 2~116 min
- JunHunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR MaterialDiffusion2506.15442Tencent HunyuanJun 18, 2025score 2~104 min
- JunHunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate DetailsVision2506.16504Jun 19, 2025score 3~106 min
- JunInference-Time Hyper-Scaling with KV Cache CompressionInference Optimization2506.05345NVIDIAJun 5, 2025score 9~102 min
- JunInfini-gram mini: Exact n-gram Search at the Internet Scale with FM-IndexData2506.12229Jun 13, 2025score 9~123 min
- JunLanguage Modeling by Language ModelsArchitecture2506.20249Jun 25, 2025~92 min
- JunLog-Linear AttentionArchitecture2506.04761Jun 5, 2025~122 min
- JunLongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMsInference Optimization2506.14429Jun 17, 2025score 9~112 min
- JunM$^3$FinMeeting: A Multilingual, Multi-Sector, and Multi-Task Financial Meeting Understanding Evaluation DatasetEvaluation2506.02510Qwen DianJinJun 3, 2025score 6~122 min
- JunMagistralReasoning2506.10910MistralJun 12, 2025~105 min
- JunMERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition QueryRetrieval2506.03144ByteDanceJun 3, 2025score 8~123 min
- JunMiniCPM4: Ultra-Efficient LLMs on End DevicesLLM Systems2506.07900OpenBMBJun 9, 2025score 9~122 min
- JunMiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning AttentionReasoning2506.13585DeepSeekJun 16, 2025score 9~132 min
- JunMultiverse: Your Language Models Secretly Decide How to Parallelize and Merge GenerationArchitecture2506.09991Jun 11, 2025score 9~114 min
- JunOpenThoughts: Data Recipes for Reasoning ModelsData2506.04178DeepSeekJun 4, 2025score 9~121 min
- JunPerformance Prediction for Large Systems via Text-to-Text RegressionServing2506.21718DeepMindJun 26, 2025score 3~109 min
- JunQwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation ModelsPretraining2506.05176Qwen / Alibaba CloudJun 5, 2025score 10~82 min
- JunRectified Sparse AttentionInference Optimization2506.04108Jun 4, 2025score 9~102 min
- JunReinforcement Pre-TrainingPretraining2506.08007Jun 9, 2025~106 min
- JunRLPR: Extrapolating RLVR to General Domains without VerifiersRL Training2506.18254OpenBMBJun 23, 2025score 9~83 min
- JunScaling Self-Supervised Representation Learning for Symbolic Piano PerformancePretraining2506.23869Jun 30, 2025~109 min
- JunSeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-TrainingVision2506.05301ByteDance SeedJun 5, 2025score 8~104 min
- JunSelf Forcing: Bridging the Train-Test Gap in Autoregressive Video DiffusionTraining Methods2506.08009Jun 9, 2025score 9~120 min
- JunSparseLoRA: Accelerating LLM Fine-Tuning with Contextual SparsityTraining Methods2506.16500Jun 19, 2025score 9~103 min
- JunThe Automated LLM Speedrunning Benchmark: Reproducing NanoGPT ImprovementsCode2506.22419Jun 27, 2025score 10~118 min
- JunThe Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed TextPretraining2506.05209Jun 5, 2025score 10~119 min
- JunTransformers Meet In-Context Learning: A Universal Approximation TheoryInference Optimization2506.05200Jun 5, 2025~121 min
- JunWhen Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition FrameworkAlignment2506.16411Together AIJun 19, 2025~132 min
- May100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language ModelsReasoning2505.00551DeepSeekMay 1, 2025score 9~118 min
- MayA Modular Approach for Clinical SLMs Driven by Synthetic Data with Pre-Instruction Tuning, Model Merging, and Clinical-Tasks AlignmentTraining Methods2505.10717Microsoft ResearchMay 15, 2025~132 min
- MayAn Empirical Study of Qwen3 QuantizationLow Precision2505.02214May 4, 2025score 9~89 min
- MayBPE Stays on SCRIPT: Structured Encoding for Robust Multilingual PretokenizationAlignment2505.24689May 30, 2025~124 min
- MayCASS: Nvidia to AMD Transpilation with Data, Models, and BenchmarkCode2505.16968NVIDIAMay 22, 2025score 6~112 min
- MayCritical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model TrainingTraining Methods2505.23971May 29, 2025~111 min
- MayEfficientLLM: Efficiency in Large Language ModelsEvaluation2505.13840May 20, 2025score 10~104 min
- MayFast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel DecodingInference Optimization2505.22618May 28, 2025score 10~107 min
- MayFFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language ModelsTraining Methods2505.17967Together AIMay 23, 2025~117 min
- MayG1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement LearningTraining Methods2505.13426Moonshot AIMay 19, 2025score 9~102 min
- MayGranary: Speech Recognition and Translation Dataset in 25 European LanguagesData2505.13404NVIDIAMay 19, 2025~86 min
- MayHunyuan-Game: Industrial-grade Intelligent Game Creation ModelAgents2505.14135May 20, 2025score 4~195 min
- MayHunyuanCustom: A Multimodal-Driven Architecture for Customized Video GenerationArchitecture2505.04512Tencent HunyuanMay 7, 2025score 3~117 min
- MayInsights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI ArchitecturesMixture of Experts2505.09343NVIDIAMay 14, 2025score 10~111 min
- MayLessons from Defending Gemini Against Indirect Prompt InjectionsSafety2505.14534DeepMindMay 20, 2025score 5~116 min
- MayLlama-Nemotron: Efficient Reasoning ModelsReasoning2505.00949DeepSeekMay 2, 2025~96 min
- MayMAGREF: Masked Guidance for Any-Reference Video Generation with Subject DisentanglementVision2505.23742ByteDanceMay 29, 2025score 2~91 min
- MayMiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker EncoderArchitecture2505.07916May 12, 2025score 2~112 min
- MayMMaDA: Multimodal Large Diffusion Language ModelsMultimodal2505.15809May 21, 2025~136 min
- MayModel Merging in Pre-training of Large Language ModelsPretraining2505.12082May 17, 2025~98 min
- MayParallel Scaling Law for Language ModelsScaling Laws2505.10475May 15, 2025~87 min
- MayPrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model ApplicationsServing2505.07203May 12, 2025~105 min
- MayQuartet: Native FP4 Training Can Be Optimal for Large Language ModelsTraining Methods2505.14669NVIDIAMay 20, 2025score 9~124 min
- MayQwen3 Technical ReportLLM Systems2505.09388Qwen / Alibaba CloudMay 14, 2025~128 min
- MayQwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context OptimizationContext Optimization2505.18092May 23, 2025score 9~115 min
- MayQwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement LearningRL Training2505.17667May 23, 2025score 9~118 min
- MayRADLADS: Rapid Attention Distillation to Linear Attention Decoders at ScaleTraining Methods2505.03005May 5, 2025score 9~133 min
- MayREASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable RewardsReasoning2505.24760May 30, 2025score 9~109 min
- MaySageAttention2++: A More Efficient Implementation of SageAttention2Inference Optimization2505.21136May 27, 2025score 9~93 min
- MaySageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit TrainingInference Optimization2505.11594May 16, 2025score 10~110 min
- MaySparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware PermutationInference Optimization2505.18875May 24, 2025score 9~93 min
- MayThe Entropy Mechanism of Reinforcement Learning for Reasoning Language ModelsTraining Methods2505.22617May 28, 2025score 9~125 min
- MayVSA: Faster Video Diffusion with Trainable Sparse AttentionDiffusion2505.13389May 19, 2025score 9~105 min
- MayWhen AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific ResearchEvaluation2505.11855May 17, 2025score 8~108 min
- MayZeroSearch: Incentivize the Search Capability of LLMs without SearchingTraining Methods2505.04588Alibaba DAMOMay 7, 2025~114 min
- AprBitNet b1.58 2B4T Technical ReportLLM Systems2504.12285Microsoft ResearchApr 16, 2025score 9~106 min
- AprBitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMsArchitecture2504.18415Apr 25, 2025score 9~90 min
- AprDataDecide: How to Predict Best Pretraining Data with Small ExperimentsData2504.11393Apr 15, 2025~133 min
- AprDeepSeek-R1 Thoughtology: Let's think about LLM ReasoningReasoning2504.07128DeepSeekApr 2, 2025score 10~120 min
- AprDeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization?Evaluation2504.08120OpenAIApr 10, 2025score 8~97 min
- AprDianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language ModelsReasoning2504.15716Qwen DianJinApr 22, 2025score 9~106 min
- AprDoes Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?RL Training2504.13837Apr 18, 2025score 9~107 min
- AprEagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language ModelsMultimodal2504.15271NVIDIAApr 21, 2025score 9~103 min
- AprHogwild! Inference: Parallel LLM Generation via Concurrent AttentionInference Optimization2504.06261Apr 8, 2025score 9~116 min
- AprInference-Time Scaling for Generalist Reward ModelingScaling Laws2504.02495Apr 3, 2025~101 min
- AprInternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal ModelsMultimodal2504.10479Apr 14, 2025score 10~101 min
- AprKimi-Audio Technical ReportMultimodal2504.18425Moonshot AIApr 25, 2025score 9~104 min
- AprKimi-VL Technical ReportMultimodal2504.07491NVIDIAApr 10, 2025~121 min
- AprLearning Adaptive Parallel Reasoning with Language ModelsReasoning2504.15466Apr 21, 2025~108 min
- AprLearning to Reason under Off-Policy GuidanceRL Training2504.14945Apr 21, 2025score 8~116 min
- AprMechanistic Anomaly Detection for "Quirky" Language ModelsSafety2504.08812Apr 9, 2025~121 min
- AprMegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert ParallelismServing2504.02263Apr 3, 2025~102 min
- AprMinitron-SSM: Efficient Hybrid Language Model Compression through Group-Aware SSM PruningTraining Methods2504.11409Apr 15, 2025score 9~124 min
- AprMSCCL++: Rethinking GPU Communication Abstractions for AI InferenceServing2504.09014Apr 11, 2025~111 min
- AprMulti-SWE-bench: A Multilingual Benchmark for Issue ResolvingEvaluation2504.02605ByteDance SeedApr 3, 2025score 9~99 min
- AprMulti-Token AttentionArchitecture2504.00927Apr 1, 2025~100 min
- AprNemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-trainingPretraining2504.13161Apr 17, 2025score 10~127 min
- AprNEMOTRON-CROSSTHINK: Scaling Self-Learning beyond Math ReasoningTraining Methods2504.13941Apr 15, 2025~105 min
- AprOLMoTrace: Tracing Language Model Outputs Back to Trillions of Training TokensTraining Methods2504.07096Apr 9, 2025score 9~92 min
- AprON LINEAR REPRESENTATIONS AND PRETRAINING DATA FREQUENCY IN LANGUAGE MODELSUncategorized2504.12459Apr 16, 2025~95 min
- AprOpen-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic ResourcesMultimodal2504.00595Apr 1, 2025score 9~95 min
- AprPaperBench: Evaluating AI's Ability to Replicate AI ResearchAgents2504.01848Apr 2, 2025score 10~102 min
- AprPhi-4-reasoning Technical ReportReasoning2504.21318Microsoft ResearchApr 30, 2025~123 min
- AprPixel-SAIL: Single Transformer For Pixel-Grounded UnderstandingMultimodal2504.10465ByteDanceApr 14, 2025score 9~120 min
- AprReinforcement Learning for Reasoning in Large Language Models with One Training ExampleTraining Methods2504.20571Apr 29, 2025score 10~117 min
- AprReinforcement Learning from Human FeedbackRL Training2504.12501Apr 16, 2025~84 min
- AprSleep-time Compute: Beyond Inference Scaling at Test-timeInference Optimization2504.13171Apr 17, 2025~127 min
- AprSmolVLM: Redefining small and efficient multimodal modelsMultimodal2504.05299Hugging Face Smol ModelsApr 7, 2025~116 min
- AprSphereDiff: Tuning-free 360° Static and Dynamic Panorama Generation via Spherical Latent RepresentationVision2504.14396KAIST AIApr 19, 2025score 2~98 min
- AprThe AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree SearchAgents2504.08066Apr 10, 2025score 9~93 min
- AprThe Leaderboard IllusionEvaluation2504.20879Apr 29, 2025~124 min
- AprThe Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single TransformerMultimodal2504.10462ByteDanceApr 14, 2025score 8~103 min
- AprTTRL: Test-Time Reinforcement LearningRL Training2504.16084Apr 22, 2025score 9~93 min
- MarA Comprehensive Survey on Long Context Language ModelingLLM Systems2503.17407Mar 20, 2025~121 min
- MarCube: A Roblox View of 3D IntelligenceArchitecture2503.15475RobloxMar 19, 2025~109 min
- MarDAPO: An Open-Source LLM Reinforcement Learning System at ScaleRL Training2503.14476OpenAIMar 18, 2025~111 min
- MarEAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time TestInference Optimization2503.01840Mar 3, 2025score 10~123 min
- MarFlowTok: Flowing Seamlessly Across Text and Image TokensArchitecture2503.10772ByteDance SeedMar 13, 2025score 9~117 min
- MarForgetting Transformer: Softmax Attention with a Forget GateArchitecture2503.02130Mar 3, 2025score 9~118 min
- MarGemini Embedding: Generalizable Embeddings from GeminiLLM Systems2503.07891DeepMindMar 10, 2025~99 min
- MarGemini Robotics: Bringing AI into the Physical WorldMultimodal2503.20020Mar 25, 2025score 9~134 min
- MarGemma 3 Technical ReportArchitecture2503.19786Google ResearchMar 25, 2025~112 min
- MarHolistically Evaluating the Environmental Impact of Creating Language ModelsEvaluation2503.05804Mar 3, 2025~121 min
- MarLarge Language Model Agent: A Survey on Methodology, Applications and ChallengesAgents2503.21460Mar 27, 2025score 1~89 min
- MarOn the Acquisition of Shared Grammatical Representations in Bilingual Language ModelsAlignment2503.03962Mar 5, 2025score 4~111 min
- MarOpen-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base ModelReasoning2503.24290DeepSeekMar 31, 2025score 9~116 min
- MarPhi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAsMultimodal2503.01743Microsoft ResearchMar 3, 2025score 10~111 min
- MarPokéChamp: an Expert-level Minimax Language AgentAgents2503.04094Mar 6, 2025score 4~130 min
- MarPolyPythias: Stability and Outliers across Fifty Language Model Pre-Training RunsPretraining2503.09543EleutherAIMar 12, 2025~146 min
- MarQuantization for OpenAI's Whisper Models: A Comparative AnalysisInference Optimization2503.09905OpenAIMar 12, 2025score 3~112 min
- MarQuestBench: Can LLMs ask the right question to acquire information in reasoning tasks?Evaluation2503.22674DeepMindMar 28, 2025~121 min
- MarQwen2.5-Omni Technical ReportMultimodal2503.20215Qwen / Alibaba CloudMar 26, 2025~106 min
- MarRankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval EvaluationEvaluation2503.19092Mar 24, 2025~123 min
- MarRWKV-7 "Goose" with Expressive Dynamic State EvolutionArchitecture2503.14456Mar 18, 2025score 9~123 min
- MarSearch-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningTraining Methods2503.09516Mar 12, 2025score 10~105 min
- MarTraining and Inference Efficiency of Encoder-Decoder Speech ModelsTraining Methods2503.05931NVIDIAMar 7, 2025~114 min
- MarTraining Video Foundation Models with NVIDIA NeMoTraining Methods2503.12964NVIDIAMar 17, 2025score 6~127 min
- MarTransformers without NormalizationArchitecture2503.10622Mar 13, 2025~114 min
- MarUnderstanding R1-Zero-Like Training: A Critical PerspectiveReasoning2503.20783DeepSeekMar 26, 2025score 9~108 min
- MarUVE: Are MLLMs Unified Evaluators for AI-Generated Videos?Evaluation2503.09949ByteDance SeedMar 13, 2025score 6~111 min
- MarWhy Do Multi-Agent LLM Systems Fail?Agents2503.13657Mar 17, 2025~133 min
- FebCan 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time ScalingInference Optimization2502.06703Feb 10, 2025score 9~110 min
- FebChain of Draft: Thinking Faster by Writing LessPrompting2502.18600Zoom AIFeb 25, 2025score 8~88 min
- FebCompetitive Programming with Large Reasoning ModelsRL Training2502.06807OpenAIFeb 3, 2025~127 min
- FebConverting MLPs into Polynomials in Closed FormTraining Methods2502.01032Feb 3, 2025~111 min
- FebExamining Two Hop Reasoning Through Information Content ScalingTraining Methods2502.03490Feb 5, 2025~117 min
- FebGold-medalist Performance in Solving Olympiad Geometry with AlphaGeometry2Reasoning2502.03544Feb 5, 2025score 10~127 min
- FebInfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPUInference Optimization2502.08910Feb 13, 2025score 10~130 min
- FebKernelBench: Can LLMs Write Efficient GPU Kernels?Evaluation2502.10517Feb 14, 2025~112 min
- FebLIMO: Less is More for ReasoningReasoning2502.03387Feb 5, 2025~123 min
- FebLM2: Large Memory ModelsArchitecture2502.06049Feb 9, 2025~93 min
- FebLongRoPE2: Near-Lossless LLM Context Window ScalingScaling Laws2502.20082Feb 27, 2025score 10~92 min
- FebLServe: Efficient Long-sequence LLM Serving with Unified Sparse AttentionInference Optimization2502.14866Feb 20, 2025score 9~120 min
- FebMatryoshka QuantizationTraining Methods2502.06786Feb 10, 2025score 9~112 min
- FebMaximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit FlipsSafety2502.07408NVIDIAFeb 11, 2025~127 min
- FebMoBA: Mixture of Block Attention for Long-Context LLMsArchitecture2502.13189Moonshot AIFeb 18, 2025score 9~112 min
- FebNative Sparse Attention: Hardware-Aligned and Natively Trainable Sparse AttentionArchitecture2502.11089DeepSeekFeb 16, 2025score 9~127 min
- FebolmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language ModelsMultimodal2502.18443Feb 25, 2025~135 min
- FebPartition Tree Weighting for Non-Stationary Stochastic BanditsRL Training2502.19325DeepMindFeb 26, 2025~120 min
- FebPoly-Autoregressive Prediction for Modeling InteractionsArchitecture2502.08646DeepMindFeb 12, 2025~104 min
- FebProcess Reinforcement through Implicit RewardsRL Training2502.01456Feb 3, 2025score 9~110 min
- FebQwen2.5-VL Technical ReportMultimodal2502.13923Qwen / Alibaba CloudFeb 19, 2025~122 min
- FebReformulation for Pretraining Data AugmentationData2502.04235ByteDance SeedFeb 6, 2025score 9~95 min
- FebScaling Pre-training to One Hundred Billion Data for Vision Language ModelsMultimodal2502.07617DeepMindFeb 11, 2025score 9~135 min
- FebSigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense FeaturesMultimodal2502.14786Google ResearchFeb 20, 2025score 8~116 min
- FebSlowing Learning by Erasing Simple FeaturesSafety2502.02820Feb 5, 2025~131 min
- FebSmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language ModelPretraining2502.02737Hugging Face Smol ModelsFeb 4, 2025score 10~133 min
- FebSuperGPQA: Scaling LLM Evaluation across 285 Graduate DisciplinesEvaluation2502.14739ByteDance SeedFeb 20, 2025score 9~86 min
- FebSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software EvolutionTraining Methods2502.18449DeepSeekFeb 25, 2025score 9~116 min
- FebTransMLA: Multi-Head Latent Attention Is All You NeedInference Optimization2502.07864DeepSeekFeb 11, 2025score 10~101 min
- FebV2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language ModelsLLM Systems2502.09980NVIDIAFeb 14, 2025score 2~119 min
- Jan2.5 Years in Class: A Multimodal Textbook for Vision-Language PretrainingData2501.00958Jan 1, 2025score 10~113 min
- JanAn Empirical Study of Autoregressive Pre-training from VideosPretraining2501.05453Jan 9, 2025~102 min
- JanCosmos World Foundation Model Platform for Physical AIPretraining2501.03575NVIDIAJan 6, 2025score 5~137 min
- JanDecoding-based RegressionTraining Methods2501.19383DeepMindJan 31, 2025~128 min
- JanDeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learningRL Training2501.12948DeepSeekJan 22, 2025score 10~129 min
- JanEagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language ModelsMultimodal2501.14818Jan 20, 2025~133 min
- JanEarly External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment EvaluationSafety2501.17749OpenAIJan 29, 2025score 6~108 min
- JanEvolving Deeper LLM ThinkingAgents2501.09891DeepMindJan 17, 2025~119 min
- JanFlashInfer: Efficient and Customizable Attention Engine for LLM Inference ServingServing2501.01005Jan 2, 2025~136 min
- JanHumanity's Last ExamEvaluation2501.14249AnthropicJan 24, 2025score 10~122 min
- JanHunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets GenerationLLM Systems2501.12202Tencent HunyuanJan 21, 2025score 6~119 min
- JanInternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward ModelAlignment2501.12368InternLM / Shanghai AI LabJan 21, 2025score 9~95 min
- JanKimi k1.5: Scaling Reinforcement Learning with LLMsReasoning2501.12599Jan 22, 2025~107 min
- JanMiniMax-01: Scaling Foundation Models with Lightning AttentionArchitecture2501.08313MiniMaxJan 14, 2025~123 min
- JanMONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward HackingAlignment2501.13011DeepMindJan 22, 2025~107 min
- Jano3-mini vs DeepSeek-R1: Which One is Safer?Safety2501.18438OpenAIJan 30, 2025score 3~96 min
- JanOmni-RGPT: Unifying Image and Video Region-level Understanding via Token MarksMultimodal2501.08326NVIDIAJan 14, 2025score 9~104 min
- JanOpen Problems in Mechanistic InterpretabilitySafety2501.16496Jan 27, 2025score 6~110 min
- JanOptimizing Large Language Model Training Using FP4 QuantizationTraining Methods2501.17116Jan 28, 2025score 9~107 min
- JanPartially Rewriting a Transformer in Natural LanguageAlignment2501.18838Jan 31, 2025~101 min
- JanPeople who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated textEvaluation2501.15654Jan 26, 2025score 10~110 min
- JanQwen2.5-1M Technical ReportContext Optimization2501.15383Qwen / Alibaba CloudJan 26, 2025~114 min
- JanREINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage NormalizationRL Training2501.03262Jan 4, 2025score 9~107 min
- JanReward-Guided Speculative Decoding for Efficient LLM ReasoningReasoning2501.19324SalesforceJan 31, 2025score 9~129 min
- JanrStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep ThinkingReasoning2501.04519OpenAIJan 8, 2025score 9~115 min
- Jans1: Simple test-time scalingReasoning2501.19393OpenAIJan 31, 2025~112 min
- JanSa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and VideosMultimodal2501.04001ByteDance SeedJan 7, 2025score 8~109 min
- JanSeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video RestorationVision2501.01320ByteDance SeedJan 2, 2025score 5~98 min
- JanSFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-trainingAlignment2501.17161Jan 28, 2025score 10~103 min
- JanSigma: Differential Rescaling of Query, Key and Value for Efficient Language ModelsArchitecture2501.13629Jan 23, 2025score 9~111 min
- JanSparse Autoencoders Trained on the Same Data Learn Different FeaturesAlignment2501.16615Jan 28, 2025~112 min
- JanStreaming DiLoCo with overlapping communication: Towards a Distributed Free LunchDistributed Training2501.18512Jan 30, 2025score 10~109 min
- JanTensor Product Attention Is All You NeedArchitecture2501.06425math-aiJan 11, 2025score 9~113 min
- JanThe Lessons of Developing Process Reward Models in Mathematical ReasoningTraining Methods2501.07301Qwen / Alibaba CloudJan 13, 2025score 10~115 min
- JanTowards Best Practices for Open Datasets for LLM TrainingData2501.08365Jan 14, 2025~104 min
- JanTrading Inference-Time Compute for Adversarial RobustnessReasoning2501.18841OpenAIJan 31, 2025score 10~141 min
- JanTransformer-Squared: Self-adaptive LLMsTraining Methods2501.06252Jan 9, 2025score 9~115 min
2024
375 papers- Dec2 OLMo 2 FuriousPretraining2501.00656Allen Institute for AIDec 31, 2024~111 min
- DecApollo: An Exploration of Video Understanding in Large Multimodal ModelsMultimodal2412.10360Dec 13, 2024~111 min
- DecAPOLLO: SGD-like Memory, AdamW-level PerformanceTraining Methods2412.05270Dec 6, 2024score 9~116 min
- DecB-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught ReasonersTraining Methods2412.17256Dec 23, 2024score 9~118 min
- DecByte Latent Transformer: Patches Scale Better Than TokensArchitecture2412.09871Dec 13, 2024score 9~136 min
- DecDensing Law of LLMsScaling Laws2412.04315OpenBMBDec 5, 2024score 8~113 min
- DecEfficiently Serving LLM Reasoning Programs with CertaindexServing2412.20993Dec 30, 2024score 9~106 min
- DecEXAONE 3.5: Series of Large Language Models for Real-world Use CasesPretraining2412.04862LG EXAONEDec 6, 2024~97 min
- DecExponential Speedups by Rerooting Levin Tree SearchReasoning2412.05196DeepMindDec 6, 2024~112 min
- DecFLEX ATTENTION: A PROGRAMMING MODEL FOR GENERATING OPTIMIZED ATTENTION KERNELSArchitecture2412.05496Dec 7, 2024~116 min
- DecFourier Position Embedding: Enhancing Attention's Periodic Extension for Length GeneralizationArchitecture2412.17739Dec 23, 2024score 9~109 min
- DecHunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem ProvingReasoning2412.20735Dec 30, 2024score 9~119 min
- DecInternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio InteractionsMultimodal2412.09596InternLM / Shanghai AI LabDec 12, 2024score 6~112 min
- DecLAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural AnnotationsData2412.08580Dec 11, 2024score 6~88 min
- DecLearnLM: Improving Gemini for LearningTraining Methods2412.16429Dec 21, 2024score 7~111 min
- DecMachine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and ResearchSafety2412.06966DeepMindDec 9, 2024~132 min
- DecMix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LNTraining Methods2412.13795Dec 18, 2024score 8~111 min
- DecMultimodal Latent Language Modeling with Next-Token DiffusionArchitecture2412.08635Microsoft ResearchDec 11, 2024score 6~129 min
- DecNext Token Prediction Towards Multimodal Intelligence: A Comprehensive SurveyMultimodal2412.18619Dec 16, 2024~124 min
- DecNo More Adam: Learning Rate Scaling at Initialization is All You NeedTraining Methods2412.11768Dec 16, 2024score 9~100 min
- DecNVILA: Efficient Frontier Visual Language ModelsLLM Systems2412.04468Dec 5, 2024~117 min
- DecOffline Reinforcement Learning for LLM Multi-Step ReasoningReasoning2412.16145Dec 20, 2024score 9~122 min
- DecOpenAI o1 System CardSafety2412.16720OpenAIDec 21, 2024score 9~170 min
- DecPaliGemma 2: A Family of Versatile VLMs for TransferMultimodal2412.03555Google ResearchDec 4, 2024score 9~114 min
- DecParallelized Autoregressive Visual GenerationVision2412.15119Dec 19, 2024score 9~103 min
- DecPhi-4 Technical ReportTraining Methods2412.08905Microsoft ResearchDec 12, 2024~112 min
- DecProactive Agents for Multi-Turn Text-to-Image Generation Under UncertaintyMultimodal2412.06771DeepMindDec 9, 2024~124 min
- DecQwen2.5 Technical ReportPretraining2412.15115Qwen / Alibaba CloudDec 19, 2024~109 min
- DecRobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy ResponseTraining Methods2412.14922Dec 19, 2024score 10~90 min
- DecTraining Large Language Models to Reason in a Continuous Latent SpaceReasoning2412.06769Dec 9, 2024~126 min
- DecVLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language ModelsTraining Methods2412.01822NVIDIADec 2, 2024score 9~97 min
- Nov"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM QuantizationInference Optimization2411.02355DropboxNov 4, 2024score 10~118 min
- NovBalancing Pipeline Parallelism with Vocabulary ParallelismTraining Methods2411.05288Nov 8, 2024score 9~118 min
- NovBenchmarking Distributional Alignment of Large Language ModelsEvaluation2411.05403Nov 8, 2024~118 min
- NovBitNet a4.8: 4-bit Activations for 1-bit LLMsArchitecture2411.04965Nov 7, 2024score 9~92 min
- NovContext Parallelism for Scalable Million-Token InferenceInference Optimization2411.01783Nov 4, 2024~130 min
- NovCut Your Losses in Large-Vocabulary Language ModelsTraining Methods2411.09009AppleNov 13, 2024score 9~114 min
- NovDeMo: Decoupled Momentum OptimizationTraining Methods2411.19870Nov 29, 2024score 7~101 min
- NovDo Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?Evaluation2411.16679DeepMindNov 25, 2024~124 min
- NovHunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by TencentMixture of Experts2411.02265Tencent HunyuanNov 4, 2024score 9~110 min
- NovHymba: A Hybrid-head Architecture for Small Language ModelsArchitecture2411.13676NVIDIANov 20, 2024score 9~102 min
- NovKV Shifting Attention Enhances Language ModelingArchitecture2411.19574Nov 29, 2024score 9~124 min
- NovLLaVA-o1: Let Vision Language Models Reason Step-by-StepTraining Methods2411.10440Nov 15, 2024score 10~100 min
- NovMARCONI: PREFIX CACHING FOR THE ERA OF HYBRID LLMSServing2411.19379Nov 28, 2024~99 min
- NovMARS: Unleashing the Power of Variance Reduction for Training Large ModelsTraining Methods2411.10438Nov 15, 2024score 9~118 min
- NovMH-MoE: Multi-Head Mixture-of-ExpertsMixture of Experts2411.16205Nov 25, 2024score 9~107 min
- NovMixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation ModelsArchitecture2411.04996Nov 7, 2024score 10~118 min
- NovOPENCODER: THE OPEN COOKBOOK FOR TOP-TIER CODE LARGE LANGUAGE MODELSCode2411.04905Nov 7, 2024~110 min
- NovREAD MOREData2411.12372Together AINov 19, 2024~127 min
- NovSageAttention2 Technical Report: Accurate 4 Bit Attention for Plug-and-play Inference AccelerationInference Optimization2411.10958Nov 17, 2024score 9~109 min
- NovSample-Efficient Alignment for LLMsAlignment2411.01493Nov 3, 2024score 8~124 min
- NovSmoothCache: A Universal Inference Acceleration Technique for Diffusion TransformersInference Optimization2411.10510RobloxNov 15, 2024score 9~102 min
- NovSparsing Law: Towards Large Language Models with Greater Activation SparsityAgents2411.02335Nov 4, 2024score 9~108 min
- NovStar Attention: Efficient LLM Inference over Long SequencesInference Optimization2411.17116Nov 26, 2024score 9~124 min
- NovSteering Language Model Refusal with Sparse AutoencodersSafety2411.11296Nov 18, 2024~107 min
- NovTülu 3: Pushing Frontiers in Open Language Model Post-TrainingTraining Methods2411.15124Allen Institute for AINov 22, 2024~132 min
- NovUnderstanding Chain-of-Thought in LLMs through Information TheoryReasoning2411.11984Nov 18, 2024~105 min
- NovWhen Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context TrainingArchitecture2411.13476Nov 20, 2024score 8~114 min
- Oct$π_0$: A Vision-Language-Action Flow Model for General Robot ControlUncategorized2410.24164NVIDIAOct 31, 2024~111 min
- OctA Comparative Study on Reasoning Patterns of OpenAI's o1 ModelReasoning2410.13639Oct 17, 2024score 9~110 min
- OctA Survey of Small Language ModelsLLM Systems2410.20011Oct 25, 2024~119 min
- OctAddition is All You Need for Energy-efficient Language ModelsInference Optimization2410.00907Oct 1, 2024score 9~109 min
- OctAsynchronous RLHF: Faster and More Efficient Off-Policy RL for Language ModelsRL Training2410.18252Oct 23, 2024score 9~117 min
- OctControllable Safety Alignment: Inference-Time Adaptation to Diverse Safety RequirementsAlignment2410.08968Oct 11, 2024score 8~113 min
- OctDIFFERENTIAL TRANSFORMERArchitecture2410.05258Oct 7, 2024~99 min
- OctDiffusion Model Predictive ControlReasoning2410.05364DeepMindOct 7, 2024~101 min
- OctDocument Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information ExtractionVision2410.21169Oct 28, 2024score 10~114 min
- OctDuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming HeadsInference Optimization2410.10819Oct 14, 2024score 9~125 min
- OctEoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank ApproximationLLM Systems2410.21271NVIDIAOct 28, 2024score 6~113 min
- OctGPT-4o System CardSafety2410.21276OpenAIOct 25, 2024score 9~137 min
- OctInference Scaling for Long-Context Retrieval Augmented GenerationReasoning2410.04343Oct 6, 2024~124 min
- OctJanus: Decoupling Visual Encoding for Unified Multimodal Understanding and GenerationMultimodal2410.13848DeepSeekOct 17, 2024score 8~79 min
- OctLanguage Model Embeddings Can Be Sufficient for Bayesian OptimizationAgents2410.10190DeepMindOct 14, 2024~125 min
- OctLiger Kernel: Efficient Triton Kernels for LLM TrainingTraining Methods2410.10989Oct 14, 2024~124 min
- OctMA-RLHF: Reinforcement Learning from Human Feedback with Macro ActionsRL Training2410.02743BAIDUOct 3, 2024score 8~117 min
- OctMerge to Learn: Efficiently Adding Skills to Language Models with Model MergingTraining Methods2410.12937Oct 16, 2024~116 min
- OctMOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU LanguagesData2410.01036NVIDIAOct 1, 2024score 2~112 min
- OctMulti-Field Adaptive RetrievalRetrieval2410.20056Oct 26, 2024~108 min
- OctNot All LLM Reasoners Are Created EqualReasoning2410.01748Oct 2, 2024~109 min
- OctOrca: A Distributed Serving System for Transformer-Based Generative ModelsServing2410.17840Oct 23, 2024~108 min
- OctPre-training Distillation for Large Language Models: A Design Space ExplorationPretraining2410.16215Oct 21, 2024score 10~124 min
- OctPrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models QuantizationInference Optimization2410.05265Oct 7, 2024score 9~117 min
- OctRATIONALYST: Mining Implicit Rationales for Process Supervision of ReasoningReasoning2410.01044Oct 1, 2024score 9~110 min
- OctREAD MOREServing2410.20399Together AIOct 27, 2024~108 min
- OctRevisiting Reliability in Large-Scale Machine Learning Research ClustersDistributed Training2410.21680Oct 29, 2024~112 min
- OctSageAttention: Accurate 8-Bit Attention for Plug-and-play Inference AccelerationInference Optimization2410.02367Oct 3, 2024score 9~112 min
- OctSeerAttention: Learning Intrinsic Sparse Attention in Your LLMsInference Optimization2410.13276Oct 17, 2024score 9~107 min
- OctSelective Attention Improves TransformerArchitecture2410.02703Oct 3, 2024score 9~123 min
- OctSelf-Boosting Large Language Models with Synthetic Preference DataAlignment2410.06961Oct 9, 2024score 9~118 min
- OctShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM InferenceServing2410.21465ByteDance SeedOct 28, 2024score 9~114 min
- OctStuffed Mamba: Oversized States Lead to the Inability to ForgetTraining Methods2410.07145Oct 9, 2024score 9~127 min
- OctSwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model TransformationServing2410.03960SnowflakeOct 4, 2024score 9~128 min
- OctTIPS: Text-Image Pretraining with Spatial awarenessMultimodal2410.16512DeepMindOct 21, 2024~108 min
- OctTLDR: Token-Level Detective Reward Model for Large Vision Language ModelsAlignment2410.04734Meta LlamaOct 7, 2024score 8~119 min
- OctUFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward FunctionTraining Methods2410.21438Oct 28, 2024~111 min
- OctUndesirable Memorization in Large Language Models: A SurveySafety2410.02650Oct 3, 2024~133 min
- SepA Case Study of Web App Coding with OpenAI Reasoning ModelsCode2409.13773Sep 19, 2024score 8~108 min
- SepA Controlled Study on Long Context Extension and Generalization in LLMsTraining Methods2409.12181Sep 18, 2024~146 min
- SepAttention Heads of Large Language Models: A SurveyReasoning2409.03752Sep 5, 2024~127 min
- SepCan LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP ResearchersAgents2409.04109Sep 6, 2024score 10~118 min
- SepCoffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous CodeRL Training2409.19715Sep 29, 2024score 8~111 min
- SepConfigurable Foundation Models: Building LLMs from a Modular PerspectiveArchitecture2409.02877OpenBMBSep 4, 2024score 9~129 min
- SepEmu3: Next-Token Prediction is All You NeedMultimodal2409.18869Sep 27, 2024~122 min
- SepEuroLLM: Multilingual Language Models for EuropeLLM Systems2409.16235Sep 24, 2024score 9~103 min
- SepInstruction Following without Instruction TuningAlignment2409.14254Sep 21, 2024score 9~115 min
- SepIs Preference Alignment Always the Best Option to Enhance LLM-Based Translation? An Empirical AnalysisAlignment2409.20059Sep 30, 2024score 8~107 min
- SepLanguage Models Learn to Mislead Humans via RLHFAlignment2409.12822Sep 19, 2024score 8~98 min
- SepLaw of the Weakest Link: Cross Capabilities of Large Language ModelsEvaluation2409.19951Sep 30, 2024score 9~114 min
- SepMaskLLM: Learnable Semi-Structured Sparsity for Large Language ModelsLLM Systems2409.17481Sep 26, 2024score 9~118 min
- SepMichelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure QueriesEvaluation2409.12640DeepMindSep 19, 2024~114 min
- SepMM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-TuningMultimodal2409.20566AppleSep 30, 2024~110 min
- SepMMMU-Pro: A More Robust Multi-discipline Multimodal Understanding BenchmarkEvaluation2409.02813Sep 4, 2024score 9~99 min
- SepMolmo and PixMo: Open Weights and Open Data for State-of-the-Art Multimodal ModelsMultimodal2409.17146Allen Institute for AISep 25, 2024score 9~121 min
- SepNVLM: Open Frontier-Class Multimodal LLMsMultimodal2409.11402Sep 17, 2024~107 min
- SepOLMoE: Open Mixture-of-Experts Language ModelsMixture of Experts2409.02060Allen Institute for AISep 3, 2024~96 min
- SepOryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary ResolutionMultimodal2409.12961Sep 19, 2024score 9~102 min
- SepQwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any ResolutionMultimodal2409.12191Qwen / Alibaba CloudSep 18, 2024score 9~112 min
- SepQwen2.5-Coder Technical ReportCode2409.12186Qwen / Alibaba CloudSep 18, 2024~110 min
- SepRetrievalAttention: Accelerating Long-Context LLM Inference via Vector RetrievalInference Optimization2409.10516Sep 16, 2024score 8~105 min
- SepScaling Smart: Accelerating Large Language Model Pre-training with Small Model InitializationPretraining2409.12903AppleSep 19, 2024score 9~102 min
- SepSortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text SystemsUncategorized2409.06656NVIDIASep 10, 2024~113 min
- SepSource2Synth: Synthetic Data Generation and Curation Grounded in Real Data SourcesData2409.08239Sep 12, 2024score 10~112 min
- SepTowards a Unified View of Preference Learning for Large Language Models: A SurveyAlignment2409.02795Sep 4, 2024score 10~110 min
- SepTraining Language Models to Self-Correct via Reinforcement LearningTraining Methods2409.12917Sep 19, 2024~103 min
- SepVPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language ModelsLow Precision2409.17066Sep 25, 2024score 9~107 min
- AugAchieving Human Level Competitive Robot Table TennisArchitecture2408.03906DeepMindAug 7, 2024score 2~120 min
- AugAUXILIARY-LOSS-FREE LOAD BALANCING STRATEGY FOR MIXTURE-OF-EXPERTSTraining Methods2408.15664Aug 28, 2024~97 min
- AugBaichuanSEED: Sharing the Potential of ExtensivE Data Collection and Deduplication by Introducing a Competitive Large Language Model BaselinePretraining2408.15079Aug 27, 2024score 9~122 min
- AugBuilding and better understanding vision-language models: insights and future directionsVision2408.12637Aug 22, 2024score 10~96 min
- AugCogVideoX: Text-to-Video Diffusion Models with An Expert TransformerDiffusion2408.06072Zhipu / GLMAug 12, 2024score 3~121 min
- AugDeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree SearchReasoning2408.08152DeepSeekAug 15, 2024score 9~112 min
- AugDiversity Empowers Intelligence: Integrating Expertise of Software Engineering AgentsAgents2408.07060SalesforceAug 13, 2024score 10~108 min
- AugDolphin: Long Context as a New Modality for Energy-Efficient On-Device Language ModelsAgents2408.15518Aug 28, 2024score 10~87 min
- AugEXAONE 3.0 7.8B Instruction Tuned Language ModelLLM Systems2408.03541LG EXAONEAug 7, 2024score 9~114 min
- AugFocusLLM: Precise Understanding of Long Context by Dynamic CondensingContext Optimization2408.11745Aug 21, 2024score 9~135 min
- AugHermes 3 Technical ReportAlignment2408.11857Aug 15, 2024~105 min
- AugJamba-1.5: Hybrid Transformer-Mamba Models at ScaleArchitecture2408.12570Aug 22, 2024~102 min
- AugLayerwise Recurrent Router for Mixture-of-ExpertsMixture of Experts2408.06793Aug 13, 2024score 8~110 min
- AugLLaVA-OneVision: Easy Visual Task TransferMultimodal2408.03326Aug 6, 2024score 9~112 min
- AugLLM Pruning and Distillation in Practice: The Minitron ApproachTraining Methods2408.11796Aug 21, 2024~110 min
- AugMemory-Efficient LLM Training with Online Subspace DescentTraining Methods2408.12857Aug 23, 2024score 7~126 min
- AugMulti-Layer Transformers Gradient Can be Approximated in Almost Linear TimeTraining Methods2408.13233Aug 23, 2024score 9~100 min
- AugMUTUAL REASONING MAKES SMALLER LLMS STRONGER PROBLEM-SOLVERSReasoning2408.06195Aug 12, 2024~115 min
- AugNanoFlow: Towards Optimal Large Language Model Serving ThroughputServing2408.12757Aug 22, 2024~108 min
- AugNEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing TasksUncategorized2408.13106NVIDIAAug 23, 2024~97 min
- AugPhysics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math ProblemsTraining Methods2408.16293Aug 29, 2024score 9~120 min
- AugRecent Surge in Public Interest in Transportation: Sentiment Analysis of Baidu Apollo Go Using Weibo DataContext Optimization2408.10088Aug 19, 2024score 1~117 min
- AugSAM 2: Segment Anything in Images and VideosVision2408.00714Meta AI / FAIRAug 1, 2024score 9~135 min
- AugScaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model ParametersInference Optimization2408.03314Aug 6, 2024score 10~122 min
- AugSelf-Taught EvaluatorsEvaluation2408.02666Aug 5, 2024score 9~103 min
- AugThe Mamba in the Llama: Distilling and Accelerating Hybrid ModelsArchitecture2408.15237Aug 27, 2024~116 min
- AugThe Vizier Gaussian Process Bandit AlgorithmTraining Methods2408.11527DeepMindAug 21, 2024~133 min
- AugTo Code, or Not To Code? Exploring Impact of Code in Pre-trainingPretraining2408.10914Aug 20, 2024~120 min
- AugTransformers are Universal In-context LearnersPretraining2408.01367Aug 2, 2024~122 min
- AugTransfusion: Predict the Next Token and Diffuse Images with One Multi-Modal ModelMultimodal2408.11039Aug 20, 2024score 9~106 min
- AugUnleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language ModelsData2408.02085Aug 4, 2024score 10~182 min
- AugWriting in the Margins: Better Inference Pattern for Long Context RetrievalInference Optimization2408.14906Aug 27, 2024score 8~108 min
- JulAn Efficient Inference Framework for Early-exit Large Language ModelsInference Optimization2407.20272Jul 25, 2024~103 min
- JulCompact Language Models via Pruning and Knowledge DistillationPretraining2407.14679Jul 19, 2024~140 min
- JulComposable Interventions for Language ModelsAlignment2407.06483Jul 9, 2024~101 min
- JulEmbedding And Clustering Your Data Can Improve Contrastive PretrainingTraining Methods2407.18887SnowflakeJul 26, 2024~101 min
- JulFlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precisionInference Optimization2407.08608DropboxJul 11, 2024~111 min
- JulGemma 2: Improving Open Language Models at a Practical SizePretraining2408.00118Google ResearchJul 31, 2024~106 min
- JulGENERALIZATION V.S. MEMORIZATION: TRACING LANGUAGE MODELS’ CAPABILITIES BACK TO PRETRAINING DATATraining Methods2407.14985Jul 20, 2024~131 min
- JulGoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache CompressionArchitecture2407.12077Jul 16, 2024score 9~124 min
- JulHuman-inspired Episodic Memory for Infinite Context LLMsInference Optimization2407.09450Jul 12, 2024score 9~127 min
- JulInference Performance Optimization for Large Language Models on CPUsInference Optimization2407.07304Jul 10, 2024score 9~98 min
- JulInternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and OutputMultimodal2407.03320InternLM / Shanghai AI LabJul 3, 2024score 9~105 min
- JulKiVA: Kid-inspired Visual Analogies for Testing Large Multimodal ModelsEvaluation2407.17773DeepMindJul 25, 2024~112 min
- JulLarge Language Monkeys: Scaling Inference Compute with Repeated SamplingScaling Laws2407.21787Jul 31, 2024~130 min
- JulLazyLLM: Dynamic Token Pruning for Efficient Long Context LLM InferenceInference Optimization2407.14057AppleJul 19, 2024score 9~100 min
- JulLearning to (Learn at Test Time): RNNs with Expressive Hidden StatesArchitecture2407.04620Jul 5, 2024~108 min
- JulLet the Expert Stick to His Last: Expert-Specialized Fine-Tuning for Sparse Architectural Large Language ModelsMixture of Experts2407.01906DeepSeekJul 2, 2024score 9~107 min
- JulLiNR: Model Based Neural Retrieval on GPUs at LinkedInServing2407.13218Jul 18, 2024~132 min
- JulLMMs-Eval: Reality Check on the Evaluation of Large Multimodal ModelsEvaluation2407.12772Jul 17, 2024score 9~133 min
- JulMindSearch: Mimicking Human Minds Elicits Deep AI SearcherAgents2407.20183Jul 29, 2024score 9~93 min
- JulMInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse AttentionInference Optimization2407.02490Qwen / Alibaba CloudJul 2, 2024score 9~128 min
- JulOn scalable oversight with weak LLMs judging strong LLMsSafety2407.04622Jul 5, 2024~137 min
- JulPhi-3 Safety Post-Training: Aligning Language Models with a "Break-Fix" CycleSafety2407.13833Microsoft ResearchJul 18, 2024score 9~110 min
- JulQwen2 Technical ReportLLM Systems2407.10671Qwen / Alibaba CloudJul 15, 2024~114 min
- JulQwen2-Audio Technical ReportMultimodal2407.10759Qwen / Alibaba CloudJul 15, 2024score 6~104 min
- JulScaling Granite Code Models to 128K ContextTraining Methods2407.13739IBM ResearchJul 18, 2024score 8~113 min
- JulScaling Laws with Vocabulary: Larger Models Deserve Larger VocabulariesPretraining2407.13623Jul 18, 2024score 9~122 min
- JulScaling Retrieval-Based Language Models with a Trillion-Token DatastoreRetrieval2407.12854Jul 9, 2024~112 min
- JulSpectra: Surprising Effectiveness of Pretraining Ternary Language Models at ScalePretraining2407.12327Jul 17, 2024score 9~98 min
- JulThe Llama 3 Herd of ModelsTraining Methods2407.21783Jul 31, 2024~129 min
- JunA Simple and Effective $L_2$ Norm-Based Strategy for KV Cache CompressionInference Optimization2406.11430Jun 17, 2024score 8~93 min
- JunAdam-mini: Use Fewer Learning Rates To Gain MoreTraining Methods2406.16793Jun 24, 2024score 9~100 min
- JunAligning Language Models with Demonstrated FeedbackAlignment2406.00888Jun 2, 2024score 8~102 min
- JunBlock Transformer: Global-to-Local Language Modeling for Fast InferenceArchitecture2406.02657Jun 4, 2024score 9~100 min
- JunBootstrapping Language Models with DPO Implicit RewardsAlignment2406.09760Jun 14, 2024score 9~116 min
- JunChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All ToolsLLM Systems2406.12793Zhipu / GLMJun 18, 2024score 9~108 min
- JunDataComp-LM: In Search of the Next Generation of Training Sets for Language ModelsData2406.11794AppleJun 17, 2024score 10~93 min
- JunDeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code IntelligencePretraining2406.11931DeepSeekJun 17, 2024score 10~11 min
- JunFrom Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder PipelineEvaluation2406.11939Jun 17, 2024score 9~105 min
- JunGenAI Arena: An Open Evaluation Platform for Generative ModelsEvaluation2406.04485Jun 6, 2024score 9~98 min
- JunHow Do Large Language Models Acquire Factual Knowledge During Pretraining?Pretraining2406.11813Jun 17, 2024score 9~107 min
- JunInfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache ManagementInference Optimization2406.19707Jun 28, 2024~107 min
- JunInstruction Pre-Training: Language Models are Supervised Multitask LearnersPretraining2406.14491Jun 20, 2024score 10~97 min
- JunLlumnix: Dynamic Scheduling for Large Language Model ServingServing2406.03243Jun 5, 2024~113 min
- JunMixture-of-Agents Enhances Large Language Model CapabilitiesAgents2406.04692Jun 7, 2024~91 min
- JunMMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding BenchmarkEvaluation2406.01574MistralJun 3, 2024score 10~94 min
- JunMooncake: A KVCache-centric Disaggregated Architecture for LLM ServingServing2407.00079Jun 24, 2024~127 min
- JunOLMES: A Standard for Language Model EvaluationsEvaluation2406.08446Allen Institute for AIJun 12, 2024~111 min
- JunPowerInfer-2: Fast Large Language Model Inference on a SmartphoneServing2406.06282Jun 10, 2024score 8~108 min
- JunRVT-2: Learning Precise Manipulation from Few DemonstrationsAgents2406.08545NVIDIAJun 12, 2024score 2~107 min
- JunSamba: Simple Hybrid State Space Models for Efficient Unlimited Context Language ModelingArchitecture2406.07522Jun 11, 2024score 9~115 min
- JunScaling Synthetic Data Creation with 1,000,000,000 PersonasData2406.20094Jun 28, 2024~88 min
- JunT-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on EdgeInference Optimization2407.00088Jun 25, 2024score 8~124 min
- JunThe BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language ModelsEvaluation2406.05761Jun 9, 2024~107 min
- JunThe FineWeb Datasets: Decanting the Web for the Finest Text Data at ScaleData2406.17557FineDataJun 25, 2024score 10~123 min
- JunThe Prompt Report: A Systematic Survey of Prompting TechniquesPrompting2406.06608Jun 6, 2024score 10~119 min
- JunUnderstanding and Mitigating Tokenization Bias in Language ModelsReasoning2406.16829Jun 24, 2024~102 min
- JunVideoPhy: Evaluating Physical Commonsense for Video GenerationEvaluation2406.03520Jun 5, 2024~105 min
- JunWPO: Enhancing RLHF with Weighted Preference OptimizationRL Training2406.11827Zoom AIJun 17, 2024score 9~112 min
- JunYODAS: Youtube-Oriented Dataset for Audio and SpeechData2406.00899NVIDIAJun 2, 2024~96 min
- MayAdvancing Multimodal Medical Capabilities of GeminiMultimodal2405.03162DeepMindMay 6, 2024~132 min
- MayAn Introduction to Vision-Language ModelingMultimodal2405.17247May 27, 2024~111 min
- MayArctic-Embed: Scalable, Efficient, and Accurate Text Embedding ModelsData2405.05374SnowflakeMay 8, 2024~111 min
- MayBiMix: A Bivariate Data Mixing Law for Language Model PretrainingPretraining2405.14908May 23, 2024score 9~105 min
- MayClover: Regressive Lightweight Speculative Decoding with Sequential KnowledgeInference Optimization2405.00263May 1, 2024score 9~105 min
- MayDeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic DataReasoning2405.14333DeepSeekMay 23, 2024score 9~101 min
- MayDistributed Speculative Inference (DSI): Speculation Parallelism for Provably Faster Lossless Language Model InferenceInference Optimization2405.14105May 23, 2024score 9~89 min
- MayHunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese UnderstandingDiffusion2405.08748May 14, 2024score 9~110 min
- MayLayer-Condensed KV Cache for Efficient Inference of Large Language ModelsArchitecture2405.10637May 17, 2024score 9~96 min
- MayNearest Neighbor Speculative Decoding for LLM Generation and AttributionLLM Systems2405.19325May 29, 2024score 9~103 min
- MayOffline Regularised Reinforcement Learning for Large Language Models AlignmentRL Training2405.19107May 29, 2024score 8~97 min
- MayOpenRLHF: An Easy-to-use, Scalable and High-performance RLHF FrameworkAlignment2405.11143May 20, 2024score 9~99 min
- MayParrot: Efficient Serving of LLM-based Applications with Semantic VariableServing2405.19888May 30, 2024score 9~98 min
- MayPose Priors from Language ModelsVision2405.03689DeepMindMay 6, 2024~111 min
- MayReducing Transformer Key-Value Cache Size with Cross-Layer AttentionArchitecture2405.12981May 21, 2024score 9~103 min
- MayRLHF Workflow: From Reward Modeling to Online RLHFTraining Methods2405.07863SalesforceMay 13, 2024score 10~96 min
- MaySelf-Play Preference Optimization for Language Model AlignmentAlignment2405.00675May 1, 2024score 9~96 min
- MaySuper-Exponential Regret for UCT, AlphaGo and VariantsRL Training2405.04407DeepMindMay 7, 2024~118 min
- MayTransformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space DualityArchitecture2405.21060Amazon ScienceMay 31, 2024score 10~123 min
- MayUnderstanding the performance gap between online and offline alignment algorithmsAlignment2405.08448May 14, 2024score 9~107 min
- AprAdvancing LLM Reasoning Generalists with Preference TreesReasoning2404.02078OpenBMBApr 2, 2024score 9~115 min
- AprBetter & Faster Large Language Models via Multi-token PredictionTraining Methods2404.19737Apr 30, 2024~103 min
- AprCapabilities of Gemini Models in MedicineMultimodal2404.18416Apr 29, 2024score 9~125 min
- AprChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique PipelineTraining Methods2404.02893Apr 3, 2024score 8~99 min
- AprDoes Transformer Interpretability Transfer to RNNs?Safety2404.05971Apr 9, 2024~107 min
- AprEagle and Finch: RWKV with Matrix-Valued States and Dynamic RecurrenceArchitecture2404.05892Apr 8, 2024score 9~133 min
- AprExtending Llama-3's Context Ten-Fold OvernightContext Optimization2404.19553Apr 30, 2024score 9~103 min
- AprImproving Dictionary Learning with Gated Sparse AutoencodersArchitecture2404.16014DeepMindApr 24, 2024~108 min
- AprInternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HDMultimodal2404.06512Apr 9, 2024score 9~102 min
- AprIterative Reasoning Preference OptimizationReasoning2404.19733Apr 30, 2024score 9~101 min
- AprJetMoE: Reaching Llama2 Performance with 0.1M DollarsMixture of Experts2404.07413Apr 11, 2024score 9~79 min
- AprKAN: Kolmogorov-Arnold NetworksArchitecture2404.19756Apr 30, 2024score 6~117 min
- AprKangaroo: Lossless Self-Speculative Decoding via Double Early ExitingInference Optimization2404.18911HUAWEI Noah's Ark LabApr 29, 2024score 9~106 min
- AprLayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingInference Optimization2404.16710Apr 25, 2024score 9~107 min
- AprLearn Your Reference Model for Real Good AlignmentTraining Methods2404.09656Apr 15, 2024score 9~83 min
- AprLeave No Context Behind: Efficient Infinite Context Transformers with Infini-attentionArchitecture2404.07143Apr 10, 2024score 9~113 min
- AprLLM2Vec: Large Language Models Are Secretly Powerful Text EncodersLLM Systems2404.05961Apr 9, 2024~105 min
- AprMiniCPM: Unveiling the Potential of Small Language Models with Scalable Training StrategiesTraining Methods2404.06395OpenBMBApr 9, 2024score 9~139 min
- AprMixture-of-Depths: Dynamically allocating compute in transformer-based language modelsArchitecture2404.02258Apr 2, 2024score 9~101 min
- AprPhi-3 Technical Report: A Highly Capable Language Model Locally on Your PhonePretraining2404.14219Microsoft ResearchApr 22, 2024score 9~114 min
- AprRecurrentGemma: Moving Past Transformers for Efficient Open Language ModelsLLM Systems2404.07839Apr 11, 2024score 10~108 min
- AprReFT: Representation Finetuning for Language ModelsTraining Methods2404.03592Apr 4, 2024~102 min
- AprReplacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse ModelsEvaluation2404.18796Apr 29, 2024score 9~103 min
- AprRho-1: Not All Tokens Are What You NeedPretraining2404.07965Microsoft ResearchApr 11, 2024score 9~96 min
- AprRULER: What's the Real Context Size of Your Long-Context Language Models?Evaluation2404.06654Qwen / Alibaba CloudApr 9, 2024score 10~109 min
- AprStream of Search (SoS): Learning to Search in LanguageTraining Methods2404.03683Apr 1, 2024score 9~121 min
- MarAtP*: An efficient and scalable method for localizing LLM behaviour to componentsUncategorized2403.00745DeepMind0 citesMar 1, 2024score 3~123 min
- MarBranch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLMMixture of Experts2403.07816Mar 12, 2024score 9~107 min
- MarChatbot Arena: An Open Platform for Evaluating LLMs by Human PreferenceEvaluation2403.04132Mar 7, 2024~118 min
- MarCLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in KoreanEvaluation2403.06412Microsoft ResearchMar 11, 2024~111 min
- MarDeepSeek-VL: Towards Real-World Vision-Language UnderstandingMultimodal2403.05525DeepSeekMar 8, 2024score 9~88 min
- MarDiPaCo: Distributed Path CompositionDistributed Training2403.10616DeepMindMar 15, 2024score 9~133 min
- MarEvaluating Frontier Models for Dangerous CapabilitiesSafety2403.13793DeepMindMar 20, 2024score 8~140 min
- MarFew-Shot Recalibration of Language ModelsSafety2403.18286DeepMindMar 27, 2024~111 min
- MarFrozen Feature Augmentation for Few-Shot Image ClassificationVision2403.10519DeepMindMar 15, 2024~122 min
- MarGaLore: Memory-Efficient LLM Training by Gradient Low-Rank ProjectionTraining Methods2403.03507Mar 6, 2024score 9~103 min
- MarGecko: Versatile Text Embeddings Distilled from Large Language ModelsData2403.20327DeepMindMar 29, 2024score 9~98 min
- MarGemini 1.5: Unlocking multimodal understanding across millions of tokens of contextContext Optimization2403.05530Mar 8, 2024score 10~133 min
- MarGemma: Open Models Based on Gemini Research and TechnologyLLM Systems2403.08295Google ResearchMar 13, 2024score 9~105 min
- MarInternLM2 Technical ReportTraining Methods2403.17297InternLM / Shanghai AI LabMar 26, 2024score 9~92 min
- MarJamba: A Hybrid Transformer-Mamba Language ModelArchitecture2403.19887AI21Mar 28, 2024~130 min
- MarLLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt CompressionContext Optimization2403.12968Microsoft ResearchMar 19, 2024score 8~113 min
- MarLoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPUTraining Methods2403.06504Mar 11, 2024score 9~120 min
- MarLong-form factuality in large language modelsAlignment2403.18802DeepMindMar 27, 2024score 8~110 min
- MarMini-Gemini: Mining the Potential of Multi-modality Vision Language ModelsMultimodal2403.18814Mar 27, 2024score 9~109 min
- MarParameter Efficient Reinforcement Learning from Human FeedbackTraining Methods2403.10704Mar 15, 2024score 8~106 min
- MarProsody for Intuitive Robotic Interface Design: It's Not What You Said, It's How You Said ItUncategorized2403.08144DeepMindMar 13, 2024~102 min
- MarQuaRot: Outlier-Free 4-Bit Inference in Rotated LLMsInference Optimization2404.00456Mar 30, 2024~106 min
- MarQuiet-STaR: Language Models Can Teach Themselves to Think Before SpeakingReasoning2403.09629Mar 14, 2024score 9~107 min
- MarRAFT: Adapting Language Model to Domain Specific RAGTraining Methods2403.10131Mar 15, 2024~103 min
- MarRecurrent Drafter for Fast Speculative Decoding in Large Language ModelsLLM Systems2403.09919AppleMar 14, 2024~125 min
- MarRewardBench: Evaluating Reward Models for Language ModelingEvaluation2403.13787InternLM / Shanghai AI LabMar 20, 2024~124 min
- MarSimple and Scalable Strategies to Continually Pre-train Large Language ModelsPretraining2403.08763Mar 13, 2024score 9~127 min
- MarTaming Throughput-Latency Tradeoff in LLM Inference with Sarathi-ServeServing2403.02310Mar 4, 2024~86 min
- MarTeaching Large Language Models to Reason with Reinforcement LearningRL Training2403.04642Mar 7, 2024score 9~115 min
- MarThe Unreasonable Ineffectiveness of the Deeper LayersPretraining2403.17887Mar 26, 2024score 9~100 min
- MarView publicationCode2403.13839AppleMar 14, 2024~98 min
- MarYi: Open Foundation Models by 01.AIScaling Laws2403.0465201-AIMar 7, 2024score 9~73 min
- FebA Distributional Analogue to the Successor RepresentationRL Training2402.08530DeepMindFeb 13, 2024~115 min
- FebA Human-Inspired Reading Agent with Gist Memory of Very Long ContextsAgents2402.09727DeepMindFeb 15, 2024score 9~103 min
- FebApproximating the Core via Iterative Coalition SamplingAgents2402.03928Feb 6, 2024~100 min
- FebBenchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERTRetrieval2402.07440Together AIFeb 12, 2024~97 min
- FebBreak the Sequential Dependency of LLM Inference Using LOOKAHEAD DECODINGInference Optimization2402.02057Feb 3, 2024~122 min
- FebChain-of-Thought Reasoning without PromptingReasoning2402.10200Feb 15, 2024~113 min
- FebChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase PartitionServing2402.15220Feb 23, 2024score 10~108 min
- FebData Engineering for Scaling Language Models to 128K ContextData2402.10171Feb 15, 2024score 9~112 min
- FebDeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsReasoning2402.03300DeepSeekFeb 5, 2024score 10~130 min
- FebDirect Language Model Alignment from Online AI FeedbackRL Training2402.04792Feb 7, 2024score 9~100 min
- FebDo Membership Inference Attacks Work on Large Language Models?Safety2402.07841Feb 12, 2024~125 min
- FebExperts Don't Cheat: Learning What You Don't Know By Predicting PairsAlignment2402.08733DeepMindFeb 13, 2024~109 min
- FebFractal Patterns May Illuminate the Success of Next-Token PredictionPretraining2402.01825DeepMindFeb 2, 2024~134 min
- FebGenie: Generative Interactive EnvironmentsPretraining2402.15391DeepMindFeb 23, 2024score 9~111 min
- FebGriffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language ModelsArchitecture2402.19427Google ResearchFeb 29, 2024score 9~123 min
- FebHydragen: High-Throughput LLM Inference with Shared PrefixesServing2402.05099Feb 7, 2024score 9~105 min
- FebInternLM-Math: Open Math Large Language Models Toward Verifiable ReasoningUncategorized2402.06332InternLM / Shanghai AI LabFeb 9, 2024score 9~97 min
- FebKTO: Model Alignment as Prospect Theoretic OptimizationAlignment2402.01306OpenBMBFeb 2, 2024~117 min
- FebLearning to Learn Faster from Human Feedback with Language Model Predictive ControlTraining Methods2402.11450DeepMindFeb 18, 2024score 9~104 min
- FebLiRank: Industrial Large Scale Ranking Models at LinkedInLLM Systems2402.06859Feb 10, 2024score 3~133 min
- FebLongRoPE: Extending LLM Context Window Beyond 2 Million TokensContext Optimization2402.13753Feb 21, 2024~93 min
- FebMegaScale: Scaling Large Language Model Training to More Than 10,000 GPUsTraining Methods2402.15627Feb 23, 2024score 9~116 min
- FebMobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use CasesArchitecture2402.14905Meta AI / FAIRFeb 22, 2024score 10~111 min
- FebMultilingual E5 Text Embeddings: A Technical ReportContext Optimization2402.05672Feb 8, 2024~118 min
- FebNear-Minimax-Optimal Distributional Reinforcement Learning with a Generative ModelRL Training2402.07598DeepMindFeb 12, 2024~95 min
- FebNemotron-4 15B Technical ReportPretraining2402.16819Feb 26, 2024~106 min
- FebNeural Networks Learn Statistics of Increasing ComplexityScaling Laws2402.04362EleutherAIFeb 6, 2024~108 min
- FebODIN: Disentangled Reward Mitigates Hacking in RLHFAlignment2402.07319Feb 11, 2024score 9~112 min
- FebOLMo: Accelerating the Science of Language ModelsAgents2402.00838Allen Institute for AIFeb 1, 2024score 10~113 min
- FebOmniPred: Language Models as Universal RegressorsPretraining2402.14547DeepMindFeb 22, 2024score 5~101 min
- FebOuroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative DecodingInference Optimization2402.13720Feb 21, 2024score 9~105 min
- FebPIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMsAgents2402.07872DeepMindFeb 12, 2024score 8~119 min
- FebPremise Order Matters in Reasoning with Large Language ModelsReasoning2402.08939DeepMindFeb 14, 2024~116 min
- FebPrior-Dependent Allocations for Bayesian Fixed-Budget Best-Arm Identification in Structured BanditsEvaluation2402.05878DeepMind0 citesFeb 8, 2024~114 min
- FebResonance RoPE: Improving Context Length Generalization of Large Language ModelsReasoning2403.00071Feb 29, 2024score 9~100 min
- FebSelf-Discover: Large Language Models Self-Compose Reasoning StructuresPrompting2402.03620DeepMindFeb 6, 2024score 9~88 min
- FebSimple linear attention language models balance the recall-throughput tradeoffArchitecture2402.18668Together AIFeb 28, 2024score 9~112 min
- FebSimulacra as Conscious ExoticaSafety2402.12422DeepMindFeb 19, 2024~136 min
- FebSpeculative Streaming: Fast LLM Inference without Auxiliary ModelsInference Optimization2402.11131AppleFeb 16, 2024score 9~100 min
- FebStarCoder 2 and The Stack v2: The Next GenerationCode2402.19173RobloxFeb 29, 2024score 9~111 min
- FebSuppressing Pink Elephants with Direct Principle FeedbackAlignment2402.07896EleutherAIFeb 12, 2024score 9~102 min
- FebThe Era of 1-bit LLMs: All Large Language Models are in 1.58 BitsPretraining2402.17764DropboxFeb 27, 2024~118 min
- FebThe Hedgehog & the Porcupine: Expressive Linear Attentions with Softmax MimicryLLM Systems2402.04347Feb 6, 2024score 9~113 min
- FebTraining-Free Long-Context Scaling of Large Language ModelsTraining Methods2402.17463Qwen / Alibaba CloudFeb 27, 2024score 9~121 min
- FebWorld Model on Million-Length Video And Language With Blockwise RingAttentionLLM Systems2402.08268Feb 13, 2024score 9~106 min
- JanAPAR: LLMs Can Do Auto-Parallel Auto-Regressive DecodingInference Optimization2401.06761Zhipu / GLMJan 12, 2024~109 min
- JanAsynchronous Local-SGD Training for Language ModelingTraining Methods2401.09135DeepMindJan 17, 2024score 7~125 min
- JanAutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic AgentsAgents2401.12963DeepMindJan 23, 2024score 3~112 min
- JanDeepSeek LLM: Scaling Open-Source Language Models with LongtermismScaling Laws2401.02954Jan 5, 2024~129 min
- JanDeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code IntelligenceCode2401.14196DeepSeekJan 25, 2024score 10~96 min
- JanDeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language ModelsMixture of Experts2401.06066DeepSeekJan 11, 2024score 10~107 min
- JanDistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model ServingServing2401.09670Jan 18, 2024~102 min
- JanDolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining ResearchData2402.00159Allen Institute for AIJan 31, 2024score 10~137 min
- JanE3x: $\mathrm{E}(3)$-Equivariant Deep Learning Made EasyCode2401.07595DeepMindJan 15, 2024~86 min
- JanEAGLE: Speculative Sampling Requires Rethinking Feature UncertaintyInference Optimization2401.15077Jan 26, 2024~133 min
- JanFP6-LLM: Efficiently Serving Large Language Models Through FP6-Centric Algorithm-System Co-DesignServing2401.14112Jan 25, 2024score 9~96 min
- JanFrom GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four ModalitiesEvaluation2401.15071Jan 26, 2024score 8~96 min
- JanGATS: Gather-Attend-ScatterArchitecture2401.08525DeepMindJan 16, 2024~108 min
- JanInference without Interference: Disaggregate LLM Inference for Mixed Downstream WorkloadsLLM Systems2401.11181Jan 20, 2024~115 min
- JanInfini-gram: Scaling Unbounded n-gram Language Models to a Trillion TokensData2401.17377Jan 30, 2024score 10~114 min
- JanInternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large ModelMultimodal2401.16420InternLM / Shanghai AI LabJan 29, 2024score 9~91 min
- JanLearning Universal PredictorsPretraining2401.14953DeepMindJan 26, 2024score 7~105 min
- JanLightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language ModelsTraining Methods2401.04658Jan 9, 2024score 9~118 min
- JanMambaByte: Token-free Selective State Space ModelArchitecture2401.13660Jan 24, 2024score 9~116 min
- JanMedusa: Simple LLM Inference Acceleration Framework with Multiple Decoding HeadsInference Optimization2401.10774Jan 19, 2024score 10~108 min
- JanMeta-Prompting: Enhancing Language Models with Task-Agnostic ScaffoldingPrompting2401.12954SlackJan 23, 2024~95 min
- JanMixtral of ExpertsMixture of Experts2401.04088Jan 8, 2024~103 min
- JanMoE-Mamba: Efficient Selective State Space Models with Mixture of ExpertsMixture of Experts2401.04081Jan 8, 2024score 9~97 min
- JanMoonshot: Towards Controllable Video Generation and Editing with Multimodal ConditionsDiffusion2401.01827Jan 3, 2024score 5~113 min
- JanNeural Population Learning beyond Symmetric Zero-sum GamesRL Training2401.05133DeepMindJan 10, 2024~107 min
- JanRephrasing the Web: A Recipe for Compute and Data-Efficient Language ModelingData2401.16380AppleJan 29, 2024score 9~109 min
- JanSecrets of RLHF in Large Language Models Part II: Reward ModelingAlignment2401.06080Jan 11, 2024score 9~130 min
- JanSelf-Play Fine-Tuning Converts Weak Language Models to Strong Language ModelsAlignment2401.01335Jan 2, 2024score 9~128 min
- JanSelf-Rewarding Language ModelsAlignment2401.10020Jan 18, 2024score 9~116 min
- JanSliceGPT: Compress Large Language Models by Deleting Rows and ColumnsArchitecture2401.15024Jan 26, 2024score 8~122 min
- JanSoaring from 4K to 400K: Extending LLM's Context with Activation BeaconLLM Systems2401.03462Jan 7, 2024score 9~109 min
- JanSteering Language Models with Game-Theoretic SolversAgents2402.01704DeepMindJan 24, 2024~116 min
- JanThe Case for Co-Designing Model Architectures with HardwareLLM Systems2401.14489Jan 25, 2024~103 min
- JanTransformers are Multi-State RNNsInference Optimization2401.06104Jan 11, 2024score 9~93 min
- JanTuning Language Models by ProxyTraining Methods2401.08565Jan 16, 2024~104 min
- JanWARM: On the Benefits of Weight Averaged Reward ModelsTraining Methods2401.12187Jan 22, 2024score 9~112 min
2023
248 papers- DecA Challenger to GPT-4V? Early Explorations of Gemini in Visual ExpertiseVision2312.12436Dec 19, 2023score 9~92 min
- DecA Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 FramesMultimodal2312.07395DeepMindDec 12, 2023~104 min
- DecAlignment for HonestyAlignment2312.07000Dec 12, 2023score 9~124 min
- DecBeyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling LawsScaling Laws2401.00448Dec 31, 2023score 9~99 min
- DecBeyond Human Data: Scaling Self-Training for Problem-Solving with Language ModelsTraining Methods2312.06585Dec 11, 2023score 10~116 min
- DecCascade Speculative Drafting for Even Faster LLM InferenceInference Optimization2312.11462Dec 18, 2023score 9~101 min
- DecChallenges with unsupervised LLM knowledge discoveryAlignment2312.10029DeepMindDec 15, 2023score 5~131 min
- DecCodestral MambaArchitecture2312.00752MistralDec 1, 2023~109 min
- DecDistributional Bellman Operators over Mean EmbeddingsUncategorized2312.07358DeepMindDec 9, 2023~126 min
- DecGemini in Reasoning: Unveiling Commonsense in Multimodal Large Language ModelsEvaluation2312.17661Dec 29, 2023score 3~127 min
- DecGemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative CasesMultimodal2312.15011Dec 22, 2023score 5~118 min
- DecGemini: A Family of Highly Capable Multimodal ModelsMultimodal2312.11805Google ResearchDec 19, 2023~123 min
- DecGenCast: Diffusion-based ensemble forecasting for medium-range weatherDiffusion2312.15796DeepMindDec 25, 2023~130 min
- DecGenerative agent-based modeling with actions grounded in physical, social, or digital space using ConcordiaAgents2312.03664DeepMindDec 6, 2023score 6~96 min
- DecHelping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward HackingAlignment2312.09244Dec 14, 2023score 9~116 min
- DecLearning from One Continuous Video StreamTraining Methods2312.00598DeepMindDec 1, 2023~117 min
- DecLLM in a Flash: Efficient Large Language Model Inference with Limited MemoryInference Optimization2312.11514AppleDec 12, 2023score 10~117 min
- DecLLM360: Towards Fully Transparent Open-Source LLMsPretraining2312.06550Dec 11, 2023score 9~104 min
- DecMagicoder: Source Code Is All You NeedCode2312.02120Dec 4, 2023score 9~82 min
- DecNash Learning from Human FeedbackAlignment2312.00886Dec 1, 2023score 9~110 min
- DecReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM AgentAgents2312.10003Dec 15, 2023score 9~107 min
- DecSGLang: Efficient Execution of Structured Language Model ProgramsAgents2312.07104Dec 12, 2023~101 min
- DecSparQ Attention: Bandwidth-Efficient LLM InferenceInference Optimization2312.04985Dec 8, 2023score 9~132 min
- DecSwitchHead: Accelerating Transformers with Mixture-of-Experts AttentionMixture of Experts2312.07987Dec 13, 2023score 9~109 min
- DecThe Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context LearningAlignment2312.01552Dec 4, 2023score 9~116 min
- DecVILA: On Pre-training for Visual Language ModelsVision2312.07533Dec 12, 2023score 9~90 min
- DecWeak-to-Strong Generalization: Eliciting Strong Capabilities With Weak SupervisionAlignment2312.09390Dec 14, 2023score 9~115 min
- DecZero-Shot Metric Depth with a Field-of-View Conditioned Diffusion ModelVision2312.13252DeepMindDec 20, 2023score 9~103 min
- DecZeroQuant(4+2): Redefining LLMs Quantization with a New FP6-Centric Strategy for Diverse Generative TasksLow Precision2312.08583Dec 14, 2023score 9~123 min
- NovAMSP: Super-Scaling LLM Training via Advanced Model States PartitioningTraining Methods2311.00257Nov 1, 2023score 9~117 min
- NovCamels in a Changing Climate: Enhancing LM Adaptation with Tulu 2Training Methods2311.10702Allen Institute for AINov 17, 2023score 10~106 min
- NovDiLoCo: Distributed Low-Communication Training of Language ModelsTraining Methods2311.08105DeepMindNov 14, 2023score 9~128 min
- NovEverything of Thoughts: Defying the Law of Penrose Triangle for Thought GenerationReasoning2311.04254Nov 7, 2023score 9~116 min
- NovFast Chain-of-Thought: A Glance of Future from Parallel Decoding Leads to Answers FasterInference Optimization2311.08263Nov 14, 2023score 9~102 min
- NovFine-tuning Language Models for FactualityTraining Methods2311.08401Nov 14, 2023score 9~104 min
- NovFlashDecoding++: Faster Large Language Model Inference on GPUsInference Optimization2311.01282Nov 2, 2023score 9~129 min
- NovFlashFFTConv: Efficient Convolutions for Long Sequences with Tensor CoresInference Optimization2311.05908Together AINov 10, 2023score 9~128 min
- NovFlorence-2: Advancing a Unified Representation for a Variety of Vision TasksVision2311.06242Microsoft ResearchNov 10, 2023score 8~100 min
- NovGPQA: A Graduate-Level Google-Proof Q&A BenchmarkEvaluation2311.12022MistralNov 20, 2023~119 min
- NovInstruction-Following Evaluation for Large Language ModelsEvaluation2311.07911Google ResearchNov 14, 2023score 9~89 min
- NovLearning and Controlling Silicon Dopant Transitions in Graphene using Scanning Transmission Electron MicroscopyVision2311.17894DeepMindNov 21, 2023~117 min
- NovLevels of AGI for Operationalizing Progress on the Path to AGIEvaluation2311.02462DeepMindNov 4, 2023score 5~122 min
- NovMAIRA-1: A specialised large multimodal model for radiology report generationMultimodal2311.13668Microsoft ResearchNov 22, 2023~104 min
- NovMemory Augmented Language Models through Mixture of Word ExpertsArchitecture2311.10768Nov 15, 2023score 9~93 min
- NovMirasol3B: A Multimodal Autoregressive Model for Time-Aligned and Contextual ModalitiesMultimodal2311.05698DeepMindNov 9, 2023score 6~120 min
- NovMMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning BenchmarkEvaluation2311.1650201-AINov 27, 2023~97 min
- NovOrca 2: Teaching Small Language Models How to ReasonReasoning2311.11045Microsoft ResearchNov 18, 2023score 9~101 min
- NovParameter-Efficient Orthogonal Finetuning via Butterfly FactorizationTraining Methods2311.06243Nov 10, 2023score 9~102 min
- NovPrompt Cache: Modular Attention Reuse for Low-Latency InferenceInference Optimization2311.04934Nov 7, 2023score 9~118 min
- NovQwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language ModelsMultimodal2311.07919Qwen / Alibaba CloudNov 14, 2023score 8~116 min
- NovRelax: Composable Abstractions for End-to-End Dynamic Machine LearningServing2311.02103Nov 1, 2023~107 min
- NovReplay across Experiments: A Natural Extension of Off-Policy RLTraining Methods2311.15951DeepMindNov 27, 2023~117 min
- NovReport of the 1st Workshop on Generative AI and LawAlignment2311.06477DeepMindNov 11, 2023~147 min
- NovRethinking Attention: Exploring Shallow Feed-Forward Neural Networks as an Alternative to Attention Layers in TransformersArchitecture2311.10642Nov 17, 2023score 9~106 min
- NovRoboVQA: Multimodal Long-Horizon Reasoning for RoboticsUncategorized2311.00899DeepMindNov 1, 2023score 5~140 min
- NovS-LORA: SERVING THOUSANDS OF CONCURRENT LORA ADAPTERSServing2311.03285Nov 6, 2023~106 min
- NovScalable AI Safety via Doubly-Efficient DebateSafety2311.14125DeepMindNov 23, 2023~117 min
- NovSystem 2 Attention (is something you might need too)Prompting2311.11829Nov 20, 2023score 9~121 min
- NovThe ART of LLM Refinement: Ask, Refine, and TrustReasoning2311.07961Nov 14, 2023score 9~98 min
- NovUltra-Long Sequence Distributed TransformerDistributed Training2311.02382Nov 4, 2023score 9~130 min
- NovUniversal Self-Consistency for Large Language Model GenerationReasoning2311.17311DeepMindNov 29, 2023~108 min
- NovZero Bubble Pipeline ParallelismDistributed Training2401.10241Nov 30, 2023score 9~105 min
- OctA General Theoretical Paradigm to Understand Learning from Human PreferencesAlignment2310.12036DeepMindOct 18, 2023~103 min
- OctAssessing Large Language Models on Climate InformationEvaluation2310.02932DeepMindOct 4, 2023~118 min
- OctBitNet: Scaling 1-bit Transformers for Large Language ModelsPretraining2310.11453Oct 17, 2023score 9~106 min
- OctContrastive Prefence Learning: Learning from Human Feedback without RLRL Training2310.13639Oct 20, 2023score 9~109 min
- OctControlled Decoding from Language ModelsAlignment2310.17022Oct 25, 2023score 9~110 min
- OctConvNets Match Vision Transformers at ScaleVision2310.16764Oct 25, 2023score 9~119 min
- OctCorrelated Noise Provably Beats Independent Noise for Differentially Private LearningTraining Methods2310.06771DeepMindOct 10, 2023~97 min
- OctDemocratizing Reasoning Ability: Tailored Learning from Large Language ModelReasoning2310.13332Oct 20, 2023score 9~110 min
- OctDetecting Pretraining Data from Large Language ModelsSafety2310.16789Oct 25, 2023score 9~111 min
- OctFP8-LM: Training FP8 Large Language ModelsTraining Methods2310.18313Oct 27, 2023~108 min
- OctImproved Baselines with Visual Instruction TuningMultimodal2310.03744Stability AIOct 5, 2023score 9~103 min
- OctIN-CONTEXT PRETRAINING: LANGUAGE MODELING BEYOND DOCUMENT BOUNDARIESPretraining2310.10638Oct 16, 2023~111 min
- OctLarge Language Models as Analogical ReasonersPrompting2310.01714DeepMindOct 3, 2023score 9~83 min
- OctLarge Language Models Cannot Self-Correct Reasoning YetReasoning2310.01798DeepMindOct 3, 2023score 8~111 min
- OctLearning Interactive Real-World SimulatorsAgents2310.06114DeepMindOct 9, 2023~112 min
- OctLinear Representations of Sentiment in Large Language ModelsSafety2310.15154EleutherAIOct 23, 2023~131 min
- OctLlemma: An Open Language Model For MathematicsPretraining2310.10631Stability AIOct 16, 2023score 9~105 min
- OctLLM-FP4: 4-Bit Floating-Point Quantized TransformersInference Optimization2310.16836Oct 25, 2023score 9~104 min
- OctLoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language ModelsTraining Methods2310.08659Oct 12, 2023score 9~110 min
- OctMicroscaling Data Formats for Deep LearningLow Precision2310.10537Oct 16, 2023score 9~124 min
- OctMistral 7BPretraining2310.06825MistralOct 10, 2023~97 min
- OctModel-free Posterior Sampling via Learning Rate RandomizationRL Training2310.18186DeepMind0 citesOct 27, 2023~108 min
- OctMonarch Mixer: A Simple Sub-Quadratic GEMM-Based ArchitectureArchitecture2310.12109Together AIOct 18, 2023~94 min
- OctOpenWebMath: An Open Dataset of High-Quality Mathematical Web TextData2310.06786EleutherAIOct 10, 2023~112 min
- OctProperty-Aware Multi-Speaker Data Simulation: A Probabilistic Modelling Technique for Synthetic Data GenerationData2310.12371NVIDIAOct 18, 2023~106 min
- OctPUNICA: MULTI-TENANT LORA SERVINGServing2310.18547Oct 28, 2023~100 min
- OctQMoE: Practical Sub-1-Bit Compression of Trillion-Parameter ModelsMixture of Experts2310.16795Oct 25, 2023score 9~111 min
- OctREAD MOREInference Optimization2310.17157Together AIOct 26, 2023score 9~117 min
- OctRepelling Random WalksLLM Systems2310.04854DeepMindOct 7, 2023~115 min
- OctRepresentation Engineering: A Top-Down Approach to AI TransparencySafety2310.01405EleutherAIOct 2, 2023~134 min
- OctRing Attention with Blockwise Transformers for Near-Infinite ContextLLM Systems2310.01889Oct 3, 2023~101 min
- OctSafe RLHF: Safe Reinforcement Learning from Human FeedbackAlignment2310.12773Oct 19, 2023score 9~114 min
- OctSALM: Speech-augmented Language Model with In-context Learning for Speech Recognition and TranslationMultimodal2310.09424NVIDIAOct 13, 2023~116 min
- OctScalable Neural Network KernelsArchitecture2310.13225DeepMindOct 20, 2023~110 min
- OctSum of the GL(3) Fourier Coefficients over Quadratics and Mixed PowersReasoning2310.11408Oct 17, 2023~132 min
- OctVeRA: Vector-based Random Matrix AdaptationTraining Methods2310.11454Oct 17, 2023score 9~107 min
- SepAn Empirical Study of Scaling Instruct-Tuned Large Multimodal ModelsMultimodal2309.09958Sep 18, 2023score 9~101 min
- SepDeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer ModelsDistributed Training2309.14509Sep 25, 2023score 8~106 min
- SepDoLa: Decoding by Contrasting Layers Improves Factuality in Large Language ModelsInference Optimization2309.03883Sep 7, 2023score 9~113 min
- SepEffective Long-Context Scaling of Foundation ModelsTraining Methods2309.16039Sep 27, 2023score 9~104 min
- SepEfficient Memory Management for Large Language Model Serving with PagedAttentionServing2309.06180Sep 12, 2023score 10~122 min
- SepEfficient Post-training Quantization with FP8 FormatsInference Optimization2309.14592Sep 26, 2023score 9~126 min
- SepEfficient RLHF: Reducing the Memory Usage of PPOTraining Methods2309.00754Sep 1, 2023score 9~102 min
- SepEFFICIENT STREAMING LANGUAGE MODELS WITH ATTENTION SINKSInference Optimization2309.17453Sep 29, 2023~109 min
- SepGated recurrent neural networks discover attentionRL Training2309.01775Sep 4, 2023score 9~157 min
- SepLarge Language Models for Compiler OptimizationCode2309.07062Sep 11, 2023~112 min
- SepLMSYS-CHAT-1M: A LARGE-SCALE REAL-WORLD LLM CONVERSATION DATASETSafety2309.11998Sep 21, 2023~126 min
- SepLongLoRA: Efficient Fine-tuning of Long-Context Large Language ModelsTraining Methods2309.12307Sep 21, 2023score 9~93 min
- SepM3DSYNTH: A DATASET OF MEDICAL 3D IMAGES WITH AI-GENERATED LOCAL MANIPULATIONSData2309.07973Sep 14, 2023~120 min
- SepQwen Technical ReportAlignment2309.16609Stability AISep 28, 2023score 9~119 min
- SepRead MoreAlignment2309.08600EleutherAISep 15, 2023score 2~103 min
- SepReplacing softmax with ReLU in Vision TransformersVision2309.08586Sep 15, 2023~96 min
- SepRevisiting Energy Based Models as Policies: Ranking Noise Contrastive Estimation and Interpolating Energy ModelsAgents2309.05803DeepMindSep 11, 2023~103 min
- SepRLAIF: Scaling Reinforcement Learning from Human Feedback with AI FeedbackAlignment2309.00267Sep 1, 2023score 9~119 min
- SepScaling Autoregressive Multi-Modal Models: Pretraining and Instruction TuningPretraining2309.02591Sep 5, 2023score 10~113 min
- SepScaling Catalog Attribute Extraction with Multi-modal LLMsPrompting2309.03409InstacartSep 7, 2023~116 min
- SepScaling Laws for Sparsely-Connected Foundation ModelsScaling Laws2309.08520Sep 15, 2023score 9~115 min
- SepSpeak While You Think: Streaming Speech Synthesis During Text GenerationMultimodal2309.11210Sep 20, 2023~104 min
- SepStabilizing RLHF through Advantage Model and Selective RehearsalAlignment2309.10202Sep 18, 2023score 9~119 min
- SepStatistical Rejection Sampling Improves Preference OptimizationRL Training2309.06657Sep 13, 2023score 9~114 min
- SepTextbooks Are All You Need II: phi-1.5 technical reportPretraining2309.05463Microsoft ResearchSep 11, 2023~92 min
- SepWhen Less is More: Investigating Data Pruning for Pretraining LLMs at ScalePretraining2309.04564Sep 8, 2023score 9~110 min
- AugAccelerating LLM Inference with Staged Speculative DecodingInference Optimization2308.04623Aug 8, 2023~104 min
- AugAccurate Computation of Quantum Excited States with Neural NetworksScaling Laws2308.16848DeepMind5 citesAug 31, 2023~132 min
- AugContinual Pre-Training of Large Language Models: How to (re)warm your model?Training Methods2308.04014EleutherAIAug 8, 2023~112 min
- AugDeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All ScalesLLM Systems2308.01320Aug 2, 2023score 9~96 min
- AugFLIQS: One-Shot Mixed-Precision Floating-Point and Integer Quantization SearchInference Optimization2308.03290Aug 7, 2023score 8~119 min
- AugFrom Sparse to Soft Mixture of ExpertsArchitecture2308.00951DeepMindAug 2, 2023score 9~109 min
- AugLM-Infinite: Simple On-the-Fly Length Generalization for Large Language ModelsInference Optimization2308.16137Aug 30, 2023score 9~105 min
- AugOmniQuant: Omnidirectionally Calibrated Quantization for Large Language ModelsInference Optimization2308.13137Aug 25, 2023score 9~100 min
- AugQwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and BeyondMultimodal2308.12966Qwen / Alibaba CloudAug 24, 2023~97 min
- AugRetroformer: Retrospective Large Language Agents with Policy Gradient OptimizationRL Training2308.02151Aug 4, 2023score 9~111 min
- AugSARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked PrefillsLLM Systems2308.16369Aug 31, 2023~105 min
- AugScaling Relationship on Learning Mathematical Reasoning with Large Language ModelsScaling Laws2308.01825Aug 3, 2023score 9~111 min
- AugSelf-Alignment with Instruction BacktranslationAlignment2308.06259Aug 11, 2023score 9~109 min
- AugSIMPLE SYNTHETIC DATA REDUCES SYCOPHANCY IN LARGE LANGUAGE MODELSAlignment2308.03958Aug 7, 2023~107 min
- AugStudying Large Language Model Generalization with Influence FunctionsTraining Methods2308.03296Aug 7, 2023score 8~102 min
- AugYARN: EFFICIENT CONTEXT WINDOW EXTENSION OF LARGE LANGUAGE MODELSTraining Methods2309.00071Qwen / Alibaba CloudAug 31, 2023~112 min
- JulA Survey on Evaluation of Large Language ModelsEvaluation2307.03109Jul 6, 2023~108 min
- JulFlashAttention-2: Faster Attention with Better Parallelism and Work PartitioningInference Optimization2307.08691Jul 17, 2023~110 min
- JulFocused Transformer: Contrastive Training for Context ScalingLLM Systems2307.03170Jul 6, 2023score 9~116 min
- JulHow is ChatGPT's behavior changing over time?Evaluation2307.09009Jul 18, 2023score 9~107 min
- JulIn-context Autoencoder for Context Compression in a Large Language ModelContext Optimization2307.06945Jul 13, 2023score 9~107 min
- JulLine Search for Convex MinimizationUncategorized2307.16560DeepMindJul 31, 2023~135 min
- JulLlama 2: Open Foundation and Fine-Tuned Chat ModelsAlignment2307.09288NVIDIAJul 18, 2023~120 min
- JulLongNet: Scaling Transformers to 1,000,000,000 TokensArchitecture2307.02486Jul 5, 2023~123 min
- JulLost in the Middle: How Language Models Use Long ContextsContext Optimization2307.03172Together AIJul 6, 2023score 9~101 min
- JulOpen Problems and Fundamental Limitations of Reinforcement Learning from Human FeedbackAlignment2307.15217Jul 27, 2023score 9~121 min
- JulRead MoreTraining Methods2307.05695EleutherAIJul 11, 2023score 6~112 min
- JulRetentive Network: A Successor to Transformer for Large Language ModelsArchitecture2307.08621Jul 17, 2023score 9~130 min
- JulRLCD: Reinforcement Learning from Contrast Distillation for Language Model AlignmentRL Training2307.12950Jul 24, 2023score 9~85 min
- JulScaling TransNormer to 175 Billion ParametersLLM Systems2307.14995Jul 27, 2023score 9~114 min
- JulSecrets of RLHF in Large Language Models: Part I: PPORL Training2307.04964Jul 11, 2023~131 min
- JulSelf-consistency for open-ended generationsReasoning2307.06857Jul 11, 2023score 8~118 min
- JulSet Learning for Accurate and Calibrated ModelsTraining Methods2307.02245DeepMindJul 5, 2023~111 min
- JulSkeleton-of-Thought: Large Language Models Can Do Parallel DecodingLLM Systems2307.15337Jul 28, 2023score 9~96 min
- JulSkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM InferenceInference Optimization2307.02628Jul 5, 2023score 9~96 min
- JunAugmenting Language Models with Long-Term MemoryLLM Systems2306.07174Jun 12, 2023score 9~107 min
- JunAWQ: Activation-Aware Weight Quantization for On-Device LLM Compression and AccelerationInference Optimization2306.00978Microsoft ResearchJun 1, 2023~110 min
- JunBinary and Ternary Natural Language GenerationLow Precision2306.01841Jun 2, 2023score 9~115 min
- JunBlock-State TransformerArchitecture2306.09539Jun 15, 2023score 9~108 min
- JunEstimating the Causal Effect of Early ArXiving on Paper AcceptanceSafety2306.13891Jun 24, 2023~116 min
- JunExtending Context Window of Large Language Models via Positional InterpolationContext Optimization2306.15595Zhipu / GLMJun 27, 2023score 9~122 min
- JunFaster Causal Attention Over Large Sequences Through Sparse Flash AttentionArchitecture2306.01160Jun 1, 2023score 9~101 min
- JunFull Parameter Fine-tuning for Large Language Models with Limited ResourcesTraining Methods2306.09782Jun 16, 2023score 9~100 min
- JunGAIA Search: Hugging Face and Pyserini Interoperability for NLP Training Data ExplorationData2306.01481EleutherAIJun 2, 2023~101 min
- JunH_2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language ModelsServing2306.14048Jun 24, 2023score 9~87 min
- JunMistral 7BEvaluation2306.05685MistralJun 9, 2023~109 min
- JunOn-Policy Distillation of Language Models: Learning from Self-Generated MistakesTraining Methods2306.13649DeepMindJun 23, 2023score 10~116 min
- JunOrca: Progressive Learning from Complex Explanation Traces of GPT-4Reasoning2306.02707Stability AIJun 5, 2023score 9~91 min
- JunPreference Ranking Optimization for Human AlignmentAlignment2306.17492Jun 30, 2023score 9~118 min
- JunQuantizable Transformers: Removing Outliers by Helping Attention Heads Do NothingPretraining2306.12929Jun 22, 2023score 8~107 min
- JunRead MoreAlignment2306.03819EleutherAIJun 6, 2023score 2~103 min
- JunRead MoreInference Optimization2306.17806EleutherAIJun 30, 2023~115 min
- JunRead MorePretraining2306.02254EleutherAIJun 4, 2023score 5~108 min
- JunSqueezeLLM: Dense-and-Sparse QuantizationInference Optimization2306.07629Jun 13, 2023~109 min
- JunTextbooks Are All You NeedData2306.11644Microsoft ResearchJun 20, 2023~112 min
- JunThe RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data OnlyData2306.01116Jun 1, 2023score 9~120 min
- JunTraining Transformers with 4-bit IntegersTraining Methods2306.11987Jun 21, 2023score 9~99 min
- MayBlockwise Parallel Transformer for Long Context Large ModelsTraining Methods2305.19370May 30, 2023score 8~112 min
- MayBM25 Query Augmentation Learned End-to-EndRetrieval2305.14087May 23, 2023~106 min
- MayBrainformers: Trading Simplicity for EfficiencyArchitecture2306.00008May 29, 2023score 9~88 min
- MayCan Transformers Learn to Solve Problems Recursively?Reasoning2305.14699EleutherAIMay 24, 2023~111 min
- MayCheaply Evaluating Inference Efficiency Metrics for Autoregressive Transformer APIsServing2305.02440May 3, 2023score 9~111 min
- MayDirect Preference Optimization: Your Language Model is Secretly a Reward ModelTraining Methods2305.18290Stability AIMay 29, 2023~122 min
- MayDoReMi: Optimizing Data Mixtures Speeds Up Language Model PretrainingData2305.10429May 17, 2023score 9~98 min
- MayEnhancing Chat Language Models by Scaling High-quality Instructional ConversationsData2305.14233OpenBMBMay 23, 2023score 9~99 min
- MayFast Conformer with Linearly Scalable Attention for Efficient Speech RecognitionArchitecture2305.05084NVIDIAMay 8, 2023~102 min
- MayFast Distributed Inference Serving for Large Language ModelsServing2305.05920May 10, 2023~112 min
- MayFine-Tuning Language Models with Just Forward PassesTraining Methods2305.17333May 27, 2023score 9~112 min
- MayGQA: Training Generalized Multi-Query Transformer Models from Multi-Head CheckpointsArchitecture2305.13245May 22, 2023~87 min
- MayHow Language Model Hallucinations Can SnowballUncategorized2305.13534May 22, 2023score 9~113 min
- MayInstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningMultimodal2305.06500SalesforceMay 11, 2023score 9~101 min
- MayLet's Verify Step by StepReasoning2305.20050May 31, 2023~124 min
- MayLIMA: Less Is More for AlignmentAlignment2305.11206May 18, 2023~96 min
- MayMassively Scalable Inverse Reinforcement Learning in Google MapsRL Training2305.11290DeepMindMay 18, 2023~99 min
- MayMEGABYTE: Predicting Million-byte Sequences with Multiscale TransformersArchitecture2305.07185May 12, 2023score 9~116 min
- MayOptimal Preconditioning and Fisher Adaptive Langevin SamplingTraining Methods2305.14442DeepMindMay 23, 2023~122 min
- MayPaLM 2 Technical ReportPretraining2305.10403May 17, 2023~108 min
- MayQLoRA: Efficient Finetuning of Quantized LLMsTraining Methods2305.14314AI21May 23, 2023score 9~103 min
- MayRead MoreArchitecture2305.13048EleutherAIMay 22, 2023score 9~106 min
- MayRead MoreMultimodal2305.18274EleutherAIMay 29, 2023score 1~126 min
- MayRead MoreSafety2305.16367EleutherAIMay 25, 2023score 2~123 min
- MayRecasting Self-Attention with Holographic Reduced RepresentationsArchitecture2305.19534EleutherAIMay 31, 2023~118 min
- MayScaling Catalog Attribute Extraction with Multi-modal LLMsLLM Systems2305.05176InstacartMay 9, 2023score 8~97 min
- MayScaling Speech Technology to 1,000+ LanguagesPretraining2305.13516Meta AI / FAIRMay 22, 2023~162 min
- MaySLiC-HF: Sequence Likelihood Calibration with Human FeedbackAlignment2305.10425May 17, 2023score 9~108 min
- MaySpecInfer: Accelerating Large Language Model Serving with Tree-based Speculative Inference and VerificationServing2305.09781May 16, 2023~113 min
- MayStarCoder: may the source be with you!Code2305.06161Stability AIMay 9, 2023score 8~124 min
- MayThe False Promise of Imitating Proprietary LLMsTraining Methods2305.15717May 25, 2023score 9~122 min
- MayTree of Thoughts: Deliberate Problem Solving with Large Language ModelsReasoning2305.10601May 17, 2023score 9~122 min
- MayUnified Embedding: Battle-Tested Feature Representations for Web-Scale ML SystemsArchitecture2305.12102May 20, 2023~102 min
- MayUnlocking the Power of Representations in Long-term Novelty-based ExplorationAgents2305.01521DeepMind0 citesMay 2, 2023~114 min
- AprDINOv2: Learning Robust Visual Features without SupervisionPretraining2304.07193Meta AI / FAIRApr 14, 2023~104 min
- AprDynamic Chunk Convolution for Unified Streaming and Non-Streaming Conformer ASRArchitecture2304.09325Apr 18, 2023~96 min
- AprEfficient Sequence Transduction by Jointly Predicting Tokens and DurationsArchitecture2304.06795NVIDIAApr 13, 2023~99 min
- AprGenerative Agents: Interactive Simulacra of Human BehaviorAgents2304.03442Apr 7, 2023~119 min
- AprImageReward: Learning and Evaluating Human Preferences for Text-to-Image GenerationAlignment2304.05977Zhipu / GLMApr 12, 2023~113 min
- AprInstruction Tuning with GPT-4Training Methods2304.03277Allen Institute for AIApr 6, 2023~113 min
- AprLLaVA: Visual Instruction TuningMultimodal2304.08485Apr 17, 2023~91 min
- AprMiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language ModelsMultimodal2304.10592Apr 20, 2023~99 min
- AprPyTorch FSDP: Experiences on Scaling Fully Sharded Data ParallelDistributed Training2304.11277Apr 21, 2023~121 min
- AprPyTorch FSDP: Experiences on Scaling Fully Sharded Data ParallelTraining Methods2304.11277Apr 21, 2023~121 min
- AprRethinking the Role of Token Retrieval in Multi-Vector RetrievalRetrieval2304.01982Apr 4, 2023~101 min
- AprSegment AnythingVision2304.02643Meta AI / FAIRApr 5, 2023~122 min
- MarEliciting Latent Predictions from Transformers with the Tuned LensUncategorized2303.08112EleutherAIMar 14, 2023~106 min
- MarGPT-4 Technical ReportPretraining2303.08774Mar 15, 2023~118 min
- MarLLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init AttentionTraining Methods2303.16199Mar 28, 2023~100 min
- MarREAD MOREInference Optimization2303.06865Together AIMar 13, 2023~115 min
- MarReclaiming the Digital Commons: A Public Data Trust for Training DataAlignment2303.09001EleutherAIMar 16, 2023~115 min
- MarReflexion: Language Agents with Verbal Reinforcement LearningAgents2303.11366Mar 20, 2023~108 min
- MarRequirement Adherence: Boosting Data Labeling Quality Using LLMsReasoning2303.17651UberMar 30, 2023~96 min
- MarSparks of Artificial General Intelligence: Early experiments with GPT-4Evaluation2303.12712Mar 22, 2023~117 min
- FebAdding Conditional Control to Text-to-Image Diffusion ModelsVision2302.05543Stability AIFeb 10, 2023~111 min
- FebAlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning ServingServing2302.11665Feb 22, 2023~109 min
- FebHyena Hierarchy: Towards Larger Convolutional Language ModelsArchitecture2302.10866Together AIFeb 21, 2023~120 min
- FebLearning a Fourier Transform for Linear Relative Positional Encodings in TransformersArchitecture2302.01925DeepMindFeb 3, 2023~123 min
- FebLLaMA: Open and Efficient Foundation Language ModelsPretraining2302.13971Stability AIFeb 27, 2023~120 min
- FebPoisoning Web-Scale Training Datasets is PracticalTraining Methods2302.10149Feb 20, 2023~129 min
- FebProofNet: Autoformalizing and Formally Proving Undergraduate-Level MathematicsUncategorized2302.12433EleutherAIFeb 24, 2023~96 min
- FebThe geometry of hidden representations of large transformer modelsScaling Laws2302.00294Feb 1, 2023~127 min
- FebToolformer: Language Models Can Teach Themselves to Use ToolsTraining Methods2302.04761Feb 9, 2023~129 min
- JanBLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language ModelsMultimodal2301.12597SalesforceJan 30, 2023~119 min
- JanOvercoming Simplicity Bias in Deep Networks using a Feature SieveTraining Methods2301.13293Jan 30, 2023~132 min
- JanThe Flan Collection: Designing Data and Methods for Effective Instruction TuningTraining Methods2301.13688Allen Institute for AIJan 31, 2023~111 min
- JanTracr: Compiled Transformers as a Laboratory for InterpretabilityArchitecture2301.05062DeepMindJan 12, 2023~123 min
2022
65 papers- DecAttentive Mask CLIPVision2212.08653Dec 16, 2022~115 min
- DecBLOOM+1: Adding Language Support to BLOOM for Zero-Shot PromptingAlignment2212.09535EleutherAIDec 19, 2022~121 min
- DecConstitutional AI: Harmlessness from AI FeedbackAlignment2212.08073Dec 15, 2022~123 min
- DecHungry Hungry Hippos: Towards Language Modeling with State Space ModelsArchitecture2212.14052Together AIDec 28, 2022~118 min
- DecHyDE: Precise Zero-Shot Dense Retrieval without Relevance LabelsRetrieval2212.10496DoorDashDec 20, 2022~94 min
- DecRobust Speech Recognition via Large-Scale Weak SupervisionPretraining2212.04356OpenAIDec 6, 2022~119 min
- DecScalable Diffusion Models with TransformersVision2212.09748Dec 19, 2022~103 min
- DecUnifying Vision, Text, and Layout for Universal Document ProcessingMultimodal2212.02623Microsoft ResearchDec 5, 2022~131 min
- NovA Novel Sampling Scheme for Text- and Image-Conditional Image Synthesis in Quantized Latent SpacesVision2211.07292Nov 14, 2022~119 min
- NovCrosslingual Generalization through Multitask FinetuningMultimodal2211.01786EleutherAINov 3, 2022~106 min
- NovEFFICIENTLY SCALING TRANSFORMER INFERENCEServing2211.05102Nov 9, 2022~147 min
- NovFast Inference from Transformers via Speculative DecodingInference Optimization2211.17192Nov 30, 2022~104 min
- NovHolistic Evaluation of Language ModelsEvaluation2211.09110Stanford NLPNov 16, 2022~115 min
- NovHyperTuning: Toward Adapting Large Language Models without Back-propagationLLM Systems2211.12485EleutherAINov 22, 2022~111 min
- NovProgram of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning TasksPrompting2211.12588Nov 22, 2022~106 min
- NovRead MoreTraining Methods2211.05100EleutherAINov 9, 2022~119 min
- NovRoentGen: Vision-Language Foundation Model for Chest X-ray GenerationDiffusion2211.12737EleutherAINov 23, 2022~136 min
- NovSmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language ModelsInference Optimization2211.10438Nov 18, 2022~96 min
- OctEleutherAI: Going Beyond "Open Science" to "Science in the Open"Alignment2210.06413EleutherAIOct 12, 2022~97 min
- OctLAION-5B: An open large-scale dataset for training next generation image-text modelsData2210.08402LAIONOct 16, 2022~105 min
- OctReAct: Synergizing Reasoning and Acting in Language ModelsAgents2210.03629Qwen / Alibaba CloudOct 6, 2022~104 min
- OctRobust Preference Learning for Storytelling via Contrastive Reinforcement LearningTraining Methods2210.07792EleutherAIOct 14, 2022~121 min
- OctScaling Instruction-Finetuned Language ModelsAlignment2210.11416SalesforceOct 20, 2022~105 min
- OctThe Goldilocks of Pragmatic Understanding: Fine-Tuning Strategy Matters for Implicature Resolution by LLMsEvaluation2210.14986EleutherAIOct 26, 2022~100 min
- SepAudioLM: a Language Modeling Approach to Audio GenerationPretraining2209.03143Sep 7, 2022~118 min
- SepFlow Straight and Fast: Learning to Generate and Transfer Data with Rectified FlowTraining Methods2209.03003Sep 7, 2022~114 min
- SepIn-context Learning and Induction HeadsUncategorized2209.11895Sep 24, 2022~120 min
- AugAtlas: Few-shot Learning with Retrieval Augmented Language ModelsRetrieval2208.03299Aug 5, 2022~124 min
- AugLLM.int8(): 8-bit Matrix Multiplication for Transformers at ScaleInference Optimization2208.07339Aug 15, 2022~109 min
- AugMoCapAct: A Multi-Task Dataset for Simulated Humanoid ControlAgents2208.07363Aug 15, 2022~122 min
- JunBIG-bench: Beyond the Imitation Game BenchmarkScaling Laws2206.04615MistralJun 9, 2022~99 min
- JunDeepSpeed-Inference: Enabling Efficient Inference of Transformer Models at Unprecedented ScaleServing2207.00032Jun 30, 2022~127 min
- JunEmergent Abilities of Large Language ModelsScaling Laws2206.07682Jun 15, 2022~128 min
- JunTutel: Adaptive Mixture-of-Experts at ScaleMixture of Experts2206.03382Jun 7, 2022~114 min
- JunZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale TransformersInference Optimization2206.01861Jun 4, 2022~92 min
- MayCoCa: Contrastive Captioners are Image-Text Foundation ModelsMultimodal2205.01917Google ResearchMay 4, 2022~112 min
- MayFew-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context LearningAlignment2205.05638May 11, 2022~115 min
- MayFLEURS: Few-shot Learning Evaluation of Universal Representations of SpeechEvaluation2205.12446NVIDIAMay 25, 2022~94 min
- MayGIT: A Generative Image-to-text Transformer for Vision and LanguageMultimodal2205.14100Microsoft ResearchMay 27, 2022~114 min
- MayLarge Language Models are Zero-Shot ReasonersReasoning2205.11916May 24, 2022~102 min
- MayOPT: Open Pre-trained Transformer Language ModelsPretraining2205.01068Meta AI / FAIRMay 2, 2022~125 min
- MayOptimizing Test-Time Query Representations for Dense RetrievalInference Optimization2205.12680May 25, 2022~134 min
- MayREAD MOREInference Optimization2205.14135Together AIMay 27, 2022~127 min
- MayUL2: Unifying Language Learning ParadigmsPretraining2205.05131Together AIMay 10, 2022~122 min
- AprDo As I Can, Not As I Say: Grounding Language in Robotic AffordancesUncategorized2204.01691Apr 4, 2022~124 min
- AprFlamingo: a Visual Language Model for Few-Shot LearningMultimodal2204.14198Apr 29, 2022~97 min
- AprGPT-NeoX-20B: An Open-Source Autoregressive Language ModelLLM Systems2204.06745Stability AIApr 14, 2022~111 min
- AprHierarchical Text-Conditional Image Generation with CLIP LatentsMultimodal2204.06125Apr 13, 2022~111 min
- AprOpen Source and In-House: How Uber Optimizes LLM TrainingPretraining2204.02311UberApr 5, 2022~108 min
- AprStructured Pruning Learns Compact and Accurate ModelsTraining Methods2204.00408Apr 1, 2022~113 min
- AprTraining a Helpful and Harmless Assistant with Reinforcement Learning from Human FeedbackAlignment2204.05862Apr 12, 2022~132 min
- MarLEVEN: A Large-Scale Chinese Legal Event Detection DatasetAgents2203.08556Mar 16, 2022~117 min
- MarPathways: Asynchronous Distributed Dataflow for MLDistributed Training2203.12533Mar 23, 2022~108 min
- MarSelf-Consistency Improves Chain of Thought Reasoning in Language ModelsReasoning2203.11171Mar 21, 2022~99 min
- MarSTaR: Bootstrapping Reasoning With ReasoningReasoning2203.14465Mar 28, 2022~94 min
- MarTraining Compute-Optimal Large Language ModelsScaling Laws2203.15556Mar 29, 2022~111 min
- MarTraining language models to follow instructions with human feedbackAlignment2203.02155Berkeley BAIRMar 4, 2022~125 min
- FebRed Teaming Language Models with Language ModelsAlignment2202.03286Feb 7, 2022~119 min
- FebRethinking the Role of Demonstrations: What Makes In-Context Learning Work?Prompting2202.12837Feb 25, 2022~119 min
- JanAlpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep LearningDistributed Training2201.12023Jan 28, 2022~97 min
- JanBLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and GenerationMultimodal2201.12086SalesforceJan 28, 2022~104 min
- JanConvNeXt: A ConvNet for the 2020sVision2201.03545Meta AI / FAIRJan 10, 2022~111 min
- JanDatasheet for the PileData2201.07311EleutherAIJan 13, 2022~124 min
- JanGrokking: Generalization Beyond Overfitting on Small Algorithmic DatasetsTraining Methods2201.02177Jan 6, 2022~125 min
- JanMonte Carlo, Puppetry and Laughter: The Unexpected Joys of Prompt EngineeringReasoning2201.11903InstacartJan 28, 2022~119 min
2021
64 papers- DecContriever: Unsupervised Dense Information Retrieval with Contrastive LearningRetrieval2112.09118Meta AI / FAIRDec 16, 2021~103 min
- DecGeneral Facial Representation Learning in a Visual-Linguistic MannerPretraining2112.03109Dec 6, 2021~120 min
- DecGLaM: Efficient Scaling of Language Models with Mixture-of-ExpertsMixture of Experts2112.06905Dec 13, 2021~114 min
- DecGopherScaling Laws2112.11446Dec 8, 2021~142 min
- DecHigh-Resolution Image Synthesis with Latent Diffusion ModelsDiffusion2112.10752AppleDec 20, 2021~128 min
- DecWebGPT: Browser-Assisted Question-Answering with Human FeedbackAgents2112.09332Dec 17, 2021~112 min
- NovCombined Scaling for Zero-shot Transfer LearningScaling Laws2111.10050Nov 19, 2021~124 min
- NovDeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding SharingPretraining2111.09543Microsoft ResearchNov 18, 2021~106 min
- NovFlorence: A New Foundation Model for Computer VisionVision2111.11432Nov 22, 2021~118 min
- NovLAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text PairsData2111.02114EleutherAINov 3, 2021~95 min
- NovOn Transferability of Prompt Tuning for Natural Language ProcessingPrompting2111.06719Nov 12, 2021~117 min
- NovOpenPrompt: An Open-source Framework for Prompt-learningArchitecture2111.01998Nov 3, 2021~102 min
- NovScaling Law for Recommendation Models: Towards General-purpose User RepresentationsScaling Laws2111.11294Nov 15, 2021~105 min
- NovVector Quantized Diffusion Model for Text-to-Image SynthesisDiffusion2111.14822Nov 29, 2021~110 min
- OctColossal-AI: A Unified Deep Learning System For Large-Scale Parallel TrainingDistributed Training2110.14883Oct 28, 2021~114 min
- OctGSM8K: A Benchmark for Grade School Math Word ProblemsReasoning2110.14168MistralOct 27, 2021~113 min
- OctMultitask Prompted Training Enables Zero-Shot Task GeneralizationTraining Methods2110.08207EleutherAI561 citesOct 15, 2021~106 min
- OctSpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language ProcessingArchitecture2110.07205Microsoft ResearchOct 14, 2021~105 min
- SepAn Empirical Exploration in Quality Filtering of Text DataData2109.00698EleutherAISep 2, 2021~106 min
- SepFinetuned Language Models Are Zero-Shot LearnersTraining Methods2109.01652Sep 3, 2021~98 min
- SepRecursively Summarizing Books with Human FeedbackTraining Methods2109.1086266 citesSep 22, 2021~99 min
- SepTruthfulQA: Measuring How Models Mimic Human FalsehoodsSafety2109.07958MistralSep 8, 2021~117 min
- AugSayCan: Do As I Can, Not As I SayScaling Laws2108.07258Stanford NLPAug 16, 2021~107 min
- AugSimVLM: Simple Visual Language Model Pretraining with Weak SupervisionMultimodal2108.10904Meta AI / FAIRAug 24, 2021~111 min
- AugTrain Short, Test Long: Attention with Linear Biases Enables Input Length ExtrapolationPretraining2108.12409BaichuanAug 27, 2021~104 min
- JulALBEF: Align Before FuseMultimodal2107.07651Jul 16, 2021~118 min
- JulEvaluating Large Language Models Trained on CodeCode2107.03374MistralJul 7, 2021~126 min
- JulSPLADE: Sparse Lexical and Expansion Model for First Stage Ranking and Re-rankingRetrieval2107.05720Jul 12, 2021~95 min
- JulTAPEX: Table Pre-training via Learning a Neural SQL ExecutorPretraining2107.07653Microsoft ResearchJul 16, 2021~88 min
- JunBitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-modelsTraining Methods2106.10199Jun 18, 2021~102 min
- JunDecision Transformer: Reinforcement Learning via Sequence ModelingRL Training2106.01345Jun 2, 2021~111 min
- JunLM-BFF: Better Few-Shot Fine-Tuning of Language ModelsArchitecture2106.04884Jun 9, 2021~116 min
- JunLoRA: Low-Rank Adaptation of Large Language ModelsTraining Methods2106.09685Jun 17, 2021~91 min
- MayContrastive Learning for Many-to-many Multilingual Neural Machine TranslationTraining Methods2105.09501May 20, 2021~117 min
- MayFNet: Mixing Tokens with Fourier TransformsArchitecture2105.03824Google ResearchMay 9, 2021~126 min
- MayGSPMD: General and Scalable Parallelization for ML Computation GraphsDistributed Training2105.04663May 10, 2021~138 min
- MayMLP-Mixer: An all-MLP Architecture for VisionVision2105.016012 citesMay 4, 2021~103 min
- MaySegFormer: Simple and Efficient Design for Semantic Segmentation with TransformersArchitecture2105.15203May 31, 2021~100 min
- AprEfficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LMDistributed Training2104.04473Apr 9, 2021~101 min
- AprEmerging Properties in Self-Supervised Vision TransformersVision2104.14294Meta AI / FAIRApr 29, 2021~128 min
- AprPrompt Tuning: The Power of Scale for Parameter-Efficient Prompt TuningPrompting2104.0869194 citesApr 18, 2021~88 min
- AprRoFormer: Enhanced Transformer with Rotary Position EmbeddingPretraining2104.09864SnowflakeApr 20, 2021~105 min
- AprTowards Measuring Fairness in AI: the Casual Conversations DatasetSafety2104.02821NVIDIAApr 6, 2021~111 min
- AprZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep LearningDistributed Training2104.07857Apr 16, 2021~116 min
- MarCoordinate Attention for Efficient Mobile Network DesignVision2103.02907Mar 4, 2021~97 min
- MarMATH: Measuring Mathematical Problem Solving with the MATH DatasetEvaluation2103.03874MistralMar 5, 2021~102 min
- MarSwin Transformer: Hierarchical Vision Transformer Using Shifted WindowsVision2103.14030Microsoft ResearchMar 25, 2021~120 min
- FebA Fast Transformer Decoding System with Better Memory Bandwidth UtilizationMultimodal2103.00020Apple5,296 citesFeb 26, 2021~130 min
- FebALIGN: Large-Scale Image-Text Representation Learning with Noisy Text SupervisionMultimodal2102.05918Kakao Brain1,196 citesFeb 11, 2021~111 min
- FebCalibrate Before Use: Improving Few-Shot Performance of Language ModelsPrompting2102.09690Feb 19, 2021~102 min
- FebConceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual ConceptsPretraining2102.0898137 citesFeb 17, 2021~111 min
- FebMeasuring and Improving Consistency in Pretrained Language ModelsUncategorized2102.0101732 citesFeb 1, 2021~101 min
- FebNyströmformer: A Nyström-Based Algorithm for Approximating Self-AttentionArchitecture2102.03902Feb 7, 2021~109 min
- FebProbing Classifiers: Promises, Shortcomings, and AdvancesEvaluation2102.12452Feb 24, 2021~128 min
- FebPyramid Vision Transformer: A Versatile Backbone for Dense Prediction without ConvolutionsVision2102.12122Feb 24, 2021~94 min
- FebTeraPipe: Token-Level Pipeline Parallelism for Training Large-Scale Language ModelsDistributed Training2102.07988Feb 16, 2021~109 min
- FebViLT: Vision-and-Language Transformer Without Convolution or Region SupervisionMultimodal2102.03334Feb 5, 2021~128 min
- FebZero-Shot Text-to-Image GenerationArchitecture2102.120921,134 citesFeb 24, 2021~111 min
- JanPrefix-Tuning: Optimizing Continuous Prompts for GenerationTraining Methods2101.00190Jan 1, 2021~85 min
- JanSwitch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient SparsityMixture of Experts2101.03961361 citesJan 11, 2021~109 min
- JanTokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNetArchitecture2101.11986Jan 28, 2021~113 min
- JanVinVL: Revisiting Visual Representations in Vision-Language ModelsMultimodal2101.00529Jan 2, 2021~103 min
- JanWhat Makes Good In-Context Examples for GPT-3?Prompting2101.06804Jan 17, 2021~101 min
- JanZeRO-Offload: Democratizing Billion-Scale Model TrainingTraining Methods2101.06840Jan 18, 2021~102 min
2020
54 papers- DecBinaryBERT: Pushing the Limit of BERT QuantizationLow Precision2012.15701Dec 31, 2020~104 min
- DecMaking Pre-trained Language Models Better Few-shot LearnersTraining Methods2012.15723Dec 31, 2020~117 min
- DecMemorizing TransformersTraining Methods2012.0036342 citesDec 1, 2020~111 min
- DecMLS: A Large-Scale Multilingual Dataset for Speech ResearchData2012.03411NVIDIA340 citesDec 7, 2020~137 min
- DecThe Pile: An 800GB Dataset of Diverse Text for Language ModelingData2101.00027Stability AIDec 31, 2020~117 min
- DecTraining data-efficient image transformers & distillation through attentionVision2012.12877Meta AI / FAIRDec 23, 2020~106 min
- OctAn Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.Vision2010.11929Apple21,567 citesOct 22, 2020~101 min
- OctAutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated PromptsPrompting2010.15980Oct 29, 2020~100 min
- OctDenoising Diffusion Implicit ModelsDiffusion2010.02502Oct 6, 2020~116 min
- OctFastFormers: Highly Efficient Transformer Models for Natural Language UnderstandingInference Optimization2010.133825 citesOct 26, 2020~122 min
- OctLearning to Execute Programs with Instruction Pointer Attention Graph Neural NetworksArchitecture2010.1262110 citesOct 23, 2020~118 min
- OctNeural Representations in Hybrid Recommender Systems: Prediction versus RegularizationTraining Methods2010.06070Oct 12, 2020~117 min
- OctScaling Laws for Autoregressive Generative ModelingScaling Laws2010.14701Oct 28, 2020~128 min
- SepDeepETA: How Uber Predicts Arrival Times Using Deep LearningArchitecture2009.14794Uber122 citesSep 30, 2020~124 min
- SepLearning to summarize from human feedbackRL Training2009.01325Sep 2, 2020~94 min
- SepMMLU: Measuring Massive Multitask Language UnderstandingEvaluation2009.03300MistralSep 7, 2020~120 min
- SepThe Hardware LotteryScaling Laws2009.0648929 citesSep 14, 2020~110 min
- AugPollux: Co-Adaptive Cluster Scheduling for Goodput-Optimized Deep LearningDistributed Training2008.12260Aug 27, 2020~116 min
- JulANCE: Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text RetrievalRetrieval2007.00808Jul 1, 2020~118 min
- JulBig Bird: Transformers for Longer SequencesArchitecture2007.14062Google Research273 citesJul 28, 2020~124 min
- JulCoVoST 2 and Massively Multilingual Speech-to-Text TranslationData2007.10310NVIDIAJul 20, 2020~136 min
- JulFusion-in-Decoder: Open-Domain Question Answering with Retrieval-Augmented GenerationLLM Systems2007.01282Jul 2, 2020~90 min
- JulMultiWOZ 2.2 : A Dialogue Dataset with Additional Annotation Corrections and State Tracking BaselinesData2007.12720Jul 10, 2020~101 min
- JunBootstrap Your Own Latent: A New Approach to Self-Supervised LearningPretraining2006.077333,445 citesJun 13, 2020~122 min
- JunConservative Q-Learning for Offline Reinforcement LearningRL Training2006.0477935 citesJun 8, 2020~107 min
- JunDeepETA: How Uber Predicts Arrival Times Using Deep LearningArchitecture2006.04768UberJun 8, 2020~115 min
- JunDeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion ParametersTraining Methods2006.05525Jun 9, 2020~126 min
- JunDenoising Diffusion Probabilistic ModelsDiffusion2006.11239Jun 19, 2020~118 min
- JunGShard: Scaling Giant Models with Conditional Computation and Automatic ShardingLLM Systems2006.16668Jun 30, 2020~130 min
- JunPyTorch Distributed: Experiences on Accelerating Data Parallel TrainingDistributed Training2006.15704Jun 28, 2020~109 min
- Junwav2vec 2.0: A Framework for Self-Supervised Learning of Speech RepresentationsPretraining2006.11477Meta AI / FAIRJun 20, 2020~131 min
- MayEnd-to-End Object Detection with TransformersVision2005.12872Meta AI / FAIR831 citesMay 26, 2020~116 min
- MayFinding Experts in Transformer ModelsUncategorized2005.07647May 15, 2020~129 min
- MayLanguage Models are Few-Shot LearnersPretraining2005.14165Meta AI / FAIRMay 28, 2020~119 min
- MayRetrieval-Augmented Generation for Knowledge-Intensive NLP TasksRetrieval2005.11401Meta AI / FAIRMay 22, 2020~98 min
- MaySpeech Recognition and Multi-Speaker Diarization of Long ConversationsMultimodal2005.08072NVIDIAMay 16, 2020~104 min
- MaySynthesizer: Rethinking Self-Attention in Transformer ModelsArchitecture2005.00743198 citesMay 2, 2020~101 min
- AprColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERTRetrieval2004.12832Apr 27, 2020~118 min
- AprDense Passage Retrieval for Open-Domain Question AnsweringRetrieval2004.04906Meta AI / FAIRApr 10, 2020~113 min
- AprETC: Encoding Long and Structured Inputs in TransformersArchitecture2004.0848328 citesApr 17, 2020~130 min
- AprHow Does NLP Benefit Legal System: A Summary of Legal Artificial IntelligenceAgents2004.12158Apr 25, 2020~122 min
- AprLexically Constrained Neural Machine Translation with Levenshtein TransformerInference Optimization2004.12681Apr 27, 2020~95 min
- AprLongformer: The Long-Document TransformerArchitecture2004.05150Allen Institute for AI2,199 citesApr 10, 2020~103 min
- AprNever Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement LearningRL Training2004.1019013 citesApr 21, 2020~116 min
- AprOSCAR: Object-Semantics Aligned Pre-training for Vision-Language TasksMultimodal2004.06165135 citesApr 13, 2020~128 min
- MarNeRF: Representing Scenes as Neural Radiance Fields for View SynthesisVision2003.08934526 citesMar 19, 2020~114 min
- MarRouting TransformerArchitecture2003.0599749 citesMar 12, 2020~111 min
- FebA Simple Framework for Contrastive Learning of Visual RepresentationsVision2002.05709Microsoft Research7,333 citesFeb 13, 2020~114 min
- FebBERT-of-Theseus: Compressing BERT by Progressive Module ReplacingTraining Methods2002.02925Feb 7, 2020~113 min
- FebMiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression of Pre-Trained TransformersDistributed Training2002.10957Microsoft ResearchFeb 25, 2020~97 min
- FebREALM: Retrieval-Augmented Language Model Pre-TrainingPretraining2002.08909Google Research515 citesFeb 10, 2020~113 min
- Jan2028: Two scenarios for global AI leadershipScaling Laws2001.08361Anthropic1,503 citesJan 23, 2020~129 min
- JanReformer: The Efficient TransformerArchitecture2001.04451323 citesJan 13, 2020~104 min
- —Highly accurate protein structure prediction with AlphaFoldEvaluation~118 min
2019
44 papers- DecDeep Double Descent: Where Bigger Models and More Data HurtScaling Laws1912.02292149 citesDec 4, 2019~131 min
- DecPEGASUS: Pre-training with Extracted Gap-sentences for Abstractive SummarizationPretraining1912.08777Google ResearchDec 18, 2019~84 min
- DecPyTorch: An Imperative Style, High-Performance Deep Learning LibraryArchitecture1912.01703Dec 3, 2019~105 min
- NovCompressive TransformerArchitecture1911.05507Nov 13, 2019~112 min
- NovGeneralization through Memorization: Nearest Neighbor Language ModelsRetrieval1911.00172Nov 1, 2019~114 min
- NovMomentum Contrast for Unsupervised Visual Representation LearningVision1911.05722Nov 13, 2019~111 min
- NovMuZero (Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model)RL Training1911.082651,088 citesNov 19, 2019~123 min
- NovUnsupervised Cross-lingual Representation Learning at ScalePretraining1911.02116Microsoft Research539 citesNov 5, 2019~92 min
- OctBART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionTraining Methods1910.13461Meta AI / FAIROct 29, 2019~102 min
- OctExploring the Limits of Transfer Learning with a Unified Text-to-Text TransformerTraining Methods1910.10683Allen Institute for AIOct 23, 2019~132 min
- OctLearning Classifiers on Positive and Unlabeled Data with Policy GradientTraining Methods1910.06535Oct 15, 2019~118 min
- OctLudwig v0.3 Introduces Hyperparameter Optimization, Transformers and TensorFlow 2 supportPretraining1910.01108UberOct 2, 2019~108 min
- OctMLQA: Evaluating Cross-lingual Extractive Question AnsweringEvaluation1910.07475Microsoft ResearchOct 16, 2019~121 min
- OctQ8BERT: Quantized 8Bit BERTInference Optimization1910.06188Oct 14, 2019~91 min
- OctQuantifying the Carbon Emissions of Machine LearningTraining Methods1910.09700Meta AI / FAIROct 21, 2019~87 min
- OctZeRO: Memory Optimizations Toward Training Trillion Parameter ModelsDistributed Training1910.02054Stability AIOct 4, 2019~105 min
- SepALBERT: A Lite BERT for Self-supervised Learning of Language RepresentationsArchitecture1909.11942984 citesSep 26, 2019~104 min
- SepControlling Text Generation with Plug and Play Language ModelsRL Training1909.08593UberSep 18, 2019~120 min
- SepLanguage Models as Knowledge Bases?Evaluation1909.01066Sep 3, 2019~114 min
- SepMegatron-LM: Training Multi-Billion Parameter Language Models Using Model ParallelismDistributed Training1909.08053Sep 17, 2019~105 min
- SepQ-BERT: Hessian Based Ultra Low Precision Quantization of BERTInference Optimization1909.05840Sep 12, 2019~112 min
- SepTinyBERT: Distilling BERT for Natural Language UnderstandingTraining Methods1909.10351Sep 23, 2019~106 min
- SepUNITER: Learning Universal Image-Text RepresentationsMultimodal1909.11740184 citesSep 25, 2019~113 min
- AugLXMERT: Learning Cross-Modality Encoder Representations from TransformersMultimodal1908.07490Aug 20, 2019~111 min
- AugSentence-BERT: Sentence Embeddings using Siamese BERT-NetworksArchitecture1908.10084MozillaAug 27, 2019~110 min
- AugViLBERT: Pretraining Task-Agnostic Visiolinguistic RepresentationsMultimodal1908.02265Aug 6, 2019~109 min
- AugVisualBERT: A Simple and Performant Baseline for Vision and LanguageMultimodal1908.03557Aug 9, 2019~119 min
- JulRoBERTa: A Robustly Optimized BERT Pretraining ApproachPretraining1907.11692Meta AI / FAIRJul 26, 2019~113 min
- JulSpanBERT: Improving Pre-training by Representing and Predicting SpansPretraining1907.10529179 citesJul 24, 2019~119 min
- JunLatent Retrieval for Weakly Supervised Open Domain Question AnsweringRetrieval1906.0030067 citesJun 1, 2019~102 min
- JunXLNet: Generalized Autoregressive Pretraining for Language UnderstandingPretraining1906.08237Stitch FixJun 19, 2019~118 min
- MayAdaptive Attention Span in TransformersTraining Methods1905.07799May 19, 2019~109 min
- MayEfficientNet: Rethinking Model Scaling for Convolutional Neural NetworksArchitecture1905.11946Google Research5,013 citesMay 28, 2019~109 min
- MayHellaSwag: Can a Machine Really Finish Your Sentence?Evaluation1905.07830MistralMay 19, 2019~119 min
- MayInterpreting and improving natural-language processing (in machines) with natural language-processing (in the brain)Uncategorized1905.11833May 28, 2019~126 min
- MaySuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding SystemsEvaluation1905.00537991 citesMay 2, 2019~114 min
- AprERNIE: Enhanced Representation through Knowledge IntegrationPretraining1904.09223770 citesApr 19, 2019~100 min
- AprGenerating Long Sequences with Sparse TransformersArchitecture1904.10509Apr 23, 2019~125 min
- AprHAWQ: Hessian Aware Quantization of Neural NetworksLow Precision1905.03696Apr 29, 2019~102 min
- AprHOList: An Environment for Machine Learning of Higher-Order Theorem ProvingAgents1904.0324120 citesApr 5, 2019~116 min
- FebLanguage Models are Unsupervised Multitask LearnersTraining Methods1902.01313Feb 4, 2019~107 min
- FebParameter-Efficient Transfer Learning for NLPTraining Methods1902.00751144 citesFeb 2, 2019~115 min
- JanNatural Questions: A Benchmark for Question Answering ResearchRL Training1901.04473Jan 12, 2019~127 min
- JanTransformer-XL: Attentive Language Models Beyond a Fixed-Length ContextArchitecture1901.02860Jan 9, 2019~110 min
2018
35 papers- DecA Style-Based Generator Architecture for Generative Adversarial NetworksVision1812.04948Dec 12, 2018~106 min
- DecOff-Policy Deep Reinforcement Learning without ExplorationTraining Methods1812.02900Dec 7, 2018~110 min
- DecSoft Actor-Critic Algorithms and ApplicationsRL Training1812.05905Dec 13, 2018~118 min
- NovGPipe: Efficient Training of Giant Neural Networks using Pipeline ParallelismDistributed Training1811.06965236 citesNov 16, 2018~120 min
- NovMesh-TensorFlow: Deep Learning for SupercomputersTraining Methods1811.0208452 citesNov 5, 2018~105 min
- OctA Block Coordinate Descent Proximal Method for Simultaneous Filtering and Parameter EstimationTraining Methods1810.06759Oct 16, 2018~93 min
- OctBERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingPretraining1810.04805DeepMind45,647 citesOct 11, 2018~131 min
- OctHow Powerful Are Graph Neural Networks?Architecture1810.00826Oct 1, 2018~119 min
- OctModel Cards for Model ReportingAlignment1810.03993Meta AI / FAIROct 5, 2018~118 min
- SepLarge Scale GAN Training for High Fidelity Natural Image SynthesisPretraining1809.110961,786 citesSep 28, 2018~132 min
- SepLoop Patterns: Extension of Kleene Star Operator for More Expressive Pattern Matching against Arbitrary Data StructuresCode1809.03252Sep 10, 2018~114 min
- SepXNLI: Evaluating Cross-lingual Sentence RepresentationsEvaluation1809.05053Microsoft ResearchSep 13, 2018~96 min
- AugSWAG: A Large-Scale Adversarial Dataset for Grounded Commonsense InferenceEvaluation1808.05326103 citesAug 16, 2018~123 min
- JulBeyond Data and Model Parallelism for Deep Neural NetworksDistributed Training1807.05358Jul 14, 2018~114 min
- JulORQA: Open-Retrieval Question-AnsweringEvaluation1807.01836Jul 5, 2018~101 min
- JulRepresentation Learning with Contrastive Predictive CodingPretraining1807.037483,768 citesJul 10, 2018~112 min
- JunDARTS: Differentiable Architecture SearchArchitecture1806.090551,402 citesJun 24, 2018~133 min
- JunNeural Ordinary Differential EquationsDiffusion1806.07366Jun 19, 2018~115 min
- JunPipeDream: Fast and Efficient Pipeline Parallel DNN TrainingDistributed Training1806.03377Jun 8, 2018~103 min
- JunQuantizing deep convolutional networks for efficient inference: A whitepaperLow Precision1806.08342Jun 21, 2018~102 min
- JunSQuAD 2.0: The Stanford Question Answering DatasetEvaluation1806.03822Jun 11, 2018~97 min
- AprGLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language UnderstandingEvaluation1804.07461555 citesApr 20, 2018~108 min
- MarGroup NormalizationUncategorized1803.08494478 citesMar 22, 2018~84 min
- MarSelf-Attention with Relative Position RepresentationsArchitecture1803.02155272 citesMar 6, 2018~100 min
- MarThink you have Solved Question Answering? Try ARC, the AI2 Reasoning ChallengeEvaluation1803.05457Allen Institute for AIMar 14, 2018~118 min
- MarUnsupervised Representation Learning by Predicting Image RotationsVision1803.07728Mar 21, 2018~126 min
- MarYear in Review: 2019 Highlights from the Uber Engineering BlogTraining Methods1803.03635UberMar 9, 2018~110 min
- FebAddressing Function Approximation Error in Actor-Critic MethodsRL Training1802.09477Feb 26, 2018~111 min
- FebDeep contextualized word representationsPretraining1802.053651,791 citesFeb 15, 2018~112 min
- FebHorovod: Fast and Easy Distributed Deep Learning in TensorFlowDistributed Training1802.05799Feb 15, 2018~105 min
- FebIMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner ArchitecturesRL Training1802.01561612 citesFeb 5, 2018~119 min
- FebSpectral Normalization for Generative Adversarial NetworksArchitecture1802.05957Feb 16, 2018~122 min
- FebTVM: An Automated End-to-End Optimizing Compiler for Deep LearningInference Optimization1802.04799Feb 12, 2018~120 min
- JanImproving Language Understanding by Generative Pre-TrainingTraining Methods1801.06146Jan 18, 2018~117 min
- JanSoft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic ActorRL Training1801.01290Jan 4, 2018~116 min
2017
28 papers- DecA general reinforcement learning algorithm that masters chess, shogi, and Go through self-playRL Training1712.01815Dec 5, 2017~122 min
- DecQuantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only InferenceLow Precision1712.05877200 citesDec 15, 2017~113 min
- DecRay: A Distributed Framework for Emerging AI ApplicationsDistributed Training1712.05889Dec 16, 2017~127 min
- DecTensorFlow-Serving: Flexible, High-Performance ML ServingServing1712.06139Dec 17, 2017~101 min
- NovDecoupled Weight Decay RegularizationTraining Methods1711.05101Nov 14, 2017~107 min
- NovInverse Reward DesignAlignment1711.02827Nov 8, 2017~111 min
- NovNeural Discrete Representation LearningArchitecture1711.009371,969 citesNov 2, 2017~112 min
- OctFraud Detection: Using Relational Graph Learning to Detect CollusionArchitecture1710.10903UberOct 30, 2017~112 min
- OctMixed Precision TrainingTraining Methods1710.03740203 citesOct 10, 2017~113 min
- Octmixup: Beyond Empirical Risk MinimizationTraining Methods1710.09412Oct 25, 2017~113 min
- OctRainbow: Combining Improvements in Deep Reinforcement LearningRL Training1710.02298428 citesOct 6, 2017~111 min
- OctTo prune, or not to prune: exploring the efficacy of pruning for model compressionInference Optimization1710.01878Oct 5, 2017~104 min
- SepSqueeze-and-Excitation NetworksVision1709.01507Sep 5, 2017~97 min
- AugFocal Loss for Dense Object DetectionVision1708.02002Aug 7, 2017~118 min
- JulBottom-Up and Top-Down Attention for Image Captioning and Visual Question AnsweringVision1707.07998Jul 25, 2017~126 min
- JulFiber: Distributed Computing for AI Made SimpleRL Training1707.06347UberJul 20, 2017~130 min
- JunAttention Is All You NeedArchitecture1706.03762NVIDIAJun 12, 2017~118 min
- JunDeep reinforcement learning from human preferencesRL Training1706.03741Jun 12, 2017~104 min
- JunFood Discovery with Uber Eats: Using Graph Learning to Power RecommendationsArchitecture1706.02216UberJun 7, 2017~114 min
- AprMobileNets: Efficient Convolutional Neural Networks for Mobile Vision ApplicationsArchitecture1704.04861Apr 17, 2017~124 min
- MarMask R-CNNVision1703.068701,516 citesMar 20, 2017~120 min
- MarMeta-Graph: Few-Shot Link Prediction Using Meta-LearningTraining Methods1703.03400Uber5,791 citesMar 9, 2017~118 min
- MarPrototypical Networks for Few-shot LearningPretraining1703.0517585 citesMar 15, 2017~113 min
- MarReading Wikipedia to Answer Open-Domain QuestionsRetrieval1704.00051Mar 31, 2017~99 min
- MarSurvey of the State of the Art in Natural Language Generation: Core tasks, applications and evaluationTraining Methods1703.09902Mar 29, 2017~142 min
- MarUnpaired Image-to-Image Translation using Cycle-Consistent Adversarial NetworksVision1703.10593Mar 30, 2017~112 min
- JanDeepETA: How Uber Predicts Arrival Times Using Deep LearningMixture of Experts1701.06538Uber268 citesJan 23, 2017~112 min
- JanWasserstein GANTraining Methods1701.07875Jan 26, 2017~99 min
2016
32 papers- DecAttention TransferVision1612.03928Dec 12, 2016~110 min
- DecClipper: A Low-Latency Online Prediction Serving SystemServing1612.03079Dec 9, 2016~118 min
- DecFeature Pyramid Networks for Object DetectionVision1612.03144Dec 9, 2016~121 min
- DecPointNet: Deep Learning on Point Sets for 3D Classification and SegmentationArchitecture1612.00593Dec 2, 2016~106 min
- NovAggregated Residual Transformations for Deep Neural NetworksArchitecture1611.05431Nov 16, 2016~113 min
- NovGenerative Teaching Networks: Accelerating Neural Architecture Search by Learning to Generate Synthetic Training DataArchitecture1611.01578Uber909 citesNov 5, 2016~96 min
- SepGoogle's Neural Machine Translation System: Bridging the Gap between Human and Machine TranslationArchitecture1609.08144Sep 26, 2016~114 min
- SepPano2CAD: Room Layout From A Single Panorama ImageVision1609.09270Sep 29, 2016~120 min
- SepWaveNet: A Generative Model for Raw AudioArchitecture1609.03499Sep 12, 2016~132 min
- AugDensely Connected Convolutional NetworksArchitecture1608.06993Aug 25, 2016~106 min
- AugPruning Filters for Efficient ConvNetsArchitecture1608.08710Aug 31, 2016~105 min
- JulEnriching Word Vectors with Subword InformationPretraining1607.04606Meta AI / FAIRJul 15, 2016~124 min
- JulInstance Normalization: The Missing Ingredient for Fast StylizationVision1607.08022Jul 27, 2016~91 min
- JulLayer NormalizationTraining Methods1607.06450Stability AIJul 21, 2016~98 min
- JulOn the efficient representation and execution of deep acoustic modelsInference Optimization1607.046836 citesJul 15, 2016~107 min
- JunConcrete Problems in AI SafetyAlignment1606.06565Jun 21, 2016~119 min
- JunCooperative Inverse Reinforcement LearningAlignment1606.03137Jun 9, 2016~106 min
- JunGaussian Error Linear Units (GELUs)Architecture1606.08415Jun 27, 2016~107 min
- JunLAMBADA: Word Prediction Requiring a Broad Discourse ContextEvaluation1606.06031Jun 20, 2016~113 min
- JunOpenAI GymCode1606.01540Jun 5, 2016~95 min
- MayElectronic structure of the high and low pressure polymorphs of MgSiN$_{2}$Scaling Laws1605.00500May 2, 2016~114 min
- MayTensorFlow: A system for large-scale machine learningLLM Systems1605.086958,823 citesMay 27, 2016~115 min
- MarMastering the game of Go with deep neural networks and tree searchData1603.07185Mar 23, 2016~115 min
- MarProductionizing Distributed XGBoost to Train Deep Tree Models with Large Data Sets at UberArchitecture1603.02754UberMar 9, 2016~122 min
- MarTensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed SystemsDistributed Training1603.04467Mar 14, 2016~107 min
- MarXNOR-Net: ImageNet Classification Using Binary Convolutional Neural NetworksLow Precision1603.05279Mar 16, 2016~118 min
- Feb"Why Should I Trust You?": Explaining the Predictions of Any ClassifierUncategorized1602.04938Feb 16, 2016~119 min
- FebAsynchronous Methods for Deep Reinforcement LearningRL Training1602.01783Feb 4, 2016~138 min
- FebBinarized Neural NetworksLow Precision1602.02830Feb 9, 2016~111 min
- FebCommunication-Efficient Learning of Deep Networks from Decentralized DataLLM Systems1602.056295,178 citesFeb 17, 2016~109 min
- FebEIE: Efficient Inference Engine on Compressed Deep Neural NetworkArchitecture1602.01528Feb 4, 2016~119 min
- FebSqueezeNet: AlexNet-level accuracy with 50x fewer parameters and <1MB model sizeVision1602.07360Feb 24, 2016~121 min
2015
36 papers- DecDeep Residual Learning for Image RecognitionVision1512.03385AppleDec 10, 2015~106 min
- DecMXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed SystemsArchitecture1512.01274Dec 3, 2015~114 min
- DecRethinking the Inception Architecture for Computer VisionVision1512.00567OpenAI565 citesDec 2, 2015~115 min
- NovBinaryConnect: Training Deep Neural Networks with Binary Weights during PropagationsTraining Methods1511.00363Nov 2, 2015~95 min
- NovDueling Network Architectures for Deep Reinforcement LearningArchitecture1511.065811,816 citesNov 20, 2015~96 min
- NovPrioritized Experience ReplayRL Training1511.05952Stitch Fix2,045 citesNov 18, 2015~101 min
- NovUnsupervised Representation Learning with Deep Convolutional Generative Adversarial NetworksPretraining1511.06434Stitch FixNov 19, 2015~111 min
- OctDeep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman CodingInference Optimization1510.00149Oct 1, 2015~94 min
- OctMUSAN: A Music, Speech, and Noise CorpusData1510.08484NVIDIAOct 28, 2015~103 min
- SepCharacter-level Convolutional Networks for Text ClassificationArchitecture1509.01626Sep 4, 2015~104 min
- SepDeep Reinforcement Learning with Double Q-learningRL Training1509.06461Stitch Fix3,521 citesSep 22, 2015~96 min
- AugEffective Approaches to Attention-based Neural Machine TranslationArchitecture1508.04025Aug 17, 2015~128 min
- AugNeural Machine Translation of Rare Words with Subword UnitsPretraining1508.07909Aug 31, 2015~109 min
- AugUnified Acceleration Method for Packing and Covering Problems via Diameter ReductionTraining Methods1508.02439Aug 10, 2015~113 min
- JunFaster R-CNN: Towards Real-Time Object Detection with Region Proposal NetworksVision1506.014976,265 citesJun 4, 2015~105 min
- JunLearning both Weights and Connections for Efficient Neural NetworkPretraining1506.02626Jun 8, 2015~107 min
- JunPointer NetworksArchitecture1506.03134Stitch Fix4 citesJun 9, 2015~115 min
- JunSpatial Transformer NetworksVision1506.0202563 citesJun 5, 2015~122 min
- JunYou Only Look Once: Unified, Real-Time Object DetectionVision1506.02640Jun 8, 2015~97 min
- MayHighway NetworksArchitecture1505.00387May 3, 2015~98 min
- MayU-Net: Convolutional Networks for Biomedical Image SegmentationVision1505.04597May 18, 2015~115 min
- AprEnd-to-End Training of Deep Visuomotor PoliciesRL Training1504.00702Apr 2, 2015~109 min
- AprFast R-CNNVision1504.080831,769 citesApr 30, 2015~120 min
- MarFaceNet: A Unified Embedding for Face Recognition and ClusteringVision1503.0383211,139 citesMar 12, 2015~111 min
- MarLINE: Large-scale Information Network EmbeddingArchitecture1503.03578Mar 12, 2015~118 min
- MarLudwig v0.3 Introduces Hyperparameter Optimization, Transformers and TensorFlow 2 supportTraining Methods1503.02531UberMar 9, 2015~122 min
- FebBatch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate ShiftArchitecture1502.03167Dropbox24,373 citesFeb 11, 2015~113 min
- FebDelving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet ClassificationTraining Methods1502.01852Feb 6, 2015~99 min
- FebDRAW: A Recurrent Neural Network For Image GenerationVision1502.04623965 citesFeb 16, 2015~121 min
- FebImproved Semantic Representations From Tree-Structured Long Short-Term Memory NetworksArchitecture1503.00075Feb 28, 2015~128 min
- FebShow, Attend and Tell: Neural Image Caption Generation with Visual AttentionMultimodal1502.03044Feb 10, 2015~106 min
- FebTrust Region Policy OptimizationRL Training1502.05477Feb 19, 2015~108 min
- —Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate ShiftTraining Methods~110 min
- —Deep learningArchitecture~18 min
- —On the importance of initialization and momentum in deep learningTraining Methods~117 min
- —PyTorch: An Imperative Style, High-Performance Deep Learning LibraryArchitecture~117 min
2014
29 papers- DecAdam: A Method for Stochastic OptimizationTraining Methods1412.6980Dec 22, 2014~125 min
- DecEmpirical Evaluation of Gated Recurrent Neural Networks on Sequence ModelingArchitecture1412.3555Dec 11, 2014~108 min
- DecExplaining and Harnessing Adversarial ExamplesUncategorized1412.65728,153 citesDec 20, 2014~141 min
- NovConditional Generative Adversarial NetsVision1411.1784Nov 6, 2014~104 min
- NovFully Convolutional Networks for Semantic SegmentationVision1411.4038Nov 14, 2014~127 min
- NovGloVe: Global Vectors for Word RepresentationTraining Methods1411.5595Nov 20, 2014~102 min
- NovHow transferable are features in deep neural networks?Training Methods1411.1792Nov 6, 2014~123 min
- NovShow and Tell: A Neural Image Caption GeneratorMultimodal1411.4555186 citesNov 17, 2014~116 min
- OctHigh-Performance Distributed ML at Scale through Parameter Server Consistency ModelsTraining Methods1410.8043Oct 29, 2014~108 min
- OctMemory NetworksArchitecture1410.3916Oct 15, 2014~138 min
- OctNeural Turing MachinesArchitecture1410.5401110 citesOct 20, 2014~129 min
- SepGoing Deeper with ConvolutionsArchitecture1409.48421,390 citesSep 17, 2014~113 min
- SepImageNet Large Scale Visual Recognition ChallengeVision1409.0575Sep 1, 2014~104 min
- SepNeural Machine Translation by Jointly Learning to Align and TranslateAlignment1409.0473Sep 1, 2014~101 min
- SepOn the Properties of Neural Machine Translation: Encoder–Decoder ApproachesScaling Laws1409.1259Sep 3, 2014~114 min
- SepSequence to Sequence Learning with Neural NetworksTraining Methods1409.321513,358 citesSep 10, 2014~112 min
- SepVery Deep Convolutional Networks for Large-Scale Image RecognitionVision1409.1556Sep 4, 2014~129 min
- AugConvolutional Neural Networks for Sentence ClassificationArchitecture1408.5882Aug 25, 2014~108 min
- JunCaffe: Convolutional Architecture for Fast Feature EmbeddingArchitecture1408.50934,309 citesJun 20, 2014~99 min
- JunGenerative Adversarial NetworksArchitecture1406.2661Google ResearchJun 10, 2014~117 min
- JunHuman-level Control Through Deep Reinforcement LearningContext Optimization1406.3722Jun 14, 2014~120 min
- JunLearning Phrase Representations using RNN Encoder–Decoder for Statistical Machine TranslationArchitecture1406.1078Jun 3, 2014~119 min
- JunSpatial Pyramid Pooling in Deep Convolutional Networks for Visual RecognitionVision1406.4729Jun 18, 2014~110 min
- MayDistributed Representations of Sentences and DocumentsArchitecture1405.40535,128 citesMay 16, 2014~120 min
- MayMicrosoft COCO: Common Objects in ContextVision1405.0312NVIDIAMay 1, 2014~98 min
- MarMeta-Graph: Few-Shot Link Prediction Using Meta-LearningPretraining1403.6652UberMar 26, 2014~118 min
- —Dropout: A Simple Way to Prevent Neural Networks from OverfittingTraining Methods~21 min
- —Dropout: A Simple Way to Prevent Neural Networks from OverfittingTraining Methods~114 min
- —Generative Adversarial NetsTraining Methods~16 min
2013
12 papers- DecAuto-Encoding Variational BayesArchitecture1312.6114Stitch FixDec 20, 2013~109 min
- DecExact solutions to the nonlinear dynamics of learning in deep linear neural networksTraining Methods1312.6120Dec 20, 2013~119 min
- DecIntriguing properties of neural networksUncategorized1312.6199Dec 21, 2013~109 min
- DecLearning Factored Representations in a Deep Mixture of ExpertsArchitecture1312.4314137 citesDec 16, 2013~116 min
- DecOverFeat: Integrated Recognition, Localization and Detection using Convolutional NetworksVision1312.6229Dec 21, 2013~129 min
- DecPlaying Atari with Deep Reinforcement LearningRL Training1312.5602Dec 19, 2013~144 min
- NovRich feature hierarchies for accurate object detection and semantic segmentationVision1311.2524Nov 11, 2013~118 min
- NovVisualizing and Understanding Convolutional NetworksVision1311.2901Nov 12, 2013~123 min
- OctDistributed Representations of Words and Phrases and their CompositionalityPretraining1310.454618,086 citesOct 16, 2013~114 min
- AugGenerating Sequences With Recurrent Neural NetworksPretraining1308.0850Aug 4, 2013~115 min
- FebMaxout NetworksArchitecture1302.4389Feb 18, 2013~131 min
- JanEfficient Estimation of Word Representations in Vector SpacePretraining1301.378118,139 citesJan 16, 2013~122 min
2012
6 papers- DecADADELTA: An Adaptive Learning Rate MethodTraining Methods1212.5701Dec 22, 2012~96 min
- JulFiber: Distributed Computing for AI Made SimpleEvaluation1207.4708UberJul 19, 2012~116 min
- AprMuJoCo: A physics engine for model-based controlPretraining1204.6211Apr 24, 2012~107 min
- AprRealization of the anisotropic XY model in a Tb(III)-W(V) chain compoundAgents1204.4894Apr 22, 2012~113 min
- —ImageNet Classification with Deep Convolutional Neural NetworksVision~120 min
- —Random Search for Hyper-Parameter OptimizationTraining Methods~19 min
2000
77 papers- —A decision-theoretic generalization of on-line learning and an application to boostingTraining Methods~84 min
- —A Fast Learning Algorithm for Deep Belief NetsPretraining~133 min
- —A Global Geometric Framework for Nonlinear Dimensionality ReductionVision~100 min
- —A Unified Approach to Interpreting Model PredictionsAgents~111 min
- —Accelerating t-SNE using Tree-Based AlgorithmsServing~109 min
- —Adapting Large Language Models for Document-Level Machine TranslationTraining Methods~110 min
- —Adaptive Subgradient Methods for Online Learning and Stochastic OptimizationTraining Methods~136 min
- —An Introduction to Conditional Random FieldsArchitecture~124 min
- —Apprenticeship Learning via Inverse Reinforcement LearningRL Training~128 min
- —Bandit Based Monte-Carlo PlanningRL Training~114 min
- —Bigtable: A Distributed Storage System for Structured DataArchitecture~125 min
- —Bootstrapped Thompson Sampling and Deep ExplorationRL Training~132 min
- —Conditional Image Generation with PixelCNN DecodersVision~128 min
- —DeCAF: A Deep Convolutional Activation Feature for Generic Visual RecognitionVision~115 min
- —Deep contextualized word representationsPretraining~127 min
- —Deep Neural Networks for Acoustic Modeling in Speech RecognitionUncategorized~155 min
- —Deep Sparse Rectifier Neural NetworksArchitecture~119 min
- —Deep Unsupervised Learning using Nonequilibrium ThermodynamicsDiffusion~132 min
- —DeepFace: Closing the Gap to Human-Level Performance in Face VerificationVision~129 min
- —Deterministic Policy Gradient AlgorithmsRL Training~115 min
- —Distance Metric Learning, with Application to Clustering with Side-InformationUncategorized~108 min
- —Distinctive Image Features from Scale-Invariant KeypointsVision~142 min
- —Distributed Representations of Sentences and DocumentsPretraining~113 min
- —Distributed Representations of Words and Phrases and their CompositionalityTraining Methods~123 min
- —Efficient and Effective Query Auto-CompletionServing~139 min
- —Efficient Selectivity and Backup Operators in Monte-Carlo Tree SearchAgents~101 min
- —Finite-time Analysis of the Multiarmed Bandit ProblemRL Training~110 min
- —Gender Shades: Intersectional Accuracy Disparities in Commercial Gender ClassificationEvaluation~106 min
- —GloVe: Global Vectors for Word RepresentationPretraining~124 min
- —Hierarchical Dirichlet ProcessesPretraining~112 min
- —Histograms of Oriented Gradients for Human DetectionVision~119 min
- —Hogwild!: A Lock-Free Approach to Parallelizing Stochastic Gradient DescentTraining Methods~113 min
- —Human-level control through deep reinforcement learningRL Training~136 min
- —Improving Language Understanding by Generative Pre-TrainingPretraining~93 min
- —Kernel Methods in Machine LearningPretraining~131 min
- —Language Models are Unsupervised Multitask LearnersPretraining~119 min
- —Large Scale Distributed Deep NetworksTraining Methods~103 min
- —Large-Scale Machine Learning with Stochastic Gradient DescentTraining Methods~109 min
- —Latent Dirichlet AllocationPretraining~118 min
- —Least Angle RegressionTraining Methods~121 min
- —Local structures of gravity-free space and time and their phenomenaScaling Laws~75 min
- —Magnetic Lorentz Force Drives Giant Second-Harmonic Generation in Split-Ring Resonator MetamaterialsPretraining~118 min
- —Map-Reduce for Machine Learning on MulticoreTraining Methods~141 min
- —MapReduce: Simplified Data Processing on Large ClustersDistributed Training~125 min
- —Mastering the game of Go without human knowledgeRL Training~144 min
- —Matrix Factorization Techniques for Recommender SystemsData~97 min
- —Mining Frequent Patterns without Candidate GenerationArchitecture~99 min
- —Netflix Update: Try This at HomeTraining Methods~112 min
- —Nonlinear Dimensionality Reduction by Locally Linear EmbeddingScaling Laws~104 min
- —On Spectral Clustering: Analysis and an algorithmData~85 min
- —On Spectral Clustering: Analysis and an AlgorithmVision~98 min
- —Online Convex Programming and Generalized Infinitesimal Gradient AscentTraining Methods~99 min
- —Pegasos: Primal Estimated sub-GrAdient SOlver for SVMTraining Methods~99 min
- —Probabilistic Matrix FactorizationRetrieval~107 min
- —Rainbow: Combining Improvements in Deep Reinforcement LearningTraining Methods~127 min
- —Random ForestsPretraining~147 min
- —Random Projection in Dimensionality Reduction: Applications to Image and Text DataData~115 min
- —Rapid Object Detection using a Boosted Cascade of Simple FeaturesVision~126 min
- —Reducing the Dimensionality of Data with Neural NetworksPretraining~103 min
- —Regularization and Variable Selection via the Elastic NetTraining Methods~118 min
- —Regularized Multi-Task LearningTraining Methods~117 min
- —Semi-Supervised Learning Using Gaussian Fields and Harmonic FunctionsUncategorized~115 min
- —Sequence to Sequence Learning with Neural NetworksTraining Methods~109 min
- —Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement LearningEvaluation~63 min
- —Some PAC-Bayesian TheoremsTraining Methods~110 min
- —Spanner: Google’s Globally-Distributed DatabaseScaling Laws~125 min
- —SparseEmbed: Learning Sparse Lexical Representations with Contextual Embeddings for RetrievalRetrieval~117 min
- —Stacked Denoising Autoencoders: Learning Useful Representations in a Deep Network with a Local Denoising CriterionArchitecture~143 min
- —Support Vector ClusteringArchitecture~89 min
- —Support Vector Machine Learning for Interdependent and Structured Output SpacesTraining Methods~121 min
- —TensorFlow: A System for Large-Scale Machine LearningArchitecture~115 min
- —The Google File SystemArchitecture~118 min
- —Translating Embeddings for Modeling Multi-relational DataScaling Laws~92 min
- —Trust Region Policy OptimizationRL Training~121 min
- —Understanding the difficulty of training deep feedforward neural networksTraining Methods~115 min
- —Visualizing Data using t-SNEDiffusion~118 min
- —Web Search for a Planet: The Google Cluster ArchitectureServing~116 min