392 papers
Vision
0/391Computer vision and ViT.
- MayQwen-Image-2.0 Technical Reportarchitecture2605.10730QwenMay 11, 2026~115 min
- MayLongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generationarchitecture2605.18739NVIDIAMay 18, 2026~131 min
- MayPiD: Fast and High-Resolution Latent Decoding with Pixel Diffusiondiffusion2605.23902NVIDIAMay 22, 2026~112 min
- MayMSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generationevaluation2605.20183TongyiLabMay 19, 2026~122 min
- MayEnhancing Train-Free Infinite-Frame Generation for Consistent Long Videosinference-optimization2605.18233alibaba-incMay 18, 2026~99 min
- MayReinforcing Multimodal Reasoning Against Visual Degradationmultimodal2605.09262Tencent HunyuanMay 10, 2026~119 min
- MayTraining Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Contextmultimodal2605.13831ByteDance SeedMay 13, 2026~98 min
- MayETCHR: Editing To Clarify and Harness Reasoningreasoning2605.23897InternLM / Shanghai AI LabMay 22, 2026~135 min
- MayEnd-to-End Autoregressive Image Generation with 1D Semantic Tokenizertraining-methods2605.00503ByteDance SeedMay 1, 2026~115 min
- MayLet ViT Speak: Generative Language-Image Pre-trainingvision2605.00809ByteDanceMay 1, 2026~95 min
- MayQwen-Image-VAE-2.0 Technical Reportvision2605.13565QwenMay 13, 2026~110 min
- MaySANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformervision2605.15178NVIDIAMay 14, 2026~113 min
- MayLiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMsvision2605.17260DeepmindMay 17, 2026~106 min
- MayFast 4D Mesh Generation by Spatio-Temporal Attention Chainsvision2605.19786NVIDIAMay 19, 2026~109 min
- MaySetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Predictionvision2605.20110May 19, 2026~113 min
- MayFlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matchingvision2605.20910KAIST AIMay 20, 2026~133 min
- AprGPA: Learning GUI Process Automation from Demonstrationsagents2604.01676Salesforce AI ResearchApr 2, 2026score 9~114 min
- AprHierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modelingcode2604.05072Tencent HunyuanApr 6, 2026score 3~120 min
- AprSeedance 2.0: Advancing Video Generation for World Complexitydiffusion2604.14148ByteDance SeedApr 15, 2026score 3~127 min
- AprCoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generationdiffusion2604.19636alibaba-incApr 21, 2026~120 min
- AprDiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domainevaluation2604.10425meituanApr 12, 2026score 3~113 min
- AprDo Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understandingevaluation2604.11177VideoDBApr 13, 2026score 8~119 min
- AprLARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignmentevaluation2604.11689LongCatApr 13, 2026~111 min
- AprLeveraging Verifier-Based Reinforcement Learning in Image Editingllm-systems2604.27505ByteDance SeedApr 30, 2026~121 min
- AprEXAONE 4.5 Technical Reportmultimodal2604.08644LG EXAONEApr 9, 2026score 9~90 min
- AprOmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generationmultimodal2604.11804ByteDanceApr 13, 2026score 3~110 min
- AprImage Generators are Generalist Vision Learnersmultimodal2604.20329DeepMindApr 22, 2026~135 min
- AprTuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generationmultimodal2604.24763Meta AIApr 27, 2026~119 min
- AprNemotron 3 Nano Omni: Efficient and Open Multimodal Intelligencemultimodal2604.24954NVIDIAApr 27, 2026~116 min
- AprActionParty: Multi-Subject Action Binding in Generative Video Gamesvision2604.02330Snap ResearchApr 2, 2026score 9~102 min
- AprThink in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoningvision2604.04746AI at MetaApr 6, 2026score 9~98 min
- AprMoRight: Motion Control Done Rightvision2604.07348NVIDIAApr 8, 2026score 3~110 min
- AprWildDet3D: Scaling Promptable 3D Detection in the Wildvision2604.08626Allen Institute for AIApr 9, 2026score 3~124 min
- AprELT: Elastic Looped Transformers for Visual Generationvision2604.09168DeepmindApr 10, 2026score 9~111 min
- AprLyra 2.0: Explorable Generative 3D Worldsvision2604.13036NVIDIAApr 14, 2026score 3~102 min
- AprTstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Itemsvision2604.19748alibaba-incApr 21, 2026~107 min
- MarLumosX: Relate Any Identities with Their Attributes for Personalized Video Generationagents2603.20192Alibaba DAMOMar 20, 2026score 4~109 min
- MarUnify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesisagents2603.29620Tencent HunyuanMar 31, 2026score 8~107 min
- MarVersatile Editing of Video Content, Actions, and Dynamics without Trainingdiffusion2603.17989DeepmindMar 18, 2026score 3~122 min
- MarOmni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Modelsevaluation2603.22212alibaba-incMar 23, 2026score 6~118 min
- MarBizGenEval: A Systematic Benchmark for Commercial Visual Content Generationevaluation2603.25732Microsoft ResearchMar 26, 2026score 3~121 min
- MarRealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluationevaluation2603.25804QwenMar 26, 2026score 4~89 min
- MarUnified Spatio-Temporal Token Scoring for Efficient Video VLMsinference-optimization2603.18004Ai2Mar 18, 2026score 9~114 min
- MarArtLLM: Generating Articulated Assets via 3D LLMmultimodal2603.01142Tencent HunyuanMar 1, 2026score 2~105 min
- MarUniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representationsmultimodal2603.10702Tencent HunyuanMar 11, 2026score 6~110 min
- MarCodePercept: Code-Grounded Visual STEM Perception for MLLMsmultimodal2603.10757QwenMar 11, 2026score 9~103 min
- MarSpatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Trainingmultimodal2603.12255Tencent HunyuanMar 12, 2026score 9~139 min
- MarQianfan-OCR: A Unified End-to-End Model for Document Intelligencemultimodal2603.13398BAIDUMar 11, 2026score 9~134 min
- MarLongCat-Next: Lexicalizing Modalities as Discrete Tokensmultimodal2603.27538Meituan LongCatMar 29, 2026score 9~113 min
- MarDreamLite: A Lightweight On-Device Unified Model for Image Generation and Editingmultimodal2603.28713ByteDanceMar 30, 2026score 6~111 min
- MarV-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learningpretraining2603.14482Meta LlamaMar 15, 2026score 7~123 min
- MarUniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generationrl-training2603.23500ByteDance SeedMar 24, 2026score 9~101 min
- MarRepresentation Alignment for Just Image Transformers is not Easier than You Thinktraining-methods2603.14366KAIST AIMar 15, 2026score 8~128 min
- MarManifold-Aware Exploration for Reinforcement Learning in Video Generationtraining-methods2603.21872Tencent HunyuanMar 23, 2026score 9~110 min
- MarSpatialBoost: Enhancing Visual Representation through Language-Guided Reasoningtraining-methods2603.22057KAIST AIMar 23, 2026score 6~115 min
- MarSIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLMuncategorized2603.23386ByteDance SeedMar 24, 2026score 3~116 min
- MarHiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Imagesvision2603.02210ByteDanceMar 2, 2026score 3~97 min
- MarLoGeR: Long-Context Geometric Reconstruction with Hybrid Memoryvision2603.03269DeepmindMar 3, 2026score 9~132 min
- MarHelios: Real Real-Time Long Video Generation Modelvision2603.04379NVIDIAMar 4, 2026score 9~109 min
- MarHiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoisingvision2603.08703Tencent HunyuanMar 9, 2026score 9~125 min
- MarDreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learningvision2603.12257TongyiLabMar 12, 2026score 4~107 min
- MarVisual-ERM: Reward Modeling for Visual Equivalencevision2603.13224InternLM / Shanghai AI LabMar 13, 2026score 9~127 min
- MarGrounding World Simulation Models in a Real-World Metropolisvision2603.15583NAVER AI LabMar 16, 2026score 9~120 min
- MarSAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editingvision2603.19228BAIDUMar 19, 2026score 3~105 min
- MarRepurposing Geometric Foundation Models for Multi-view Diffusionvision2603.22275KAIST AIMar 23, 2026score 3~90 min
- MarDA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Modelsvision2603.23499KAIST AIMar 24, 2026score 2~104 min
- FebRynnBrain: Open Embodied Foundation Modelsagents2602.14979Alibaba DAMOFeb 13, 2026score 9~112 min
- FebFSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Spacearchitecture2602.02092ByteDanceFeb 2, 2026score 9~118 min
- FebUniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Modelarchitecture2602.14178ByteDanceFeb 15, 2026score 9~131 min
- FebHY3D-Bench: Generation of 3D Assetsdata2602.03907Tencent HunyuanFeb 3, 2026score 2~113 min
- FebFrom Scale to Speed: Adaptive Test-Time Scaling for Image Editingdiffusion2603.00141alibaba-incFeb 24, 2026score 6~106 min
- FebNarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Controlmultimodal2602.09070ByteDanceFeb 9, 2026score 2~110 min
- FebAdapting Vision-Language Models for E-commerce Understanding at Scalemultimodal2602.11733Feb 12, 2026~133 min
- FebA Mixed Diet Makes DINO An Omnivorous Vision Encodermultimodal2602.24181DeepmindFeb 27, 2026score 6~109 min
- FebVideoWorld 2: Learning Transferable Knowledge from Real-world Videospretraining2602.10102ByteDance SeedFeb 10, 2026score 2~107 min
- FebABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learningtraining-methods2602.11236Alibaba AMAP CV LabFeb 11, 2026score 2~111 min
- FebLIVE: Long-horizon Interactive Video World Modelinguncategorized2602.03747Microsoft ResearchFeb 3, 2026score 3~103 min
- FebDreamDojo: A Generalist Robot World Model from Large-Scale Human Videosuncategorized2602.06949NVIDIAFeb 6, 2026score 2~117 min
- FebBitDance: Scaling Autoregressive Generative Models with Binary Tokensuncategorized2602.14041ByteDanceFeb 15, 2026score 9~104 min
- FebMedXIAOHE: A Comprehensive Recipe for Building Medical MLLMsvision2602.12705ByteDanceFeb 13, 2026score 7~121 min
- FebSpanning the Visual Analogy Space with a Weight Basis of LoRAsvision2602.15727NVIDIAFeb 17, 2026score 2~110 min
- FebVGG-T$^3$: Offline Feed-Forward 3D Reconstruction at Scalevision2602.23361NVIDIAFeb 26, 2026score 2~97 min
- FebMode Seeking meets Mean Seeking for Fast Long Video Generationvision2602.24289NVIDIAFeb 27, 2026score 2~106 min
- JanThe Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generationagents2601.17737Tencent HunyuanJan 25, 2026score 2~118 min
- JanRigMo: Unifying Rig and Motion Learning for Generative Animationarchitecture2601.06378SnapJan 10, 2026score 1~115 min
- JanMHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Headarchitecture2601.07832DAGroup-PKUJan 12, 2026score 9~105 min
- JanImplicit Neural Representation Facilitates Unified Universal Vision Encodingarchitecture2601.14256TikTokJan 20, 2026score 2~109 min
- JanSAMTok: Representing Any Mask with Two Wordsarchitecture2601.16093ByteDanceJan 22, 2026score 9~122 min
- JanDeepSeek-OCR 2: Visual Causal Flowarchitecture2601.20552DeepSeekJan 28, 2026score 8~118 min
- JanDreamStyle: A Unified Framework for Video Stylizationdiffusion2601.02785ByteDanceJan 6, 2026score 2~109 min
- JanEverything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Modelsevaluation2601.20354alibaba-incJan 28, 2026score 2~100 min
- JanWorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Modelsevaluation2602.02537Moonshot AIJan 28, 2026score 5~108 min
- JanEfficient Autoregressive Video Diffusion with Dummy Headinference-optimization2601.20499Microsoft ResearchJan 28, 2026score 7~106 min
- JanNextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generationmultimodal2601.02204ByteDanceJan 5, 2026score 9~124 min
- JanRethinking Video Generation Model for the Embodied Worldmultimodal2601.15282ByteDance SeedJan 21, 2026score 2~104 min
- JanThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editingrl-training2601.03467ByteDanceJan 6, 2026score 2~98 min
- JanVAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generationtraining-methods2601.02256ByteDanceJan 5, 2026score 5~115 min
- Jan360Anything: Geometry-Free Lifting of Images and Videos to 360°uncategorized2601.16192DeepmindJan 22, 2026score 2~106 min
- JanDreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformervision2601.01425ByteDanceJan 4, 2026score 2~125 min
- JanPlenoptic Video Generationvision2601.05239NVIDIAJan 8, 2026score 2~110 min
- JanOpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understandingvision2601.09575NVIDIAJan 14, 2026score 2~107 min
- JanFlowAct-R1: Towards Interactive Humanoid Video Generationvision2601.10103ByteDanceJan 15, 2026score 3~101 min
- JanUrban Socio-Semantic Segmentation with Vision-Language Reasoningvision2601.10477alibaba-incJan 15, 2026score 3~102 min
- JanMolmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Groundingvision2601.10611Jan 15, 2026score 9~97 min
- JanOmniTransfer: All-in-one Framework for Spatio-temporal Video Transfervision2601.14250ByteDanceJan 20, 2026score 2~97 min
- JaniFSQ: Improving FSQ for Image Generation with 1 Line of Codevision2601.17124Tencent HunyuanJan 23, 2026score 2~134 min
- JanTowards Pixel-Level VLM Perception via Simple Points Predictionvision2601.19228Moonshot AIJan 27, 2026score 4~100 min
- JanDreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learningvision2601.21716ByteDanceJan 29, 2026score 2~112 min
- DecSAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learningagents2512.13874Ai2Dec 15, 2025score 9~119 min
- DecAligned but Stereotypical? The Hidden Influence of System Prompts on Social Bias in LVLM-Based Text-to-Image Modelsalignment2512.04981KAIST AIDec 4, 2025score 4~119 min
- DecBlurDM: A Blur Diffusion Model for Image Deblurringarchitecture2512.03979NVIDIADec 3, 2025score 1~106 min
- DecFast-FoundationStereo: Real-Time Zero-Shot Stereo Matchingarchitecture2512.11130NVIDIADec 11, 2025score 4~108 min
- DecEgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editingdiffusion2512.06065SnapDec 5, 2025score 2~105 min
- DecTowards Scalable Pre-training of Visual Tokenizers for Generationdiffusion2512.13687MiniMaxDec 15, 2025~122 min
- DecQwen-Image-Layered: Towards Inherent Editability via Layer Decompositiondiffusion2512.15603Qwen / Alibaba CloudDec 17, 2025score 6~110 min
- DecEnd-to-End Training for Autoregressive Video Diffusion via Self-Resamplingdiffusion2512.15702ByteDance SeedDec 17, 2025score 10~101 min
- DecKnot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animationdiffusion2512.21734TongyiLabDec 25, 2025score 9~120 min
- DecMMGR: Multi-Modal Generative Reasoningevaluation2512.14691Dec 16, 2025~123 min
- DecUniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Drivingmultimodal2512.09864ByteDance SeedDec 10, 2025score 2~109 min
- DecOmni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalizationmultimodal2512.10955Snap ResearchDec 11, 2025score 5~100 min
- DecEasyV2V: A High-quality Instruction-based Video Editing Frameworkmultimodal2512.16920Snap ResearchDec 18, 2025score 2~105 min
- Dec4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillationmultimodal2512.17012NVIDIADec 18, 2025score 6~109 min
- DecBridging Your Imagination with Audio-Video Generation via a Unified Directormultimodal2512.23222ByteDanceDec 29, 2025score 6~102 min
- DecMasking Teacher and Reinforcing Student for Distilling Vision-Language Modelstraining-methods2512.22238NVIDIADec 23, 2025score 9~102 min
- DecDivide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understandingvision2512.04000Microsoft ResearchDec 3, 2025score 8~110 min
- DecSCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representationsvision2512.05905Zhipu / GLMDec 5, 2025score 2~109 min
- DecLongCat-Image Technical Reportvision2512.07584Meituan LongCatDec 8, 2025score 6~124 min
- DecEgoX: Egocentric Video Generation from a Single Exocentric Videovision2512.08269KAIST AIDec 9, 2025score 2~115 min
- DecWan-Move: Motion-controllable Video Generation via Latent Trajectory Guidancevision2512.08765TongyiLabDec 9, 2025score 2~110 min
- DecEvaluating Gemini Robotics Policies in a Veo World Simulatorvision2512.10675DeepmindDec 11, 2025score 4~115 min
- DecVector Prism: Animating Vector Graphics by Stratifying Semantic Structurevision2512.14336KAIST AIDec 16, 2025score 3~113 min
- DecNative and Compact Structured Latents for 3D Generationvision2512.14692Microsoft ResearchDec 16, 2025~96 min
- DecInfinite-Homography as Robust Conditioning for Camera-Controlled Video Generationvision2512.17040KAIST AIDec 18, 2025score 5~111 min
- DecInsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertionvision2512.17504KAIST AIDec 19, 2025score 2~120 min
- DecStoryMem: Multi-shot Long Video Storytelling with Memoryvision2512.19539ByteDanceDec 22, 2025score 3~115 min
- DecQuantile Rendering: Efficiently Embedding High-dimensional Feature on 3D Gaussian Splattingvision2512.20927NVIDIADec 24, 2025score 3~128 min
- DecDreaMontage: Arbitrary Frame-Guided One-Shot Video Generationvision2512.21252ByteDanceDec 24, 2025score 2~96 min
- DecDreamOmni3: Scribble-based Editing and Generationvision2512.22525ByteDanceDec 27, 2025score 5~119 min
- NovRobot Learning from a Physical World Modelagents2511.07416DeepmindNov 10, 2025score 2~105 min
- NovLumine: An Open Recipe for Building Generalist Agents in 3D Open Worldsagents2511.08892ByteDance SeedNov 12, 2025score 6~115 min
- NovPart-X-MLLM: Part-aware 3D Multimodal Large Language Modelagents2511.13647Tencent HunyuanNov 17, 2025score 9~107 min
- NovDynamic Reflections: Probing Video Representations with Text Alignmentalignment2511.02767DeepMindNov 4, 2025score 9~115 min
- NovVideo Generation Models Are Good Latent Reward Modelsalignment2511.21541Tencent HunyuanNov 26, 2025score 8~104 min
- NovUniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedbackdiffusion2511.01678Alibaba DAMONov 3, 2025score 2~115 min
- NovBlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generationdiffusion2511.22973DAMO AcademyNov 28, 2025score 7~116 min
- NovWhen Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thoughtevaluation2511.02779ByteDance SeedNov 4, 2025score 8~114 min
- NovNVIDIA Nemotron Nano V2 VLmultimodal2511.03929NVIDIANov 6, 2025score 9~122 min
- NovVADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Modelsmultimodal2511.07299NVIDIANov 10, 2025score 2~110 min
- NovHunyuanOCR Technical Reportmultimodal2511.19575Tencent HunyuanNov 24, 2025score 9~146 min
- NovNVIDIA Nemotron Parse 1.1multimodal2511.20478NVIDIANov 25, 2025score 9~127 min
- NovQwen3-VL Technical Reportmultimodal2511.21631Nov 26, 2025~107 min
- NovOlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observationpretraining2511.13655Ai2Nov 17, 2025score 6~130 min
- NovThink Visually, Reason Textually: Vision-Language Synergy in ARCreasoning2511.15703Intern Large ModelsNov 19, 2025score 9~105 min
- NovRevisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalizationtraining-methods2511.22586ByteDance SeedNov 27, 2025score 9~113 min
- NovLearning Vision-Driven Reactive Soccer Skills for Humanoid Robotsuncategorized2511.03996ByteDance SeedNov 6, 2025score 2~136 min
- NovRynnVLA-002: A Unified Vision-Language-Action and World Modeluncategorized2511.17502DAMO AcademyNov 21, 2025score 6~109 min
- NovVisual Spatial Tuningvision2511.05491ByteDance SeedNov 7, 2025score 9~119 min
- NovDepth Anything 3: Recovering the Visual Space from Any Viewsvision2511.10647Nov 13, 2025~100 min
- NovInstruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Datasetvision2511.15186KAIST AINov 19, 2025score 2~116 min
- NovNaTex: Seamless Texture Generation as Latent Color Diffusionvision2511.16317Tencent HunyuanNov 20, 2025score 2~101 min
- NovHunyuanVideo 1.5 Technical Reportvision2511.18870Tencent HunyuanNov 24, 2025score 5~112 min
- NovPixelDiT: Pixel Diffusion Transformers for Image Generationvision2511.20645NVIDIANov 25, 2025score 9~106 min
- NovZ-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformervision2511.22699Tongyi-MAINov 27, 2025score 9~108 min
- OctDiffusion Transformers with Representation Autoencodersarchitecture2510.11690Oct 13, 2025~117 min
- OctJanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligencecode2510.23538InternLM / Shanghai AI LabOct 27, 2025score 6~97 min
- OctSelf-Forcing++: Towards Minute-Scale High-Quality Video Generationdiffusion2510.02283ByteDance SeedOct 2, 2025score 10~133 min
- OctVideo-As-Prompt: Unified Semantic Control for Video Generationdiffusion2510.20888ByteDance SeedOct 23, 2025score 5~122 min
- OctSprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformersdiffusion2510.21986SnapOct 24, 2025score 9~110 min
- OctGenerative Universal Verifier as Multimodal Meta-Reasonermultimodal2510.13804ByteDance SeedOct 15, 2025score 8~106 min
- OctPaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Modelmultimodal2510.14528Baidu ResearchOct 16, 2025~118 min
- OctOmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLMmultimodal2510.15870NVIDIAOct 17, 2025score 10~108 min
- OctRL makes MLLMs see better than SFTmultimodal2510.16333NAVER AI LabOct 18, 2025score 9~100 min
- OctGrasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMsmultimodal2510.18876ByteDanceOct 21, 2025score 4~92 min
- OctolmOCR 2: Unit Test Rewards for Document OCRmultimodal2510.19817Ai2Oct 22, 2025score 9~115 min
- OctVoMP: Predicting Volumetric Mechanical Property Fieldsmultimodal2510.22975NVIDIAOct 27, 2025score 2~122 min
- OctRevisiting Multimodal Positional Encoding in Vision-Language Modelsmultimodal2510.23095QwenOct 27, 2025score 10~105 min
- OctHeptapod: Language Modeling on Visual Signalspretraining2510.06673ByteDance SeedOct 8, 2025score 9~128 min
- OctOpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidencereasoning2510.20579OpenAIOct 23, 2025score 9~97 min
- OctUnified Reinforcement and Imitation Learning for Vision-Language Modelstraining-methods2510.19307NVIDIAOct 22, 2025score 9~87 min
- OctHigh-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian Splattinguncategorized2510.10637DAMO AcademyOct 12, 2025score 3~114 min
- OctFrom Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priorsuncategorized2510.17439ByteDance SeedOct 20, 2025score 9~122 min
- OctChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulationvision2510.04290NVIDIAOct 5, 2025score 2~105 min
- OctTrace Anything: Representing Any Video in 4D via Trajectory Fieldsvision2510.13802ByteDance SeedOct 15, 2025score 2~108 min
- OctDeepSeek-OCR: Contexts Optical Compressionvision2510.18234DeepSeekOct 21, 2025score 9~115 min
- OctDSI-Bench: A Benchmark for Dynamic Spatial Intelligencevision2510.18873alibaba-incOct 21, 2025score 8~102 min
- OctSeed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assetsvision2510.19944ByteDance SeedOct 22, 2025score 5~112 min
- OctLayerComposer: Multi-Human Personalized Generation via Layered Canvasvision2510.20820Snap ResearchOct 23, 2025score 3~109 min
- OctTowards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculumvision2510.27571Alibaba DAMOOct 31, 2025score 8~135 min
- OctSpatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learningvision2510.27606InternLM / Shanghai AI LabOct 31, 2025score 9~124 min
- OctWorld Simulation with Video Foundation Models for Physical AIvision2511.00062NVIDIAOct 28, 2025score 4~128 min
- SepHunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assetsarchitecture2509.21245Tencent HunyuanSep 25, 2025score 3~93 min
- SepSANA-Video: Efficient Video Generation with Block Linear Diffusion Transformerarchitecture2509.24695NVIDIASep 29, 2025score 8~105 min
- SepHunyuan3D Studio: End-to-End AI Pipeline for Game-Ready 3D Asset Generationdiffusion2509.12815Sep 16, 2025score 3~119 min
- SepLongLive: Real-time Interactive Long Video Generationllm-systems2509.22622NVIDIASep 26, 2025score 6~111 min
- SepSAIL-VL2 Technical Reportmultimodal2509.14033Sep 17, 2025~130 min
- SepVideo models are zero-shot learners and reasonersmultimodal2509.20328DeepMindSep 24, 2025~135 min
- SepLLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Trainingmultimodal2509.23661Sep 28, 2025score 9~125 min
- SepDA$^{2}$: Depth Anything in Any Directionscaling-laws2509.26618Tencent HunyuanSep 30, 2025score 9~100 min
- SepManipulation as in Simulation: Enabling Accurate Geometry Perception in Robotsuncategorized2509.02530ByteDance SeedSep 2, 2025score 2~106 min
- SepP3-SAM: Native 3D Part Segmentationvision2509.06784Tencent HunyuanSep 8, 2025score 6~116 min
- SepAToken: A Unified Tokenizer for Visionvision2509.14476AppleSep 17, 2025~104 min
- SepLynx: Towards High-Fidelity Personalized Video Generationvision2509.15496ByteDance SeedSep 19, 2025score 6~96 min
- SepV2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughtsvision2509.18053NVIDIASep 22, 2025score 3~97 min
- SepZero-Shot Multi-Spectral Learning: Reimagining a Generalist Multimodal Gemini 2.5 Model for Remote Sensing Applicationsvision2509.19087Sep 23, 2025score 3~112 min
- SepDC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencodervision2509.25182NVIDIASep 29, 2025score 6~105 min
- AugQwen-Image Technical Reportmultimodal2508.02324Qwen / Alibaba CloudAug 4, 2025~137 min
- AugDINOv3vision2508.10104Meta AI / FAIRAug 13, 2025~120 min
- AugAutoregressive Universal Video Segmentation Modelvision2508.19242Aug 26, 2025~108 min
- JulLocality-aware Parallel Decoding for Efficient Autoregressive Image Generationinference-optimization2507.01957Jul 2, 2025score 9~111 min
- JulTraceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodologymultimodal2507.07999OpenAIJul 10, 2025score 8~99 min
- JulScaling RL to Long Videosrl-training2507.07966Jul 10, 2025~98 min
- JulToken Bottleneck: One Token to Remember Dynamicstraining-methods2507.06543NAVER AI LabJul 9, 2025score 5~116 min
- JulARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shortstraining-methods2507.20939TencentJul 28, 2025score 9~125 min
- JulAI-Generated Video Detection via Perceptual Straighteningvision2507.00583DeepMindJul 1, 2025~130 min
- JulHunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixelsvision2507.21809Tencent HunyuanJul 29, 2025score 3~105 min
- JunHunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Materialdiffusion2506.15442Tencent HunyuanJun 18, 2025score 2~104 min
- JunGUI-Actor: Coordinate-Free Visual Grounding for GUI Agentsvision2506.03143Microsoft ResearchJun 3, 2025score 9~98 min
- JunSeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Trainingvision2506.05301ByteDance SeedJun 5, 2025score 8~104 min
- JunCyberV: Cybernetics for Test-time Scaling in Video Understandingvision2506.07971ByteDanceJun 9, 2025score 8~125 min
- JunHunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Detailsvision2506.16504Jun 19, 2025score 3~106 min
- JunHunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Conditionvision2506.17201Tencent HunyuanJun 20, 2025score 2~116 min
- MayHunyuan-Game: Industrial-grade Intelligent Game Creation Modelagents2505.14135May 20, 2025score 4~195 min
- MayHunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generationarchitecture2505.04512Tencent HunyuanMay 7, 2025score 3~117 min
- MayVSA: Faster Video Diffusion with Trainable Sparse Attentiondiffusion2505.13389May 19, 2025score 9~105 min
- MaySparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutationinference-optimization2505.18875May 24, 2025score 9~93 min
- MayG1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learningtraining-methods2505.13426Moonshot AIMay 19, 2025score 9~102 min
- MayMAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglementvision2505.23742ByteDanceMay 29, 2025score 2~91 min
- AprOpen-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resourcesmultimodal2504.00595Apr 1, 2025score 9~95 min
- AprSmolVLM: Redefining small and efficient multimodal modelsmultimodal2504.05299Hugging Face Smol ModelsApr 7, 2025~116 min
- AprThe Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformermultimodal2504.10462ByteDanceApr 14, 2025score 8~103 min
- AprPixel-SAIL: Single Transformer For Pixel-Grounded Understandingmultimodal2504.10465ByteDanceApr 14, 2025score 9~120 min
- AprEagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Modelsmultimodal2504.15271NVIDIAApr 21, 2025score 9~103 min
- AprSphereDiff: Tuning-free 360° Static and Dynamic Panorama Generation via Spherical Latent Representationvision2504.14396KAIST AIApr 19, 2025score 2~98 min
- MarCube: A Roblox View of 3D Intelligencearchitecture2503.15475RobloxMar 19, 2025~109 min
- MarGemma 3 Technical Reportarchitecture2503.19786Google ResearchMar 25, 2025~112 min
- MarUVE: Are MLLMs Unified Evaluators for AI-Generated Videos?evaluation2503.09949ByteDance SeedMar 13, 2025score 6~111 min
- MarTraining Video Foundation Models with NVIDIA NeMotraining-methods2503.12964NVIDIAMar 17, 2025score 6~127 min
- FebQwen2.5-VL Technical Reportmultimodal2502.13923Qwen / Alibaba CloudFeb 19, 2025~122 min
- FebSigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Featuresmultimodal2502.14786Google ResearchFeb 20, 2025score 8~116 min
- FebolmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Modelsmultimodal2502.18443Feb 25, 2025~135 min
- JanHunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generationllm-systems2501.12202Tencent HunyuanJan 21, 2025score 6~119 min
- JanSa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videosmultimodal2501.04001ByteDance SeedJan 7, 2025score 8~109 min
- JanOmni-RGPT: Unifying Image and Video Region-level Understanding via Token Marksmultimodal2501.08326NVIDIAJan 14, 2025score 9~104 min
- JanCosmos World Foundation Model Platform for Physical AIpretraining2501.03575NVIDIAJan 6, 2025score 5~137 min
- JanAn Empirical Study of Autoregressive Pre-training from Videospretraining2501.05453Jan 9, 2025~102 min
- JanSeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restorationvision2501.01320ByteDance SeedJan 2, 2025score 5~98 min
- DecLAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotationsdata2412.08580Dec 11, 2024score 6~88 min
- DecNVILA: Efficient Frontier Visual Language Modelsllm-systems2412.04468Dec 5, 2024~117 min
- DecPaliGemma 2: A Family of Versatile VLMs for Transfermultimodal2412.03555Google ResearchDec 4, 2024score 9~114 min
- DecApollo: An Exploration of Video Understanding in Large Multimodal Modelsmultimodal2412.10360Dec 13, 2024~111 min
- DecVLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Modelstraining-methods2412.01822NVIDIADec 2, 2024score 9~97 min
- DecParallelized Autoregressive Visual Generationvision2412.15119Dec 19, 2024score 9~103 min
- NovLLaVA-o1: Let Vision Language Models Reason Step-by-Steptraining-methods2411.10440Nov 15, 2024score 10~100 min
- OctJanus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generationmultimodal2410.13848DeepSeekOct 17, 2024score 8~79 min
- OctDocument Parsing Unveiled: Techniques, Challenges, and Prospects for
Structured Information Extractionvision2410.21169Oct 28, 2024score 10~114 min
- SepNVLM: Open Frontier-Class Multimodal LLMsmultimodal2409.11402Sep 17, 2024~107 min
- SepQwen2-VL: Enhancing Vision-Language Model's Perception of the World at
Any Resolutionmultimodal2409.12191Qwen / Alibaba CloudSep 18, 2024score 9~112 min
- SepOryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolutionmultimodal2409.12961Sep 19, 2024score 9~102 min
- SepEmu3: Next-Token Prediction is All You Needmultimodal2409.18869Sep 27, 2024~122 min
- SepMM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-Tuningmultimodal2409.20566AppleSep 30, 2024~110 min
- AugCogVideoX: Text-to-Video Diffusion Models with An Expert Transformerdiffusion2408.06072Zhipu / GLMAug 12, 2024score 3~121 min
- AugLLaVA-OneVision: Easy Visual Task Transfermultimodal2408.03326Aug 6, 2024score 9~112 min
- AugSAM 2: Segment Anything in Images and Videosvision2408.00714Meta AI / FAIRAug 1, 2024score 9~135 min
- AugBuilding and better understanding vision-language models: insights and
future directionsvision2408.12637Aug 22, 2024score 10~96 min
- JulInternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Outputmultimodal2407.03320InternLM / Shanghai AI LabJul 3, 2024score 9~105 min
- JunRVT-2: Learning Precise Manipulation from Few Demonstrationsagents2406.08545NVIDIAJun 12, 2024score 2~107 min
- JunGenAI Arena: An Open Evaluation Platform for Generative Modelsevaluation2406.04485Jun 6, 2024score 9~98 min
- MayAn Introduction to Vision-Language Modelingmultimodal2405.17247May 27, 2024~111 min
- MayPose Priors from Language Modelsvision2405.03689DeepMindMay 6, 2024~111 min
- AprLLM2Vec: Large Language Models Are Secretly Powerful Text Encodersllm-systems2404.05961Apr 9, 2024~105 min
- AprInternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HDmultimodal2404.06512Apr 9, 2024score 9~102 min
- MarDeepSeek-VL: Towards Real-World Vision-Language Understandingmultimodal2403.05525DeepSeekMar 8, 2024score 9~88 min
- MarMini-Gemini: Mining the Potential of Multi-modality Vision Language Modelsmultimodal2403.18814Mar 27, 2024score 9~109 min
- MarFrozen Feature Augmentation for Few-Shot Image Classificationvision2403.10519DeepMindMar 15, 2024~122 min
- FebWorld Model on Million-Length Video And Language With Blockwise RingAttentionllm-systems2402.08268Feb 13, 2024score 9~106 min
- FebGenie: Generative Interactive Environmentspretraining2402.15391DeepMindFeb 23, 2024score 9~111 min
- JanMoonshot: Towards Controllable Video Generation and Editing with
Multimodal Conditionsdiffusion2401.01827Jan 3, 2024score 5~113 min
- JanInternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Modelmultimodal2401.16420InternLM / Shanghai AI LabJan 29, 2024score 9~91 min
- DecGemini: A Family of Highly Capable Multimodal Modelsmultimodal2312.11805Google ResearchDec 19, 2023~123 min
- DecGemini vs GPT-4V: A Preliminary Comparison and Combination of
Vision-Language Models Through Qualitative Casesmultimodal2312.15011Dec 22, 2023score 5~118 min
- DecVILA: On Pre-training for Visual Language Modelsvision2312.07533Dec 12, 2023score 9~90 min
- DecA Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertisevision2312.12436Dec 19, 2023score 9~92 min
- DecZero-Shot Metric Depth with a Field-of-View Conditioned Diffusion Modelvision2312.13252DeepMindDec 20, 2023score 9~103 min
- NovMirasol3B: A Multimodal Autoregressive Model for Time-Aligned and Contextual Modalitiesmultimodal2311.05698DeepMindNov 9, 2023score 6~120 min
- NovParameter-Efficient Orthogonal Finetuning via Butterfly Factorizationtraining-methods2311.06243Nov 10, 2023score 9~102 min
- NovFlorence-2: Advancing a Unified Representation for a Variety of Vision
Tasksvision2311.06242Microsoft ResearchNov 10, 2023score 8~100 min
- NovLearning and Controlling Silicon Dopant Transitions in Graphene using Scanning Transmission Electron Microscopyvision2311.17894DeepMindNov 21, 2023~117 min
- OctImproved Baselines with Visual Instruction Tuningmultimodal2310.03744Stability AIOct 5, 2023score 9~103 min
- OctConvNets Match Vision Transformers at Scalevision2310.16764Oct 25, 2023score 9~119 min
- SepM3DSYNTH: A DATASET OF MEDICAL 3D IMAGES WITH AI-GENERATED LOCAL MANIPULATIONSdata2309.07973Sep 14, 2023~120 min
- SepAn Empirical Study of Scaling Instruct-Tuned Large Multimodal Modelsmultimodal2309.09958Sep 18, 2023score 9~101 min
- SepReplacing softmax with ReLU in Vision Transformersvision2309.08586Sep 15, 2023~96 min
- AugFrom Sparse to Soft Mixture of Expertsarchitecture2308.00951DeepMindAug 2, 2023score 9~109 min
- AugMirror-NeRF: Learning Neural Radiance Fields for Mirrors with
Whitted-Style Ray Tracingno summary yetcs-cv2308.0328030 citesAug 7, 2023score 2
- MayInstructBLIP: Towards General-purpose Vision-Language Models with
Instruction Tuningmultimodal2305.06500SalesforceMay 11, 2023score 9~101 min
- MayRead Moremultimodal2305.18274EleutherAIMay 29, 2023score 1~126 min
- AprLLaVA: Visual Instruction Tuningmultimodal2304.08485Apr 17, 2023~91 min
- AprMiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Modelsmultimodal2304.10592Apr 20, 2023~99 min
- AprDINOv2: Learning Robust Visual Features without Supervisionpretraining2304.07193Meta AI / FAIRApr 14, 2023~104 min
- AprSegment Anythingvision2304.02643Meta AI / FAIRApr 5, 2023~122 min
- FebThe geometry of hidden representations of large transformer modelsscaling-laws2302.00294Feb 1, 2023~127 min
- FebAdding Conditional Control to Text-to-Image Diffusion Modelsvision2302.05543Stability AIFeb 10, 2023~111 min
- JanBLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Modelsmultimodal2301.12597SalesforceJan 30, 2023~119 min
- DecHigh-Resolution Image Synthesis with Latent Diffusion Modelsdiffusion2112.10752AppleDec 20, 2021~128 min
- NovFlorence: A New Foundation Model for Computer Visionvision2111.11432Nov 22, 2021~118 min
- JulALBEF: Align Before Fusemultimodal2107.07651Jul 16, 2021~118 min
- MayMLP-Mixer: An all-MLP Architecture for Visionvision2105.016012 citesMay 4, 2021~103 min
- AprEmerging Properties in Self-Supervised Vision Transformersvision2104.14294Meta AI / FAIRApr 29, 2021~128 min
- MarCoordinate Attention for Efficient Mobile Network Designvision2103.02907Mar 4, 2021~97 min
- MarSwin Transformer: Hierarchical Vision Transformer Using Shifted Windowsvision2103.14030Microsoft ResearchMar 25, 2021~120 min
- FebZero-Shot Text-to-Image Generationarchitecture2102.120921,134 citesFeb 24, 2021~111 min
- FebViLT: Vision-and-Language Transformer Without Convolution or Region Supervisionmultimodal2102.03334Feb 5, 2021~128 min
- FebALIGN: Large-Scale Image-Text Representation Learning with Noisy Text Supervisionmultimodal2102.05918Kakao Brain1,196 citesFeb 11, 2021~111 min
- FebA Fast Transformer Decoding System with Better Memory Bandwidth Utilizationmultimodal2103.00020Apple5,296 citesFeb 26, 2021~130 min
- FebPyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutionsvision2102.12122Feb 24, 2021~94 min
- JanTokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNetarchitecture2101.11986Jan 28, 2021~113 min
- JanVinVL: Revisiting Visual Representations in Vision-Language Modelsmultimodal2101.00529Jan 2, 2021~103 min
- DecTraining data-efficient image transformers & distillation through attentionvision2012.12877Meta AI / FAIRDec 23, 2020~106 min
- OctScaling Laws for Autoregressive Generative Modelingscaling-laws2010.14701Oct 28, 2020~128 min
- OctAn Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.vision2010.11929Apple21,567 citesOct 22, 2020~101 min
- JunDenoising Diffusion Probabilistic Modelsdiffusion2006.11239Jun 19, 2020~118 min
- JunBootstrap Your Own Latent: A New Approach to Self-Supervised Learningpretraining2006.077333,445 citesJun 13, 2020~122 min
- MayEnd-to-End Object Detection with Transformersvision2005.12872Meta AI / FAIR831 citesMay 26, 2020~116 min
- AprOSCAR: Object-Semantics Aligned Pre-training for Vision-Language Tasksmultimodal2004.06165135 citesApr 13, 2020~128 min
- MarNeRF: Representing Scenes as Neural Radiance Fields for View Synthesisvision2003.08934526 citesMar 19, 2020~114 min
- FebA Simple Framework for Contrastive Learning of Visual Representationsvision2002.05709Microsoft Research7,333 citesFeb 13, 2020~114 min
- DecRethinking the Inception Architecture for Computer Visionvision1512.00567OpenAI565 citesDec 2, 2015~115 min
- DecDeep Residual Learning for Image Recognitionvision1512.03385AppleDec 10, 2015~106 min
- NovUnsupervised Representation Learning with Deep Convolutional Generative Adversarial Networkspretraining1511.06434Stitch FixNov 19, 2015~111 min
- JunFaster R-CNN: Towards Real-Time Object Detection with Region Proposal Networksvision1506.014976,265 citesJun 4, 2015~105 min
- JunSpatial Transformer Networksvision1506.0202563 citesJun 5, 2015~122 min
- JunYou Only Look Once: Unified, Real-Time Object Detectionvision1506.02640Jun 8, 2015~97 min
- MayU-Net: Convolutional Networks for Biomedical Image Segmentationvision1505.04597May 18, 2015~115 min
- AprEnd-to-End Training of Deep Visuomotor Policiesrl-training1504.00702Apr 2, 2015~109 min
- AprFast R-CNNvision1504.080831,769 citesApr 30, 2015~120 min
- MarFaceNet: A Unified Embedding for Face Recognition and Clusteringvision1503.0383211,139 citesMar 12, 2015~111 min
- FebShow, Attend and Tell: Neural Image Caption Generation with Visual Attentionmultimodal1502.03044Feb 10, 2015~106 min
- FebDelving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classificationtraining-methods1502.01852Feb 6, 2015~99 min
- FebDRAW: A Recurrent Neural Network For Image Generationvision1502.04623965 citesFeb 16, 2015~121 min
- NovShow and Tell: A Neural Image Caption Generatormultimodal1411.4555186 citesNov 17, 2014~116 min
- NovConditional Generative Adversarial Netsvision1411.1784Nov 6, 2014~104 min
- NovFully Convolutional Networks for Semantic Segmentationvision1411.4038Nov 14, 2014~127 min
- SepGoing Deeper with Convolutionsarchitecture1409.48421,390 citesSep 17, 2014~113 min
- SepImageNet Large Scale Visual Recognition Challengevision1409.0575Sep 1, 2014~104 min
- SepVery Deep Convolutional Networks for Large-Scale Image Recognitionvision1409.1556Sep 4, 2014~129 min
- JunCaffe: Convolutional Architecture for Fast Feature Embeddingarchitecture1408.50934,309 citesJun 20, 2014~99 min
- JunSpatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognitionvision1406.4729Jun 18, 2014~110 min
- MayMicrosoft COCO: Common Objects in Contextvision1405.0312NVIDIAMay 1, 2014~98 min