2026
69- MayQwen-Image-2.0 Technical Reportarchitecture2605.10730QwenMay 11, 2026~115 min
- MayLens: Rethinking Training Efficiency for Foundational Text-to-Image Modelsdiffusion2605.21573Microsoft ResearchMay 20, 2026~117 min
- MayPiD: Fast and High-Resolution Latent Decoding with Pixel Diffusiondiffusion2605.23902NVIDIAMay 22, 2026~112 min
- MayEnhancing Train-Free Infinite-Frame Generation for Consistent Long Videosinference-optimization2605.18233alibaba-incMay 18, 2026~99 min
- MayContinuous Latent Diffusion Language Modelllm-systems2605.06548ByteDance SeedMay 7, 2026~125 min
- MayContinuous-Time Distribution Matching for Few-Step Diffusion Distillationtraining-methods2605.06376alibaba-incMay 7, 2026~110 min
- MaySANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformervision2605.15178NVIDIAMay 14, 2026~113 min
- MayFast 4D Mesh Generation by Spatio-Temporal Attention Chainsvision2605.19786NVIDIAMay 19, 2026~109 min
- MayFlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matchingvision2605.20910KAIST AIMay 20, 2026~133 min
- MayVideo Generation with Predictive Latentsno summary yetcs-cv2605.02134ByteDance SeedMay 4, 2026
- MayD-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Modelsno summary yetcs-cv2605.05204Tongyi-MAIMay 6, 2026
- MayWhat Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusionno summary yetcs-cv2605.07915alibaba-incMay 8, 2026
- MayFashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customizationno summary yetcs-cv2605.15824alibaba-incMay 15, 2026
- MayBernini: Latent Semantic Planning for Video Diffusionno summary yetcs-cv2605.22344ByteDanceMay 21, 2026
- AprSeedance 2.0: Advancing Video Generation for World Complexitydiffusion2604.14148ByteDance SeedApr 15, 2026score 3~127 min
- AprElucidating the SNR-t Bias of Diffusion Probabilistic Modelsdiffusion2604.16044alibaba-incApr 17, 2026~105 min
- AprCoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generationdiffusion2604.19636alibaba-incApr 21, 2026~120 min
- AprDMax: Aggressive Parallel Decoding for dLLMsinference-optimization2604.08302National University of SingaporeApr 9, 2026~108 min
- AprOmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generationmultimodal2604.11804ByteDanceApr 13, 2026score 3~110 min
- AprFP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scalingtraining-methods2604.06916NVIDIAApr 8, 2026~116 min
- AprContinuous Adversarial Flow Modelstraining-methods2604.11521ByteDance SeedApr 13, 2026score 8~119 min
- AprLeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectoriestraining-methods2604.15311ByteDance SeedApr 16, 2026score 8~110 min
- AprActionParty: Multi-Subject Action Binding in Generative Video Gamesvision2604.02330Snap ResearchApr 2, 2026score 9~102 min
- AprMoRight: Motion Control Done Rightvision2604.07348NVIDIAApr 8, 2026score 3~110 min
- AprELT: Elastic Looped Transformers for Visual Generationvision2604.09168DeepmindApr 10, 2026score 9~111 min
- AprLyra 2.0: Explorable Generative 3D Worldsvision2604.13036NVIDIAApr 14, 2026score 3~102 min
- MarLumosX: Relate Any Identities with Their Attributes for Personalized Video Generationagents2603.20192Alibaba DAMOMar 20, 2026score 4~109 min
- MarVersatile Editing of Video Content, Actions, and Dynamics without Trainingdiffusion2603.17989DeepmindMar 18, 2026score 3~122 min
- MarOn-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformersdiffusion2603.28762Snap ResearchMar 30, 2026score 6~104 min
- MarDreamLite: A Lightweight On-Device Unified Model for Image Generation and Editingmultimodal2603.28713ByteDanceMar 30, 2026score 6~111 min
- MarEndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Modelsreasoning2603.12252InternLM / Shanghai AI LabMar 12, 2026score 9~121 min
- MarRepresentation Alignment for Just Image Transformers is not Easier than You Thinktraining-methods2603.14366KAIST AIMar 15, 2026score 8~128 min
- MarBeyond Single Tokens: Distilling Discrete Diffusion Models via Discrete MMDtraining-methods2603.20155DeepmindMar 20, 2026score 9~109 min
- MarLingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cellsuncategorized2603.25240DAMO AcademyMar 26, 2026score 2~128 min
- MarHelios: Real Real-Time Long Video Generation Modelvision2603.04379NVIDIAMar 4, 2026score 9~109 min
- MarHiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoisingvision2603.08703Tencent HunyuanMar 9, 2026score 9~125 min
- MarDreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learningvision2603.12257TongyiLabMar 12, 2026score 4~107 min
- MarRepurposing Geometric Foundation Models for Multi-view Diffusionvision2603.22275KAIST AIMar 23, 2026score 3~90 min
- MarDA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Modelsvision2603.23499KAIST AIMar 24, 2026score 2~104 min
- FebFSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Spacearchitecture2602.02092ByteDanceFeb 2, 2026score 9~118 min
- FebProtein Autoregressive Modeling via Multiscale Structure Generationdiffusion2602.04883ByteDance SeedFeb 4, 2026score 1~107 min
- FebArcFlow: Unleashing 2-Step Text-to-Image Generation via High-Precision Non-Linear Flow Distillationdiffusion2602.09014Fudan UniversityFeb 9, 2026score 8~99 min
- FebSLA2: Sparse-Linear Attention with Learnable Routing and QATdiffusion2602.12675Feb 13, 2026~115 min
- FebFrom Scale to Speed: Adaptive Test-Time Scaling for Image Editingdiffusion2603.00141alibaba-incFeb 24, 2026score 6~106 min
- FebDFlash: Block Diffusion for Flash Speculative Decodinginference-optimization2602.06036Feb 5, 2026~116 min
- FebSpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuninginference-optimization2602.13515Feb 13, 2026~108 min
- FebNarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Controlmultimodal2602.09070ByteDanceFeb 9, 2026score 2~110 min
- FebDreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generationmultimodal2602.12160ByteDanceFeb 12, 2026score 3~121 min
- FebMolHIT: Advancing Molecular-Graph Generation with Hierarchical Discrete Diffusion Modelspretraining2602.17602KAIST AIFeb 19, 2026score 2~123 min
- FebLLaDA2.1: Speeding Up Text Diffusion via Token Editingtraining-methods2602.08676Feb 9, 2026~106 min
- FebLIVE: Long-horizon Interactive Video World Modelinguncategorized2602.03747Microsoft ResearchFeb 3, 2026score 3~103 min
- FebBitDance: Scaling Autoregressive Generative Models with Binary Tokensuncategorized2602.14041ByteDanceFeb 15, 2026score 9~104 min
- FebWorld Action Models are Zero-shot Policiesuncategorized2602.15922NVIDIA Deep Imagination ResearchFeb 17, 2026score 2~101 min
- FebMode Seeking meets Mean Seeking for Fast Long Video Generationvision2602.24289NVIDIAFeb 27, 2026score 2~106 min
- JanStable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Modelcode2601.15892ByteDance SeedJan 22, 2026score 8~142 min
- JanDreamStyle: A Unified Framework for Video Stylizationdiffusion2601.02785ByteDanceJan 6, 2026score 2~109 min
- JanTransition Matching Distillation for Fast Video Generationinference-optimization2601.09881NVIDIAJan 14, 2026score 9~115 min
- JanEfficient Autoregressive Video Diffusion with Dummy Headinference-optimization2601.20499Microsoft ResearchJan 28, 2026score 7~106 min
- JanTAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Expertsmoe2601.08881Tencent HunyuanJan 12, 2026score 7~101 min
- JanDIFFA-2: A Practical Diffusion Large Language Model for General Audio Understandingmultimodal2601.23161LongCatJan 30, 2026score 5~125 min
- JanDenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignmenttraining-methods2601.20218TongyiLabJan 28, 2026score 6~100 min
- JanCosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planninguncategorized2601.16163NVIDIAJan 22, 2026score 2~115 min
- Jan360Anything: Geometry-Free Lifting of Images and Videos to 360°uncategorized2601.16192DeepmindJan 22, 2026score 2~106 min
- JanDreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformervision2601.01425ByteDanceJan 4, 2026score 2~125 min
- JanPlenoptic Video Generationvision2601.05239NVIDIAJan 8, 2026score 2~110 min
- JanFlowAct-R1: Towards Interactive Humanoid Video Generationvision2601.10103ByteDanceJan 15, 2026score 3~101 min
- JanOmniTransfer: All-in-one Framework for Spatio-temporal Video Transfervision2601.14250ByteDanceJan 20, 2026score 2~97 min
- JaniFSQ: Improving FSQ for Image Generation with 1 Line of Codevision2601.17124Tencent HunyuanJan 23, 2026score 2~134 min
- JanDreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learningvision2601.21716ByteDanceJan 29, 2026score 2~112 min
2025
75- DecBlurDM: A Blur Diffusion Model for Image Deblurringarchitecture2512.03979NVIDIADec 3, 2025score 1~106 min
- DecEgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editingdiffusion2512.06065SnapDec 5, 2025score 2~105 min
- DecFew-Step Distillation for Text-to-Image Generation: A Practical Guidediffusion2512.13006Alibaba DAMODec 15, 2025score 6~86 min
- DecImage Diffusion Preview with Consistency Solverdiffusion2512.13592DeepmindDec 15, 2025score 7~99 min
- DecQwen-Image-Layered: Towards Inherent Editability via Layer Decompositiondiffusion2512.15603Qwen / Alibaba CloudDec 17, 2025score 6~110 min
- DecEnd-to-End Training for Autoregressive Video Diffusion via Self-Resamplingdiffusion2512.15702ByteDance SeedDec 17, 2025score 10~101 min
- DecLLaDA2.0: Scaling Up Diffusion Language Models to 100Bdiffusion2512.15745Dec 10, 2025~122 min
- DecKnot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animationdiffusion2512.21734TongyiLabDec 25, 2025score 9~120 min
- DecDEER: Draft with Diffusion, Verify with Autoregressive Modelsinference-optimization2512.15176Dec 17, 2025score 10~125 min
- DecTurboDiffusion: Accelerating Video Diffusion Models by 100-200 Timesinference-optimization2512.16093University of California, BerkeleyDec 18, 2025score 10~99 min
- DecSeedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Modelmultimodal2512.13507ByteDance SeedDec 15, 2025score 3~94 min
- DecEasyV2V: A High-quality Instruction-based Video Editing Frameworkmultimodal2512.16920Snap ResearchDec 18, 2025score 2~105 min
- DecDirectional Textual Inversion for Personalized Text-to-Image Generationtraining-methods2512.13672KAIST AIDec 15, 2025score 5~102 min
- DecEfficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speedtraining-methods2512.14067NVIDIADec 16, 2025score 9~107 min
- DecSCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representationsvision2512.05905Zhipu / GLMDec 5, 2025score 2~109 min
- DecEgoX: Egocentric Video Generation from a Single Exocentric Videovision2512.08269KAIST AIDec 9, 2025score 2~115 min
- DecWan-Move: Motion-controllable Video Generation via Latent Trajectory Guidancevision2512.08765TongyiLabDec 9, 2025score 2~110 min
- DecInfinite-Homography as Robust Conditioning for Camera-Controlled Video Generationvision2512.17040KAIST AIDec 18, 2025score 5~111 min
- DecInsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertionvision2512.17504KAIST AIDec 19, 2025score 2~120 min
- DecStoryMem: Multi-shot Long Video Storytelling with Memoryvision2512.19539ByteDanceDec 22, 2025score 3~115 min
- DecDreaMontage: Arbitrary Frame-Guided One-Shot Video Generationvision2512.21252ByteDanceDec 24, 2025score 2~96 min
- NovTiDAR: Think in Diffusion, Talk in Autoregressionarchitecture2511.08923NVIDIANov 12, 2025score 9~120 min
- NovUniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedbackdiffusion2511.01678Alibaba DAMONov 3, 2025score 2~115 min
- NovMMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generationdiffusion2511.09611ByteDanceNov 12, 2025score 9~109 min
- NovAdversarial Flow Modelsdiffusion2511.22475ByteDance SeedNov 27, 2025score 3~110 min
- NovDecoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shielddiffusion2511.22677Tongyi-MAINov 27, 2025score 4~114 min
- NovBlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generationdiffusion2511.22973DAMO AcademyNov 28, 2025score 7~116 min
- NovKLASS: KL-Guided Fast Inference in Masked Diffusion Modelsinference-optimization2511.05664KAIST AINov 7, 2025score 8~114 min
- NovHarmony: Harmonizing Audio and Video Generation through Cross-Task Synergymultimodal2511.21579Tencent HunyuanNov 26, 2025score 5~107 min
- NovNaTex: Seamless Texture Generation as Latent Color Diffusionvision2511.16317Tencent HunyuanNov 20, 2025score 2~101 min
- NovHunyuanVideo 1.5 Technical Reportvision2511.18870Tencent HunyuanNov 24, 2025score 5~112 min
- NovPixelDiT: Pixel Diffusion Transformers for Image Generationvision2511.20645NVIDIANov 25, 2025score 9~106 min
- NovZ-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformervision2511.22699Tongyi-MAINov 27, 2025score 9~108 min
- OctExploring Conditions for Diffusion models in Robotic Controlagents2510.15510NAVER AI LabOct 17, 2025score 2~102 min
- OctDiffusion Transformers with Representation Autoencodersarchitecture2510.11690Oct 13, 2025~117 min
- OctMoGA: Mixture-of-Groups Attention for End-to-End Long Video Generationarchitecture2510.18692ByteDanceOct 21, 2025score 9~116 min
- OctSelf-Forcing++: Towards Minute-Scale High-Quality Video Generationdiffusion2510.02283ByteDance SeedOct 2, 2025score 10~133 min
- OctTemporal Alignment Guidance: On-Manifold Sampling in Diffusion Modelsdiffusion2510.11057KAIST AIOct 13, 2025score 5~129 min
- OctAlphaFlow: Understanding and Improving MeanFlow Modelsdiffusion2510.20771SnapOct 23, 2025score 5~115 min
- OctVideo-As-Prompt: Unified Semantic Control for Video Generationdiffusion2510.20888ByteDance SeedOct 23, 2025score 5~122 min
- OctSprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformersdiffusion2510.21986SnapOct 24, 2025score 9~110 min
- OctBoundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Modelsinference-optimization2510.11683Z.aiOct 13, 2025score 9~120 min
- OctTC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion Controlllm-systems2510.09561NVIDIAOct 10, 2025score 3~86 min
- OctFine-Grained GRPO for Precise Preference Alignment in Flow Modelstraining-methods2510.01982IXCLab@Shanghai AI LabOct 2, 2025score 8~101 min
- OctLongCat-Video Technical Reportuncategorized2510.22200Meituan LongCatOct 25, 2025score 9~122 min
- OctChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulationvision2510.04290NVIDIAOct 5, 2025score 2~105 min
- OctWorld Simulation with Video Foundation Models for Physical AIvision2511.00062NVIDIAOct 28, 2025score 4~128 min
- SepSLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attentionarchitecture2509.24006Tsinghua UniversitySep 28, 2025score 10~110 min
- SepSANA-Video: Efficient Video Generation with Block Linear Diffusion Transformerarchitecture2509.24695NVIDIASep 29, 2025score 8~105 min
- SepHunyuan3D Studio: End-to-End AI Pipeline for Game-Ready 3D Asset Generationdiffusion2509.12815Sep 16, 2025score 3~119 min
- SepDC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Spacediffusion2509.25180NVIDIASep 29, 2025score 8~99 min
- SepSet Block Decoding is a Language Model Inference Acceleratorinference-optimization2509.04185Sep 4, 2025score 9~102 min
- SepFast-dLLM v2: Efficient Block-Diffusion LLMllm-systems2509.26328Sep 30, 2025~114 min
- SepLynx: Towards High-Fidelity Personalized Video Generationvision2509.15496ByteDance SeedSep 19, 2025score 6~96 min
- SepDC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencodervision2509.25182NVIDIASep 29, 2025score 6~105 min
- AugSeed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inferencecode2508.02193Aug 4, 2025score 9~115 min
- AugVibeVoice Technical Reportinference-optimization2508.19205Microsoft ResearchAug 26, 2025~119 min
- AugA Survey on Diffusion Language Modelsllm-systems2508.10875Aug 14, 2025~126 min
- JunHunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Materialdiffusion2506.15442Tencent HunyuanJun 18, 2025score 2~104 min
- JunLongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMsinference-optimization2506.14429Jun 17, 2025score 9~112 min
- JunSelf Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusiontraining-methods2506.08009Jun 9, 2025score 9~120 min
- JunSeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Trainingvision2506.05301ByteDance SeedJun 5, 2025score 8~104 min
- JunHunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Detailsvision2506.16504Jun 19, 2025score 3~106 min
- JunHunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Conditionvision2506.17201Tencent HunyuanJun 20, 2025score 2~116 min
- MayHunyuan-Game: Industrial-grade Intelligent Game Creation Modelagents2505.14135May 20, 2025score 4~195 min
- MayVSA: Faster Video Diffusion with Trainable Sparse Attentiondiffusion2505.13389May 19, 2025score 9~105 min
- MaySparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutationinference-optimization2505.18875May 24, 2025score 9~93 min
- MayFast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decodinginference-optimization2505.22618May 28, 2025score 10~107 min
- MayMMaDA: Multimodal Large Diffusion Language Modelsmultimodal2505.15809May 21, 2025~136 min
- MayMAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglementvision2505.23742ByteDanceMay 29, 2025score 2~91 min
- AprSphereDiff: Tuning-free 360° Static and Dynamic Panorama Generation via Spherical Latent Representationvision2504.14396KAIST AIApr 19, 2025score 2~98 min
- MarFlowTok: Flowing Seamlessly Across Text and Image Tokensarchitecture2503.10772ByteDance SeedMar 13, 2025score 9~117 min
- MarTraining Video Foundation Models with NVIDIA NeMotraining-methods2503.12964NVIDIAMar 17, 2025score 6~127 min
- JanHunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generationllm-systems2501.12202Tencent HunyuanJan 21, 2025score 6~119 min
- JanSeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restorationvision2501.01320ByteDance SeedJan 2, 2025score 5~98 min
2024
9- DecMultimodal Latent Language Modeling with Next-Token Diffusionarchitecture2412.08635Microsoft ResearchDec 11, 2024score 6~129 min
- DecParallelized Autoregressive Visual Generationvision2412.15119Dec 19, 2024score 9~103 min
- NovSmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformersinference-optimization2411.10510RobloxNov 15, 2024score 9~102 min
- SepA Diffusion Approach to Radiance Field Relighting using Multi-Illumination Synthesisno summary yetcs-cv2409.0894714 citesSep 13, 2024score 1
- AugCogVideoX: Text-to-Video Diffusion Models with An Expert Transformerdiffusion2408.06072Zhipu / GLMAug 12, 2024score 3~121 min
- AugTransfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Modelmultimodal2408.11039Aug 20, 2024score 9~106 min
- MayHunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understandingdiffusion2405.08748May 14, 2024score 9~110 min
- MarLightIt: Illumination Modeling and Control for Diffusion Modelsno summary yetcs-cv2403.106152 citesMar 15, 2024score 5
- JanMoonshot: Towards Controllable Video Generation and Editing with Multimodal Conditionsdiffusion2401.01827Jan 3, 2024score 5~113 min
2023
7- DecGenCast: Diffusion-based ensemble forecasting for medium-range weatherdiffusion2312.15796DeepMindDec 25, 2023~130 min
- DecZero-Shot Metric Depth with a Field-of-View Conditioned Diffusion Modelvision2312.13252DeepMindDec 20, 2023score 9~103 min
- NovParameter-Efficient Orthogonal Finetuning via Butterfly Factorizationtraining-methods2311.06243Nov 10, 2023score 9~102 min
- SepM3DSYNTH: A DATASET OF MEDICAL 3D IMAGES WITH AI-GENERATED LOCAL MANIPULATIONSdata2309.07973Sep 14, 2023~120 min
- JulLEDITS: Real Image Editing with DDPM Inversion and Semantic Guidanceno summary yetcs-cv2307.005228 citesJul 2, 2023score 3
- MayRead Moremultimodal2305.18274EleutherAIMay 29, 2023score 1~126 min
- FebAdding Conditional Control to Text-to-Image Diffusion Modelsvision2302.05543Stability AIFeb 10, 2023~111 min
2022
3- DecScalable Diffusion Models with Transformersvision2212.09748Dec 19, 2022~103 min
- NovRoentGen: Vision-Language Foundation Model for Chest X-ray Generationdiffusion2211.12737EleutherAINov 23, 2022~136 min
- AprHierarchical Text-Conditional Image Generation with CLIP Latentsmultimodal2204.06125Apr 13, 2022~111 min