529 papers
Multimodal
0/521Vision-language, audio, and multi-modal fusion.
Progress0 of 521
2026
171- MayMolmoAct2: Action Reasoning Models for Real-world Deploymentagents2605.02881Allen Institute for AIMay 4, 2026~118 min
- MayOrchard: An Open-Source Agentic Modeling Frameworkagents2605.15040Microsoft ResearchMay 14, 2026~130 min
- MayQwen-Image-2.0 Technical Reportarchitecture2605.10730QwenMay 11, 2026~115 min
- MayLongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generationarchitecture2605.18739NVIDIAMay 18, 2026~131 min
- MayCovering Human Action Space for Computer Use: Data Synthesis and Benchmarkdata2605.12501MicrosoftMay 12, 2026~108 min
- MayLens: Rethinking Training Efficiency for Foundational Text-to-Image Modelsdiffusion2605.21573Microsoft ResearchMay 20, 2026~117 min
- MayPiD: Fast and High-Resolution Latent Decoding with Pixel Diffusiondiffusion2605.23902NVIDIAMay 22, 2026~112 min
- MayMSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generationevaluation2605.20183TongyiLabMay 19, 2026~122 min
- MayContinuous Latent Diffusion Language Modelllm-systems2605.06548ByteDance SeedMay 7, 2026~125 min
- MayOpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agentsmultimodal2605.05185Tencent HunyuanMay 6, 2026~104 min
- MayReinforcing Multimodal Reasoning Against Visual Degradationmultimodal2605.09262Tencent HunyuanMay 10, 2026~119 min
- MayTraining Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Contextmultimodal2605.13831ByteDance SeedMay 13, 2026~98 min
- MayMemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Modelsmultimodal2605.14906NVIDIAMay 14, 2026~125 min
- MayETCHR: Editing To Clarify and Harness Reasoningreasoning2605.23897InternLM / Shanghai AI LabMay 22, 2026~135 min
- MayDeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verificationtraining-methods2605.09269Tencent HunyuanMay 10, 2026~113 min
- MaySee What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understandingtraining-methods2605.18018TongyiLabMay 18, 2026~118 min
- MayLet ViT Speak: Generative Language-Image Pre-trainingvision2605.00809ByteDanceMay 1, 2026~95 min
- MayQwen-Image-VAE-2.0 Technical Reportvision2605.13565QwenMay 13, 2026~110 min
- MaySANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformervision2605.15178NVIDIAMay 14, 2026~113 min
- MayLiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMsvision2605.17260DeepmindMay 17, 2026~106 min
- MayFast 4D Mesh Generation by Spatio-Temporal Attention Chainsvision2605.19786NVIDIAMay 19, 2026~109 min
- MayCollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Modelsno summary yetcs-cv2605.08735KAIST AIMay 9, 2026
- MayUnlocking Dense Metric Depth Estimation in VLMsno summary yetcs-cv2605.15876Tencent HunyuanMay 15, 2026
- AprGPA: Learning GUI Process Automation from Demonstrationsagents2604.01676Salesforce AI ResearchApr 2, 2026score 9~114 min
- AprMM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generationagents2604.15309Microsoft ResearchApr 16, 2026score 3~94 min
- AprHierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modelingcode2604.05072Tencent HunyuanApr 6, 2026score 3~120 min
- AprSeedance 2.0: Advancing Video Generation for World Complexitydiffusion2604.14148ByteDance SeedApr 15, 2026score 3~127 min
- AprCoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generationdiffusion2604.19636alibaba-incApr 21, 2026~120 min
- AprDiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domainevaluation2604.10425meituanApr 12, 2026score 3~113 min
- AprDo Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understandingevaluation2604.11177VideoDBApr 13, 2026score 8~119 min
- AprLARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignmentevaluation2604.11689LongCatApr 13, 2026~111 min
- AprMind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMsevaluation2604.16054Microsoft ResearchApr 17, 2026~137 min
- AprMolmoWeb: Open Visual Web Agent and Open Data for the Open Webllm-systems2604.08516Apr 9, 2026~100 min
- AprLeveraging Verifier-Based Reinforcement Learning in Image Editingllm-systems2604.27505ByteDance SeedApr 30, 2026~121 min
- AprEXAONE 4.5 Technical Reportmultimodal2604.08644LG EXAONEApr 9, 2026score 9~90 min
- AprAudio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Musicmultimodal2604.10905NVIDIAApr 13, 2026score 9~106 min
- AprOmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generationmultimodal2604.11804ByteDanceApr 13, 2026score 3~110 min
- AprQwen3.5-Omni Technical Reportmultimodal2604.15804Apr 17, 2026~123 min
- AprImage Generators are Generalist Vision Learnersmultimodal2604.20329DeepMindApr 22, 2026~135 min
- AprTuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generationmultimodal2604.24763Meta AIApr 27, 2026~119 min
- AprNemotron 3 Nano Omni: Efficient and Open Multimodal Intelligencemultimodal2604.24954NVIDIAApr 27, 2026~116 min
- AprGLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agentsmultimodal2604.26752Z.aiApr 29, 2026~127 min
- AprMiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interactionmultimodal2604.27393OpenBMBApr 30, 2026~120 min
- AprWorld-R1: Reinforcing 3D Constraints for Text-to-Video Generationrl-training2604.24764Microsoft ResearchApr 27, 2026~117 min
- AprHY-Embodied-0.5: Embodied Foundation Models for Real-World Agentsuncategorized2604.07430Tencent HunyuanApr 8, 2026score 9~127 min
- AprActionParty: Multi-Subject Action Binding in Generative Video Gamesvision2604.02330Snap ResearchApr 2, 2026score 9~102 min
- AprThink in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoningvision2604.04746AI at MetaApr 6, 2026score 9~98 min
- AprMoRight: Motion Control Done Rightvision2604.07348NVIDIAApr 8, 2026score 3~110 min
- AprWildDet3D: Scaling Promptable 3D Detection in the Wildvision2604.08626Allen Institute for AIApr 9, 2026score 3~124 min
- AprLyra 2.0: Explorable Generative 3D Worldsvision2604.13036NVIDIAApr 14, 2026score 3~102 min
- AprTstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Itemsvision2604.19748alibaba-incApr 21, 2026~107 min
- MarProact-VL: A Proactive VideoLLM for Real-Time AI Companionsagents2603.03447Microsoft ResearchMar 3, 2026score 9~94 min
- MarLumosX: Relate Any Identities with Their Attributes for Personalized Video Generationagents2603.20192Alibaba DAMOMar 20, 2026score 4~109 min
- MarVision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verificationagents2603.26648Z.aiMar 27, 2026score 9~132 min
- MarUnify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesisagents2603.29620Tencent HunyuanMar 31, 2026score 8~107 min
- MarPolyglot-Lion: Efficient Multilingual ASR for Singapore via Balanced Fine-Tuning of Qwen3-ASRarchitecture2603.16184Knovel EngineeringMar 17, 2026score 3~116 min
- MarSommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Modelsdata2603.25750KAIST AIMar 20, 2026score 6~111 min
- MarVersatile Editing of Video Content, Actions, and Dynamics without Trainingdiffusion2603.17989DeepmindMar 18, 2026score 3~122 min
- MarOn-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformersdiffusion2603.28762Snap ResearchMar 30, 2026score 6~104 min
- MarMA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agentsevaluation2603.09827KAIST AIMar 10, 2026score 3~119 min
- MarECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretationevaluation2603.14326KAIST AIMar 15, 2026score 9~120 min
- MarOmni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Modelsevaluation2603.22212alibaba-incMar 23, 2026score 6~118 min
- MarEgo2Web: A Web Agent Benchmark Grounded in Egocentric Videosevaluation2603.22529DeepmindMar 23, 2026score 8~120 min
- MarBizGenEval: A Systematic Benchmark for Commercial Visual Content Generationevaluation2603.25732Microsoft ResearchMar 26, 2026score 3~121 min
- MarRealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluationevaluation2603.25804QwenMar 26, 2026score 4~89 min
- MarViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?evaluation2603.25823meituanMar 26, 2026score 9~108 min
- MarUnified Spatio-Temporal Token Scoring for Efficient Video VLMsinference-optimization2603.18004Ai2Mar 18, 2026score 9~114 min
- MarArtLLM: Generating Articulated Assets via 3D LLMmultimodal2603.01142Tencent HunyuanMar 1, 2026score 2~105 min
- MarBeyond Language Modeling: An Exploration of Multimodal Pretrainingmultimodal2603.03276AI at MetaMar 3, 2026score 9~119 min
- MarFrom Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoningmultimodal2603.03825QwenMar 4, 2026score 9~124 min
- MarMASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Modelsmultimodal2603.04800alibaba-incMar 5, 2026score 9~125 min
- MarUniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representationsmultimodal2603.10702Tencent HunyuanMar 11, 2026score 6~110 min
- MarCodePercept: Code-Grounded Visual STEM Perception for MLLMsmultimodal2603.10757QwenMar 11, 2026score 9~103 min
- MarGLM-OCR Technical Reportmultimodal2603.10910Zhipu / GLMMar 11, 2026~111 min
- MarSpatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Trainingmultimodal2603.12255Tencent HunyuanMar 12, 2026score 9~139 min
- MarQianfan-OCR: A Unified End-to-End Model for Document Intelligencemultimodal2603.13398BAIDUMar 11, 2026score 9~134 min
- MarIntern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scalemultimodal2603.25040InternLM / Shanghai AI LabMar 26, 2026~113 min
- MarLongCat-Next: Lexicalizing Modalities as Discrete Tokensmultimodal2603.27538Meituan LongCatMar 29, 2026score 9~113 min
- MarDreamLite: A Lightweight On-Device Unified Model for Image Generation and Editingmultimodal2603.28713ByteDanceMar 30, 2026score 6~111 min
- MarV-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learningpretraining2603.14482Meta LlamaMar 15, 2026score 7~123 min
- MarEndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Modelsreasoning2603.12252InternLM / Shanghai AI LabMar 12, 2026score 9~121 min
- MarHopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoningreasoning2603.17024QwenMar 17, 2026score 9~135 min
- MarUniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generationrl-training2603.23500ByteDance SeedMar 24, 2026score 9~101 min
- MarSNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detectionsafety2603.20686KAIST AIMar 21, 2026score 3~120 min
- MarMM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Datatraining-methods2603.09206NVIDIAMar 10, 2026score 9~112 min
- MarRoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Modelstraining-methods2603.21341KAIST AIMar 22, 2026score 9~108 min
- MarManifold-Aware Exploration for Reinforcement Learning in Video Generationtraining-methods2603.21872Tencent HunyuanMar 23, 2026score 9~110 min
- MarSpatialBoost: Enhancing Visual Representation through Language-Guided Reasoningtraining-methods2603.22057KAIST AIMar 23, 2026score 6~115 min
- MarMolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulationuncategorized2603.16861Ai2Mar 17, 2026score 9~120 min
- MarSIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLMuncategorized2603.23386ByteDance SeedMar 24, 2026score 3~116 min
- MarLingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cellsuncategorized2603.25240DAMO AcademyMar 26, 2026score 2~128 min
- MarHiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Imagesvision2603.02210ByteDanceMar 2, 2026score 3~97 min
- MarDreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learningvision2603.12257TongyiLabMar 12, 2026score 4~107 min
- MarVisual-ERM: Reward Modeling for Visual Equivalencevision2603.13224InternLM / Shanghai AI LabMar 13, 2026score 9~127 min
- MarGrounding World Simulation Models in a Real-World Metropolisvision2603.15583NAVER AI LabMar 16, 2026score 9~120 min
- MarSAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editingvision2603.19228BAIDUMar 19, 2026score 3~105 min
- MarRepurposing Geometric Foundation Models for Multi-view Diffusionvision2603.22275KAIST AIMar 23, 2026score 3~90 min
- MarDA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Modelsvision2603.23499KAIST AIMar 24, 2026score 2~104 min
- FebSAGE: Scalable Agentic 3D Scene Generation for Embodied AIagents2602.10116NVIDIAFeb 10, 2026score 2~115 min
- FebRynnBrain: Open Embodied Foundation Modelsagents2602.14979Alibaba DAMOFeb 13, 2026score 9~112 min
- FebMobile-Agent-v3.5: Multi-platform Fundamental GUI Agentsagents2602.16855TongyiLabFeb 15, 2026score 2~131 min
- FebVLS: Steering Pretrained Robot Policies via Vision-Language Modelsalignment2602.03973Ai2Feb 3, 2026score 2~100 min
- FebFSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Spacearchitecture2602.02092ByteDanceFeb 2, 2026score 9~118 min
- FebRecurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoningarchitecture2602.07845Ai2Feb 8, 2026score 6~107 min
- FebUniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Modelarchitecture2602.14178ByteDanceFeb 15, 2026score 9~131 min
- FebHY3D-Bench: Generation of 3D Assetsdata2602.03907Tencent HunyuanFeb 3, 2026score 2~113 min
- FebRoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learningdata2602.18742KAIST AIFeb 21, 2026score 2~101 min
- FebProtein Autoregressive Modeling via Multiscale Structure Generationdiffusion2602.04883ByteDance SeedFeb 4, 2026score 1~107 min
- FebFrom Scale to Speed: Adaptive Test-Time Scaling for Image Editingdiffusion2603.00141alibaba-incFeb 24, 2026score 6~106 min
- FebKimi K2.5: Visual Agentic Intelligencemultimodal2602.02276Moonshot / KimiFeb 2, 2026score 8~145 min
- FebERNIE 5.0 Technical Reportmultimodal2602.04705Feb 4, 2026~138 min
- FebNarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Controlmultimodal2602.09070ByteDanceFeb 9, 2026score 2~110 min
- FebAdapting Vision-Language Models for E-commerce Understanding at Scalemultimodal2602.11733Feb 12, 2026~133 min
- FebDreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generationmultimodal2602.12160ByteDanceFeb 12, 2026score 3~121 min
- FebCC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answeringmultimodal2602.23952Alibaba CloudFeb 27, 2026score 2~95 min
- FebA Mixed Diet Makes DINO An Omnivorous Vision Encodermultimodal2602.24181DeepmindFeb 27, 2026score 6~109 min
- FebVideoWorld 2: Learning Transferable Knowledge from Real-world Videospretraining2602.10102ByteDance SeedFeb 10, 2026score 2~107 min
- FebThinking with Drafting: Optical Decompression via Logical Reconstructionreasoning2602.11731ByteDanceFeb 12, 2026score 3~102 min
- FebWorldCompass: Reinforcement Learning for Long-Horizon World Modelsrl-training2602.09022Tencent HunyuanFeb 9, 2026score 8~114 min
- FebLLaDA2.1: Speeding Up Text Diffusion via Token Editingtraining-methods2602.08676Feb 9, 2026~106 min
- FebPhyCritic: Multimodal Critic Models for Physical AItraining-methods2602.11124NVIDIAFeb 11, 2026score 6~105 min
- FebABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learningtraining-methods2602.11236Alibaba AMAP CV LabFeb 11, 2026score 2~111 min
- FebWorld Guidance: World Modeling in Condition Space for Action Generationtraining-methods2602.22010ByteDance SeedFeb 25, 2026score 2~102 min
- FebLIVE: Long-horizon Interactive Video World Modelinguncategorized2602.03747Microsoft ResearchFeb 3, 2026score 3~103 min
- FebDreamDojo: A Generalist Robot World Model from Large-Scale Human Videosuncategorized2602.06949NVIDIAFeb 6, 2026score 2~117 min
- FebBitDance: Scaling Autoregressive Generative Models with Binary Tokensuncategorized2602.14041ByteDanceFeb 15, 2026score 9~104 min
- FebWorld Action Models are Zero-shot Policiesuncategorized2602.15922NVIDIA Deep Imagination ResearchFeb 17, 2026score 2~101 min
- FebTOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Roboticsuncategorized2602.19313Ai2Feb 22, 2026score 3~97 min
- FebMedXIAOHE: A Comprehensive Recipe for Building Medical MLLMsvision2602.12705ByteDanceFeb 13, 2026score 7~121 min
- FebSpanning the Visual Analogy Space with a Weight Basis of LoRAsvision2602.15727NVIDIAFeb 17, 2026score 2~110 min
- FebMode Seeking meets Mean Seeking for Fast Long Video Generationvision2602.24289NVIDIAFeb 27, 2026score 2~106 min
- JanNitroGen: An Open Foundation Model for Generalist Gaming Agentsagents2601.02427NVIDIAJan 4, 2026score 2~125 min
- JanThinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalizationagents2601.05432alibaba-incJan 8, 2026score 3~115 min
- JanVLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memoryagents2601.08665ByteDance SeedJan 13, 2026score 3~124 min
- JanFast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planningagents2601.09708NVIDIAJan 14, 2026score 3~113 min
- JanFantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigationagents2601.13976Alibaba AMAP CV LabJan 20, 2026score 3~126 min
- JanThe Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generationagents2601.17737Tencent HunyuanJan 25, 2026score 2~118 min
- JanRigMo: Unifying Rig and Motion Learning for Generative Animationarchitecture2601.06378SnapJan 10, 2026score 1~115 min
- JanMHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Headarchitecture2601.07832DAGroup-PKUJan 12, 2026score 9~105 min
- JanFlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloningarchitecture2601.11141FlashLabsJan 16, 2026score 2~112 min
- JanImplicit Neural Representation Facilitates Unified Universal Vision Encodingarchitecture2601.14256TikTokJan 20, 2026score 2~109 min
- JanQwen3-TTS Technical Reportarchitecture2601.15621Qwen / Alibaba CloudJan 22, 2026score 2~120 min
- JanSAMTok: Representing Any Mask with Two Wordsarchitecture2601.16093ByteDanceJan 22, 2026score 9~122 min
- JanDeepSeek-OCR 2: Visual Causal Flowarchitecture2601.20552DeepSeekJan 28, 2026score 8~118 min
- JanConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocationarchitecture2601.21420ByteDance SeedJan 29, 2026score 3~103 min
- JanDreamStyle: A Unified Framework for Video Stylizationdiffusion2601.02785ByteDanceJan 6, 2026score 2~109 min
- JanEverything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Modelsevaluation2601.20354alibaba-incJan 28, 2026score 2~100 min
- JanWorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Modelsevaluation2602.02537Moonshot AIJan 28, 2026score 5~108 min
- JanK-EXAONE Technical Reportmoe2601.01739LG EXAONEJan 5, 2026~112 min
- JanTAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Expertsmoe2601.08881Tencent HunyuanJan 12, 2026score 7~101 min
- JanNextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generationmultimodal2601.02204ByteDanceJan 5, 2026score 9~124 min
- JanQwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Rankingmultimodal2601.04720Qwen / Alibaba CloudJan 8, 2026~114 min
- JanRethinking Video Generation Model for the Embodied Worldmultimodal2601.15282ByteDance SeedJan 21, 2026score 2~104 min
- JanDIFFA-2: A Practical Diffusion Large Language Model for General Audio Understandingmultimodal2601.23161LongCatJan 30, 2026score 5~125 min
- JanVisual Generation Unlocks Human-Like Reasoning through Multimodal World Modelsreasoning2601.19834ByteDance SeedJan 27, 2026score 3~111 min
- JanThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editingrl-training2601.03467ByteDanceJan 6, 2026score 2~98 min
- JanA Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5safety2601.10527Jan 15, 2026score 4~118 min
- JanTranslateGemma Technical Reporttraining-methods2601.09012Google ResearchJan 13, 2026~107 min
- JanQwen3-ASR Technical Reporttraining-methods2601.21337Qwen / Alibaba CloudJan 29, 2026score 2~125 min
- JanCosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planninguncategorized2601.16163NVIDIAJan 22, 2026score 2~115 min
- Jan360Anything: Geometry-Free Lifting of Images and Videos to 360°uncategorized2601.16192DeepmindJan 22, 2026score 2~106 min
- JanDreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformervision2601.01425ByteDanceJan 4, 2026score 2~125 min
- JanPlenoptic Video Generationvision2601.05239NVIDIAJan 8, 2026score 2~110 min
- JanOpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understandingvision2601.09575NVIDIAJan 14, 2026score 2~107 min
- JanFlowAct-R1: Towards Interactive Humanoid Video Generationvision2601.10103ByteDanceJan 15, 2026score 3~101 min
- JanUrban Socio-Semantic Segmentation with Vision-Language Reasoningvision2601.10477alibaba-incJan 15, 2026score 3~102 min
- JanMolmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Groundingvision2601.10611Jan 15, 2026score 9~97 min
- JanOmniTransfer: All-in-one Framework for Spatio-temporal Video Transfervision2601.14250ByteDanceJan 20, 2026score 2~97 min
- JaniFSQ: Improving FSQ for Image Generation with 1 Line of Codevision2601.17124Tencent HunyuanJan 23, 2026score 2~134 min
- JanTowards Pixel-Level VLM Perception via Simple Points Predictionvision2601.19228Moonshot AIJan 27, 2026score 4~100 min
- JanDreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learningvision2601.21716ByteDanceJan 29, 2026score 2~112 min
2025
217- DecSIMA 2: A Generalist Embodied Agent for Virtual Worldsagents2512.04797DeepmindDec 4, 2025score 9~116 min
- DecSAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learningagents2512.13874Ai2Dec 15, 2025score 9~119 min
- DecMAI-UI Technical Report: Real-World Centric Foundation GUI Agentsagents2512.22047TongyiLabDec 26, 2025score 4~124 min
- DecGR-Dexter Technical Reportagents2512.24210ByteDance SeedDec 30, 2025score 2~103 min
- DecAligned but Stereotypical? The Hidden Influence of System Prompts on Social Bias in LVLM-Based Text-to-Image Modelsalignment2512.04981KAIST AIDec 4, 2025score 4~119 min
- DecEgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editingdiffusion2512.06065SnapDec 5, 2025score 2~105 min
- DecFew-Step Distillation for Text-to-Image Generation: A Practical Guidediffusion2512.13006Alibaba DAMODec 15, 2025score 6~86 min
- DecTowards Scalable Pre-training of Visual Tokenizers for Generationdiffusion2512.13687MiniMaxDec 15, 2025~122 min
- DecQwen-Image-Layered: Towards Inherent Editability via Layer Decompositiondiffusion2512.15603Qwen / Alibaba CloudDec 17, 2025score 6~110 min
- DecThe FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factualityevaluation2512.10791DeepmindDec 11, 2025score 9~127 min
- DecMMGR: Multi-Modal Generative Reasoningevaluation2512.14691Dec 16, 2025~123 min
- DecMobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environmentsevaluation2512.19432TongyiLabDec 22, 2025score 6~122 min
- DecUnderstanding and Harnessing Sparsity in Unified Multimodal Modelsmoe2512.02351ByteDance SeedDec 2, 2025score 9~121 min
- DecUniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Drivingmultimodal2512.09864ByteDance SeedDec 10, 2025score 2~109 min
- DecOmni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalizationmultimodal2512.10955Snap ResearchDec 11, 2025score 5~100 min
- DecInsight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural Languagemultimodal2512.11251Dec 12, 2025~108 min
- DecSeedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Modelmultimodal2512.13507ByteDance SeedDec 15, 2025score 3~94 min
- DecEasyV2V: A High-quality Instruction-based Video Editing Frameworkmultimodal2512.16920Snap ResearchDec 18, 2025score 2~105 min
- Dec4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillationmultimodal2512.17012NVIDIADec 18, 2025score 6~109 min
- DecSpatialTree: How Spatial Abilities Branch Out in MLLMsmultimodal2512.20617ByteDance SeedDec 23, 2025score 8~112 min
- DecBridging Your Imagination with Audio-Video Generation via a Unified Directormultimodal2512.23222ByteDanceDec 29, 2025score 6~102 min
- DecGR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulationrl-training2512.01801ByteDance SeedDec 1, 2025score 2~116 min
- DecARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoningrl-training2512.05111Intern Large ModelsDec 4, 2025score 8~102 min
- DecZoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-inrl-training2512.14273NVIDIADec 16, 2025score 8~102 min
- DecSpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RLtraining-methods2512.04069NVIDIADec 3, 2025score 7~118 min
- DecDirectional Textual Inversion for Personalized Text-to-Image Generationtraining-methods2512.13672KAIST AIDec 15, 2025score 5~102 min
- DecMasking Teacher and Reinforcing Student for Distilling Vision-Language Modelstraining-methods2512.22238NVIDIADec 23, 2025score 9~102 min
- DecCosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modelinguncategorized2512.23162NVIDIADec 29, 2025score 2~99 min
- DecDivide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understandingvision2512.04000Microsoft ResearchDec 3, 2025score 8~110 min
- DecSCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representationsvision2512.05905Zhipu / GLMDec 5, 2025score 2~109 min
- DecLongCat-Image Technical Reportvision2512.07584Meituan LongCatDec 8, 2025score 6~124 min
- DecEgoX: Egocentric Video Generation from a Single Exocentric Videovision2512.08269KAIST AIDec 9, 2025score 2~115 min
- DecWan-Move: Motion-controllable Video Generation via Latent Trajectory Guidancevision2512.08765TongyiLabDec 9, 2025score 2~110 min
- DecEvaluating Gemini Robotics Policies in a Veo World Simulatorvision2512.10675DeepmindDec 11, 2025score 4~115 min
- DecVector Prism: Animating Vector Graphics by Stratifying Semantic Structurevision2512.14336KAIST AIDec 16, 2025score 3~113 min
- DecInfinite-Homography as Robust Conditioning for Camera-Controlled Video Generationvision2512.17040KAIST AIDec 18, 2025score 5~111 min
- DecInsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertionvision2512.17504KAIST AIDec 19, 2025score 2~120 min
- DecStoryMem: Multi-shot Long Video Storytelling with Memoryvision2512.19539ByteDanceDec 22, 2025score 3~115 min
- DecDreaMontage: Arbitrary Frame-Guided One-Shot Video Generationvision2512.21252ByteDanceDec 24, 2025score 2~96 min
- DecDreamOmni3: Scribble-based Editing and Generationvision2512.22525ByteDanceDec 27, 2025score 5~119 min
- NovRobot Learning from a Physical World Modelagents2511.07416DeepmindNov 10, 2025score 2~105 min
- NovLumine: An Open Recipe for Building Generalist Agents in 3D Open Worldsagents2511.08892ByteDance SeedNov 12, 2025score 6~115 min
- NovPart-X-MLLM: Part-aware 3D Multimodal Large Language Modelagents2511.13647Tencent HunyuanNov 17, 2025score 9~107 min
- NovGeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalizationagents2511.15705Tencent HunyuanNov 19, 2025score 7~96 min
- NovDynamic Reflections: Probing Video Representations with Text Alignmentalignment2511.02767DeepMindNov 4, 2025score 9~115 min
- NovVideo Generation Models Are Good Latent Reward Modelsalignment2511.21541Tencent HunyuanNov 26, 2025score 8~104 min
- NovLong Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scaledata2511.05705NVIDIANov 7, 2025score 9~105 min
- NovUniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedbackdiffusion2511.01678Alibaba DAMONov 3, 2025score 2~115 min
- NovMMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generationdiffusion2511.09611ByteDanceNov 12, 2025score 9~109 min
- NovDecoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shielddiffusion2511.22677Tongyi-MAINov 27, 2025score 4~114 min
- NovBlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generationdiffusion2511.22973DAMO AcademyNov 28, 2025score 7~116 min
- NovWhen Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thoughtevaluation2511.02779ByteDance SeedNov 4, 2025score 8~114 min
- NovDiscoX: Benchmarking Discourse-Level Translation task in Expert Domainsevaluation2511.10984ByteDance SeedNov 14, 2025score 5~111 min
- NovInferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulationinference-optimization2511.20714DAMO AcademyNov 25, 2025score 9~100 min
- NovLlama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasksllm-systems2511.07025NVIDIANov 10, 2025score 9~99 min
- NovMME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacitymultimodal2511.03146ByteDance SeedNov 5, 2025score 9~107 min
- NovNVIDIA Nemotron Nano V2 VLmultimodal2511.03929NVIDIANov 6, 2025score 9~122 min
- NovVADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Modelsmultimodal2511.07299NVIDIANov 10, 2025score 2~110 min
- NovMusic Flamingo: Scaling Music Understanding in Audio Language Modelsmultimodal2511.10289NVIDIANov 13, 2025score 6~121 min
- NovHunyuanOCR Technical Reportmultimodal2511.19575Tencent HunyuanNov 24, 2025score 9~146 min
- NovNVIDIA Nemotron Parse 1.1multimodal2511.20478NVIDIANov 25, 2025score 9~127 min
- NovHarmony: Harmonizing Audio and Video Generation through Cross-Task Synergymultimodal2511.21579Tencent HunyuanNov 26, 2025score 5~107 min
- NovQwen3-VL Technical Reportmultimodal2511.21631Nov 26, 2025~107 min
- NovOlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observationpretraining2511.13655Ai2Nov 17, 2025score 6~130 min
- NovThink Visually, Reason Textually: Vision-Language Synergy in ARCreasoning2511.15703Intern Large ModelsNov 19, 2025score 9~105 min
- NovSAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuningrl-training2511.02280BytedanceDouyinContentNov 4, 2025score 9~130 min
- NovTimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learningrl-training2511.05489ByteDanceNov 7, 2025score 9~106 min
- NovWMPO: World Model-based Policy Optimization for Vision-Language-Action Modelsrl-training2511.09515ByteDance SeedNov 12, 2025score 5~128 min
- NovRevisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalizationtraining-methods2511.22586ByteDance SeedNov 27, 2025score 9~113 min
- NovLearning Vision-Driven Reactive Soccer Skills for Humanoid Robotsuncategorized2511.03996ByteDance SeedNov 6, 2025score 2~136 min
- NovRynnVLA-002: A Unified Vision-Language-Action and World Modeluncategorized2511.17502DAMO AcademyNov 21, 2025score 6~109 min
- NovVisual Spatial Tuningvision2511.05491ByteDance SeedNov 7, 2025score 9~119 min
- NovDepth Anything 3: Recovering the Visual Space from Any Viewsvision2511.10647Nov 13, 2025~100 min
- NovInstruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Datasetvision2511.15186KAIST AINov 19, 2025score 2~116 min
- NovNaTex: Seamless Texture Generation as Latent Color Diffusionvision2511.16317Tencent HunyuanNov 20, 2025score 2~101 min
- NovHunyuanVideo 1.5 Technical Reportvision2511.18870Tencent HunyuanNov 24, 2025score 5~112 min
- NovZ-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformervision2511.22699Tongyi-MAINov 27, 2025score 9~108 min
- OctExploring Conditions for Diffusion models in Robotic Controlagents2510.15510NAVER AI LabOct 17, 2025score 2~102 min
- OctGame-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agentsagents2510.23691ByteDanceOct 27, 2025score 8~124 min
- OctBeyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Modelsalignment2510.21978AI at MetaOct 24, 2025score 10~112 min
- OctDiffusion Transformers with Representation Autoencodersarchitecture2510.11690Oct 13, 2025~117 min
- OctVLA-0: Building State-of-the-Art VLAs with Zero Modificationarchitecture2510.13054NVIDIAOct 15, 2025score 6~100 min
- OctJanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligencecode2510.23538InternLM / Shanghai AI LabOct 27, 2025score 6~97 min
- OctDocReward: A Document Reward Model for Structuring and Stylizingdata2510.11391Microsoft ResearchOct 13, 2025score 6~95 min
- OctSelf-Forcing++: Towards Minute-Scale High-Quality Video Generationdiffusion2510.02283ByteDance SeedOct 2, 2025score 10~133 min
- OctVideo-As-Prompt: Unified Semantic Control for Video Generationdiffusion2510.20888ByteDance SeedOct 23, 2025score 5~122 min
- OctOSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agentsevaluation2510.24563TongyiLabOct 28, 2025score 5~111 min
- OctSTAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligenceevaluation2510.24693Intern Large ModelsOct 28, 2025score 6~114 min
- OctTC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion Controlllm-systems2510.09561NVIDIAOct 10, 2025score 3~86 min
- OctMultimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMsmultimodal2510.09201KAIST AIOct 10, 2025score 3~134 min
- OctScaling Language-Centric Omnimodal Representation Learningmultimodal2510.11693DAMO AcademyOct 13, 2025score 8~128 min
- OctSAIL-Embedding Technical Report: Omni-modal Embedding Foundation Modelmultimodal2510.12709ByteDanceOct 14, 2025score 9~151 min
- OctGenerative Universal Verifier as Multimodal Meta-Reasonermultimodal2510.13804ByteDance SeedOct 15, 2025score 8~106 min
- OctPaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Modelmultimodal2510.14528Baidu ResearchOct 16, 2025~118 min
- OctOmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLMmultimodal2510.15870NVIDIAOct 17, 2025score 10~108 min
- OctRL makes MLLMs see better than SFTmultimodal2510.16333NAVER AI LabOct 18, 2025score 9~100 min
- OctGrasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMsmultimodal2510.18876ByteDanceOct 21, 2025score 4~92 min
- OctolmOCR 2: Unit Test Rewards for Document OCRmultimodal2510.19817Ai2Oct 22, 2025score 9~115 min
- OctVoMP: Predicting Volumetric Mechanical Property Fieldsmultimodal2510.22975NVIDIAOct 27, 2025score 2~122 min
- OctRevisiting Multimodal Positional Encoding in Vision-Language Modelsmultimodal2510.23095QwenOct 27, 2025score 10~105 min
- OctLongCat-Flash-Omni Technical Reportmultimodal2511.00279Meituan LongCatOct 31, 2025score 9~117 min
- OctHeptapod: Language Modeling on Visual Signalspretraining2510.06673ByteDance SeedOct 8, 2025score 9~128 min
- OctOpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidencereasoning2510.20579OpenAIOct 23, 2025score 9~97 min
- OctVerifier-free Test-Time Sampling for Vision Language Action Modelsrl-training2510.05681KAIST AIOct 7, 2025score 9~106 min
- OctUnified Reinforcement and Imitation Learning for Vision-Language Modelstraining-methods2510.19307NVIDIAOct 22, 2025score 9~87 min
- OctDaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agentstraining-methods2510.19336OPPOOct 22, 2025score 8~104 min
- OctPairUni: Pairwise Training for Unified Multimodal Language Modelstraining-methods2510.25682ByteDanceOct 29, 2025score 8~110 min
- OctHigh-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian Splattinguncategorized2510.10637DAMO AcademyOct 12, 2025score 3~114 min
- OctFrom Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priorsuncategorized2510.17439ByteDance SeedOct 20, 2025score 9~122 min
- OctLongCat-Video Technical Reportuncategorized2510.22200Meituan LongCatOct 25, 2025score 9~122 min
- OctChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulationvision2510.04290NVIDIAOct 5, 2025score 2~105 min
- OctTrace Anything: Representing Any Video in 4D via Trajectory Fieldsvision2510.13802ByteDance SeedOct 15, 2025score 2~108 min
- OctDeepSeek-OCR: Contexts Optical Compressionvision2510.18234DeepSeekOct 21, 2025score 9~115 min
- OctDSI-Bench: A Benchmark for Dynamic Spatial Intelligencevision2510.18873alibaba-incOct 21, 2025score 8~102 min
- OctSeed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assetsvision2510.19944ByteDance SeedOct 22, 2025score 5~112 min
- OctLayerComposer: Multi-Human Personalized Generation via Layered Canvasvision2510.20820Snap ResearchOct 23, 2025score 3~109 min
- OctTowards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculumvision2510.27571Alibaba DAMOOct 31, 2025score 8~135 min
- OctSpatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learningvision2510.27606InternLM / Shanghai AI LabOct 31, 2025score 9~124 min
- OctWorld Simulation with Video Foundation Models for Physical AIvision2511.00062NVIDIAOct 28, 2025score 4~128 min
- SepUI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learningagents2509.02544ByteDance SeedSep 2, 2025score 6~126 min
- SepHunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assetsarchitecture2509.21245Tencent HunyuanSep 25, 2025score 3~93 min
- SepHunyuan-MT Technical Reportllm-systems2509.05209Tencent HunyuanSep 5, 2025score 3~99 min
- SepHunyuanImage 3.0 Technical Reportmoe2509.23951Tencent HunyuanSep 28, 2025score 9~121 min
- SepSAIL-VL2 Technical Reportmultimodal2509.14033Sep 17, 2025~130 min
- SepQwen3-Omni Technical Reportmultimodal2509.17765Sep 22, 2025~129 min
- SepMetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interactionmultimodal2509.18095Sep 22, 2025score 9~117 min
- SepVideo models are zero-shot learners and reasonersmultimodal2509.20328DeepMindSep 24, 2025~135 min
- SepCapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learningmultimodal2509.22647InternLM / Shanghai AI LabSep 26, 2025score 6~114 min
- SepLLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Trainingmultimodal2509.23661Sep 28, 2025score 9~125 min
- SepRobix: A Unified Model for Robot Interaction, Reasoning and Planninguncategorized2509.01106ByteDance SeedSep 1, 2025score 9~108 min
- SepManipulation as in Simulation: Enabling Accurate Geometry Perception in Robotsuncategorized2509.02530ByteDance SeedSep 2, 2025score 2~106 min
- SepP3-SAM: Native 3D Part Segmentationvision2509.06784Tencent HunyuanSep 8, 2025score 6~116 min
- SepAToken: A Unified Tokenizer for Visionvision2509.14476AppleSep 17, 2025~104 min
- SepLynx: Towards High-Fidelity Personalized Video Generationvision2509.15496ByteDance SeedSep 19, 2025score 6~96 min
- SepV2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughtsvision2509.18053NVIDIASep 22, 2025score 3~97 min
- SepZero-Shot Multi-Spectral Learning: Reimagining a Generalist Multimodal Gemini 2.5 Model for Remote Sensing Applicationsvision2509.19087Sep 23, 2025score 3~112 min
- SepDC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencodervision2509.25182NVIDIASep 29, 2025score 6~105 min
- AugVibeVoice Technical Reportinference-optimization2508.19205Microsoft ResearchAug 26, 2025~119 min
- AugA Survey on Diffusion Language Modelsllm-systems2508.10875Aug 14, 2025~126 min
- AugQwen-Image Technical Reportmultimodal2508.02324Qwen / Alibaba CloudAug 4, 2025~137 min
- AugWebWatcher: Breaking New Frontier of Vision-Language Deep Research Agentmultimodal2508.05748Alibaba DAMOAug 7, 2025score 9~109 min
- AugSeeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memorymultimodal2508.09736ByteDance SeedAug 13, 2025score 8~110 min
- AugIntern-S1: A Scientific Multimodal Foundation Modelmultimodal2508.15763InternLM / Shanghai AI LabAug 21, 2025~122 min
- AugInternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiencymultimodal2508.18265Aug 25, 2025score 10~107 min
- AugSemantic IDs for Joint Generative Search and Recommendationpretraining2508.10478DoorDashAug 14, 2025score 3~123 min
- AugMolmoAct: Action Reasoning Models that can Reason in Spaceuncategorized2508.07917Aug 11, 2025~111 min
- AugTowards Affordance-Aware Robotic Dexterous Grasping with Human-like Priorsuncategorized2508.08896DAMO AcademyAug 12, 2025score 2~120 min
- AugDINOv3vision2508.10104Meta AI / FAIRAug 13, 2025~120 min
- AugAutoregressive Universal Video Segmentation Modelvision2508.19242Aug 26, 2025~108 min
- JulThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planningagents2507.16815NVIDIAJul 22, 2025score 9~110 min
- JulGemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilitiesllm-systems2507.06261Jul 7, 2025score 10~104 min
- JulGLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learningmultimodal2507.01006Zhipu / GLMJul 1, 2025score 10~109 min
- JulTraceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodologymultimodal2507.07999OpenAIJul 10, 2025score 8~99 min
- JulVoxtralmultimodal2507.13264MistralJul 17, 2025~111 min
- JulMeta CLIP 2: A Worldwide Scaling Recipemultimodal2507.22062Jul 29, 2025score 10~113 min
- JulEXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modesreasoning2507.11407LG EXAONEJul 15, 2025score 10~110 min
- JulScaling RL to Long Videosrl-training2507.07966Jul 10, 2025~98 min
- JulToken Bottleneck: One Token to Remember Dynamicstraining-methods2507.06543NAVER AI LabJul 9, 2025score 5~116 min
- JulARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shortstraining-methods2507.20939TencentJul 28, 2025score 9~125 min
- JulGR-3 Technical Reportuncategorized2507.15493ByteDance SeedJul 21, 2025score 5~104 min
- JulHunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixelsvision2507.21809Tencent HunyuanJul 29, 2025score 3~105 min
- JunHunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Materialdiffusion2506.15442Tencent HunyuanJun 18, 2025score 2~104 min
- JunM$^3$FinMeeting: A Multilingual, Multi-Sector, and Multi-Task Financial Meeting Understanding Evaluation Datasetevaluation2506.02510Qwen DianJinJun 3, 2025score 6~122 min
- JunGenRecal: Generation after Recalibration from Large to Small Vision-Language Modelsllm-systems2506.15681NVIDIAJun 18, 2025score 9~102 min
- JunQwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Modelspretraining2506.05176Qwen / Alibaba CloudJun 5, 2025score 10~82 min
- JunMERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Queryretrieval2506.03144ByteDanceJun 3, 2025score 8~123 min
- JunSelf Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusiontraining-methods2506.08009Jun 9, 2025score 9~120 min
- JunGUI-Actor: Coordinate-Free Visual Grounding for GUI Agentsvision2506.03143Microsoft ResearchJun 3, 2025score 9~98 min
- JunCyberV: Cybernetics for Test-time Scaling in Video Understandingvision2506.07971ByteDanceJun 9, 2025score 8~125 min
- JunHunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Detailsvision2506.16504Jun 19, 2025score 3~106 min
- JunHunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Conditionvision2506.17201Tencent HunyuanJun 20, 2025score 2~116 min
- MayHunyuan-Game: Industrial-grade Intelligent Game Creation Modelagents2505.14135May 20, 2025score 4~195 min
- MayHunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generationarchitecture2505.04512Tencent HunyuanMay 7, 2025score 3~117 min
- MayMiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoderarchitecture2505.07916May 12, 2025score 2~112 min
- MayEfficientLLM: Efficiency in Large Language Modelsevaluation2505.13840May 20, 2025score 10~104 min
- MayQwen3 Technical Reportllm-systems2505.09388Qwen / Alibaba CloudMay 14, 2025~128 min
- MayMMaDA: Multimodal Large Diffusion Language Modelsmultimodal2505.15809May 21, 2025~136 min
- MayG1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learningtraining-methods2505.13426Moonshot AIMay 19, 2025score 9~102 min
- MayMAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglementvision2505.23742ByteDanceMay 29, 2025score 2~91 min
- AprOpen-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resourcesmultimodal2504.00595Apr 1, 2025score 9~95 min
- AprSmolVLM: Redefining small and efficient multimodal modelsmultimodal2504.05299Hugging Face Smol ModelsApr 7, 2025~116 min
- AprKimi-VL Technical Reportmultimodal2504.07491NVIDIAApr 10, 2025~121 min
- AprThe Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformermultimodal2504.10462ByteDanceApr 14, 2025score 8~103 min
- AprPixel-SAIL: Single Transformer For Pixel-Grounded Understandingmultimodal2504.10465ByteDanceApr 14, 2025score 9~120 min
- AprInternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Modelsmultimodal2504.10479Apr 14, 2025score 10~101 min
- AprEagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Modelsmultimodal2504.15271NVIDIAApr 21, 2025score 9~103 min
- AprKimi-Audio Technical Reportmultimodal2504.18425Moonshot AIApr 25, 2025score 9~104 min
- AprSphereDiff: Tuning-free 360° Static and Dynamic Panorama Generation via Spherical Latent Representationvision2504.14396KAIST AIApr 19, 2025score 2~98 min
- MarOn the Acquisition of Shared Grammatical Representations in Bilingual Language Modelsalignment2503.03962Mar 5, 2025score 4~111 min
- MarFlowTok: Flowing Seamlessly Across Text and Image Tokensarchitecture2503.10772ByteDance SeedMar 13, 2025score 9~117 min
- MarCube: A Roblox View of 3D Intelligencearchitecture2503.15475RobloxMar 19, 2025~109 min
- MarGemma 3 Technical Reportarchitecture2503.19786Google ResearchMar 25, 2025~112 min
- MarUVE: Are MLLMs Unified Evaluators for AI-Generated Videos?evaluation2503.09949ByteDance SeedMar 13, 2025score 6~111 min
- MarGemini Embedding: Generalizable Embeddings from Geminillm-systems2503.07891DeepMindMar 10, 2025~99 min
- MarPhi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAsmultimodal2503.01743Microsoft ResearchMar 3, 2025score 10~111 min
- MarGemini Robotics: Bringing AI into the Physical Worldmultimodal2503.20020Mar 25, 2025score 9~134 min
- MarQwen2.5-Omni Technical Reportmultimodal2503.20215Qwen / Alibaba CloudMar 26, 2025~106 min
- MarTraining Video Foundation Models with NVIDIA NeMotraining-methods2503.12964NVIDIAMar 17, 2025score 6~127 min
- FebV2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Modelsllm-systems2502.09980NVIDIAFeb 14, 2025score 2~119 min
- FebScaling Pre-training to One Hundred Billion Data for Vision Language Modelsmultimodal2502.07617DeepMindFeb 11, 2025score 9~135 min
- FebQwen2.5-VL Technical Reportmultimodal2502.13923Qwen / Alibaba CloudFeb 19, 2025~122 min
- FebSigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Featuresmultimodal2502.14786Google ResearchFeb 20, 2025score 8~116 min
- FebolmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Modelsmultimodal2502.18443Feb 25, 2025~135 min
- JanInternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Modelalignment2501.12368InternLM / Shanghai AI LabJan 21, 2025score 9~95 min
- JanSFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-trainingalignment2501.17161Jan 28, 2025score 10~103 min
- JanMiniMax-01: Scaling Foundation Models with Lightning Attentionarchitecture2501.08313MiniMaxJan 14, 2025~123 min
- Jan2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretrainingdata2501.00958Jan 1, 2025score 10~113 min
- JanHumanity's Last Examevaluation2501.14249AnthropicJan 24, 2025score 10~122 min
- JanHunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generationllm-systems2501.12202Tencent HunyuanJan 21, 2025score 6~119 min
- JanSa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videosmultimodal2501.04001ByteDance SeedJan 7, 2025score 8~109 min
- JanOmni-RGPT: Unifying Image and Video Region-level Understanding via Token Marksmultimodal2501.08326NVIDIAJan 14, 2025score 9~104 min
- JanEagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Modelsmultimodal2501.14818Jan 20, 2025~133 min
- JanCosmos World Foundation Model Platform for Physical AIpretraining2501.03575NVIDIAJan 6, 2025score 5~137 min
- JanAn Empirical Study of Autoregressive Pre-training from Videospretraining2501.05453Jan 9, 2025~102 min
- JanKimi k1.5: Scaling Reinforcement Learning with LLMsreasoning2501.12599Jan 22, 2025~107 min
- JanTransformer-Squared: Self-adaptive LLMstraining-methods2501.06252Jan 9, 2025score 9~115 min
- JanSeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restorationvision2501.01320ByteDance SeedJan 2, 2025score 5~98 min
2024
63- DecMultimodal Latent Language Modeling with Next-Token Diffusionarchitecture2412.08635Microsoft ResearchDec 11, 2024score 6~129 min
- DecLAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotationsdata2412.08580Dec 11, 2024score 6~88 min
- DecNVILA: Efficient Frontier Visual Language Modelsllm-systems2412.04468Dec 5, 2024~117 min
- DecPaliGemma 2: A Family of Versatile VLMs for Transfermultimodal2412.03555Google ResearchDec 4, 2024score 9~114 min
- DecProactive Agents for Multi-Turn Text-to-Image Generation Under Uncertaintymultimodal2412.06771DeepMindDec 9, 2024~124 min
- DecInternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactionsmultimodal2412.09596InternLM / Shanghai AI LabDec 12, 2024score 6~112 min
- DecApollo: An Exploration of Video Understanding in Large Multimodal Modelsmultimodal2412.10360Dec 13, 2024~111 min
- DecNext Token Prediction Towards Multimodal Intelligence: A Comprehensive Surveymultimodal2412.18619Dec 16, 2024~124 min
- DecVLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Modelstraining-methods2412.01822NVIDIADec 2, 2024score 9~97 min
- NovMixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Modelsarchitecture2411.04996Nov 7, 2024score 10~118 min
- NovSmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformersinference-optimization2411.10510RobloxNov 15, 2024score 9~102 min
- NovLLaVA-o1: Let Vision Language Models Reason Step-by-Steptraining-methods2411.10440Nov 15, 2024score 10~100 min
- OctTLDR: Token-Level Detective Reward Model for Large Vision Language Modelsalignment2410.04734Meta LlamaOct 7, 2024score 8~119 min
- OctMOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU Languagesdata2410.01036NVIDIAOct 1, 2024score 2~112 min
- OctJanus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generationmultimodal2410.13848DeepSeekOct 17, 2024score 8~79 min
- OctTIPS: Text-Image Pretraining with Spatial awarenessmultimodal2410.16512DeepMindOct 21, 2024~108 min
- OctGPT-4o System Cardsafety2410.21276OpenAIOct 25, 2024score 9~137 min
- OctDocument Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extractionvision2410.21169Oct 28, 2024score 10~114 min
- SepMMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmarkevaluation2409.02813Sep 4, 2024score 9~99 min
- SepEuroLLM: Multilingual Language Models for Europellm-systems2409.16235Sep 24, 2024score 9~103 min
- SepNVLM: Open Frontier-Class Multimodal LLMsmultimodal2409.11402Sep 17, 2024~107 min
- SepQwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolutionmultimodal2409.12191Qwen / Alibaba CloudSep 18, 2024score 9~112 min
- SepOryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolutionmultimodal2409.12961Sep 19, 2024score 9~102 min
- SepMolmo and PixMo: Open Weights and Open Data for State-of-the-Art Multimodal Modelsmultimodal2409.17146Allen Institute for AISep 25, 2024score 9~121 min
- SepEmu3: Next-Token Prediction is All You Needmultimodal2409.18869Sep 27, 2024~122 min
- SepMM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-Tuningmultimodal2409.20566AppleSep 30, 2024~110 min
- SepLVCD: Reference-based Lineart Video Colorization with Diffusion Modelsno summary yetcs-cv2409.1296011 citesSep 19, 2024score 2
- SepSpaceBlender: Creating Context-Rich Collaborative Spaces Through Generative 3D Scene Blendingno summary yetcs-ai2409.1392611 citesSep 20, 2024score 1
- AugCogVideoX: Text-to-Video Diffusion Models with An Expert Transformerdiffusion2408.06072Zhipu / GLMAug 12, 2024score 3~121 min
- AugLLaVA-OneVision: Easy Visual Task Transfermultimodal2408.03326Aug 6, 2024score 9~112 min
- AugTransfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Modelmultimodal2408.11039Aug 20, 2024score 9~106 min
- AugSAM 2: Segment Anything in Images and Videosvision2408.00714Meta AI / FAIRAug 1, 2024score 9~135 min
- AugBuilding and better understanding vision-language models: insights and future directionsvision2408.12637Aug 22, 2024score 10~96 min
- JulLMMs-Eval: Reality Check on the Evaluation of Large Multimodal Modelsevaluation2407.12772Jul 17, 2024score 9~133 min
- JulQwen2 Technical Reportllm-systems2407.10671Qwen / Alibaba CloudJul 15, 2024~114 min
- JulInternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Outputmultimodal2407.03320InternLM / Shanghai AI LabJul 3, 2024score 9~105 min
- JulQwen2-Audio Technical Reportmultimodal2407.10759Qwen / Alibaba CloudJul 15, 2024score 6~104 min
- JulThe Llama 3 Herd of Modelstraining-methods2407.21783Jul 31, 2024~129 min
- JulUnderstanding Visual Feature Reliance through the Lens of Complexityno summary yetcs-cv2407.060760 citesJul 8, 2024score 2
- JulThe FIGNEWS Shared Task on News Media Narrativesno summary yetcs-cl2407.181470 citesJul 25, 2024score 2
- JulMatting by Generationno summary yetcs-cv2407.210173 citesJul 30, 2024score 1
- JunRVT-2: Learning Precise Manipulation from Few Demonstrationsagents2406.08545NVIDIAJun 12, 2024score 2~107 min
- JunGenAI Arena: An Open Evaluation Platform for Generative Modelsevaluation2406.04485Jun 6, 2024score 9~98 min
- JunChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Toolsllm-systems2406.12793Zhipu / GLMJun 18, 2024score 9~108 min
- JunThe Prompt Report: A Systematic Survey of Prompting Techniquesprompting2406.06608Jun 6, 2024score 10~119 min
- MayHunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understandingdiffusion2405.08748May 14, 2024score 9~110 min
- MayAdvancing Multimodal Medical Capabilities of Geminimultimodal2405.03162DeepMindMay 6, 2024~132 min
- MayAn Introduction to Vision-Language Modelingmultimodal2405.17247May 27, 2024~111 min
- AprInternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HDmultimodal2404.06512Apr 9, 2024score 9~102 min
- AprCapabilities of Gemini Models in Medicinemultimodal2404.18416Apr 29, 2024score 9~125 min
- MarGemini 1.5: Unlocking multimodal understanding across millions of tokens of contextcontext-optimization2403.05530Mar 8, 2024score 10~133 min
- MarDeepSeek-VL: Towards Real-World Vision-Language Understandingmultimodal2403.05525DeepSeekMar 8, 2024score 9~88 min
- MarMini-Gemini: Mining the Potential of Multi-modality Vision Language Modelsmultimodal2403.18814Mar 27, 2024score 9~109 min
- MarYi: Open Foundation Models by 01.AIscaling-laws2403.0465201-AIMar 7, 2024score 9~73 min
- FebPIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMsagents2402.07872DeepMindFeb 12, 2024score 8~119 min
- FebMultilingual E5 Text Embeddings: A Technical Reportcontext-optimization2402.05672Feb 8, 2024~118 min
- FebWorld Model on Million-Length Video And Language With Blockwise RingAttentionllm-systems2402.08268Feb 13, 2024score 9~106 min
- FebGenie: Generative Interactive Environmentspretraining2402.15391DeepMindFeb 23, 2024score 9~111 min
- FebNemotron-4 15B Technical Reportpretraining2402.16819Feb 26, 2024~106 min
- JanAutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agentsagents2401.12963DeepMindJan 23, 2024score 3~112 min
- JanMoonshot: Towards Controllable Video Generation and Editing with Multimodal Conditionsdiffusion2401.01827Jan 3, 2024score 5~113 min
- JanFrom GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalitiesevaluation2401.15071Jan 26, 2024score 8~96 min
- JanInternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Modelmultimodal2401.16420InternLM / Shanghai AI LabJan 29, 2024score 9~91 min
2023
34- DecGemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Modelsevaluation2312.17661Dec 29, 2023score 3~127 min
- DecA Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Framesmultimodal2312.07395DeepMindDec 12, 2023~104 min
- DecGemini: A Family of Highly Capable Multimodal Modelsmultimodal2312.11805Google ResearchDec 19, 2023~123 min
- DecGemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Casesmultimodal2312.15011Dec 22, 2023score 5~118 min
- DecVILA: On Pre-training for Visual Language Modelsvision2312.07533Dec 12, 2023score 9~90 min
- DecA Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertisevision2312.12436Dec 19, 2023score 9~92 min
- DecZero-Shot Metric Depth with a Field-of-View Conditioned Diffusion Modelvision2312.13252DeepMindDec 20, 2023score 9~103 min
- NovMMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmarkevaluation2311.1650201-AINov 27, 2023~97 min
- NovMirasol3B: A Multimodal Autoregressive Model for Time-Aligned and Contextual Modalitiesmultimodal2311.05698DeepMindNov 9, 2023score 6~120 min
- NovQwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Modelsmultimodal2311.07919Qwen / Alibaba CloudNov 14, 2023score 8~116 min
- NovMAIRA-1: A specialised large multimodal model for radiology report generationmultimodal2311.13668Microsoft ResearchNov 22, 2023~104 min
- NovParameter-Efficient Orthogonal Finetuning via Butterfly Factorizationtraining-methods2311.06243Nov 10, 2023score 9~102 min
- NovRoboVQA: Multimodal Long-Horizon Reasoning for Roboticsuncategorized2311.00899DeepMindNov 1, 2023score 5~140 min
- NovFlorence-2: Advancing a Unified Representation for a Variety of Vision Tasksvision2311.06242Microsoft ResearchNov 10, 2023score 8~100 min
- OctImproved Baselines with Visual Instruction Tuningmultimodal2310.03744Stability AIOct 5, 2023score 9~103 min
- OctSALM: Speech-augmented Language Model with In-context Learning for Speech Recognition and Translationmultimodal2310.09424NVIDIAOct 13, 2023~116 min
- OctWoodpecker: Hallucination Correction for Multimodal Large Language Modelsno summary yetcs-cv2310.1604522 citesOct 24, 2023score 6
- SepM3DSYNTH: A DATASET OF MEDICAL 3D IMAGES WITH AI-GENERATED LOCAL MANIPULATIONSdata2309.07973Sep 14, 2023~120 min
- SepAn Empirical Study of Scaling Instruct-Tuned Large Multimodal Modelsmultimodal2309.09958Sep 18, 2023score 9~101 min
- SepSpeak While You Think: Streaming Speech Synthesis During Text Generationmultimodal2309.11210Sep 20, 2023~104 min
- SepScaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuningpretraining2309.02591Sep 5, 2023score 10~113 min
- SepScaling Laws for Sparsely-Connected Foundation Modelsscaling-laws2309.08520Sep 15, 2023score 9~115 min
- AugQwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyondmultimodal2308.12966Qwen / Alibaba CloudAug 24, 2023~97 min
- MayMEGABYTE: Predicting Million-byte Sequences with Multiscale Transformersarchitecture2305.07185May 12, 2023score 9~116 min
- MayInstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuningmultimodal2305.06500SalesforceMay 11, 2023score 9~101 min
- MayRead Moremultimodal2305.18274EleutherAIMay 29, 2023score 1~126 min
- MayPaLM 2 Technical Reportpretraining2305.10403May 17, 2023~108 min
- AprLLaVA: Visual Instruction Tuningmultimodal2304.08485Apr 17, 2023~91 min
- AprMiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Modelsmultimodal2304.10592Apr 20, 2023~99 min
- MarSparks of Artificial General Intelligence: Early experiments with GPT-4evaluation2303.12712Mar 22, 2023~117 min
- MarGPT-4 Technical Reportpretraining2303.08774Mar 15, 2023~118 min
- MarLLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attentiontraining-methods2303.16199Mar 28, 2023~100 min
- FebAdding Conditional Control to Text-to-Image Diffusion Modelsvision2302.05543Stability AIFeb 10, 2023~111 min
- JanBLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Modelsmultimodal2301.12597SalesforceJan 30, 2023~119 min
2022
11- DecUnifying Vision, Text, and Layout for Universal Document Processingmultimodal2212.02623Microsoft ResearchDec 5, 2022~131 min
- DecRobust Speech Recognition via Large-Scale Weak Supervisionpretraining2212.04356OpenAIDec 6, 2022~119 min
- NovCrosslingual Generalization through Multitask Finetuningmultimodal2211.01786EleutherAINov 3, 2022~106 min
- NovRead Moretraining-methods2211.05100EleutherAINov 9, 2022~119 min
- SepAudioLM: a Language Modeling Approach to Audio Generationpretraining2209.03143Sep 7, 2022~118 min
- MayCoCa: Contrastive Captioners are Image-Text Foundation Modelsmultimodal2205.01917Google ResearchMay 4, 2022~112 min
- MayGIT: A Generative Image-to-text Transformer for Vision and Languagemultimodal2205.14100Microsoft ResearchMay 27, 2022~114 min
- AprHierarchical Text-Conditional Image Generation with CLIP Latentsmultimodal2204.06125Apr 13, 2022~111 min
- AprFlamingo: a Visual Language Model for Few-Shot Learningmultimodal2204.14198Apr 29, 2022~97 min
- AprDo As I Can, Not As I Say: Grounding Language in Robotic Affordancesuncategorized2204.01691Apr 4, 2022~124 min
- JanBLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generationmultimodal2201.12086SalesforceJan 28, 2022~104 min
2021
12- DecHigh-Resolution Image Synthesis with Latent Diffusion Modelsdiffusion2112.10752AppleDec 20, 2021~128 min
- DecContriever: Unsupervised Dense Information Retrieval with Contrastive Learningretrieval2112.09118Meta AI / FAIRDec 16, 2021~103 min
- NovFlorence: A New Foundation Model for Computer Visionvision2111.11432Nov 22, 2021~118 min
- AugSimVLM: Simple Visual Language Model Pretraining with Weak Supervisionmultimodal2108.10904Meta AI / FAIRAug 24, 2021~111 min
- AugSayCan: Do As I Can, Not As I Sayscaling-laws2108.07258Stanford NLPAug 16, 2021~107 min
- JulALBEF: Align Before Fusemultimodal2107.07651Jul 16, 2021~118 min
- MayContrastive Learning for Many-to-many Multilingual Neural Machine Translationtraining-methods2105.09501May 20, 2021~117 min
- FebZero-Shot Text-to-Image Generationarchitecture2102.120921,134 citesFeb 24, 2021~111 min
- FebViLT: Vision-and-Language Transformer Without Convolution or Region Supervisionmultimodal2102.03334Feb 5, 2021~128 min
- FebALIGN: Large-Scale Image-Text Representation Learning with Noisy Text Supervisionmultimodal2102.05918Kakao Brain1,196 citesFeb 11, 2021~111 min
- FebA Fast Transformer Decoding System with Better Memory Bandwidth Utilizationmultimodal2103.00020Apple5,296 citesFeb 26, 2021~130 min
- JanVinVL: Revisiting Visual Representations in Vision-Language Modelsmultimodal2101.00529Jan 2, 2021~103 min
2020
5- OctScaling Laws for Autoregressive Generative Modelingscaling-laws2010.14701Oct 28, 2020~128 min
- Junwav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representationspretraining2006.11477Meta AI / FAIRJun 20, 2020~131 min
- MaySpeech Recognition and Multi-Speaker Diarization of Long Conversationsmultimodal2005.08072NVIDIAMay 16, 2020~104 min
- AprOSCAR: Object-Semantics Aligned Pre-training for Vision-Language Tasksmultimodal2004.06165135 citesApr 13, 2020~128 min
- MarNeRF: Representing Scenes as Neural Radiance Fields for View Synthesisvision2003.08934526 citesMar 19, 2020~114 min
2019
6- NovUnsupervised Cross-lingual Representation Learning at Scalepretraining1911.02116Microsoft Research539 citesNov 5, 2019~92 min
- SepUNITER: Learning Universal Image-Text Representationsmultimodal1909.11740184 citesSep 25, 2019~113 min
- AugViLBERT: Pretraining Task-Agnostic Visiolinguistic Representationsmultimodal1908.02265Aug 6, 2019~109 min
- AugVisualBERT: A Simple and Performant Baseline for Vision and Languagemultimodal1908.03557Aug 9, 2019~119 min
- AugLXMERT: Learning Cross-Modality Encoder Representations from Transformersmultimodal1908.07490Aug 20, 2019~111 min
- FebLanguage Models are Unsupervised Multitask Learnerstraining-methods1902.01313Feb 4, 2019~107 min
2018
12017
3- NovNeural Discrete Representation Learningarchitecture1711.009371,969 citesNov 2, 2017~112 min
- OctFraud Detection: Using Relational Graph Learning to Detect Collusionarchitecture1710.10903UberOct 30, 2017~112 min
- JulBottom-Up and Top-Down Attention for Image Captioning and Visual Question Answeringvision1707.07998Jul 25, 2017~126 min