2026
23- MayContext Training with Active Information Seekingcontext-optimization2605.13050DeepmindMay 13, 2026~123 min
- MayMEME: Multi-entity & Evolving Memory Evaluationevaluation2605.12477KAIST AIMay 12, 2026~130 min
- MayOpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agentsmultimodal2605.05185Tencent HunyuanMay 6, 2026~104 min
- MayRetrieval from Within: An Intrinsic Capability of Attention-Based Modelsretrieval2605.05806NVIDIAMay 7, 2026~119 min
- MayRethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?retrieval2605.10848May 11, 2026~110 min
- AprProcess Reward Agents for Steering Knowledge-Intensive Reasoningreasoning2604.09482ETH ZurichApr 10, 2026score 9~100 min
- AprDual-View Training for Instruction-Following Information Retrievalretrieval2604.18845SnowflakeApr 20, 2026~95 min
- MarUnderstand and Accelerate Memory Processing Pipeline for Large Language Model Inferenceinference-optimization2603.29002Mar 30, 2026score 9~128 min
- MarLearning to Retrieve from Agent Trajectoriesretrieval2604.04949RUC-GSAI-IIRLabMar 30, 2026score 9~118 min
- MarLaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrievaltraining-methods2603.01425Alibaba DAMOMar 2, 2026score 2~116 min
- MarGrounding World Simulation Models in a Real-World Metropolisvision2603.15583NAVER AI LabMar 16, 2026score 9~120 min
- FebAgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Researchagents2602.06540OpenBMBFeb 6, 2026score 9~98 min
- FebPrincipled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendationllm-systems2602.07298AI at MetaFeb 7, 2026score 4~120 min
- FebSemantic Search At LinkedInllm-systems2602.07309LinkedInFeb 7, 2026~139 min
- FebCC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answeringmultimodal2602.23952Alibaba CloudFeb 27, 2026score 2~95 min
- FebSearch-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaborationrl-training2602.03647Feb 3, 2026~113 min
- Febjina-embeddings-v5-text: Task-Targeted Embedding Distillationtraining-methods2602.15547Feb 17, 2026~106 min
- JanOver-Searching in Search-Augmented Large Language Modelsagents2601.05503AppleJan 9, 2026score 3~131 min
- JanAACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Contextcode2601.19494AoneJan 27, 2026score 3~111 min
- JanFine-tuning Small Language Models as Efficient Enterprise Search Relevance Labelersevaluation2601.03211Jan 6, 2026~113 min
- JanRetrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilitiesevaluation2601.21937ByteDance SeedJan 29, 2026score 2~117 min
- JanQwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Rankingmultimodal2601.04720Qwen / Alibaba CloudJan 8, 2026~114 min
- JanChaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewardstraining-methods2601.06021Z.aiJan 9, 2026score 9~112 min
2025
30- DecMemory in the Age of AI Agentsagents2512.13564Dec 15, 2025score 9~101 min
- DecEcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerceevaluation2512.08868TongyiLabDec 9, 2025score 7~95 min
- DecThe FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factualityevaluation2512.10791DeepmindDec 11, 2025score 9~127 min
- DecNested Browser-Use Learning for Agentic Information Seekinguncategorized2512.23647TongyiLabDec 29, 2025score 9~115 min
- NovMixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interactionarchitecture2512.07846Nov 25, 2025~117 min
- NovLlama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasksllm-systems2511.07025NVIDIANov 10, 2025score 9~99 min
- NovReusing Pre-Training Data at Test Time is a Compute Multiplierpretraining2511.04234AppleNov 6, 2025~116 min
- NovReinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMstraining-methods2511.05933Meta AINov 8, 2025score 9~116 min
- NovDeep Research: A Systematic Surveyuncategorized2512.02038Nov 24, 2025~129 min
- OctWebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seekingagents2510.24697TongyiLabOct 28, 2025score 9~124 min
- OctTongyi DeepResearch Technical Reportagents2510.24701Oct 28, 2025~115 min
- OctSAIL-Embedding Technical Report: Omni-modal Embedding Foundation Modelmultimodal2510.12709ByteDanceOct 14, 2025score 9~151 min
- OctRepurposing Synthetic Data for Fine-grained Search Agent Supervisionrl-training2510.24694TongyiLabOct 28, 2025score 9~105 min
- OctScaling Up Efficient Small Language Models Serving and Deployment for Semantic Job Searchserving2510.22101LinkedInOct 25, 2025~111 min
- OctScalable In-context Ranking with Generative Modelstraining-methods2510.05396DeepmindOct 6, 2025score 8~107 min
- OctE2Rank: Your Text Embedding can Also be an Effective and Efficient Listwise Rerankertraining-methods2510.22733Alibaba DAMOOct 26, 2025score 9~108 min
- OctTowards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculumvision2510.27571Alibaba DAMOOct 31, 2025score 8~135 min
- SepMetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interactionmultimodal2509.18095Sep 22, 2025score 9~117 min
- AugMemento: Fine-tuning LLM Agents without Fine-tuning LLMsagents2508.16153Aug 22, 2025score 9~114 min
- AugOpen Data Synthesis For Deep Researchdata2509.00375Aug 30, 2025~139 min
- AugReportBench: Evaluating Deep Research Agents via Academic Survey Tasksevaluation2508.15804ByteDanceAug 14, 2025score 6~112 min
- AugSeeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memorymultimodal2508.09736ByteDance SeedAug 13, 2025score 8~110 min
- AugSemantic IDs for Joint Generative Search and Recommendationpretraining2508.10478DoorDashAug 14, 2025score 3~123 min
- AugOn the Theoretical Limitations of Embedding-Based Retrievalretrieval2508.21038Aug 28, 2025~102 min
- JulA Survey of Context Engineering for Large Language Modelsprompting2507.13334Jul 17, 2025~88 min
- JunQwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Modelspretraining2506.05176Qwen / Alibaba CloudJun 5, 2025score 10~82 min
- JunMERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Queryretrieval2506.03144ByteDanceJun 3, 2025score 8~123 min
- MayZeroSearch: Incentivize the Search Capability of LLMs without Searchingtraining-methods2505.04588Alibaba DAMOMay 7, 2025~114 min
- MarRankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluationevaluation2503.19092Mar 24, 2025~123 min
- MarSearch-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learningtraining-methods2503.09516Mar 12, 2025score 10~105 min
2024
14- OctInference Scaling for Long-Context Retrieval Augmented Generationreasoning2410.04343Oct 6, 2024~124 min
- OctMulti-Field Adaptive Retrievalretrieval2410.20056Oct 26, 2024~108 min
- AugWriting in the Margins: Better Inference Pattern for Long Context Retrievalinference-optimization2408.14906Aug 27, 2024score 8~108 min
- JulMindSearch: Mimicking Human Minds Elicits Deep AI Searcheragents2407.20183Jul 29, 2024score 9~93 min
- JulHuman-inspired Episodic Memory for Infinite Context LLMsinference-optimization2407.09450Jul 12, 2024score 9~127 min
- JulScaling Retrieval-Based Language Models with a Trillion-Token Datastoreretrieval2407.12854Jul 9, 2024~112 min
- JulLiNR: Model Based Neural Retrieval on GPUs at LinkedInserving2407.13218Jul 18, 2024~132 min
- MayNearest Neighbor Speculative Decoding for LLM Generation and Attributionllm-systems2405.19325May 29, 2024score 9~103 min
- MayMS MARCO Web Search: a Large-scale Information-rich Web Dataset with Millions of Real Click Labelsno summary yetcs-ir2405.075268 citesMay 13, 2024score 6
- AprRULER: What's the Real Context Size of Your Long-Context Language Models?evaluation2404.06654Qwen / Alibaba CloudApr 9, 2024score 10~109 min
- MarGecko: Versatile Text Embeddings Distilled from Large Language Modelsdata2403.20327DeepMindMar 29, 2024score 9~98 min
- MarRAFT: Adapting Language Model to Domain Specific RAGtraining-methods2403.10131Mar 15, 2024~103 min
- FebA Human-Inspired Reading Agent with Gist Memory of Very Long Contextsagents2402.09727DeepMindFeb 15, 2024score 9~103 min
- FebBenchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERTretrieval2402.07440Together AIFeb 12, 2024~97 min
2023
3- SepScaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuningpretraining2309.02591Sep 5, 2023score 10~113 min
- MayBM25 Query Augmentation Learned End-to-Endretrieval2305.14087May 23, 2023~106 min
- AprRethinking the Role of Token Retrieval in Multi-Vector Retrievalretrieval2304.01982Apr 4, 2023~101 min
2022
3- DecHyDE: Precise Zero-Shot Dense Retrieval without Relevance Labelsretrieval2212.10496DoorDashDec 20, 2022~94 min
- AugAtlas: Few-shot Learning with Retrieval Augmented Language Modelsretrieval2208.03299Aug 5, 2022~124 min
- MayOptimizing Test-Time Query Representations for Dense Retrievalinference-optimization2205.12680May 25, 2022~134 min
2021
4- DecWebGPT: Browser-Assisted Question-Answering with Human Feedbackagents2112.09332Dec 17, 2021~112 min
- DecContriever: Unsupervised Dense Information Retrieval with Contrastive Learningretrieval2112.09118Meta AI / FAIRDec 16, 2021~103 min
- JulSPLADE: Sparse Lexical and Expansion Model for First Stage Ranking and Re-rankingretrieval2107.05720Jul 12, 2021~95 min
- JanWhat Makes Good In-Context Examples for GPT-3?prompting2101.06804Jan 17, 2021~101 min
2020
6- JulFusion-in-Decoder: Open-Domain Question Answering with Retrieval-Augmented Generationllm-systems2007.01282Jul 2, 2020~90 min
- JulANCE: Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrievalretrieval2007.00808Jul 1, 2020~118 min
- MayRetrieval-Augmented Generation for Knowledge-Intensive NLP Tasksretrieval2005.11401Meta AI / FAIRMay 22, 2020~98 min
- AprDense Passage Retrieval for Open-Domain Question Answeringretrieval2004.04906Meta AI / FAIRApr 10, 2020~113 min
- AprColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERTretrieval2004.12832Apr 27, 2020~118 min
- FebREALM: Retrieval-Augmented Language Model Pre-Trainingpretraining2002.08909Google Research515 citesFeb 10, 2020~113 min
2019
4- NovGeneralization through Memorization: Nearest Neighbor Language Modelsretrieval1911.00172Nov 1, 2019~114 min
- SepLanguage Models as Knowledge Bases?evaluation1909.01066Sep 3, 2019~114 min
- AugSentence-BERT: Sentence Embeddings using Siamese BERT-Networksarchitecture1908.10084MozillaAug 27, 2019~110 min
- JunLatent Retrieval for Weakly Supervised Open Domain Question Answeringretrieval1906.0030067 citesJun 1, 2019~102 min