资源库
Papers
发现值得关注的 AI 论文、技术报告与研究成果。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
DeepSeek-AI · 2025
通过大规模强化学习激励模型形成可观察的长链推理行为。
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
Xiaokang Chen, Zhiyu Wu 等 · 2025
提出统一多模态理解与生成的 Janus-Pro,并研究数据与模型扩展。
OpenAI o3 and o4-mini System Card
OpenAI · 2025
OpenAI o3 与 o4-mini 系统卡,概述新一代推理模型的安全评估。
Qwen2.5-VL Technical Report
Qwen Team · 2025
介绍 Qwen2.5-VL 在视觉理解与代理能力上的技术进展。
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
Xinyu Guan, Li Lyna Zhang 等 · 2025
研究小模型通过自进化深度思考掌握数学推理的方法。
s1: Simple test-time scaling
Niklas Muennighoff, Zitong Yang 等 · 2025
提出简洁的测试时扩展方法,用有限样本激发更强推理表现。
Search-o1: Agentic Search-Enhanced Large Reasoning Models
Xiaoxi Li, Guanting Dong 等 · 2025
将智能体式搜索与大推理模型结合,增强复杂问题求解。
Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity
Soyeong Jeong, Jinheon Baek 等 · 2024 · NAACL 2024
按问题复杂度自适应选择检索策略,平衡效果与开销。
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
Pranav Putta, Edmund Mills 等 · 2024
结合搜索与学习改进自主 Agent 在复杂网页任务上的表现。
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
Chang Ma, Junlei Zhang 等 · 2024
提出多轮 LLM Agent 的分析性评测面板 AgentBoard。
Arena-Hard-Auto: An Automatic LLM Evaluation Pipeline for Instruction-tuned Models
Tianle Li, Wei-Lin Chiang 等 · 2024
提出自动化高难度指令模型评测流水线 Arena-Hard-Auto。
Aria: An Open Multimodal Native Mixture-of-Experts Model
Dongxu Li, Yudong Liu 等 · 2024
提出原生多模态混合专家开放模型 Aria。
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
Zhifeng Kong, Arushi Goel 等 · 2024
提出具备少样本与对话能力的音频语言模型 Audio Flamingo。
AutoGen Studio: A No-Code Developer Tool for Building and Debugging Multi-Agent Systems
Victor Dibia, Jingya Wang 等 · 2024
介绍面向多智能体系统构建与调试的无代码工具。
BitNet b1.58: The Era of 1-bit LLMs
Shuming Ma, Hongyu Wang 等 · 2024
提出约 1.58-bit 的量化语言模型训练与推理方案。
Chameleon: Mixed-Modal Early-Fusion Foundation Models
Chameleon Team · 2024
提出早期融合的混合模态基础模型,统一处理图像与文本。
Claude 3 Model Card
Anthropic · 2024
Anthropic Claude 3 模型卡,概述模型能力、安全评估与使用边界。
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
Zhuoyi Yang, Jiayan Teng 等 · 2024
提出带专家 Transformer 的文生视频扩散模型 CogVideoX。
Command R+: Retrieval-Augmented Generation at Production Scale
Cohere · 2024
Cohere Command R+ 技术介绍,面向生产级检索增强生成。
Corrective Retrieval Augmented Generation
Shi-Qi Yan, Jia-Chen Gu 等 · 2024
通过评估检索质量并触发纠正,降低低质量检索对生成的影响。
CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens
Zhihao Du, Qian Chen 等 · 2024
提出基于监督语义词元的可扩展多语言零样本文生语音系统。
CRAG: Comprehensive RAG Benchmark
Xiao Yang, Kai Sun 等 · 2024
提出覆盖多领域的综合 RAG 评测基准 CRAG。
DataComp-LM: In search of the next generation of training sets for language models
Jeffrey Li, Alex Fang 等 · 2024
提出 DataComp-LM,系统探索下一代语言模型训练数据配方。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-AI · 2024
介绍 DeepSeek-V2 的 MoE 架构、多头潜在注意力与训练效率改进。
DeepSeek-V3 Technical Report
DeepSeek-AI · 2024
介绍 DeepSeek-V3 的大规模 MoE 架构、训练方法与开源模型表现。
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
Zhiyu Wu, Xiaokang Chen 等 · 2024
提出基于 MoE 的 DeepSeek-VL2 多模态理解模型。
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Zhihong Shao, Peiyi Wang 等 · 2024
结合数学语料与强化学习方法,提升开源模型数学推理能力。
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
Yinmin Zhong, Shengyu Liu 等 · 2024
将 prefill 与 decoding 解耦,优化大模型服务有效吞吐。
EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty
Yuhui Li, Fangyun Wei 等 · 2024
提出 EAGLE,从特征层面改进投机采样加速推理。
Executable Code Actions Elicit Better LLM Agents
Xingyao Wang, Yangyi Chen 等 · 2024 · ICML 2024
研究将可执行代码作为 Agent 动作空间以提升任务完成能力。
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
Yushen Chen, Zhikang Niu 等 · 2024
用流匹配方法实现流畅且忠实的零样本语音合成。
FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
Jay Shah, Ganesh Bikshandi 等 · 2024
利用异步与低精度进一步提升注意力计算速度与精度。
From Local to Global: A Graph RAG Approach to Query-Focused Summarization
Darren Edge, Ha Trinh 等 · 2024
提出 GraphRAG,用知识图谱与社区摘要支持查询聚焦总结。
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Gemini Team, Google · 2024
介绍 Gemini 1.5 在超长上下文与多模态理解上的能力。
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
Mantas Mazeika, Long Phan 等 · 2024
提出标准化自动红队与拒答鲁棒性评测框架 HarmBench。
HunyuanVideo: A Systematic Framework For Large Video Generative Models
Tencent Hunyuan Foundation Model Team · 2024
系统介绍面向大规模视频生成的 HunyuanVideo 框架。
Instruct-Imagen: Image Generation with Multi-modal Instruction
Hexiang Hu, Kelvin C.K. Chan 等 · 2024
研究用多模态指令控制图像生成模型。
KTO: Model Alignment as Prospect Theoretic Optimization
Kawin Ethayarajh, Winnie Xu 等 · 2024
用前景理论框架做模型对齐,可不依赖成对偏好。
Latte: Latent Diffusion Transformer for Video Generation
Xin Ma, Yaohui Wang 等 · 2024
提出潜空间扩散 Transformer 用于视频生成。
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
Naman Jain, King Han 等 · 2024
提出持续更新的代码评测基准,降低数据污染风险。
LLaVA-OneVision: Easy Visual Task Transfer
Bo Li, Yuanhan Zhang 等 · 2024
提出面向单图、多图与视频任务迁移的 LLaVA-OneVision。
LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs
Ziyan Jiang, Xueguang Ma, Wenhu Chen · 2024
利用长上下文模型扩大检索单元,简化多跳问答中的检索负担。
Lookahead Decoding for Lossless Speedup of Large Language Model Inference
Yichao Fu, Peter Bailis 等 · 2024
提出前瞻解码,在不改模型分布的前提下加速推理。
Lumiere: A Space-Time Diffusion Model for Video Generation
Omer Bar-Tal, Hila Chefer 等 · 2024
提出时空扩散模型 Lumiere,用于连贯视频生成。
M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation
Jianlv Chen, Shitao Xiao 等 · 2024
提出支持多语言、多功能与多粒度的 M3 文本嵌入模型。
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
Zhangchen Xu, Feng Jiang 等 · 2024
通过提示已对齐模型自发生成高质量对齐数据。
Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads
Tianle Cai, Yuhong Li 等 · 2024
用多个解码头进行并行候选生成以加速推理。
MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Yubo Wang, Xueguang Ma 等 · 2024
提出更具挑战性的多任务语言理解基准 MMLU-Pro。