TodayAI

资源库

Papers

发现值得关注的 AI 论文、技术报告与研究成果。

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-AI · 2025

通过大规模强化学习激励模型形成可观察的长链推理行为。

deepseekrlreasoning
推理arXiv

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Xiaokang Chen, Zhiyu Wu 等 · 2025

提出统一多模态理解与生成的 Janus-Pro,并研究数据与模型扩展。

janusmultimodalgeneration
多模态与视觉arXiv

OpenAI o3 and o4-mini System Card

OpenAI · 2025

OpenAI o3 与 o4-mini 系统卡,概述新一代推理模型的安全评估。

o3reasoningsafety
推理Technical Report

Qwen2.5-VL Technical Report

Qwen Team · 2025

介绍 Qwen2.5-VL 在视觉理解与代理能力上的技术进展。

qwen2-5-vlvision-languagemultimodal
多模态与视觉arXiv

rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking

Xinyu Guan, Li Lyna Zhang 等 · 2025

研究小模型通过自进化深度思考掌握数学推理的方法。

mathsmall-modelself-evolve
推理arXiv

s1: Simple test-time scaling

Niklas Muennighoff, Zitong Yang 等 · 2025

提出简洁的测试时扩展方法,用有限样本激发更强推理表现。

test-time-computescalingreasoning
推理arXiv

Search-o1: Agentic Search-Enhanced Large Reasoning Models

Xiaoxi Li, Guanting Dong 等 · 2025

将智能体式搜索与大推理模型结合,增强复杂问题求解。

searchagentreasoning
推理arXiv

Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity

Soyeong Jeong, Jinheon Baek 等 · 2024 · NAACL 2024

按问题复杂度自适应选择检索策略,平衡效果与开销。

adaptive-ragroutingrag
RAG 与检索arXiv

Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents

Pranav Putta, Edmund Mills 等 · 2024

结合搜索与学习改进自主 Agent 在复杂网页任务上的表现。

web-agentsearchlearning
AgentarXiv

AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents

Chang Ma, Junlei Zhang 等 · 2024

提出多轮 LLM Agent 的分析性评测面板 AgentBoard。

agentboardevaluationmulti-turn
AgentarXiv

Arena-Hard-Auto: An Automatic LLM Evaluation Pipeline for Instruction-tuned Models

Tianle Li, Wei-Lin Chiang 等 · 2024

提出自动化高难度指令模型评测流水线 Arena-Hard-Auto。

arena-hardbenchmarkevaluation
评测与安全arXiv

Aria: An Open Multimodal Native Mixture-of-Experts Model

Dongxu Li, Yudong Liu 等 · 2024

提出原生多模态混合专家开放模型 Aria。

ariamoemultimodal
多模态与视觉arXiv

Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

Zhifeng Kong, Arushi Goel 等 · 2024

提出具备少样本与对话能力的音频语言模型 Audio Flamingo。

audio-flamingoaudiofew-shot
语音与音频arXiv

AutoGen Studio: A No-Code Developer Tool for Building and Debugging Multi-Agent Systems

Victor Dibia, Jingya Wang 等 · 2024

介绍面向多智能体系统构建与调试的无代码工具。

autogenmulti-agentdevtools
AgentarXiv

BitNet b1.58: The Era of 1-bit LLMs

Shuming Ma, Hongyu Wang 等 · 2024

提出约 1.58-bit 的量化语言模型训练与推理方案。

bitnetquantizationllm
系统与效率arXiv

Chameleon: Mixed-Modal Early-Fusion Foundation Models

Chameleon Team · 2024

提出早期融合的混合模态基础模型,统一处理图像与文本。

chameleonearly-fusionmultimodal
多模态与视觉arXiv

Claude 3 Model Card

Anthropic · 2024

Anthropic Claude 3 模型卡,概述模型能力、安全评估与使用边界。

claudemodel-cardsafety
基础模型Technical Report

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang, Jiayan Teng 等 · 2024

提出带专家 Transformer 的文生视频扩散模型 CogVideoX。

cogvideoxtext-to-videodiffusion
图像与视频生成arXiv

Command R+: Retrieval-Augmented Generation at Production Scale

Cohere · 2024

Cohere Command R+ 技术介绍,面向生产级检索增强生成。

command-rragenterprise
RAG 与检索Technical Report

Corrective Retrieval Augmented Generation

Shi-Qi Yan, Jia-Chen Gu 等 · 2024

通过评估检索质量并触发纠正,降低低质量检索对生成的影响。

cragcorrectiverag
RAG 与检索arXiv

CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Zhihao Du, Qian Chen 等 · 2024

提出基于监督语义词元的可扩展多语言零样本文生语音系统。

cosyvoicettsmultilingual
语音与音频arXiv

CRAG: Comprehensive RAG Benchmark

Xiao Yang, Kai Sun 等 · 2024

提出覆盖多领域的综合 RAG 评测基准 CRAG。

crag-benchmarkragevaluation
RAG 与检索arXiv

DataComp-LM: In search of the next generation of training sets for language models

Jeffrey Li, Alex Fang 等 · 2024

提出 DataComp-LM,系统探索下一代语言模型训练数据配方。

datacompdatasetpretraining
训练与对齐arXiv

DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

DeepSeek-AI · 2024

介绍 DeepSeek-V2 的 MoE 架构、多头潜在注意力与训练效率改进。

deepseekmoemla
基础模型arXiv

DeepSeek-V3 Technical Report

DeepSeek-AI · 2024

介绍 DeepSeek-V3 的大规模 MoE 架构、训练方法与开源模型表现。

deepseekmoefoundation-model
基础模型arXiv

DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Zhiyu Wu, Xiaokang Chen 等 · 2024

提出基于 MoE 的 DeepSeek-VL2 多模态理解模型。

deepseekmoevision-language
多模态与视觉arXiv

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Zhihong Shao, Peiyi Wang 等 · 2024

结合数学语料与强化学习方法,提升开源模型数学推理能力。

mathrldeepseek
推理arXiv

DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving

Yinmin Zhong, Shengyu Liu 等 · 2024

将 prefill 与 decoding 解耦,优化大模型服务有效吞吐。

distserveservingdisaggregation
系统与效率arXiv

EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty

Yuhui Li, Fangyun Wei 等 · 2024

提出 EAGLE,从特征层面改进投机采样加速推理。

eaglespeculative-decodinginference
系统与效率arXiv

Executable Code Actions Elicit Better LLM Agents

Xingyao Wang, Yangyi Chen 等 · 2024 · ICML 2024

研究将可执行代码作为 Agent 动作空间以提升任务完成能力。

code-actionsagenttool-use
AgentarXiv

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching

Yushen Chen, Zhikang Niu 等 · 2024

用流匹配方法实现流畅且忠实的零样本语音合成。

f5-ttsflow-matchingtts
语音与音频arXiv

FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision

Jay Shah, Ganesh Bikshandi 等 · 2024

利用异步与低精度进一步提升注意力计算速度与精度。

flashattentionattentiongpu
系统与效率arXiv

From Local to Global: A Graph RAG Approach to Query-Focused Summarization

Darren Edge, Ha Trinh 等 · 2024

提出 GraphRAG,用知识图谱与社区摘要支持查询聚焦总结。

graphragknowledge-graphsummarization
RAG 与检索arXiv

Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Gemini Team, Google · 2024

介绍 Gemini 1.5 在超长上下文与多模态理解上的能力。

geminilong-contextmultimodal
基础模型arXiv

HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Mantas Mazeika, Long Phan 等 · 2024

提出标准化自动红队与拒答鲁棒性评测框架 HarmBench。

harmbenchred-teamingrefusal
评测与安全arXiv

HunyuanVideo: A Systematic Framework For Large Video Generative Models

Tencent Hunyuan Foundation Model Team · 2024

系统介绍面向大规模视频生成的 HunyuanVideo 框架。

hunyuanvideotext-to-videofoundation-model
图像与视频生成arXiv

Instruct-Imagen: Image Generation with Multi-modal Instruction

Hexiang Hu, Kelvin C.K. Chan 等 · 2024

研究用多模态指令控制图像生成模型。

instruct-imagentext-to-imageinstruction
图像与视频生成arXiv

KTO: Model Alignment as Prospect Theoretic Optimization

Kawin Ethayarajh, Winnie Xu 等 · 2024

用前景理论框架做模型对齐,可不依赖成对偏好。

ktopreferencealignment
训练与对齐arXiv

Latte: Latent Diffusion Transformer for Video Generation

Xin Ma, Yaohui Wang 等 · 2024

提出潜空间扩散 Transformer 用于视频生成。

lattevideodit
图像与视频生成arXiv

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Naman Jain, King Han 等 · 2024

提出持续更新的代码评测基准,降低数据污染风险。

livecodebenchcodecontamination
评测与安全arXiv

LLaVA-OneVision: Easy Visual Task Transfer

Bo Li, Yuanhan Zhang 等 · 2024

提出面向单图、多图与视频任务迁移的 LLaVA-OneVision。

llavavision-languagetransfer
多模态与视觉arXiv

LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs

Ziyan Jiang, Xueguang Ma, Wenhu Chen · 2024

利用长上下文模型扩大检索单元,简化多跳问答中的检索负担。

longraglong-contextrag
RAG 与检索arXiv

Lookahead Decoding for Lossless Speedup of Large Language Model Inference

Yichao Fu, Peter Bailis 等 · 2024

提出前瞻解码,在不改模型分布的前提下加速推理。

lookaheaddecodingacceleration
系统与效率arXiv

Lumiere: A Space-Time Diffusion Model for Video Generation

Omer Bar-Tal, Hila Chefer 等 · 2024

提出时空扩散模型 Lumiere,用于连贯视频生成。

lumierevideodiffusion
图像与视频生成arXiv

M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation

Jianlv Chen, Shitao Xiao 等 · 2024

提出支持多语言、多功能与多粒度的 M3 文本嵌入模型。

bge-m3embeddingsmultilingual
RAG 与检索arXiv

Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing

Zhangchen Xu, Feng Jiang 等 · 2024

通过提示已对齐模型自发生成高质量对齐数据。

magpiesynthetic-dataalignment
训练与对齐arXiv

Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads

Tianle Cai, Yuhong Li 等 · 2024

用多个解码头进行并行候选生成以加速推理。

medusaspeculative-decodinginference
系统与效率arXiv

MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark

Yubo Wang, Xueguang Ma 等 · 2024

提出更具挑战性的多任务语言理解基准 MMLU-Pro。

mmlu-probenchmarkevaluation
评测与安全arXiv