TodayAI

资源库

基础模型 Papers

面向 Transformer、预训练与基础大模型架构的重要论文。

Claude 3 Model Card

Anthropic · 2024

Anthropic Claude 3 模型卡,概述模型能力、安全评估与使用边界。

claudemodel-cardsafety
基础模型Technical Report

DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

DeepSeek-AI · 2024

介绍 DeepSeek-V2 的 MoE 架构、多头潜在注意力与训练效率改进。

deepseekmoemla
基础模型arXiv

DeepSeek-V3 Technical Report

DeepSeek-AI · 2024

介绍 DeepSeek-V3 的大规模 MoE 架构、训练方法与开源模型表现。

deepseekmoefoundation-model
基础模型arXiv

Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Gemini Team, Google · 2024

介绍 Gemini 1.5 在超长上下文与多模态理解上的能力。

geminilong-contextmultimodal
基础模型arXiv

OLMo: Accelerating the Science of Language Models

Dirk Groeneveld, Iz Beltagy 等 · 2024

发布训练过程与数据更透明的开放语言模型,服务科研复现。

olmoopen-sciencefoundation-model
基础模型arXiv

Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Marah Abdin, Sam Ade Jacobs 等 · 2024

介绍面向端侧部署的小参数量高能力语言模型 Phi-3。

phismall-modelon-device
基础模型arXiv

Phi-4 Technical Report

Marah Abdin, Jyoti Aneja 等 · 2024

介绍 Phi-4 小参数量高数据质量语言模型的训练与评估。

phismall-modelfoundation-model
基础模型arXiv

Qwen2.5 Technical Report

An Yang, Baosong Yang 等 · 2024

介绍 Qwen2.5 在知识、代码与长上下文等方向上的进一步改进。

qwenlong-contextfoundation-model
基础模型arXiv

The Llama 3 Herd of Models

Abhimanyu Dubey, Abhinav Jauhri 等 · 2024

系统报告 Llama 3 系列的数据、训练、评估与多模态扩展。

llamafoundation-modelmultimodal
基础模型arXiv

GPT-4 Technical Report

OpenAI · 2023

报告 GPT-4 的能力评估、多模态表现与对齐相关观察。

gptmultimodalevaluation
基础模型arXiv

LLaMA: Open and Efficient Foundation Language Models

Hugo Touvron, Thibaut Lavril 等 · 2023

发布可公开研究的高效基础语言模型系列,推动开源大模型发展。

llamaopen-modelfoundation-model
基础模型arXiv

Training Compute-Optimal Large Language Models

Jordan Hoffmann, Sebastian Borgeaud 等 · 2022

Chinchilla 研究表明给定计算预算时应更均衡扩大模型与训练数据。

scaling-lawschinchillacompute-optimal
基础模型arXiv

Language Models are Few-Shot Learners

Tom B. Brown, Benjamin Mann 等 · 2020 · NeurIPS 2020

提出 GPT-3,系统展示大规模语言模型在少样本提示下的任务泛化能力。

gptfew-shotscaling
基础模型arXiv

Scaling Laws for Neural Language Models

Jared Kaplan, Sam McCandlish 等 · 2020

刻画语言模型性能随模型规模、数据量与计算量变化的幂律关系。

scaling-lawslanguage-modelcompute
基础模型arXiv

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Colin Raffel, Noam Shazeer 等 · 2019 · JMLR

将多种 NLP 任务统一为文本到文本形式,并系统比较预训练目标。

t5text-to-texttransfer-learning
基础模型arXiv

RoBERTa: A Robustly Optimized BERT Pretraining Approach

Yinhan Liu, Myle Ott 等 · 2019

通过更充分的预训练设置改进 BERT,澄清优化细节对效果的影响。

bertpretrainingoptimization
基础模型arXiv

XLNet: Generalized Autoregressive Pretraining for Language Understanding

Zhilin Yang, Zihang Dai 等 · 2019 · NeurIPS 2019

提出置换语言模型预训练,结合自回归与双向上下文建模优势。

xlnetpretraininglanguage-understanding
基础模型arXiv

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Jacob Devlin, Ming-Wei Chang 等 · 2018 · NAACL 2019

通过掩码语言模型进行双向预训练,确立自然语言理解的预训练微调范式。

bertpretraininglanguage-understanding
基础模型arXiv

ELMo: Deep contextualized word representations

Matthew E. Peters, Mark Neumann 等 · 2018 · NAACL 2018

提出深层上下文词表示,推动预训练语言模型在 NLP 中的应用。

elmoembeddingspretraining
基础模型arXiv

Improving Language Understanding by Generative Pre-Training

Alec Radford, Karthik Narasimhan 等 · 2018

OpenAI GPT 技术报告,展示生成式预训练再微调的语言理解范式。

gptpretrainingtransfer
基础模型Technical Report

Attention Is All You Need

Ashish Vaswani, Noam Shazeer 等 · 2017 · NeurIPS 2017

提出基于自注意力的 Transformer 架构,成为后续大模型的核心结构基础。

transformerattentionsequence-modeling
基础模型arXiv

GloVe: Global Vectors for Word Representation

Jeffrey Pennington, Richard Socher, Christopher D. Manning · 2014 · EMNLP 2014

提出 GloVe,结合全局共现统计学习词向量。

gloveembeddingsnlp
基础模型Conference

Neural Machine Translation by Jointly Learning to Align and Translate

Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · 2014 · ICLR 2015

提出基于注意力的神经机器翻译,是后续注意力机制的重要先导。

attentionnmtseq2seq
基础模型arXiv

Sequence to Sequence Learning with Neural Networks

Ilya Sutskever, Oriol Vinyals, Quoc V. Le · 2014 · NeurIPS 2014

提出序列到序列学习框架,推动神经机器翻译与生成式建模。

seq2seqnmtencoder-decoder
基础模型arXiv

Word2Vec: Efficient Estimation of Word Representations in Vector Space

Tomas Mikolov, Kai Chen 等 · 2013

提出 Word2Vec,用高效方法学习词向量表示。

word2vecembeddingsnlp
基础模型arXiv