资源库
基础模型 Papers
面向 Transformer、预训练与基础大模型架构的重要论文。
Claude 3 Model Card
Anthropic · 2024
Anthropic Claude 3 模型卡,概述模型能力、安全评估与使用边界。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-AI · 2024
介绍 DeepSeek-V2 的 MoE 架构、多头潜在注意力与训练效率改进。
DeepSeek-V3 Technical Report
DeepSeek-AI · 2024
介绍 DeepSeek-V3 的大规模 MoE 架构、训练方法与开源模型表现。
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Gemini Team, Google · 2024
介绍 Gemini 1.5 在超长上下文与多模态理解上的能力。
OLMo: Accelerating the Science of Language Models
Dirk Groeneveld, Iz Beltagy 等 · 2024
发布训练过程与数据更透明的开放语言模型,服务科研复现。
Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
Marah Abdin, Sam Ade Jacobs 等 · 2024
介绍面向端侧部署的小参数量高能力语言模型 Phi-3。
Phi-4 Technical Report
Marah Abdin, Jyoti Aneja 等 · 2024
介绍 Phi-4 小参数量高数据质量语言模型的训练与评估。
Qwen2.5 Technical Report
An Yang, Baosong Yang 等 · 2024
介绍 Qwen2.5 在知识、代码与长上下文等方向上的进一步改进。
The Llama 3 Herd of Models
Abhimanyu Dubey, Abhinav Jauhri 等 · 2024
系统报告 Llama 3 系列的数据、训练、评估与多模态扩展。
GPT-4 Technical Report
OpenAI · 2023
报告 GPT-4 的能力评估、多模态表现与对齐相关观察。
LLaMA: Open and Efficient Foundation Language Models
Hugo Touvron, Thibaut Lavril 等 · 2023
发布可公开研究的高效基础语言模型系列,推动开源大模型发展。
Training Compute-Optimal Large Language Models
Jordan Hoffmann, Sebastian Borgeaud 等 · 2022
Chinchilla 研究表明给定计算预算时应更均衡扩大模型与训练数据。
Language Models are Few-Shot Learners
Tom B. Brown, Benjamin Mann 等 · 2020 · NeurIPS 2020
提出 GPT-3,系统展示大规模语言模型在少样本提示下的任务泛化能力。
Scaling Laws for Neural Language Models
Jared Kaplan, Sam McCandlish 等 · 2020
刻画语言模型性能随模型规模、数据量与计算量变化的幂律关系。
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
Colin Raffel, Noam Shazeer 等 · 2019 · JMLR
将多种 NLP 任务统一为文本到文本形式,并系统比较预训练目标。
RoBERTa: A Robustly Optimized BERT Pretraining Approach
Yinhan Liu, Myle Ott 等 · 2019
通过更充分的预训练设置改进 BERT,澄清优化细节对效果的影响。
XLNet: Generalized Autoregressive Pretraining for Language Understanding
Zhilin Yang, Zihang Dai 等 · 2019 · NeurIPS 2019
提出置换语言模型预训练,结合自回归与双向上下文建模优势。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Jacob Devlin, Ming-Wei Chang 等 · 2018 · NAACL 2019
通过掩码语言模型进行双向预训练,确立自然语言理解的预训练微调范式。
ELMo: Deep contextualized word representations
Matthew E. Peters, Mark Neumann 等 · 2018 · NAACL 2018
提出深层上下文词表示,推动预训练语言模型在 NLP 中的应用。
Improving Language Understanding by Generative Pre-Training
Alec Radford, Karthik Narasimhan 等 · 2018
OpenAI GPT 技术报告,展示生成式预训练再微调的语言理解范式。
Attention Is All You Need
Ashish Vaswani, Noam Shazeer 等 · 2017 · NeurIPS 2017
提出基于自注意力的 Transformer 架构,成为后续大模型的核心结构基础。
GloVe: Global Vectors for Word Representation
Jeffrey Pennington, Richard Socher, Christopher D. Manning · 2014 · EMNLP 2014
提出 GloVe,结合全局共现统计学习词向量。
Neural Machine Translation by Jointly Learning to Align and Translate
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · 2014 · ICLR 2015
提出基于注意力的神经机器翻译,是后续注意力机制的重要先导。
Sequence to Sequence Learning with Neural Networks
Ilya Sutskever, Oriol Vinyals, Quoc V. Le · 2014 · NeurIPS 2014
提出序列到序列学习框架,推动神经机器翻译与生成式建模。
Word2Vec: Efficient Estimation of Word Representations in Vector Space
Tomas Mikolov, Kai Chen 等 · 2013
提出 Word2Vec,用高效方法学习词向量表示。