资源库
Inference & Serving
面向模型推理、本地运行与在线服务的运行时与服务框架。
BentoML
BentoML
面向机器学习模型打包与服务的开源框架。
CTranslate2
OpenNMT
面向 Transformer 模型的快速推理引擎,常用于翻译与生成场景。
exllama
turboderp
面向 GPU 的高效量化 LLM 推理引擎。
Hugging Face Endpoints
Hugging Face
Hugging Face Inference Endpoints 官方文档,用于托管模型推理服务。
KServe
KServe
Kubernetes 上的标准化模型推理平台。
llama.cpp
ggml
用 C/C++ 实现的高效本地 LLM 推理引擎。
llamafile
Mozilla
Mozilla 开源的单文件本地 LLM 运行方案。
MLX
Apple
苹果开源的阵列框架,面向 Apple silicon 上的机器学习计算。
MLX-LM
Apple
基于 MLX 的大语言模型运行与微调工具包。
Ollama
Ollama
用于本地运行与管理大语言模型的开源工具。
ONNX Runtime GenAI
Microsoft
微软开源的生成式 AI ONNX Runtime 扩展,用于跨平台推理。
OpenLLM
BentoML
BentoML 开源的 LLM 服务框架,用于自托管模型 API。
Ray Serve
Anyscale / Ray
Ray 官方模型服务文档,用于可扩展在线推理部署。
SGLang
SGLang Project
面向结构化生成与高吞吐 LLM 服务的推理运行时。
TensorRT-LLM
NVIDIA
NVIDIA 开源的高性能大模型推理优化库。
Text Generation Inference
Hugging Face
Hugging Face 开源的生产级文本生成推理服务。
Triton Inference Server
NVIDIA
NVIDIA 开源的高性能多框架模型推理服务器。
vLLM
vLLM Project
面向大语言模型的高吞吐量推理与服务框架。