TodayAI

资源库

Inference & Serving

面向模型推理、本地运行与在线服务的运行时与服务框架。

BentoML

BentoML

面向机器学习模型打包与服务的开源框架。

servingdeploymentml
Inference & Serving

CTranslate2

OpenNMT

面向 Transformer 模型的快速推理引擎,常用于翻译与生成场景。

inferencetransformer
Inference & Serving

exllama

turboderp

面向 GPU 的高效量化 LLM 推理引擎。

inferencegpullm
Inference & Serving

Hugging Face Endpoints

Hugging Face

Hugging Face Inference Endpoints 官方文档,用于托管模型推理服务。

servingdocsinference
Inference & Serving

KServe

KServe

Kubernetes 上的标准化模型推理平台。

servingkubernetesml
Inference & Serving

llama.cpp

ggml

用 C/C++ 实现的高效本地 LLM 推理引擎。

inferencelocalllm
Inference & Serving

llamafile

Mozilla

Mozilla 开源的单文件本地 LLM 运行方案。

inferencelocalllm
Inference & Serving

MLX

Apple

苹果开源的阵列框架,面向 Apple silicon 上的机器学习计算。

inferenceappleframework
Inference & Serving

MLX-LM

Apple

基于 MLX 的大语言模型运行与微调工具包。

inferenceapplellm
Inference & Serving

Ollama

Ollama

用于本地运行与管理大语言模型的开源工具。

inferencelocalllm
Inference & Serving

ONNX Runtime GenAI

Microsoft

微软开源的生成式 AI ONNX Runtime 扩展,用于跨平台推理。

inferenceonnxllm
Inference & Serving

OpenLLM

BentoML

BentoML 开源的 LLM 服务框架,用于自托管模型 API。

servingllmframework
Inference & Serving

Ray Serve

Anyscale / Ray

Ray 官方模型服务文档,用于可扩展在线推理部署。

servingdistributeddocs
Inference & Serving

SGLang

SGLang Project

面向结构化生成与高吞吐 LLM 服务的推理运行时。

inferenceservingllm
Inference & Serving

TensorRT-LLM

NVIDIA

NVIDIA 开源的高性能大模型推理优化库。

inferencenvidiallm
Inference & Serving

Text Generation Inference

Hugging Face

Hugging Face 开源的生产级文本生成推理服务。

inferenceservingllm
Inference & Serving

Triton Inference Server

NVIDIA

NVIDIA 开源的高性能多框架模型推理服务器。

servingnvidiainference
Inference & Serving

vLLM

vLLM Project

面向大语言模型的高吞吐量推理与服务框架。

inferenceservingllm
Inference & ServingApache-2.0