TodayAI

用 Hugging Face Inference Providers 调用托管推理

通过 Hugging Face Inference Providers 调用托管模型,而不先自建 GPU。

基于 Hugging Face Docs 整理 · Inference · 官方资料

Inference Providers 把多家托管推理接到 Hugging Face 账号与路由层。

这篇完成:配置 token,调用一个文本生成或对话端点,打印返回结果。

发起一次托管推理

设置 HF_TOKEN,按官方 Inference Providers 文档选择 provider 与模型。优先复制当前文档中的 client 示例,避免混用旧 Inference API 字段。

InferenceClient 示意

python
import os
from huggingface_hub import InferenceClient

client = InferenceClient(token=os.environ["HF_TOKEN"])
# 具体 provider/model 以官方 Inference Providers 页面为准
result = client.chat_completion(
    model="meta-llama/Llama-3.1-8B-Instruct",
    messages=[{"role": "user", "content": "用一句话解释 embedding。"}],
    max_tokens=128,
)
print(result)

最容易踩的坑

401 / 模型不可用

检查 token 权限、provider 是否开通,以及模型是否在该 provider 上线。

官方资料

Hugging Face DocsInference Providers