用 Hugging Face Inference Providers 调用托管推理
通过 Hugging Face Inference Providers 调用托管模型,而不先自建 GPU。
基于 Hugging Face Docs 整理 · Inference · 官方资料
Inference Providers 把多家托管推理接到 Hugging Face 账号与路由层。
这篇完成:配置 token,调用一个文本生成或对话端点,打印返回结果。
发起一次托管推理
设置 HF_TOKEN,按官方 Inference Providers 文档选择 provider 与模型。优先复制当前文档中的 client 示例,避免混用旧 Inference API 字段。
InferenceClient 示意
python
import os
from huggingface_hub import InferenceClient
client = InferenceClient(token=os.environ["HF_TOKEN"])
# 具体 provider/model 以官方 Inference Providers 页面为准
result = client.chat_completion(
model="meta-llama/Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "用一句话解释 embedding。"}],
max_tokens=128,
)
print(result)最容易踩的坑
401 / 模型不可用
检查 token 权限、provider 是否开通,以及模型是否在该 provider 上线。