BAAI · BGE · Embedding
bge-m3
BAAI BGE-M3 是开放权重 Embedding 模型,适合多语言语义检索,而不是对话生成。
查看 Model Card
访问方式:Open weights
它是什么
BGE-M3 由 BAAI 发布,是开放权重 Embedding 模型:把多语言文本编码为向量,用于语义检索与相似度,而不是聊天生成。
同组织还有 BGE Reranker。Embedding 负责召回,Reranking 负责精排;BGE-M3 本身不是生成模型,也不是 Reranker。
检索效果取决于语料、切分和相似度计算。模型本身不构成完整搜索系统。
核心能力
文本向量化
把查询和文档编码成向量,供近邻检索使用。
多语言检索
官方模型卡将其定位为多语言 Embedding,具体语言覆盖以模型卡为准。
开放权重
可按 BAAI 官方模型卡部署。
适合什么任务
- 语义检索和 RAG 召回
- 多语言文档向量化
- 与 text-embedding-3-large、Qwen3-Embedding、Voyage 对照
- 需要开放权重 Embedding 的私有化检索
API 与技术信息
- API
- 开放权重
- 输入
- Text
- 权重
- 开放权重
使用时要注意
- 它不生成答案,后面仍要接生成模型。
- 向量维度和指令前缀以官方模型卡为准。
- 与 bge-reranker-v2-m3 是不同组件。
官方资料
相关模型
相关 TodayAI 指南
- 用 Gemini Embeddings 做文本向量化按 Gemini API Embeddings 文档:用 embedContent 生成向量,配置 task 前缀或 task_type,并用 output_dimensionality 控制维度。
- 用 Vercel AI SDK 生成 Embeddings按 AI SDK Core Embeddings:用 embed / embedMany 生成向量,再用 cosineSimilarity 比较相似度。
- 用 OpenAI Embeddings 给文档做语义检索向量按 OpenAI Embeddings 指南生成文本向量,并完成一次最小的相似度比对。