点我展开:基本信息
本文用于梳理 BAAI/bge-base-zh-v1.5 的模型定位、核心参数、典型用法,以及模型权重和 Python 虚拟环境的关系。
BAAI/bge-base-zh-v1.5 是什么?
BAAI/bge-base-zh-v1.5 是北京智源人工智能研究院发布的中文文本 Embedding 模型,专门用于把中文句子映射成固定维度向量。
一句话理解:给定一段中文文本,模型输出一个 768 维向量,再用向量相似度判断两段文本是否语义相近。
它常用于知识库问答、RAG、文档排序、语义检索、聚类等场景。
核心信息
| 项目 | 信息 |
|---|---|
| 开发者 | 北京智源人工智能研究院(BAAI) |
| 模型类型 | Transformer-based 文本嵌入模型 |
| 参数量 | 约 102M |
| 输出维度 | 768 |
| 最大输入 | 512 token |
| 协议 | MIT |
| 常见用途 | 中文语义检索、RAG、排序、聚类 |
典型特点
- 针对中文语义专门训练。
- 对成语、口语、专业词表现通常优于通用多语言模型。
- 支持指令式检索,可在 query 前加入提示词提升召回效果。
- 体积适中,CPU 和 GPU 都可以部署。
- 可与 FlagEmbedding、sentence-transformers、LangChain、Qdrant 等工具配合使用。
典型用法
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("BAAI/bge-base-zh-v1.5")
vec = model.encode("人工智能是一门研究如何让机器具有智能的科学")
print(vec.shape) # (768,)
通过 ModelScope 下载时下载了什么?
当执行下面命令时:
modelscope download --model BAAI/bge-base-zh-v1.5
实际下载的是这个中文文本向量模型的权重、配置和 tokenizer 等文件。下载后可以离线或在线生成句子向量。
虚拟环境下模型装在哪里?
模型权重通常不是安装到 .venv 的 site-packages 里,而是下载到模型缓存目录中。
ModelScope 默认缓存路径一般是:
~/.cache/modelscope/hub/
如果设置了 MODELSCOPE_CACHE,则会下载到自定义路径。
- Python 包:安装到
.venv/Lib/site-packages或.venv/lib/python.../site-packages。 - 模型权重:下载到模型缓存目录。
总结
BAAI/bge-base-zh-v1.5 是中文 RAG 和语义检索中常用的基础向量模型。它不是普通 Python 包,而是模型权重资源,通常存放在模型缓存目录中。

