点我展开:基本信息

本文用于梳理 BAAI/bge-base-zh-v1.5 的模型定位、核心参数、典型用法,以及模型权重和 Python 虚拟环境的关系。

BAAI/bge-base-zh-v1.5 是什么?

BAAI/bge-base-zh-v1.5 是北京智源人工智能研究院发布的中文文本 Embedding 模型,专门用于把中文句子映射成固定维度向量。

一句话理解:给定一段中文文本,模型输出一个 768 维向量,再用向量相似度判断两段文本是否语义相近。

它常用于知识库问答、RAG、文档排序、语义检索、聚类等场景。

核心信息

项目 信息
开发者 北京智源人工智能研究院(BAAI)
模型类型 Transformer-based 文本嵌入模型
参数量 约 102M
输出维度 768
最大输入 512 token
协议 MIT
常见用途 中文语义检索、RAG、排序、聚类

典型特点

  • 针对中文语义专门训练。
  • 对成语、口语、专业词表现通常优于通用多语言模型。
  • 支持指令式检索,可在 query 前加入提示词提升召回效果。
  • 体积适中,CPU 和 GPU 都可以部署。
  • 可与 FlagEmbedding、sentence-transformers、LangChain、Qdrant 等工具配合使用。

典型用法

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("BAAI/bge-base-zh-v1.5")
vec = model.encode("人工智能是一门研究如何让机器具有智能的科学")
print(vec.shape)  # (768,)

通过 ModelScope 下载时下载了什么?

当执行下面命令时:

modelscope download --model BAAI/bge-base-zh-v1.5

实际下载的是这个中文文本向量模型的权重、配置和 tokenizer 等文件。下载后可以离线或在线生成句子向量。

虚拟环境下模型装在哪里?

模型权重通常不是安装到 .venv 的 site-packages 里,而是下载到模型缓存目录中。

ModelScope 默认缓存路径一般是:

~/.cache/modelscope/hub/

如果设置了 MODELSCOPE_CACHE,则会下载到自定义路径。

  • Python 包:安装到 .venv/Lib/site-packages.venv/lib/python.../site-packages
  • 模型权重:下载到模型缓存目录。

总结

BAAI/bge-base-zh-v1.5 是中文 RAG 和语义检索中常用的基础向量模型。它不是普通 Python 包,而是模型权重资源,通常存放在模型缓存目录中。


SZUer继续加油!