pgvector Postgres 扩展。
本指南提供了快速入门 PGVector 向量存储 的概述。有关 PGVectorStore 所有功能和配置的详细文档,请参阅 API 参考。
概述
集成详情
设置
要使用 PGVector 向量存储,您需要设置一个启用了pgvector 扩展的 Postgres 实例。您还需要安装 @langchain/community 集成包,并将 pg 包作为对等依赖项。
本指南还将使用 OpenAI 嵌入,这需要您安装 @langchain/openai 集成包。您也可以使用 其他支持的嵌入模型。
我们还将使用 uuid 包来生成所需格式的 ID。
设置实例
根据您设置实例的方式,有多种连接到 Postgres 的方法。这里有一个使用pgvector 团队提供的预构建 Docker 镜像进行本地设置的示例。
创建一个名为 docker-compose.yml 的文件,内容如下:
docker compose up 来启动容器。
您可以在 官方仓库 中找到有关如何设置 pgvector 的更多信息。
凭据
要连接到您的 Postgres 实例,您需要相应的凭据。有关支持选项的完整列表,请参阅node-postgres 文档。
如果您在本指南中使用 OpenAI 嵌入,您还需要设置您的 OpenAI 密钥:
实例化
要实例化向量存储,请调用.initialize() 静态方法。这将自动检查 config 中传递的 tableName 指定的表是否存在。如果不存在,它将使用所需的列创建该表。
管理向量存储
向向量存储添加项目
从向量存储删除项目
查询向量存储
一旦您的向量存储创建完成并添加了相关文档,您很可能希望在运行链或代理时查询它。直接查询
执行简单的相似性搜索可以如下进行:使用 in 操作符
使用 notIn 操作符
使用 arrayContains 操作符
通过转换为检索器进行查询
您还可以将向量存储转换为 检索器,以便在链中更轻松地使用。用于检索增强生成
有关如何使用此向量存储进行检索增强生成 (RAG) 的指南,请参阅以下部分:高级:重用连接
您可以通过创建连接池,然后直接通过构造函数创建新的PGVectorStore 实例来重用连接。
请注意,您应至少调用一次 .initialize() 来正确设置数据库表,然后再使用构造函数。
创建 HNSW 索引
默认情况下,该扩展执行顺序扫描搜索,召回率为 100%。您可能需要考虑创建 HNSW 索引以进行近似最近邻 (ANN) 搜索,以加快similaritySearchVectorWithScore 的执行时间。要在向量列上创建 HNSW 索引,请使用 createHnswIndex() 方法。
方法参数包括:
-
dimensions:定义向量数据类型的维度数,最多 2000。例如,对于 OpenAI 的 text-embedding-ada-002 和 Amazon 的 amazon.titan-embed-text-v1 模型,使用 1536。 -
m?:每层的最大连接数(默认为 16)。较小的值可改善索引构建时间,而较高的值可以加快搜索查询速度。 -
efConstruction?:用于构建图的动态候选列表的大小(默认为 64)。较高的值可能会提高索引质量,但会增加索引构建时间。 -
distanceFunction?:您要使用的距离函数名称,根据 distanceStrategy 自动选择。
关闭连接
确保在完成后关闭连接,以避免资源过度消耗:API 参考
有关PGVectorStore 所有功能和配置的详细文档,请参阅 API 参考。
Connect these docs to Claude, VSCode, and more via MCP for real-time answers.

