Skip to main content
Oracle AI 数据库支持 AI 工作负载,您可以在其中按含义(语义)而非仅关键词查询数据。它在一个系统中结合了对非结构化内容的语义搜索对业务数据的关系过滤——因此您可以构建检索工作流(如 RAG),而无需引入单独的向量数据库或将数据分散在多个平台上。 本指南演示如何使用 OracleVS(Oracle AI 向量搜索的 LangChain 向量存储集成)来:
  • 将文档和嵌入导入 Oracle
  • 运行相似性搜索
  • 创建 HNSW 和 IVF 索引
  • 应用元数据过滤器以进行高级检索
  • 在 Oracle Database 26ai 中启用混合搜索(关键词 + 语义)
  • 使用 Oracle Text 运行全文搜索

先决条件

安装 langchain-oracledbpython-oracledb 驱动程序将作为依赖项自动安装。

连接到 Oracle 数据库

以下示例代码将展示如何连接到 Oracle 数据库。默认情况下,python-oracledb 以‘Thin’模式运行,直接连接到 Oracle 数据库。此模式不需要 Oracle 客户端库。但是,当 python-oracledb 使用它们时,有一些额外的功能可用。当使用 Oracle 客户端库时,python-oracledb 被称为处于‘Thick’模式。两种模式都具有全面的功能,支持 Python 数据库 API v2.0 规范。请参阅以下 指南,其中介绍了每种模式支持的功能。如果您无法使用 thin-mode,可能需要切换到 thick-mode。

导入所需的依赖项

加载文档

使用不同的距离度量创建向量存储

首先,我们将创建三个具有不同距离函数的向量存储。由于我们尚未在其中创建索引,它们目前只会创建表。稍后我们将使用这些向量存储来创建 HNSW 索引。要了解有关 Oracle AI 向量搜索支持的索引类型的更多信息,请参阅以下 指南 您可以手动连接到 Oracle 数据库,并将看到三个表: Documents_DOT, Documents_COSINEDocuments_EUCLIDEAN 然后我们将创建另外三个表 Documents_DOT_IVF, Documents_COSINE_IVFDocuments_EUCLIDEAN_IVF,用于 在这些表上创建 IVF 索引而不是 HNSW 索引。

文本的添加和删除操作,以及基本相似性搜索

使用特定参数创建索引

高级搜索

Oracle Database 23ai 支持预过滤、内过滤和后过滤,以增强 AI 向量搜索功能。这些过滤机制允许用户在执行向量相似性搜索之前、期间和之后应用约束,从而提高搜索性能和准确性。 关于 Oracle 23ai 中过滤的关键点:
  1. 预过滤 在执行向量相似性搜索之前,应用传统 SQL 过滤器以减少数据集。 通过限制 AI 算法处理的数据量来帮助提高效率。
  2. 内过滤 利用 AI 向量搜索直接在向量嵌入上执行相似性搜索,使用优化的索引和算法。 基于向量相似性高效地过滤结果,而无需扫描整个数据集。
  3. 后过滤 在向量相似性搜索后应用额外的 SQL 过滤以细化结果。 允许根据业务逻辑或附加元数据条件进一步细化。
为什么这很重要?
  • 性能优化:预过滤显著减少查询执行时间,使大规模数据集上的搜索更高效。
  • 准确性增强:内过滤确保向量搜索具有语义意义,提高搜索结果的质量。

过滤器详细信息

OracleVS 支持一组过滤器,可以使用 filter 参数应用于 metadata 字段。这些过滤器允许您根据各种标准选择和完善数据。 可用的过滤器运算符:
  • 您可以使用逻辑运算符组合这些过滤器:
示例过滤器:
其他使用提示:
  • 当对象中的所有过滤器都必须满足时,可以省略 $and。这两个是等效的:
  • $not 子句可以否定比较运算符:
  • 使用 field: scalar 等同于 field: { "$eq": scalar }
有关更多过滤器示例,请参阅 测试规范

混合搜索

Oracle Database 26ai 支持混合搜索,将关键词(全文)和语义(向量)搜索结合到单个检索功能中。langchain-oracledb 集成公开了以下内容:
  • OracleVectorizerPreference:创建由混合索引使用的数据库端向量化器首选项。
  • create_hybrid_index / acreate_hybrid_index:创建 HYBRID VECTOR INDEX。
  • OracleHybridSearchRetriever:在 OracleVS 表上执行关键词、语义或混合检索。

先决条件和模型配置

使用混合搜索时,请使用 OracleEmbeddings 配置您的 OracleVS,以便向量化器首选项与嵌入配置完全匹配。您可以通过 OracleVectorizerPreference 提供额外参数来进一步调整混合向量索引。有关详细信息,请参阅 文档
替代方案 在不显式指定首选项的情况下创建索引:
  • 如果您不想管理命名首选项,请传递 vector_store 代替。该函数将创建临时首选项,构建索引,然后自动删除首选项。
注意事项和提示:
  • search_mode 决定使用哪些信号:
    • “keyword”:仅关键词
    • “semantic”:仅向量
    • “hybrid”(默认):两者结合
  • 通过检索器的 params 参数传递 DBMS_HYBRID_VECTOR 参数。
  • return_scores=True 将总分和组件 text_score 和 vector_score 添加到 Document.metadata。
  • 通过 acreate_hybrid_indexOracleHybridSearchRetriever.ainvoke 支持异步用法。
更多信息:

全文搜索 (Oracle Text)

您可以使用 Oracle Text 直接针对 Oracle 数据库运行高质量的关键词搜索。langchain-oracledb 集成公开了以下内容:
  • create_text_index / acreate_text_index:在列上创建 Oracle Text SEARCH INDEX
  • OracleTextSearchRetriever:运行 CONTAINS 查询并返回 LangChain Document 对象。
索引选项:
  • 如果您有 OracleVS 向量存储,您可以对其内置的”text”列进行索引。
  • 您也可以直接提供 table_name + column_name 来索引任何其他表/列。
运算符模式和高级查询:
  • 默认行为 (operator_search=False):
    • 输入被视为纯文本,在非单词字符处进行分词,并重写为 ACCUM 表达式。
    • 使用 fuzzy=True 时,每个令牌都包装为 FUZZY("token") 以匹配拼写错误。
  • 运算符模式 (operator_search=True):
    • 原样传递 Oracle Text 表达式 (NEAR, ABOUT, AND, OR, NOT, WITHIN 等)。在此模式下,忽略模糊匹配。
返回的列:
  • 当目标是原始表时,通过 returned_columns 在结果中包含额外列;它们附加到 Document.metadata
  • 使用 OracleVS 时,returned_columns 默认为 [“metadata”]。
注意事项和提示:
  • 使用 operator_search=True 时,忽略模糊匹配(设计如此)。
  • 通过 acreate_text_indexOracleTextSearchRetriever.ainvoke 支持异步用法。
更多信息:

端到端演示

请参阅我们的完整演示指南 Oracle AI 向量搜索端到端演示指南,借助 Oracle AI 向量搜索构建端到端 RAG 管道。