Skip to main content
Docling 将 PDF、DOCX、PPTX、HTML 等格式解析为丰富的统一表示,包括文档布局、表格等,使其适用于 RAG 等生成式 AI 工作流。 本集成通过 DoclingLoader 文档加载器提供 Docling 的功能。

概述

集成详情

加载器特性

提供的 DoclingLoader 组件使您能够:
  • 在 LLM 应用中轻松快速地使用各种文档类型,以及
  • 利用 Docling 的丰富格式进行高级的、文档原生的基础处理。
DoclingLoader 支持两种不同的导出模式:
  • ExportType.DOC_CHUNKS(默认):如果您希望将每个输入文档分块,然后将每个单独的块作为下游的独立 LangChain 文档捕获,或者
  • ExportType.MARKDOWN:如果您希望将每个输入文档作为独立的 LangChain 文档捕获
示例允许通过参数 EXPORT_TYPE 探索两种模式;根据设置的值,示例管道会相应地进行设置。

设置

为了获得最佳转换速度,请尽可能使用 GPU 加速;例如,如果在 Colab 上运行,请使用启用 GPU 的运行时。

初始化

基本初始化如下所示:
对于高级用法,DoclingLoader 具有以下参数:
  • file_path:源,可以是单个字符串(URL 或本地文件)或其可迭代对象
  • converter(可选):要使用的任何特定 Docling 转换器实例
  • convert_kwargs(可选):转换执行的任何特定 kwargs
  • export_type(可选):要使用的导出模式:ExportType.DOC_CHUNKS(默认)或 ExportType.MARKDOWN
  • md_export_kwargs(可选):任何特定的 Markdown 导出 kwargs(用于 Markdown 模式)
  • chunker(可选):任何特定的 Docling 分块器实例(用于文档分块模式)
  • meta_extractor(可选):要使用的任何特定元数据提取器

加载

注意:显示 "Token indices sequence length is longer than the specified maximum sequence length..." 的消息在这种情况下可以忽略——更多详情请参阅此 docling-core GitHub issue
检查一些示例文档:

惰性加载

文档也可以以惰性方式加载:

端到端示例

  • 以下示例管道使用 HuggingFace 的 Inference API;为了提高 LLM 配额,可以通过环境变量 HF_TOKEN 提供令牌。
  • 此管道的依赖项可以如下所示安装(--no-warn-conflicts 适用于 Colab 预填充的 Python 环境;为更严格的使用,请随意移除):
定义管道参数:
现在我们可以实例化加载器并加载文档:
确定分割:
检查一些示例分割:

数据摄取

RAG

请注意,来源包含丰富的基础信息,包括段落标题(即章节)、页码和精确的边界框。

API 参考