Skip to main content
兼容性:仅适用于 Node.js 环境。
本笔记本提供了快速入门 RecursiveUrlLoader 文档加载器 的概述。有关 RecursiveUrlLoader 所有功能和配置的详细文档,请参阅 API 参考

概述

集成详情

加载器特性

从网站加载内容时,我们可能希望处理并加载页面上的所有 URL。 例如,让我们看看 LangChain.js 的介绍文档。 它有许多有趣的子页面,我们可能希望批量加载、分割并在之后检索。 挑战在于遍历子页面的树结构并组装列表! 我们使用 RecursiveUrlLoader 来实现这一点。 这还使我们能够灵活地排除某些子页面、自定义提取器等。

设置

要访问 RecursiveUrlLoader 文档加载器,您需要安装 @langchain/community 集成包以及 jsdom 包。

凭证

如果您希望自动跟踪模型调用,还可以通过取消注释以下内容来设置您的 LangSmith API 密钥:

安装

LangChain RecursiveUrlLoader 集成位于 @langchain/community 包中:
我们还建议添加诸如 html-to-text@mozilla/readability 之类的包,用于从页面提取原始文本。
我们还建议添加诸如 html-to-text@mozilla/readability 之类的包,用于从页面提取原始文本。

实例化

现在我们可以实例化模型对象并加载文档:

加载

选项

然而,由于很难执行完美的过滤,您可能仍然会在结果中看到一些不相关的内容。如果需要,您可以自己对返回的文档执行过滤。大多数时候,返回的结果已经足够好。

API 参考

有关 RecursiveUrlLoader 所有功能和配置的详细文档,请参阅 API 参考