Skip to main content
本文介绍如何使用 WebBaseLoaderHTML 网页中的所有文本加载到可用于下游处理的文档格式中。如需更自定义的网页加载逻辑,可参考一些子类示例,例如 IMSDbLoaderAZLyricsLoaderCollegeConfidentialLoader 如果您不想处理网站爬取、绕过 JS 拦截站点以及数据清洗等问题,可考虑使用 FireCrawlLoader 或更快的选项 SpiderLoader

概述

集成详情

  • TODO: 填写表格功能。
  • TODO: 若不相关则移除 JS 支持链接,否则确保链接正确。
  • TODO: 确保 API 参考链接正确。

加载器特性

设置

凭证

WebBaseLoader 不需要任何凭证。

安装

要使用 WebBaseLoader,首先需要安装 langchain-community Python 包。

初始化

现在我们可以实例化模型对象并加载文档:
要绕过获取过程中的 SSL 验证错误,可以设置 “verify” 选项: loader.requests_kwargs = {'verify':False}

初始化多个页面

您也可以传入要加载的页面列表。

加载

并发加载多个 URL

您可以通过并发抓取和解析多个 URL 来加速爬取过程。 并发请求有合理的限制,默认为每秒 2 个。如果您不担心成为良好网络公民,或者您控制着要抓取的服务器且不关心负载,可以更改 requests_per_second 参数以增加最大并发请求数。请注意,虽然这会加快爬取过程,但可能导致服务器屏蔽您。请谨慎操作!

加载 XML 文件或使用不同的 BeautifulSoup 解析器

您也可以参考 SitemapLoader 作为使用此功能的示例,了解如何加载站点地图文件。

惰性加载

您可以使用惰性加载功能,一次仅加载一个页面,以最小化内存需求。

异步

使用代理

有时您可能需要使用代理来绕过 IP 封锁。您可以向加载器(以及底层的 requests)传入代理字典来使用它们。

API 参考

有关 WebBaseLoader 所有功能和配置的详细文档,请参阅 API 参考