Skip to main content
本笔记本提供了快速入门 FireCrawlLoader 文档加载器 的简要概述。有关 FireCrawlLoader 所有功能和配置的详细文档,请参阅 API 参考

概述

集成详情

加载器特性

FireCrawl 能够抓取任何网站并将其转换为适合 LLM 使用的数据。它会爬取所有可访问的子页面,并为每个页面提供干净的 Markdown 和元数据。无需站点地图。 FireCrawl 能够处理复杂任务,如反向代理、缓存、速率限制以及被 JavaScript 屏蔽的内容。由 mendable.ai 团队构建。 本指南展示了如何使用 LangChain 中的 FireCrawlLoader 来抓取和爬取整个网站并加载它们。

设置

要使用 FireCrawlLoader 文档加载器,您需要安装 @langchain/community 集成包以及 @mendable/firecrawl-js@0.0.36 包。然后创建一个 FireCrawl 账户并获取 API 密钥。

凭证

注册并获取免费的 FireCrawl API 密钥 以开始使用。FireCrawl 提供 300 个免费积分供您起步,并且它是 开源 的,如果您想自行托管的话。 完成此步骤后,设置 FIRECRAWL_API_KEY 环境变量:
如果您希望获得模型调用的自动追踪,还可以通过取消注释以下内容来设置您的 LangSmith API 密钥:

安装

LangChain 的 FireCrawlLoader 集成位于 @langchain/community 包中:

实例化

以下是如何使用 FireCrawlLoader 加载网页搜索结果的示例: Firecrawl 提供 3 种模式:scrapecrawlmap。在 scrape 模式下,Firecrawl 仅抓取您提供的页面。在 crawl 模式下,Firecrawl 将爬取整个网站。在 map 模式下,Firecrawl 将返回与网站相关的语义链接。 formats 参数(crawl 模式下为 scrapeOptions.formats)允许选择 "markdown""html""rawHtml"。但是,加载的文档将仅返回一种格式的内容,优先级如下:markdown,然后是 html,最后是 rawHtml 现在我们可以实例化模型对象并加载文档:

加载

附加参数

对于 params,您可以根据 Firecrawl 文档 传递任何参数。

API 参考

有关 FireCrawlLoader 所有功能和配置的详细文档,请参阅 API 参考