Firecrawl 是什么、怎么用:把网页抓成 Markdown 给大模型(API、SDK 与 MCP)

Firecrawl 是什么、怎么上手?按官方 README 讲清它的定位、scrape / crawl / map / search 等接口各做什么、API Key 格式、Python 与 Node SDK 的最小示例、curl 调用、作为 MCP 服务器接进智能体的配置,以及开源版与云端版的区别和合规提醒。

NNathaniel bigo··原创首发·AI 辅助撰写
6 分钟读完
资料核对于 2026-10-11 · 依据官方文档与公开资料整理 其他 账号
本文根据 Firecrawl 官方仓库 README 整理,资料核对于 2026-10-11。文中代码和命令取自官方 README,没有在本机运行验证,也没有注册账号。

适用于谁

  • 搜「firecrawl 是什么」「firecrawl api」「firecrawl mcp」「firecrawl api key」的人;
  • 要把网页内容喂给大模型,自己写爬虫又被动态渲染、正文提取、格式清洗折腾过的人;
  • 想让智能体具备「打开网页读内容」能力的人。

结论先说

  1. Firecrawl 是一个开源的网页数据平台:把网站变成干净的、适合大模型使用的内容,供智能体和应用使用。
  2. 最常用的是 scrape:给一个网址,返回 Markdown、HTML、截图或结构化 JSON。
  3. 有云端服务也可以自己部署。开源部分是 AGPL-3.0 许可;云端版在 firecrawl.dev,功能更多。
  4. 调用方式多:HTTP API、Python 和 Node 的 SDK、命令行、MCP 服务器。
  5. 抓取要守规矩。官方说明默认遵守 robots.txt,同时明确:遵守目标网站的政策、隐私政策和使用条款是使用者的责任。

一、几个接口各做什么

接口作用
Scrape把一个网址转成 Markdown、HTML、截图或结构化 JSON
Crawl一次请求抓取一个网站的所有页面
Map发现一个网站上有哪些网址
Search搜索网页,并返回结果页面的完整内容
Agent(原 /extract)按一段描述从网上收集数据,不需要你提供网址
Interact抓取页面后,用 AI 提示词或代码在页面上继续操作
Actions在提取内容之前先点击、滚动、输入、等待、按键
Batch Scrape异步抓取很多个网址

怎么选:

  • 已经知道要哪个页面:Scrape;
  • 要一整个文档站、一个博客的全部文章:先 Map 看看有哪些网址,再决定是 Crawl 全部还是挑着 Batch Scrape;
  • 不知道答案在哪个网站:Search;
  • 内容要点一下、滚动一下才出来:Actions。

二、拿到 API Key

在 firecrawl.dev 注册后获取。Key 以 fc- 开头,下面示例里写作 fc-YOUR_API_KEY。

实际使用时把 Key 放在环境变量里,不要写进代码。

三、Python

安装:

bash
pip install firecrawl-py

最小示例:

python
from firecrawl import Firecrawl

app = Firecrawl(api_key="fc-YOUR_API_KEY")

result = app.scrape('firecrawl.dev')

四、Node.js

安装:

bash
npm install firecrawl

最小示例:

javascript
import { Firecrawl } from 'firecrawl';

const app = new Firecrawl({ apiKey: "fc-YOUR_API_KEY" });

app.scrape('firecrawl.dev')

五、直接调 HTTP API

bash
curl -X POST 'https://api.firecrawl.dev/v2/scrape' \
-H 'Authorization: Bearer fc-YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
  "url": "firecrawl.dev"
}'

任何能发 HTTP 请求的语言都可以这样用。注意路径里的版本号,旧教程里的 v1 路径和参数与现在不一定相同。

六、命令行

bash
firecrawl scrape https://firecrawl.dev

七、接进智能体

作为 MCP 服务器。README 给的客户端配置:

json
{
  "mcpServers": {
    "firecrawl-mcp": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": {
        "FIRECRAWL_API_KEY": "fc-YOUR_API_KEY"
      }
    }
  }
}

这段配置放在哪,因客户端而异:Claude 桌面版见《Claude Desktop MCP 配置教程》,Claude Code 见《Claude Code MCP 配置教程》,Cursor 见《Cursor MCP 配置教程》。

作为 Skill。README 给了一条初始化命令,为你的编程智能体安装 Firecrawl 的技能,装完需要重启智能体:

bash
npx -y firecrawl-cli@latest init --all --browser

这条命令带 --all 和 --browser 两个参数,具体会安装和配置什么,以官方说明为准。运行前想先看清楚它会装什么,参考《Skill 安全吗:安装前检查什么》里的检查顺序。

八、开源版和云端版

开源自部署云端版
许可AGPL-3.0(SDK 和部分界面组件是 MIT)托管服务
功能核心功能README 说明有额外功能
运维自己负责官方负责
入口官方的 Self-Hosting Guidefirecrawl.dev

AGPL-3.0 对「修改后以网络服务形式提供」有开源义务的要求。要把它集成进自己的商业产品并做修改时,先让懂许可证的人看一下。

九、合规与使用边界

README 的表述是两句话:Firecrawl 默认遵守 robots.txt;使用者有责任遵守目标网站的政策、隐私政策和使用条款。

落到实际使用上:

  • 先看目标网站允不允许。服务条款明确禁止自动化抓取的,不要抓;
  • 不要抓需要登录才能看的、涉及个人信息的内容;
  • 控制频率。Crawl 一整个站之前,先用 Map 看看规模;
  • 抓来的内容有版权。用来给模型做参考和原样转载发布是两回事;
  • 网页内容不可信。页面上可能有专门写给 AI 看的指令。智能体读了网页之后要执行有副作用的操作时,保留人工确认。

常见问题

Q:和自己用 requests 加解析库写有什么区别?

简单的静态页面自己写完全可以。Firecrawl 省掉的是动态渲染、正文提取、转成干净 Markdown、批量与重试这些重复劳动。

Q:ChatGPT、Claude 自带联网搜索,还需要它吗?

聊天产品里的搜索够日常使用,见《Claude 联网搜索》。需要它的是开发场景:你自己的程序或智能体要按你的规则抓指定的页面、要结构化的结果、要批量处理。

Q:抓下来的内容怎么用?

典型流程是:抓成 Markdown → 分段 → 存进向量库 → 检索后交给模型。向量库见《ChromaDB 是什么》。

Q:免费吗?

开源版可以自己部署。云端版的价格和免费额度 README 没有写,以官网定价页为准。

参考资料

  • firecrawl/firecrawl(官方仓库与 README):https://github.com/firecrawl/firecrawl

Nathaniel 的更多内容

  1. 01

    promptfoo 使用教程:对比提示词和模型、写断言自动评测(安装与配置)

    promptfoo 是什么、怎么使用?按官方 README 和入门文档讲清它的用途、三种安装方式、用示例项目起步、promptfooconfig.yaml 里提示词、模型和测试用例三部分怎么写、常用断言类型的含义、eval 与 view 两条命令,以及把它放进日常改提示词流程的方法。

    ChatGPT其他 AI 工具0
  2. 02

    Kimi API怎么用:API Key获取、Python调用、K3价格与429报错处理

    Kimi API Key 在哪里获取、怎么用 Python 调用 K3、价格怎么算、429 和 401 报错怎么办?本文按 Kimi API 开放平台官方文档讲清注册认证、创建 Key、base_url 与模型名、计费规则和常见错误排查。

    Kimi0
  3. 03

    Cursor Agent 模式怎么用:Agent、Plan、Ask 三种模式,检查点回滚与消息排队

    Cursor Agent 模式是什么、和 Plan / Ask 模式怎么选?按官方文档讲清 Agent 能调用哪些工具、Shift+Tab 切换模式、Plan 模式先出方案再动手、用检查点撤销改动、任务进行中排队或插话,以及 /goal 长目标。

    Cursor0
  4. 04

    Gemini 聊天记录怎么导出:导出到文档 / 表格、生成 PDF 与用 Takeout 批量导出完整对话

    Gemini 没有「一键导出全部对话」的按钮,但有三条官方路径:单条回答导出到 Google 文档、Gmail、表格;让 Gemini 直接生成 PDF、Word、Markdown 文件;用 Google Takeout 批量下载全部活动记录。本文给出每种方法的步骤和限制。

    Gemini0
  5. 05

    ChatGPT 生成图片中文乱码、文字错误怎么办:7 个按顺序试的办法

    让 ChatGPT 做海报、封面、信息图,中文总是缺笔画、错字、乱码?本文按 OpenAI 官方图像提示指南,给出从写法、字数、局部修改、质量档位到后期排版的 7 个办法,以及什么时候干脆别让 AI 写字。

    ChatGPT0
  6. 06

    OpenCode Skills 使用指南:技能目录、命名规则、权限配置与不加载排查

    OpenCode 的 Skills 放在哪个目录、怎么控制哪些技能能用?按 OpenCode 官方文档讲清六个扫描位置、name 的正则规则、skill 工具的工作方式、在 opencode.json 里用 allow / deny / ask 配置权限、按智能体覆盖,以及技能不出现时的五项检查。

    其他 AI 工具0

同产品的其他教程

  1. 01

    MinerU 是什么、怎么用:把 PDF 等文档解析成 Markdown(4.0 的安装、四档解析与命令)

    MinerU 是什么、怎么安装使用?按官方中文 README 讲清 4.0 版本的定位、支持的输入与输出格式、flash / basic / standard / advanced 四档解析各适合什么、pip 安装命令、mineru-kit 与 mineru 两个命令的分工和常用写法,以及从旧版升级要注意什么。

    其他 AI 工具0
  2. 02

    npx skills add 怎么用:从 GitHub 安装 Skill、skills.sh 是什么与常用命令

    网上的 Skill 安装命令大多是 npx skills add 开头,它是什么、装到哪去了?按官方 README 讲清 skills 命令行工具支持的来源写法、项目与全局两种范围、-a 指定工具、list / find / update / remove 等命令、软链接与复制的区别,以及怎么关掉遥测。

    Claude其他 AI 工具0
  3. 03

    即梦首尾帧怎么用:两张图生成过渡视频(在哪里、提示词、不能用怎么办)

    即梦首尾帧在哪里、怎么用?本文讲清首尾帧入口、哪些模型支持、两张图的比例要求、过渡提示词怎么写,以及「首尾帧不见了 / 不能用了」「画面跳变」的原因和解决办法。

    其他 AI 工具0
  4. 04

    DeepSeek怎么用:网页版与手机App入门(深度思考、智能搜索、上传文件)

    DeepSeek怎么用?本文从官方入口和登录方式讲起,说清输入框里的「深度思考」「智能搜索」和上传附件各管什么,历史对话怎么改名、置顶、分享和导出,以及手机上使用的注意点。

    其他 AI 工具0
  5. 05

    文心一言网页版怎么用:改名「文心」后的入口、对话与工作任务、PPT生成

    文心一言现在叫什么、网页版入口在哪、怎么用?本文按百度文心官网和 App Store 官方页面讲清「文心」的新入口、对话与工作两种模式、图片生成和帮我写作、任务托管与 AIPPT、知识库和定时任务从哪开始。

    其他 AI 工具0
  6. 06

    Trae 规则与 MCP 配置教程:.trae/rules 四种生效方式、导入 AGENTS.md、添加 MCP Server

    Trae rules 怎么配置、Trae 怎么用 MCP?按 TRAE 官方中文文档讲清全局规则与项目规则的位置、四种生效方式、子目录与多层嵌套、导入 AGENTS.md / CLAUDE.md、提交信息规则,以及从市场添加和手动配置 MCP Server、项目级 mcp.json。

    其他 AI 工具0

0 条评论

登录 后参与评论

还没有评论,来抢沙发~