Firecrawl 免 API Key 完全实战指南:CLI 抓取、PDF 解析与 Agent 接入技巧


腾讯orkbuddy注册即可得2000积分,可以干不少活。下载链接:https://www.workbuddy.cn/

百度Dumate智能体,也是工作搭配好工具:邀请码及下载地址:百度 Dumate邀请码: 7D8DUYG

字节TraeWork免费4500积分,点击下载字节跳动TraeWork免费4500积分

Tabbit AI浏览器,在浏览器里用AITabbit AI浏览器,点击下载

MonkeyCode 长亭百智云Monkeycode-AI,点击在线使用

本文来源:https://mp.weixin.qq.com/s/S0_ioojlHCfeEtreBDfqDA
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。

📦 8 Parts + Conclusion

👉 滑动

PART 01

是什么

Firecrawl 介绍

PART 02

三大优势

对比同类工具

PART 03

免 Key

意味着什么

PART 04

CLI 实战

一行命令

PART 05

Agent 接入

以 WorkBuddy

PART 06

实机演示

真实跑一遍

PART 07

技巧注意

高效用法

PART ///

写在最后

趋势总结

给一个 URL,它返回干净、结构化的数据——这就是 AI Agent 的「网页榨汁机」

如果你还在为「想让 AI 联网抓数据」发愁——每次抓个网页就要注册账号、申请 API Key、配环境变量,甚至还要折腾代理 IP 和反爬虫——那这篇内容可能帮你省掉 80% 的配置时间。

2026 年 6 月 16 日,Firecrawl 官方宣布:使用 Firecrawl 不再需要 API Key。搜索、抓取、与网页交互、把 PDF 解析成干净 Markdown,全部免配置开箱即用。无需注册也能直接调用,想稳定用再免费注册(每月 1000 积分)也不迟。

Firecrawl 本质是为 AI Agent 设计的「网页榨汁机」:给一个 URL,它返回干净、结构化的数据。它能接入任何支持 MCP 的 AI Agent(Claude Code、Cursor、OpenClaw、WorkBuddy 等)。本文虽然以 WorkBuddy 为例演示 Agent 接入,但重点放在 CLI 用法和实用技巧上——毕竟大多数同学还是直接在命令行里用得最多。

01

PART

Firecrawl 是什么?

WHAT IS FIRECRAWL

Firecrawl 是目前 GitHub 上最火的网页数据接口之一,Star 数已突破 13 万,超过 15 万家企业正在使用,包括 Apple、Canva、Stanford、Zapier、Replit 等知名机构。

它和传统爬虫完全不同——传统爬虫需要你分析 DOM 结构、抠隐藏标签、买代理 IP 防封、对抗滑块验证码,稍微改个 class 名代码就报废。Firecrawl 的本质是专为 AI Agent 设计的「网页榨汁机」:你给一个 URL,它返回干净、结构化的 Markdown 或 JSON,自动剔除广告、导航栏、页脚等干扰内容。

核心能力一览

Search(全网搜索)

对整个互联网进行搜索,每条结果直接附带完整的网页内容,而非只有摘要。

Scrape(网页抓取)

抓取任意 URL 的干净内容,支持 JavaScript 动态渲染页面,无需额外配置。

Interact(页面交互)

让 AI 能在网页上执行点击、填表、翻页、登录等操作——这是传统爬虫完全做不到的。

PDF → Clean Markdown(PDF 解析)

将任意 PDF 文件解析为干净、结构完整的 Markdown,彻底告别「复制粘贴乱码」的痛苦。

Crawl(全站爬取)

自动遍历整个网站的所有子页面,返回每个页面的干净 Markdown。

Extract(结构化提取)

按自定义 Schema 从网页中提取结构化 JSON 数据。

一句话总结:Firecrawl 是 AI Agent 的「眼睛 + 双手」——看见网页、操作网页,输出 AI 能直接「吃」的格式

02

PART

Firecrawl 强在哪?对比同类工具

VS OTHERS

市面上的网页抓取方案不少:最原始的是用 Python 的 requests + BeautifulSoup 自己写解析器,再进阶一点会用 ScrapingBee、Bright Data 这类商业爬虫代理服务,或者用 Playwright / Puppeteer 做浏览器自动化。那 Firecrawl 凭什么成为 GitHub 上 13 万 Star 的项目?答案可以浓缩成三个字:快、净、定。

对比维度
自写爬虫
商业代理服务
Firecrawl
上手成本
自写解析、反爬、代理
注册、配 Key、调参
免 Key 开箱即用
动态渲染
需另配 Playwright
支持
内置支持
数据清洗
手动写选择器
部分支持
自动清洗
输出格式
自己解析 HTML
主要返回 HTML
12 种格式任选
结构化数据
自写解析器
有限
按 Schema 直出 JSON
接入 Agent
自己封装接口
自己封装
原生 MCP

① 快:开箱即用的「网页榨汁机」

传统爬虫最耗时的不是写代码,而是和反爬、代理、渲染斗争:免费代理随时失效、付费代理要排队、JS 渲染要等几秒。Firecrawl 把这些脏活累活全包了——你给一个 URL,它在云端自动完成渲染、反爬绕行,返回直接就是干净内容,不用你等、不用你配。对一个要快速验证想法的 Agent 来说,「快」本身就是生产力。

② 净:自动清洗,告别「选择器地狱」

自写爬虫最大痛点是:网站改个 class 名,你的解析代码就报废。Firecrawl 内置内容识别引擎,加上 --only-main-content 参数,能自动剔除导航栏、页脚、广告、侧边栏等干扰内容,只保留正文;还能用 --redact-pii 自动脱敏个人隐私信息。你拿到的就是 AI 能直接「吃」的干净数据。

③ 定:用 --format 指哪打哪,12 种输出任选

很多工具抓完只能给你一大坨 HTML,剩下自己解析。Firecrawl 让你用 --format 参数直接定义想要的输出类型,一次调用就能拿到你正好需要的形式。支持 12 种格式:

格式
含义 / 用途
markdown
干净的 Markdown 文本(最常用,默认)
html
页面完整 HTML 结构
rawHtml
原始 HTML(未经加工)
links
页面内全部链接
screenshot
页面截图(图片,非文本)
json
按自定义 Schema 提取结构化数据
images
页面内的图片资源
summary
页面内容摘要
changeTracking
跟踪 / 对比页面变更
attributes
提取元素属性
branding
提取品牌信息(Logo、配色等)
product
提取产品信息(价格、规格等)

多个格式用逗号组合,例如 --format markdown,links 会返回同时含正文和链接的 JSON。实际用法见下一节。

03

PART

免 API Key 意味着什么?

KEYLESS MODE

用传统方式让 AI Agent 联网,通常需要走一套固定流程:

1

去 Firecrawl 官网注册账号

2

生成 API Key

3

复制 Key 到环境变量或配置文件

4

测试连接是否正常

现在,这套流程直接缩减为零步。Firecrawl 的 MCP、CLI、API 三大入口全部向无 Key 用户开放。你只需要知道接入地址,配置一次就能永久使用。

两种用法,别搞混了:① Keyless(免 Key)模式:完全不需要账号,但仅限官方客户端,按 IP 每天限制请求数和积分数,适合临时体验和开发调试。② 注册免费账户:免费注册即可获得 1000 积分/月(无需绑卡),速率限制更宽松,解锁 crawl/extract/map 等更多端点。当 Keyless 受限或要规模化时,注册账号即可。

积分(Credits)怎么算?Firecrawl 按操作消耗积分(非按「次」):抓取(Scrape)每页 1 积分,搜索(Search)每 10 条结果 2 积分,全站爬取(Crawl)每页 1 积分,交互(Interact)按浏览器分钟计费,PDF 解析按页数计费。免费账户每月 1000 积分,日常轻度使用完全够。Keyless 模式虽免注册,但按 IP 每日积分上限更低,适合临时测试。

04

PART

CLI 实战入门:一行命令开始抓取

CLI IN ACTION

Firecrawl 的 CLI 集成在 npx 里,不用安装、不用 Key,一行命令就能跑。想全局安装也可以:npm i -g firecrawl-cli,之后用 firecrawl 命令即可。

核心命令速查

命令
作用
示例
scrape
抓取单个 URL
firecrawl https://x.com --only-main-content
search
全网搜索网页
firecrawl search "AI agent" --limit 10
crawl
整站递归爬取
firecrawl crawl https://docs.x.com --max-depth 3
map(需要KEY)
发现站点所有 URL
firecrawl map https://x.com --include-subdomains
agent(需要KEY)
自然语言联网取数
firecrawl agent 「找出前5个AI编程工具」 --wait

高频参数

--only-main-content

只保留正文,自动去导航/页脚/广告(最常用)

--format

指定输出格式,多个用逗号,如 markdown,links,screenshot,json

--schema

配合 json 格式,按自定义结构提取数据

--wait-for / --screenshot / --redact-pii / -o

等渲染 / 截图 / 脱敏 / 存文件(如 -o page.md)

bash

# 抓取正文(自动去广告/导航/页脚)

firecrawl https://example.com --only-main-content

 

# 搜索并限定条数

firecrawl search "AI agent 最新进展" --limit 10

 

# 整站爬取,限制深度

firecrawl crawl https://docs.example.com --limit 100 --max-depth 3

 

# 自然语言联网取数(Agent 模式)

firecrawl agent "找出排名前 5 的 AI 编程工具并给出官网" --wait

 

# PDF 解析为 Markdown

firecrawl scrape "https://arxiv.org/pdf/2406.12929"

 

# 指定输出格式 + 存文件

firecrawl https://example.com --format markdown,links -o page.md

隐藏彩蛋:Firecrawl 走的是海外 IP,自带「科学加速」 Firecrawl 的抓取请求从海外服务器发出,所以它能直接访问 BBC、Google 等国外站点,且速度很快。对国内用户来说,这相当于白送一个免配置的外网抓取通道。

05

PART

接入 AI Agent(以 WorkBuddy 为例)

AGENT SETUP

Firecrawl 能接入任何支持 MCP 或 Skills 的 AI Agent。这里以 WorkBuddy 为例,讲最省事的安装方式。

WorkBuddy:一句话装好 Skill,免 Key 直接用

在 WorkBuddy 的对话框里直接输入下面这句话即可,不需要打开任何设置、也不需要提供 API Key:

CMD安装这个skill https://github.com/firecrawl/skills

WorkBuddy 会自动从 GitHub 拉取并加载 Firecrawl 的 skills 技能包。加载完成后,你就能在对话里直接用自然语言让它抓取网页、搜索、解析 PDF——全程不需要填任何 API Key。典型指令:

prompt

🎯 帮我抓取这个网页的内容,整理成摘要:https://example.com/article

🎯 搜索一下最近关于 AI Agent 的行业新闻

🎯 把这个 PDF 解析成 Markdown:https://example.com/report.pdf

🎯 打开这个网页,找到价格表部分,提取成表格

🎯 爬取这个网站的所有子页面,整理成一份知识库文档

(注:Firecrawl 官方文档推荐的初始化命令是 npx -y firecrawl-cli@latest init --all --browser,但在 WorkBuddy 里实测下来,上面那句「安装 skill」最直接,免登录、免 Key,一步到位。)

其他 Agent 的接入

Claude Code

claude mcp add --transport http firecrawl https://mcp.firecrawl.dev/v2/mcp

Cursor

在 MCP 配置里添加 Firecrawl,地址同上、Key 留空

OpenClaw / OpenCode / Hermes Agent

通用 MCP 地址均为 https://mcp.firecrawl.dev/v2/mcp,Key 留空

06

PART

实机演示 — 我们跑了一遍

LIVE DEMO

光说不够,下面是我们用 Firecrawl CLI 实际测试的真实输出结果。

演示一:抓取中文技术博客

CMDfirecrawl scrape "https://knightli.com/2026/04/15/firecrawl-ai-web-data-api/"

output

## Firecrawl 项目整理:给 AI Agent 用的网页搜索、抓取与交互 API

Firecrawl 的定位很明确:把网页变成 AI Agent 更容易消费的数据。

它不是单纯的爬虫脚本,而是把搜索、单页抓取、整站遍历、

页面交互、结构化抽取和 Agent 工作流封装成 API...

 

**核心功能**

- Search:搜索网页,并返回结果页的完整内容

- Scrape:把单个 URL 转换成 Markdown、HTML、截图或结构化 JSON

- Interact:通过提示词执行点击、滚动、输入、等待等操作

可以看到,Firecrawl 自动去除了导航栏、侧边栏、广告等干扰内容,只保留了文章正文,且保持了完整的 Markdown 结构。

演示二:PDF 论文解析为 Markdown

CMDfirecrawl scrape "https://arxiv.org/pdf/2406.12929"

output

arXiv:2406.12929v1 [cs.CR] 15 Jun 2024

 

# RMF: A Risk Measurement Framework for Machine Learning Models

 

## ABSTRACT

Machine learning (ML) models are used in many safety- and

security-critical applications nowadays...

 

## CCS CONCEPTS

• Security and privacy → Software security engineering.

PDF 解析效果非常好——标题、作者、摘要、章节标题全部识别正确,格式完整。这对阅读学术论文、行业研究报告来说极为实用。

演示三:全网搜索

CMDfirecrawl search "2026 AI agent trends"

output

AI agent trends 2026 report | Google Cloud

URL: https://cloud.google.com/resources/content/ai-agent-trends-2026

Our new report reveals the 5 top trends in agentic AI...

 

Future of AI Agents: Top Trends in 2026 - Blue Prism

URL: https://www.blueprism.com/resources/blog/...

The agentic era has sparked new autonomy in AI agents...

与普通搜索引擎不同,Firecrawl 的 search 结果直接附带完整网页内容摘要,方便 AI Agent 直接理解后做下一步判断。

演示四:抓取公众号文章(实测)

公众号文章向来难复制干净——顶栏、分享按钮、「阅读原文」、底部推荐和广告一大堆。我们用 Firecrawl 直接抓了自己上一篇公众号文章试试:

CMDfirecrawl scrape "https://mp.weixin.qq.com/s/oOeGMgVysu0Y9jufHXfr1w" --only-main-content --format markdown

output(节选)

# Krea 2 文生图本地跑通,比 ComfyUI 省事多了

 

## 配置要求

- 内存 16GB 以上

- NVIDIA 显卡,显存 8GB 以上

- 硬盘至少腾出 60GB,强烈建议放固态硬盘

- Windows 10 64 位以上

 

## 安装启动器

Windows 启动器只有 56MB,下载后点「开始部署」...

 

## 下载 Krea 2 模型

进入左侧「模型管理」,找到 [45] Krea2 文生图模型包...

 

## 把 Krea 2 加到导航栏

启动成功后浏览器自动打开 http://127.0.0.1:8186/...

Firecrawl 把公众号页面上的顶栏、分享按钮、「阅读原文」、底部推荐和广告全部剥离,只留下纯净的正文 Markdown——标题、章节、列表、链接一个不少。这意味着你可以用一条命令,把任意公众号文章转成可二次加工的干净文本,做归档、摘要、对比都极其方便。

07

PART

使用技巧与注意事项

TIPS & NOTES

✅ 技巧篇

明确需求再调用

免费账户每月 1000 积分,按操作用量扣减(抓取每页 1 分、搜索每 10 条 2 分、PDF 按页数计费)。先想清楚要抓什么,再下指令,别无意义地反复抓同一页。

善用 --only-main-content

绝大多数场景只要正文,加上它能自动剔除导航/广告/页脚,既干净又省 token。需要链接、截图再叠加 --format。

善用结构化提取

只要页面里某部分数据(价格、表格、列表),用 --format json --schema 让 Firecrawl 直接吐结构化数据,而不是先抓整页再让 AI 筛——更省积分。

用 -o 落盘成知识资产

CLI 加 -o page.md 直接存本地文件;在 WorkBuddy 里说「把抓取内容保存到桌面/竞品分析.md」,形成可长期查阅的资料。

在 WorkBuddy 用一句话装 Skill

不用记 MCP 配置,对话框输入「安装这个skill https://github.com/firecrawl/skills」,加载后免 Key 用自然语言调用,Agent 自己选对命令和参数。

巧用海外 IP 通道

需要抓 BBC、Google、arXiv 等国内访问不便的站点时,直接交给 Firecrawl,省去自己折腾网络环境。

⚠️ 注意事项

!踩坑提示 🕳

Keyless 与注册账户有别:免 Key 模式按 IP 每天限制请求和积分数,且不支持 crawl/extract/map 等端点,仅适合临时测试。日常稳定使用请免费注册账户(1000 积分/月),速率更宽松;一旦受限,注册即可无缝切换。

额度管理

免费账户每月 1000 积分,自动重置。CLI 运行 firecrawl credit-usage 查看已用积分和并发数。频繁全站爬取建议升级付费套餐。

速率限制

免 Key 模式按 IP 每日封顶,超额返回 429。REST API 在严格场景仍可能要求 API Key,建议优先用 MCP 或 CLI 入口。

合规使用

抓取第三方内容时遵守 robots.txt 与服务条款。Firecrawl 内置 robots.txt 遵守机制,作为使用者也要了解合规边界。

网络环境

服务端部署在海外,你本地只要能连通 Firecrawl 即可,不必能直连目标站点——因为它从海外代抓。若连 Firecrawl 本身失败,先查网络连通性。

配置持久化

WorkBuddy 的 MCP 或 Skill 配置保存在本地,不会随对话结束丢失;换设备需重新添加。

⚠️ 特别提醒:Keyless 免 Key 模式本质是「后备通道」——有每日 IP 限制,且不支持 crawl/extract 等端点。日常稳定使用请免费注册一个账号(1000 积分/月,无需绑卡)。生产环境或大规模抓取可升级付费套餐。

///

LAST

写在最后

WRAP UP

Firecrawl 的免 Key 模式,表面上看只是去掉了一行 API Key 的配置,但背后反映的是一个更大的趋势——AI Agent 正在成为互联网基础设施的主要消费者。

传统的 API Key 模式是为人类开发者设计的:注册、付费、管理 Key。但 Agent 不会注册账号,不会绑定邮箱,它只会直接调用接口。当 AI Agent 越来越频繁地充当数据管道的主角,无 Key 调用就会从少数人的便利变为行业的默认形态。

Firecrawl 并不是只能和某一个 Agent 配合使用。它是完全通用的服务,兼容所有支持 MCP / Skills 的 AI Agent:WorkBuddy、Claude Code、Cursor、OpenClaw、OpenCode、Hermes Agent……本文以 WorkBuddy 为例演示 Agent 接入,但 CLI 用法和所有技巧,在任何环境下都成立。

Firecrawl + AI Agent 的组合,本质上是在做一件事:让 AI Agent 获得自由上网的能力。不需要中间人手动配置,不需要繁琐的凭证管理,Agent 自己就能联网、抓取、交互、整理——一条指令就够了。

打开终端跑一行 firecrawl https://example.com --only-main-content,你的 Agent,这就睁眼了

我是 文喜AI,热衷于分享 AI 工具与实战干货。如果今天这篇对你有用,欢迎点赞、在看、转发三连,我们下篇见。

参考资料

• Firecrawl 官方公告:x.com/firecrawl/status/2066918976689754148

• Keyless 官方博客:firecrawl.dev/blog/firecrawl-keyless-launch

• CLI 官方文档(--format 说明):docs.firecrawl.dev/zh/sdks/cli

• Skills 仓库:github.com/firecrawl/skills

• Firecrawl 官网:firecrawl.dev

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING

 

暂无评论,快来发表第一条评论吧!

📮 需求咨询