本文来源:https://mp.weixin.qq.com/s/S0_ioojlHCfeEtreBDfqDA
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。
📦 8 Parts + Conclusion
👉 滑动
PART 01
是什么
Firecrawl 介绍
PART 02
三大优势
对比同类工具
PART 03
免 Key
意味着什么
PART 04
CLI 实战
一行命令
PART 05
Agent 接入
以 WorkBuddy
PART 06
实机演示
真实跑一遍
PART 07
技巧注意
高效用法
PART ///
写在最后
趋势总结
给一个 URL,它返回干净、结构化的数据——这就是 AI Agent 的「网页榨汁机」
如果你还在为「想让 AI 联网抓数据」发愁——每次抓个网页就要注册账号、申请 API Key、配环境变量,甚至还要折腾代理 IP 和反爬虫——那这篇内容可能帮你省掉 80% 的配置时间。
2026 年 6 月 16 日,Firecrawl 官方宣布:使用 Firecrawl 不再需要 API Key。搜索、抓取、与网页交互、把 PDF 解析成干净 Markdown,全部免配置开箱即用。无需注册也能直接调用,想稳定用再免费注册(每月 1000 积分)也不迟。
Firecrawl 本质是为 AI Agent 设计的「网页榨汁机」:给一个 URL,它返回干净、结构化的数据。它能接入任何支持 MCP 的 AI Agent(Claude Code、Cursor、OpenClaw、WorkBuddy 等)。本文虽然以 WorkBuddy 为例演示 Agent 接入,但重点放在 CLI 用法和实用技巧上——毕竟大多数同学还是直接在命令行里用得最多。
01
PART
Firecrawl 是什么?
WHAT IS FIRECRAWL
Firecrawl 是目前 GitHub 上最火的网页数据接口之一,Star 数已突破 13 万,超过 15 万家企业正在使用,包括 Apple、Canva、Stanford、Zapier、Replit 等知名机构。
它和传统爬虫完全不同——传统爬虫需要你分析 DOM 结构、抠隐藏标签、买代理 IP 防封、对抗滑块验证码,稍微改个 class 名代码就报废。Firecrawl 的本质是专为 AI Agent 设计的「网页榨汁机」:你给一个 URL,它返回干净、结构化的 Markdown 或 JSON,自动剔除广告、导航栏、页脚等干扰内容。
核心能力一览
Search(全网搜索)
对整个互联网进行搜索,每条结果直接附带完整的网页内容,而非只有摘要。
Scrape(网页抓取)
抓取任意 URL 的干净内容,支持 JavaScript 动态渲染页面,无需额外配置。
Interact(页面交互)
让 AI 能在网页上执行点击、填表、翻页、登录等操作——这是传统爬虫完全做不到的。
PDF → Clean Markdown(PDF 解析)
将任意 PDF 文件解析为干净、结构完整的 Markdown,彻底告别「复制粘贴乱码」的痛苦。
Crawl(全站爬取)
自动遍历整个网站的所有子页面,返回每个页面的干净 Markdown。
Extract(结构化提取)
按自定义 Schema 从网页中提取结构化 JSON 数据。
一句话总结:Firecrawl 是 AI Agent 的「眼睛 + 双手」——看见网页、操作网页,输出 AI 能直接「吃」的格式
02
PART
Firecrawl 强在哪?对比同类工具
VS OTHERS
市面上的网页抓取方案不少:最原始的是用 Python 的 requests + BeautifulSoup 自己写解析器,再进阶一点会用 ScrapingBee、Bright Data 这类商业爬虫代理服务,或者用 Playwright / Puppeteer 做浏览器自动化。那 Firecrawl 凭什么成为 GitHub 上 13 万 Star 的项目?答案可以浓缩成三个字:快、净、定。
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
① 快:开箱即用的「网页榨汁机」
传统爬虫最耗时的不是写代码,而是和反爬、代理、渲染斗争:免费代理随时失效、付费代理要排队、JS 渲染要等几秒。Firecrawl 把这些脏活累活全包了——你给一个 URL,它在云端自动完成渲染、反爬绕行,返回直接就是干净内容,不用你等、不用你配。对一个要快速验证想法的 Agent 来说,「快」本身就是生产力。
② 净:自动清洗,告别「选择器地狱」
自写爬虫最大痛点是:网站改个 class 名,你的解析代码就报废。Firecrawl 内置内容识别引擎,加上 --only-main-content 参数,能自动剔除导航栏、页脚、广告、侧边栏等干扰内容,只保留正文;还能用 --redact-pii 自动脱敏个人隐私信息。你拿到的就是 AI 能直接「吃」的干净数据。
③ 定:用 --format 指哪打哪,12 种输出任选
很多工具抓完只能给你一大坨 HTML,剩下自己解析。Firecrawl 让你用 --format 参数直接定义想要的输出类型,一次调用就能拿到你正好需要的形式。支持 12 种格式:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
多个格式用逗号组合,例如 --format markdown,links 会返回同时含正文和链接的 JSON。实际用法见下一节。
03
PART
免 API Key 意味着什么?
KEYLESS MODE
用传统方式让 AI Agent 联网,通常需要走一套固定流程:
去 Firecrawl 官网注册账号
生成 API Key
复制 Key 到环境变量或配置文件
测试连接是否正常
现在,这套流程直接缩减为零步。Firecrawl 的 MCP、CLI、API 三大入口全部向无 Key 用户开放。你只需要知道接入地址,配置一次就能永久使用。
两种用法,别搞混了:① Keyless(免 Key)模式:完全不需要账号,但仅限官方客户端,按 IP 每天限制请求数和积分数,适合临时体验和开发调试。② 注册免费账户:免费注册即可获得 1000 积分/月(无需绑卡),速率限制更宽松,解锁 crawl/extract/map 等更多端点。当 Keyless 受限或要规模化时,注册账号即可。
积分(Credits)怎么算?Firecrawl 按操作消耗积分(非按「次」):抓取(Scrape)每页 1 积分,搜索(Search)每 10 条结果 2 积分,全站爬取(Crawl)每页 1 积分,交互(Interact)按浏览器分钟计费,PDF 解析按页数计费。免费账户每月 1000 积分,日常轻度使用完全够。Keyless 模式虽免注册,但按 IP 每日积分上限更低,适合临时测试。
04
PART
CLI 实战入门:一行命令开始抓取
CLI IN ACTION
Firecrawl 的 CLI 集成在 npx 里,不用安装、不用 Key,一行命令就能跑。想全局安装也可以:npm i -g firecrawl-cli,之后用 firecrawl 命令即可。
核心命令速查
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
高频参数
--only-main-content
只保留正文,自动去导航/页脚/广告(最常用)
--format
指定输出格式,多个用逗号,如 markdown,links,screenshot,json
--schema
配合 json 格式,按自定义结构提取数据
--wait-for / --screenshot / --redact-pii / -o
等渲染 / 截图 / 脱敏 / 存文件(如 -o page.md)
隐藏彩蛋:Firecrawl 走的是海外 IP,自带「科学加速」 Firecrawl 的抓取请求从海外服务器发出,所以它能直接访问 BBC、Google 等国外站点,且速度很快。对国内用户来说,这相当于白送一个免配置的外网抓取通道。
05
PART
接入 AI Agent(以 WorkBuddy 为例)
AGENT SETUP
Firecrawl 能接入任何支持 MCP 或 Skills 的 AI Agent。这里以 WorkBuddy 为例,讲最省事的安装方式。
WorkBuddy:一句话装好 Skill,免 Key 直接用
在 WorkBuddy 的对话框里直接输入下面这句话即可,不需要打开任何设置、也不需要提供 API Key:
CMD安装这个skill https://github.com/firecrawl/skills
WorkBuddy 会自动从 GitHub 拉取并加载 Firecrawl 的 skills 技能包。加载完成后,你就能在对话里直接用自然语言让它抓取网页、搜索、解析 PDF——全程不需要填任何 API Key。典型指令:
(注:Firecrawl 官方文档推荐的初始化命令是 npx -y firecrawl-cli@latest init --all --browser,但在 WorkBuddy 里实测下来,上面那句「安装 skill」最直接,免登录、免 Key,一步到位。)
其他 Agent 的接入
Claude Code
claude mcp add --transport http firecrawl https://mcp.firecrawl.dev/v2/mcp
Cursor
在 MCP 配置里添加 Firecrawl,地址同上、Key 留空
OpenClaw / OpenCode / Hermes Agent
通用 MCP 地址均为 https://mcp.firecrawl.dev/v2/mcp,Key 留空
06
PART
实机演示 — 我们跑了一遍
LIVE DEMO
光说不够,下面是我们用 Firecrawl CLI 实际测试的真实输出结果。
演示一:抓取中文技术博客
CMDfirecrawl scrape "https://knightli.com/2026/04/15/firecrawl-ai-web-data-api/"
可以看到,Firecrawl 自动去除了导航栏、侧边栏、广告等干扰内容,只保留了文章正文,且保持了完整的 Markdown 结构。
演示二:PDF 论文解析为 Markdown
CMDfirecrawl scrape "https://arxiv.org/pdf/2406.12929"
PDF 解析效果非常好——标题、作者、摘要、章节标题全部识别正确,格式完整。这对阅读学术论文、行业研究报告来说极为实用。
演示三:全网搜索
CMDfirecrawl search "2026 AI agent trends"
与普通搜索引擎不同,Firecrawl 的 search 结果直接附带完整网页内容摘要,方便 AI Agent 直接理解后做下一步判断。
演示四:抓取公众号文章(实测)
公众号文章向来难复制干净——顶栏、分享按钮、「阅读原文」、底部推荐和广告一大堆。我们用 Firecrawl 直接抓了自己上一篇公众号文章试试:
CMDfirecrawl scrape "https://mp.weixin.qq.com/s/oOeGMgVysu0Y9jufHXfr1w" --only-main-content --format markdown
Firecrawl 把公众号页面上的顶栏、分享按钮、「阅读原文」、底部推荐和广告全部剥离,只留下纯净的正文 Markdown——标题、章节、列表、链接一个不少。这意味着你可以用一条命令,把任意公众号文章转成可二次加工的干净文本,做归档、摘要、对比都极其方便。
07
PART
使用技巧与注意事项
TIPS & NOTES
✅ 技巧篇
明确需求再调用
免费账户每月 1000 积分,按操作用量扣减(抓取每页 1 分、搜索每 10 条 2 分、PDF 按页数计费)。先想清楚要抓什么,再下指令,别无意义地反复抓同一页。
善用 --only-main-content
绝大多数场景只要正文,加上它能自动剔除导航/广告/页脚,既干净又省 token。需要链接、截图再叠加 --format。
善用结构化提取
只要页面里某部分数据(价格、表格、列表),用 --format json --schema 让 Firecrawl 直接吐结构化数据,而不是先抓整页再让 AI 筛——更省积分。
用 -o 落盘成知识资产
CLI 加 -o page.md 直接存本地文件;在 WorkBuddy 里说「把抓取内容保存到桌面/竞品分析.md」,形成可长期查阅的资料。
在 WorkBuddy 用一句话装 Skill
不用记 MCP 配置,对话框输入「安装这个skill https://github.com/firecrawl/skills」,加载后免 Key 用自然语言调用,Agent 自己选对命令和参数。
巧用海外 IP 通道
需要抓 BBC、Google、arXiv 等国内访问不便的站点时,直接交给 Firecrawl,省去自己折腾网络环境。
⚠️ 注意事项
!踩坑提示 🕳
Keyless 与注册账户有别:免 Key 模式按 IP 每天限制请求和积分数,且不支持 crawl/extract/map 等端点,仅适合临时测试。日常稳定使用请免费注册账户(1000 积分/月),速率更宽松;一旦受限,注册即可无缝切换。
额度管理
免费账户每月 1000 积分,自动重置。CLI 运行 firecrawl credit-usage 查看已用积分和并发数。频繁全站爬取建议升级付费套餐。
速率限制
免 Key 模式按 IP 每日封顶,超额返回 429。REST API 在严格场景仍可能要求 API Key,建议优先用 MCP 或 CLI 入口。
合规使用
抓取第三方内容时遵守 robots.txt 与服务条款。Firecrawl 内置 robots.txt 遵守机制,作为使用者也要了解合规边界。
网络环境
服务端部署在海外,你本地只要能连通 Firecrawl 即可,不必能直连目标站点——因为它从海外代抓。若连 Firecrawl 本身失败,先查网络连通性。
配置持久化
WorkBuddy 的 MCP 或 Skill 配置保存在本地,不会随对话结束丢失;换设备需重新添加。
⚠️ 特别提醒:Keyless 免 Key 模式本质是「后备通道」——有每日 IP 限制,且不支持 crawl/extract 等端点。日常稳定使用请免费注册一个账号(1000 积分/月,无需绑卡)。生产环境或大规模抓取可升级付费套餐。
///
LAST
写在最后
WRAP UP
Firecrawl 的免 Key 模式,表面上看只是去掉了一行 API Key 的配置,但背后反映的是一个更大的趋势——AI Agent 正在成为互联网基础设施的主要消费者。
传统的 API Key 模式是为人类开发者设计的:注册、付费、管理 Key。但 Agent 不会注册账号,不会绑定邮箱,它只会直接调用接口。当 AI Agent 越来越频繁地充当数据管道的主角,无 Key 调用就会从少数人的便利变为行业的默认形态。
Firecrawl 并不是只能和某一个 Agent 配合使用。它是完全通用的服务,兼容所有支持 MCP / Skills 的 AI Agent:WorkBuddy、Claude Code、Cursor、OpenClaw、OpenCode、Hermes Agent……本文以 WorkBuddy 为例演示 Agent 接入,但 CLI 用法和所有技巧,在任何环境下都成立。
Firecrawl + AI Agent 的组合,本质上是在做一件事:让 AI Agent 获得自由上网的能力。不需要中间人手动配置,不需要繁琐的凭证管理,Agent 自己就能联网、抓取、交互、整理——一条指令就够了。
打开终端跑一行 firecrawl https://example.com --only-main-content,你的 Agent,这就睁眼了
我是 文喜AI,热衷于分享 AI 工具与实战干货。如果今天这篇对你有用,欢迎点赞、在看、转发三连,我们下篇见。
参考资料
• Firecrawl 官方公告:x.com/firecrawl/status/2066918976689754148
• Keyless 官方博客:firecrawl.dev/blog/firecrawl-keyless-launch
• CLI 官方文档(--format 说明):docs.firecrawl.dev/zh/sdks/cli
• Skills 仓库:github.com/firecrawl/skills
• Firecrawl 官网:firecrawl.dev
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING