本文来源:https://mp.weixin.qq.com/s/WRBheFsfq2ZOJ07glq4XGA
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。
PLAUD 机身纤薄,设计成熟度高;钉钉 A1 与办公系统的整合非常紧密;飞书和安克推出的 AI 录音豆,将录音功能精简至一枚可佩戴的“豆状”设备。它们共同表明:用户确实需要一个比手机更轻巧、更快捷、干扰更小的声音采集工具。设备购买后,我能否自主决定录音文件的存储位置、处理模型的选择,以及最终的数据流向?这是一款基于 ESP32-S3 和电子墨水屏开发板打造的开源 AI 录音卡片。其固件源码和中文使用指南已在 GitHub 上架,外壳模型也已发布至 MakerWorld 平台。所有用户均可进行复制、修改,或接入个人模型与工作流程。一、我反对的不是订阅模式,而是“仅有订阅”的单一选择。
需要明确的是:云端转写服务、模型推理运算、跨设备数据同步以及持续的软件维护均需成本投入。商业设备收取订阅费用,本无可厚非。关键在于,许多 AI 硬件将硬件本体、云服务、处理模型和数据出口强行捆绑为一个不可分割的整体。PLAUD 目前提供了包括 Starter、Pro 和 Unlimited 在内的多种方案。根据官方说明,Starter 方案每月包含 300 分钟的语音转写服务,Pro 方案则为每月 1,200 分钟,如需更高使用量,用户可选择升级方案或购买额外时长。钉钉在 A1 产品发布时公布的信息显示,其旗舰版硬件定价为 799 元,同时提供每月 1,000 分钟的转写功能和 10GB 云存储空间,此外还推出了 599 元/年的专业版和 1,499 元/年的高级会员选项。尽管产品方案和价格未来可能调整,但“先购买硬件设备,再按月或按年采购 AI 服务”已成为行业内普遍的商业模式。飞书 AI 录音豆选择了不同的技术路径:硬件部分由安克负责,录音内容会自动同步到飞书的妙记功能和会议纪要中。对于已经使用飞书的团队来说,这种整合体验尤为便捷;不过,它的实用价值与飞书账号体系、妙记功能以及组织内部的协同系统密切相关。这些产品的优势各有侧重。PLAUD 在工业设计与应用完整性方面表现突出;钉钉更适用于已在钉钉平台上开展工作的企业;而飞书则擅长将会议记录转化为文档、任务项和组织知识库。如果未来我决定停止使用这项云服务,硬件设备还能否继续发挥作用?原始录音文件是否能够直接导出,而不需要通过 App 内的多层操作才能获取?我是否可以选择使用 DeepSeek、Kimi、GLM 等替代服务,或者未来出现的新型模型?转写后的文字内容能否直接传输到闪念贝壳、飞书、自建服务器,甚至是我自己开发的工具中?一款硬件产品,不应仅仅被视为获取某个平台的长期凭证。二、记忆面包旨在探索“软硬分离”的可能性
记忆面包并非追求在工业设计、降噪技术或最终体验上立即超越现有商业产品。它更像是一种可以实际拆卸的实验原型:录音硬件→microSD 卡中的标准 WAV 格式文件→用户自选的语音识别服务→用户自选的大语言模型→闪念贝壳/飞书/自建服务/其他应用按键录音后,将完整 WAV 文件保存到 microSD → 用户手动执行同步 → 硅基流动 SenseVoiceSmall 进行转写 → 将 TXT 文件保存到 microSD → DeepSeek-V3.2 整理标题、摘要和正文 → 闪念贝壳 MCP 创建笔记。硅基流动只是当前接入的服务,并非硬件唯一的核心。其官方售价页目前将 SenseVoiceSmall 列为免费语音模型,DeepSeek 按 Token 收费;未来价格或模型状态变化时,可通过修改源码切换至其他兼容服务。闪念贝壳也不是最终唯一的选择。目前先接入它,是因为它提供 MCP 接口,设备可直接调用 note_create 创建笔记。后续还可进一步集成飞书、自建 Webhook,或让设备从 MCP 读取笔记和待办事项。Key 归你所有,录音归你所有,microSD 归你所有,数据流向由你掌控。三、当前所能实现的功能
当前公开发布的固件版本为 v1.5-memorybread,主要功能包括:屏幕点亮状态下,快速轻点三次即可启动长时间录音,再次轻点即可停止。每次长时间录音将生成单一连续 WAV 文件,不会按分钟分割成多个文件。支持 16 kHz、16 位、单声道录音,录音过程实时写入 microSD 卡。配备 1.54 英寸黑白电子墨水屏,支持中文用户界面。能够显示全部 20,992 个 Unicode 基本区汉字。最多可保存三组 2.4 GHz Wi-Fi 连接,例如家庭网络、办公网络和移动热点。手机连接至设备热点后,支持扫描周边 Wi-Fi网络、输入 API Key 及 MCP Token。支持标签功能、三种提示音主题设计、深度睡眠模式以及 HTTPS OTA 升级。即便在没有网络连接和 API Key 的情况下,该设备仍可作为标准录音工具使用。长时间录音采用 PSRAM 环形缓冲技术和边录制边写入存储卡的机制。固件每隔约 30 秒会更新一次 WAV 文件头,降低因异常断电导致整段录音无法播放的概率。v1.5 版本还解决了录音完成后错误触发深度睡眠、以及录音已存储却未在索引中显示的问题。这并非一个视觉化的概念图,而是一套已实际烧录至真实开发板并经过测试的固件程序。四、如何打造一台记忆面包
硬件方面无需自行设计 PCB,核心开发板已整合了墨水屏、麦克风、扬声器、microSD 卡槽、充电管理模块及两个按键。你真正需要做的仅三步:准备硬件、获取项目文件、按住指定按键让 AI 自动完成烧录。1. 准备硬件
当前固件适用于黑白屏 ESP32-S3 版本。触控版虽可运行但暂不响应触摸操作;RP2350 和四色1.54G 版本不兼容。开发板的技术文档与参数信息可查阅:https://www.waveshare.net/shop/ESP32-S3-ePaper-1.54-EN.htm2. 打印外壳
外壳模型文件已上传至 MakerWorld 平台:具体模型链接为:https://makerworld.com.cn/zh/models/2827932-ji-yi-mian-bao-lu-yin-ji下载模型时需参考页面标注的打印参数,合理选择材料、层高及支撑设置。组装时请勿先连接电池,务必检查按键回弹顺畅且 USB-C 和 microSD 开口无遮挡,确认无误后再进行最终装配。使用或二次创作该外壳时,需遵守 MakerWorld 页面中标注的授权协议。3. 最便捷的方案:将项目委托给 AI 编程助手处理。
即便不懂编程也不用担心。这一环节可转交给 Codex、Claude Code,或具备读取本地文件及执行终端命令功能的 WorkBuddy(了解更多) / CodeBuddy 等工具。项目链接为:https://github.com/Shawn-TKD/memory-bread点击 Code → Download ZIP,下载后解压。然后在 AI 编程助手里打开整个 memory-bread 文件夹。你不需要先学 Arduino,也不用自己判断该安装哪些工具。不同助手的按钮名称可能不同,但过程都是一样的:打开项目文件夹,把下面的提示词完整发给它。4. 第一次对话:让 AI 配好环境并编译
请帮我规格并编译这个 Memory Bread(记忆面包)ESP32-S3 固件。如果电脑缺少 arduino-cli,请先安装;然后安装 esp32 board core 3.2.0,以及 Adafruit GFX Library 和 ArduinoJson。请编译 ./memory_bread,板型使用 ESP32-S3 N8R8,并使用以下选项:PSRAM=opi, PartitionScheme=custom, CDCOnBoot=cdc, FlashSize=8M。编译完成后告诉我是否成功,并报告固件大小。暂时不要烧录,先等我连接设备。不要修改机型能力,也不要把任何 API Key 写进源码。
接下来,AI 会检查电脑、安装缺少的工具并编译。遇到平台安装或访问项目文件的授权提示时,确认目标确实是当前项目和 Arduino 工具,再允许它继续。如果最后表明编译成功,就可以进入下一步;如果失败,直接对它说:“请依据刚才的错误继续修复,直到编译成功。”连接开发板时,仅需长按任意一个按键即可。
这一步无法由 AI 代劳,需要亲自动手完成按键操作:务必选用支持数据传输功能的 USB-C 线材。如果只具备充电功能,电脑将无法识别开发板。7. 第二次对话:引导 AI 识别设备并执行烧录操作
我已经按住开发板的 BOOT / GPIO0(录音键)并连接 USB。请检测新出现的串口,将 ./memory_bread 固件写入这块 ESP32-S3。配置选项为:PSRAM=opi, PartitionScheme=custom, CDCOnBoot=cdc, FlashSize=8M。无需完全擦除 Flash。写入结束后,请核查日志是否出现“Hash of data verified”,确认无误后再告知我松开录音键。若未检测到串口,请先提示我检查哪部分,不要随意猜测端口。当 AI 明确提示出现“Hash of data verified”时,表明固件已完整写入。此时松开录音键,拔下 USB 后重新连接,设备将正常启动。若 AI 无法识别设备,建议首先更换一根确认能传输数据的线缆,随后更换电脑的 USB 接口位置,并重新执行“按住录音键插入线缆”的操作。若问题依旧存在,请将完整的错误日志提交给 AI 进行进一步排查。在整个操作过程中,无需将硅基流动 Key 或闪念贝壳 Token 提供给 AI。这些信息应在设备启动后的配置网页中填写。常规固件写入不会删除 microSD 卡中的录音文件;除非明确了解其影响,否则不应同意“擦除整片 Flash”的操作。7. 第一次配网
硅基流动 Key 可在控制台的“API 密钥”选项中生成。闪念贝壳 Token 的获取路径为“设置 → MCP → API 密钥”。请务必将密钥仅填写在设备规格页面,切勿将其泄露至 GitHub、截图或公众号文章中。关于更详细的按键操作、网络配置、数据同步、文件删除、OTA 更新及故障排除指南,均已记录在仓库中的 USER_GUIDE_ZH.md 文件里。五、开源并非完全零成本
用户需要自行采购开发板、打印外壳并完成固件烧录工作。它缺乏商业成品所具备的成熟应用程序、客服支持以及即开即用的便捷体验。目前必须手动执行数据同步操作,系统不会在后台自动上传,也不会按计划自动进行数据传输。受云服务提供商的文件大小限制,单次云端语音识别服务无法处理超过约25分钟的WAV文件,无法自动实现分段转写功能。目前仅实现了向闪念贝壳的数据写入,尚未将搜索、读取及待办工具部署到设备中。开源并不能使云端算力、电池、存储卡以及开发时间自动消失。它真正削减的是另一项成本:你可以选择继续使用商业产品,体验更成熟的解决方案;也可以选择自行搭建,获得更大的掌控力。这两种方式不应相互排斥。六、本项目真正追求的目标
但在人工智能时代,一段声音已不再仅仅是一个音频文件。它会被转化为文字、摘要、待办事项、日记、人物关系及长期记忆。掌控这条处理流程的人,在很大程度上就掌控了你的第二大脑。我希望验证的理想结局,并非市场上再多一个封闭的录音品牌,而是让录音设备逐步回归“传感器”的基本功能:中间部分,用户可以选择使用本地模型、云端模型,或是自行搭建服务器。向上扩展,可与闪念贝壳、飞书、Notion、邮箱、MCP等工具无缝对接,并整合任何个人工作流程。它更像是录音领域的迷你控制中心,或者可以称其为“全能适配器”。记忆面包距离这一愿景尚有距离,但至少已经迈出了实际的一步:硬件可购,外壳可打印,源码可获取,录音可存储于自有的microSD卡中。既然巨头们仍在致力于构建封闭的用户体验壁垒,总有先驱者愿意率先开启一道通道。假如你也想打造专属的录音卡片,欢迎进行复刻、提交问题反馈、优化代码,抑或是设计出全新的外壳。同样也期待你的想法:倘若录音设备的数据和模型完全由你掌控,你最想将其连接到何处?