零成本、高准确率,一行代码搞定 ASR 语音识别

🆓 推荐的免费 ASR 模型
目前平台提供以下完全免费的语音识别模型:

1️⃣ DianXin/TeleSpeechASR
-
• 特点:高准确率,支持中英文混合识别 -
• 适合:通用场景、会议转写
2️⃣ FunAudioLLM/SenseVoiceSmall
-
• 特点:轻量快速,中文识别表现优秀 -
• 适合:实时语音交互、短语音识别
3️⃣ Qwen2-Audio-7B-Instruct
-
• 特点:支持音频理解与问答,能力更强 -
• 适合:音频内容深度分析
🚀 如何调用 API
第一步:获取 API Key
注册平台账号并登录( https://siliconflow.cn ),在控制台中获取你的 API Key。
第二步:构建请求
ASR 功能通过多模态模型接口调用,使用 audio_url 参数传入音频文件地址。

请求参数说明
|
|
|
|
|---|---|---|
model |
DianXin/TeleSpeechASR |
|
messages |
|
|
audio_url |
|
|
第三步:处理返回
API 返回标准 JSON 格式结果,从中提取识别出的文本内容即可。
🔄 工作流程

整个流程非常简单:
-
1. 准备音频文件 → 支持 wav、mp3、ogg、flac 等常见格式 -
2. 构建请求 → 使用 audio_url传入音频地址 -
3. 调用 API → POST 请求到 /v1/chat/completions -
4. 获取文本 → 从返回 JSON 中提取识别结果
💡 使用场景
-
• 🎤 语音输入法:为用户提供语音转文字功能,提升输入效率 -
• 📝 会议记录:会议录音自动转写为结构化文字记录,方便归档和检索 -
• 📱 语音客服:构建智能客服系统,自动处理用户语音咨询 -
• 🎙️ 播客转文字:自动生成字幕和内容摘要,方便二次传播 -
• 📊 数据分析:对语音内容进行结构化分析,提取关键信息 -
• 🎓 课堂笔记:录制课程音频,自动生成文字笔记和知识点总结
⚠️ 注意事项
-
1. 音频格式:建议使用 wav、mp3、ogg、flac 等常见格式 -
2. 文件大小:单个音频建议不超过 50MB -
3. 网络要求:音频 URL 需要公网可访问 -
4. 免费额度:目前 ASR 模型完全免费,建议关注平台最新政策