给 AI 助手装个「耳朵」:Groq 免费语音转文字实战指南 微信里发条语音,1-3 秒后 AI 助手回你一行简体字——这是给自部署助手接上 Groq 免费语音识别后最直观的变化。1-3 秒—— 微信语音出简体字8 小时/天—— 免费档音频额度,个人用不完零内存—— 转写全在云端,本地 0 占用为什么折腾这个?我的助手 Hermes 跑在一台 2G 内存的小服务器上,打字交互没问题,但人总有懒得打字的时候,语音才是自然输入。第一版用本地faster-whisper,实测两个问题很现实:「收到」被识别成「抽到」,口语词错得更多;转写一条语音占 400-500MB 内存,2G 的机器转完基本没余量干别的。换成云端 Groq Whisper 后,中文错字基本消失,内存零占用,免费档约 8 小时音频/天个人用不完。整条路走完踩了两个坑——访问限制、默认出繁体——各有各的解法。下面六步照抄即可,所有命令都是我实测过的。1. 选型:先本地,再云端本地 faster-whisper 一句话总结:能用,但不好用。对比项本地faster-whisper云端 Groq Whisper中文识别base模型一般,「收到」识别成「抽到」,助手根本接不住话明显更准,base模型那些错字基本消失内存占用转写一条占 400-500MB,2G 的机器转完基本没余量干别的零占用,识别在云端完成免费额度无,消耗本地资源约 8 小时音频/天,个人用量用不完2. 上手:六步走完2.1 注册打开 Groq 控制台 注册,进 API Keys 页面 Create API Key,复制保存。 key 只显示一次,丢了只能重新生成。注意:Groq 需要魔法访问。2.2 写 .envkey 放进 Hermes 根目录的.env(本机是/root/.hermes/.env),加一行:# .env GROQ_API_KEY你的key 这个文件权限要收紧,别让别的用户读到:chmod 600 /root/.hermes/.env2.3 配sttconfig.yaml里加:# config.yaml stt: provider: groq language: zh模型默认就是whisper-large-v3-turbo,端点https://api.groq.com/openai/v1,一般不用改。想换模型,在.env里设STT_GROQ_MODEL和GROQ_BASE_URL即可,详见 Groq API 文档。2.4 访问限制(坑 1:无法直连)⚠️坑 1:访问限制现象:部分网络环境下无法直接访问 Groq(HTTP 403)。原因:Groq 服务有区域限制。解决:需要魔法访问,自行解决。2.5opencc补丁(坑 2:默认出繁体)⚠️坑 2:默认出繁体现象:中文识别出来了,但全是繁体字。原因:whisper-large-v3-turbo中文默认输出繁体,没有现成的「简体优先」参数。解法:转写结果过一遍 opencc,t2s(繁转简)。改 Hermes 的转写文件/usr/local/lib/hermes-agent/tools/transcription_tools.py,在_transcribe_groq函数里找到这行:# transcription_tools.py 定位 transcript_text str(transcription).strip()在它后面插入:# transcription_tools.py 插入 try: from opencc import OpenCC transcript_text OpenCC(t2s).convert(transcript_text) except Exception: pass装依赖(这步最容易漏):pip install opencc-python-reimplementedopencc库不装,上面那段try会静默失败,繁体照旧——表现就是「明明打了补丁还是繁体」。我 2026-08 装到的版本文件里已经内置了这段转换,如果你的版本没有,照上面手动加。改文件前先备份,可随时回滚:cp /usr/local/lib/hermes-agent/tools/transcription_tools.py{,.bak-groq}改完重启 Hermes 让补丁生效(本机网关是systemd服务:sudo systemctl restart hermes-gateway;其他部署方式重启对应进程即可)。2.6 验证 ✅微信发一条语音,1-3 秒应该回一行简体字。两条判断:出字慢或报错 → 确认能正常访问 Groq(需要魔法),curl一下https://api.groq.com看通不通出字了但是繁体 →opencc依赖没装或补丁没生效,重启后再试3. 效果✅1-3 秒出简体字—— 微信发语音,直接进对话流程✅零内存负担—— 识别全在云端,服务器不占资源✅免费额度充足—— 约 8 小时/天,个人用不完4. 总结小服务器跑 AI 助手,资源是硬约束。本地方案「能用」和「好用」之间,差着一条内存线;云端方案把这条线抹掉了。两个坑——访问限制、繁体输出——前者需要魔法,后者打段opencc补丁,都容易解决。如果你也在小机器上折腾语音入口,照着上面六步走,这条路可以照抄。卡在哪一步,欢迎留言交流。

相关新闻

最新新闻

DeepSeek V4接入Codex:0.24元构建AI数据分析Agent实战

DeepSeek V4接入Codex:0.24元构建AI数据分析Agent实战

这次我们来看一个将 DeepSeek V4 大模型接入 Codex 平台,并以极低成本完成真实 AI 数据分析任务的实战项目。核心目标很直接:利用国产大模型 DeepSeek V4 的强大能力,通过 Codex 平台构建一个可执行的 AI 数据分析系统,实现 Agent…

2026/8/16 7:53:59
校园综合服务系统源码 Java+SpringBoot+Vue 万字文档+PPT 前后分离

校园综合服务系统源码 Java+SpringBoot+Vue 万字文档+PPT 前后分离

一、关键词校园综合服务系统,校园一站式综合服务平台,校园一体化服务管理系统二、作品包含源码数据库万字设计文档PPT全套环境和工具资源本地部署教程三、项目技术前端技术:Html、Css、Js、Vue2、Element-ui后端技术:Java、Spring…

2026/8/16 7:53:59
Linux基本命令入门

Linux基本命令入门

文件与目录操作 pwd 命令:pwd(print working directory) 功能:打印当前目录 作用:明白自己当前在哪个目录,确认具体的工作路径 tree 命令:tree 功能:以分叉树形式列出文件夹与文件 l…

2026/8/16 7:53:59
Codex工具:一键在VS Code中集成DeepSeek API的完整指南

Codex工具:一键在VS Code中集成DeepSeek API的完整指南

如果你正在寻找一种简单、高效的方式,将强大的DeepSeek模型集成到你的开发工作流中,那么Codex这款工具绝对值得你花几分钟了解一下。它不是一个复杂的本地部署方案,而是一个旨在连接各类AI模型与开发环境的“桥梁”工具。简单来说&#xff0c…

2026/8/16 7:53:59
拆解LLM多模态心理健康分析系统:从概念到可运行原型的工程实践

拆解LLM多模态心理健康分析系统:从概念到可运行原型的工程实践

你有没有遇到过这样的场景:一个看起来功能齐全的毕业设计项目,代码、文档、PPT一应俱全,但当你真正想把它跑起来,或者想理解它背后的设计逻辑时,却发现无从下手?代码仓库里文件散落,README语焉不…

2026/8/16 7:53:59
【软考】2020年下半年信息安全工程师 上午综合知识真题完整版(试题+标准答案+解析)

【软考】2020年下半年信息安全工程师 上午综合知识真题完整版(试题+标准答案+解析)

2020年下半年信息安全工程师 上午综合知识真题完整版(试题标准答案解析) 说明 本套试卷共75道选择题(1-70单选,71-75英文完形填空),每题1分,满分75分;全部依据信管网原题整理&#x…

2026/8/16 7:48:59