【吼蛙】Vibe了一个 Mac 听写转文字LLM后处理的App (新增选中文本一键处理)
Mac本地听写与AI后处理工具HoAh的功能迭代、竞品对比及用户反馈。
关键信息
- 项目名称:HoAh(吼蛙)
- 官网/下载链接:https://hoah.app/(Mac App Store 已签名 notarized)【#1】【#11】
- 核心功能
- 本地 Whisper 语音转文字(离线,无网络请求)【#1】【#57】
- 可选 AI 后处理(润色、翻译、改写等),支持自定义 Prompt【#1】【#7】
- 多语言混合识别,支持 Hindi、Telugu、Klingon 等【#1】
- 选中文本“一键处理”功能(复制‑>AI‑>粘贴)【#96】
- 支持多家云 streaming API(OpenAI Realtime、ElevenLabs Realtime、Amazon Transcribe Streaming)【#96】
- 支持 Ollama 本地模型、Groq、Cerebras、Bedrock、Gemini 等后端【#1】【#81】【#86】
- 新增 Local Streaming 转写(较吃硬件)【#115】
- 默认转写模型已升级为千问(Qwen)【#113】
- 作者回应断句问题:Qwen3 训练数据多为 10 秒以内短句,Parakeet 训练数据约为 30 秒,导致断句表现差异【#118】
- 作者回应竞品对比:认为其他同类产品效果千差万别,只有 Handy 做得较好,HoAh 目前性能优于 Handy 才考虑收费【#120】
- 作者回应断句差异原因:具体取决于用户使用的模型版本及管线,HoAh 未关注竞品具体管线【#120】
- 新增 Regex 替换 功能(从 Context 进入效果一般,主要依赖 Regex)【#123】
- 作者回应 Cursor 索引:不确定是否通过 LLM 实现,因需大量侵入用户 accessibility且研究不深入,暂不优先开发【#123】
- 作者回应 Super Whisper:用户询问公司用 Super Whisper 与 HoAh 对比,作者未直接回答,仅表示当前内容通过听写加 AI Action 效果不错【#124】
- 作者回应替换逻辑(#125):替换是在文本识别出来之后进行的(STT 后替换),非语言识别时直接替换;针对 STT 后别字问题,作者表示目前主要依赖 Regex 处理,若用户有特定别字需求可反馈【#125】
- 回应与豆包对比(#126):针对用户询问 HoAh 相比豆包语音输入法的增量优势,作者强调 HoAh 在增量处理(Incremental)、隐私保护(本地运行/无云端上传)及自定义管线方面的差异化价值。
- 回应豆包实时上屏特性(#127):针对用户询问 HoAh 能否实现类似豆包输入法实时上屏,作者暗示当前架构主要依赖 AI Action 或系统听写接口,尚未支持直接模拟 IME 实时上屏。
- 回应会议转录需求(#128):针对用户询问会议转录,作者未直接回复,结合功能描述,HoAh 主要依赖系统听写/麦克风,未明确支持直接捕获应用内音频流。
- 回应 DIY 功能分发问题(#133):作者确认目前包含大量个人定制的 DIY 功能,因逻辑杂乱不适合标准化分发,暂时不整合进公开版本。
- 使用场景示例:浴缸 coding、客服回复润色、同事小语种悄悄话翻译、节日母语祝福等【#1】
- 资源占用:本地 Whisper 大模型(large‑v3)体积大,CPU 运行慢,推荐使用 GPU/Apple Silicon 加速;不启用 AI 时仅是本地软件【#3】【#30】
- 开源情况:项目原本开源,但因误提交凭证未清理历史,现为闭源发布【#48】
- 兼容性:不支持 macOS Ventura 以上的部分用户【#77】
- 其他功能尝试:曾计划上传音频文件、读取当前 App 信息、Ollama 本地模型等,但因体积或权限问题被舍弃【#62】【#70】
- 版本更新历史:因有人联系 rebrand 做付费版,HoAh 仅更新到 3.8.3【#120】
- 性能优化数据(作者声称):
- 常用听写长度下,Qwen、GLM、Parakeet 延迟从 300-500ms 稳定压至 100ms-200ms,极端可达 50ms【#120】
- Whisper 延迟从 1 秒压至 500ms【#120】
- 优化了冷启动、内存管理、AI Action 延迟(常态 500ms 以内)及本地流式听写【#120】
- 竞品功能提及:Wispr Flow 提供九十天免费试用,支持自定义关键词,声称可 index Cursor 文件与变量名实现自动听写【#122】
最新动态
- 新增 Ollama 本地模型 支持【#81】
- 引入 实时 streaming 转写能力(需配置 API Key)【#96】
- 增强 Selection AI Action,实现选中文本即时 AI 处理【#96】
- 修复 UI 下载按钮颜色问题【#56】【#58】
- 计划加入 DeepSeek API(社区建议)【#101】
- 收到用户反馈:与 Handy 对比,HoAh 的 transcribing + apply AI action 两步速度较慢【#111】
- 作者回应:apply AI action 速度完全取决于 API provider;transcribing 已升级默认模型为千问(Qwen),系统资源正常时稳定 < 500ms【#113】
- 新增 Local Streaming 转写功能,但较吃硬件【#115】
- 用户 @smallhead 称赞产品比闪电说更方便【#112】
- 用户 @China.No.1 表示将用 M1 Max 尝试【#116】
- 用户 @Pizza 反馈中英文混用效果好,但纯英文测试 Qwen3 和 Parakeet V3 在实时转录中有气口时断句不佳,对比 altic.dev/fluid 表现正常【#117】
- 作者 @hoah 回应断句问题:Qwen3 训练数据多为 10 秒以内短句,Parakeet 训练数据约为 30 秒,导致断句表现差异【#118】
- 用户 @Pizza 补充:自己在 FluidVoice 中也使用 Parakeet V3,理论上模型版本应一致,截图对比显示效果不同【#119】
- 作者 @hoah 回应竞品与断句:认为其他同类产品效果千差万别,具体取决于模型版本及管线;HoAh 性能已优化至 SOTA,若今年收费版不赚钱则直接开源【#120】
- 用户 @Pizza 回复作者:吼蛙吼蛙【#121】
- 用户 @交大梁朝伟 分享 Wispr Flow 体验:发现其自定义关键词词典功能好用,可放入特定常用词汇;声称可 index Cursor 文件与变量名实现自动听写【#122】
- 作者 @hoah 回应 Regex 与 Context:新增 Regex 替换功能,从 Context 进入效果一般,因需大量侵入用户 accessibility 且研究不深入,暂不深入开发【#123】
- 用户 @佩洛西 提问:公司使用 Super Whisper,询问与 HoAh 哪个更好用【#124】
- 作者 @hoah 回应替换逻辑:确认替换发生在 STT 识别出文本之后,针对别字问题主要依赖 Regex 处理【#125】
- 用户质疑(#136):@DeusX 询问 HoAh 相比 Super Whisper 的独特之处;作者未直接回复此条。
- 手机端推荐讨论(#138-#139):针对用户寻找手机端听写转文字软件的提问,有用户推荐了 Typeless,并表示其每周 8000 词的免费额度基本够用。
- 云端转写与空间节省设置:针对有用户因希望节省空间(不想下载占用 708 MB 的 Qwen 3 本地模型)而询问是否可直接使用云端模型转写的问题【#140】,已有解答指出可在安装后进入设置删除该本地模型,并选择 "online model" 即可实现直接云端转写【#142】。
- 中英夹杂识别效果反馈:有用户在使用 Grok 配合 OpenAI GPT OSS 120B 时,反馈中英夹杂的识别率相比 Typeless 免费版要差很多【#141】;对此,其他用户推荐了在此场景下体验非常好的豆包输入法【#143】。
- 产品命名致敬:有用户注意到产品名称“吼蛙”是致敬长者的梗,表示支持【#144】。