泥潭日报 uscardforum · 内容汇总

【吼蛙】Vibe了一个 Mac 听写转文字LLM后处理的App (新增选中文本一键处理)

内容摘要

Mac本地听写与AI后处理工具HoAh的功能迭代、竞品对比及用户反馈。

关键信息

  • 项目名称:HoAh(吼蛙)
  • 官网/下载链接:https://hoah.app/(Mac App Store 已签名 notarized)【#1】【#11
  • 核心功能
  • 本地 Whisper 语音转文字(离线,无网络请求)【#1】【#57
  • 可选 AI 后处理(润色、翻译、改写等),支持自定义 Prompt【#1】【#7
  • 多语言混合识别,支持 Hindi、Telugu、Klingon 等【#1
  • 选中文本“一键处理”功能(复制‑>AI‑>粘贴)【#96
  • 支持多家云 streaming API(OpenAI Realtime、ElevenLabs Realtime、Amazon Transcribe Streaming)【#96
  • 支持 Ollama 本地模型、Groq、Cerebras、Bedrock、Gemini 等后端【#1】【#81】【#86
  • 新增 Local Streaming 转写(较吃硬件)【#115
  • 默认转写模型已升级为千问(Qwen)【#113
  • 作者回应断句问题:Qwen3 训练数据多为 10 秒以内短句,Parakeet 训练数据约为 30 秒,导致断句表现差异【#118
  • 作者回应竞品对比:认为其他同类产品效果千差万别,只有 Handy 做得较好,HoAh 目前性能优于 Handy 才考虑收费【#120
  • 作者回应断句差异原因:具体取决于用户使用的模型版本及管线,HoAh 未关注竞品具体管线【#120
  • 新增 Regex 替换 功能(从 Context 进入效果一般,主要依赖 Regex)【#123
  • 作者回应 Cursor 索引:不确定是否通过 LLM 实现,因需大量侵入用户 accessibility且研究不深入,暂不优先开发【#123
  • 作者回应 Super Whisper:用户询问公司用 Super Whisper 与 HoAh 对比,作者未直接回答,仅表示当前内容通过听写加 AI Action 效果不错【#124
  • 作者回应替换逻辑(#125):替换是在文本识别出来之后进行的(STT 后替换),非语言识别时直接替换;针对 STT 后别字问题,作者表示目前主要依赖 Regex 处理,若用户有特定别字需求可反馈【#125
  • 回应与豆包对比(#126:针对用户询问 HoAh 相比豆包语音输入法的增量优势,作者强调 HoAh 在增量处理(Incremental)隐私保护(本地运行/无云端上传)及自定义管线方面的差异化价值。
  • 回应豆包实时上屏特性(#127:针对用户询问 HoAh 能否实现类似豆包输入法实时上屏,作者暗示当前架构主要依赖 AI Action 或系统听写接口,尚未支持直接模拟 IME 实时上屏。
  • 回应会议转录需求(#128:针对用户询问会议转录,作者未直接回复,结合功能描述,HoAh 主要依赖系统听写/麦克风,未明确支持直接捕获应用内音频流。
  • 回应 DIY 功能分发问题(#133:作者确认目前包含大量个人定制的 DIY 功能,因逻辑杂乱不适合标准化分发,暂时不整合进公开版本。
  • 使用场景示例:浴缸 coding、客服回复润色、同事小语种悄悄话翻译、节日母语祝福等【#1
  • 资源占用:本地 Whisper 大模型(large‑v3)体积大,CPU 运行慢,推荐使用 GPU/Apple Silicon 加速;不启用 AI 时仅是本地软件【#3】【#30
  • 开源情况:项目原本开源,但因误提交凭证未清理历史,现为闭源发布【#48
  • 兼容性:不支持 macOS Ventura 以上的部分用户【#77
  • 其他功能尝试:曾计划上传音频文件、读取当前 App 信息、Ollama 本地模型等,但因体积或权限问题被舍弃【#62】【#70
  • 版本更新历史:因有人联系 rebrand 做付费版,HoAh 仅更新到 3.8.3【#120
  • 性能优化数据(作者声称):
  • 常用听写长度下,Qwen、GLM、Parakeet 延迟从 300-500ms 稳定压至 100ms-200ms,极端可达 50ms【#120
  • Whisper 延迟从 1 秒压至 500ms【#120
  • 优化了冷启动、内存管理、AI Action 延迟(常态 500ms 以内)及本地流式听写【#120
  • 竞品功能提及:Wispr Flow 提供九十天免费试用,支持自定义关键词,声称可 index Cursor 文件与变量名实现自动听写【#122

最新动态

  • 新增 Ollama 本地模型 支持【#81
  • 引入 实时 streaming 转写能力(需配置 API Key)【#96
  • 增强 Selection AI Action,实现选中文本即时 AI 处理【#96
  • 修复 UI 下载按钮颜色问题【#56】【#58
  • 计划加入 DeepSeek API(社区建议)【#101
  • 收到用户反馈:与 Handy 对比,HoAh 的 transcribing + apply AI action 两步速度较慢【#111
  • 作者回应:apply AI action 速度完全取决于 API provider;transcribing 已升级默认模型为千问(Qwen),系统资源正常时稳定 < 500ms【#113
  • 新增 Local Streaming 转写功能,但较吃硬件【#115
  • 用户 @smallhead 称赞产品比闪电说更方便【#112
  • 用户 @China.No.1 表示将用 M1 Max 尝试【#116
  • 用户 @Pizza 反馈中英文混用效果好,但纯英文测试 Qwen3 和 Parakeet V3 在实时转录中有气口时断句不佳,对比 altic.dev/fluid 表现正常【#117
  • 作者 @hoah 回应断句问题:Qwen3 训练数据多为 10 秒以内短句,Parakeet 训练数据约为 30 秒,导致断句表现差异【#118
  • 用户 @Pizza 补充:自己在 FluidVoice 中也使用 Parakeet V3,理论上模型版本应一致,截图对比显示效果不同【#119
  • 作者 @hoah 回应竞品与断句:认为其他同类产品效果千差万别,具体取决于模型版本及管线;HoAh 性能已优化至 SOTA,若今年收费版不赚钱则直接开源【#120
  • 用户 @Pizza 回复作者:吼蛙吼蛙【#121
  • 用户 @交大梁朝伟 分享 Wispr Flow 体验:发现其自定义关键词词典功能好用,可放入特定常用词汇;声称可 index Cursor 文件与变量名实现自动听写【#122
  • 作者 @hoah 回应 Regex 与 Context:新增 Regex 替换功能,从 Context 进入效果一般,因需大量侵入用户 accessibility 且研究不深入,暂不深入开发【#123
  • 用户 @佩洛西 提问:公司使用 Super Whisper,询问与 HoAh 哪个更好用【#124
  • 作者 @hoah 回应替换逻辑:确认替换发生在 STT 识别出文本之后,针对别字问题主要依赖 Regex 处理【#125
  • 用户质疑(#136:@DeusX 询问 HoAh 相比 Super Whisper 的独特之处;作者未直接回复此条。
  • 手机端推荐讨论(#138-#139:针对用户寻找手机端听写转文字软件的提问,有用户推荐了 Typeless,并表示其每周 8000 词的免费额度基本够用。
  • 云端转写与空间节省设置:针对有用户因希望节省空间(不想下载占用 708 MB 的 Qwen 3 本地模型)而询问是否可直接使用云端模型转写的问题【#140】,已有解答指出可在安装后进入设置删除该本地模型,并选择 "online model" 即可实现直接云端转写【#142】。
  • 中英夹杂识别效果反馈:有用户在使用 Grok 配合 OpenAI GPT OSS 120B 时,反馈中英夹杂的识别率相比 Typeless 免费版要差很多【#141】;对此,其他用户推荐了在此场景下体验非常好的豆包输入法【#143】。
  • 产品命名致敬:有用户注意到产品名称“吼蛙”是致敬长者的梗,表示支持【#144】。
HoAhWhisper听写转文字Mac AppTypeless