coding_agent

办公室语音转文字方案

需求背景

办公室环境下需要将语音转换为文字输入,需要满足:

  • 隐私性:语音内容不上传到云端(办公室对话涉及敏感信息)
  • 低延迟:实时转写,延迟感知不明显
  • 高准确率:尤其是中文技术术语
  • 安静环境:主要在办公室使用,不需要很强的降噪

typeless vs 豆包输入法

对比项 typeless 豆包输入法
隐私处理 语音上传云端处理 语音上传云端处理
网络依赖 必需 必需
延迟 云端 ASR 通常 1-3 秒 云端 ASR 通常 1-3 秒
技术术语支持 一般 一般

共同问题

  • 隐私风险:两者都是云端处理,办公室的 technical discussion、code review 内容都会上传
  • 断网不可用:没有网络时完全无法使用
  • 延迟较高:云端 ASR 的网络往返带来了无法忽略的延迟

替代方案:macOS 原生听写

macOS 内置的听写功能已经支持离线识别:

# 1. 开启听写:System Settings → Keyboard → Dictation → 开启
# 2. 选择语言和离线模式(如果有)
# 3. 设置快捷键(默认连续按两下 Fn)
# 4. 使用:按两下 Fn → 说话 → 自动转为文字

macOS Ventura+ 的离线听写使用 Apple Neural Engine,隐私性没问题,但对技术术语支持较弱。

总结

如果对隐私性有要求(办公室 technical discussion),typeless 和豆包输入法都不适合。 两者都是云端处理,语音数据会上传到第三方服务器。

折中方案:macOS 原生离线听写,零配置,完全离线,隐私无忧。