给在办公室写代码的人

想用语音写 prompt,
又不想让同事 听见

把 iPhone 拿到嘴边,按住说话。你只需要很小声地讲,iPhone 负责近距离收音,Mac 在本机完成识别,然后把文字写进 Codex、Claude Code、Xcode、Terminal 或当前输入框。

在开放办公室里,一位 coder 把 iPhone 拿到嘴边小声说话,文字出现在电脑屏幕上

01 / 它解决什么

MacBook 离嘴太远。
iPhone 可以离你只有几厘米。

用 MacBook 麦克风轻声说时,你的声音会和键盘声、空调声、同事说话一起进入麦克风。把 iPhone 拿到嘴边,距离从几十厘米缩短到几厘米,识别器先拿到更强的直达声。你不必为了让电脑听清而提高音量。

IPHONE → MAC / 实际工作方式

你对着 iPhone 小声说,
文字就在 Codex 或 Claude Code 里出现。

手机只负责贴近收音。音频加密传到已配对的 Mac,在本机识别,然后直接写进当前光标。

Codex / Claude Codeslowmap / prototype
正在搭建路线偏好ScenicRouteRanker.swift
做一张不推荐最快路线,只推荐最适合散步路线的地图。先根据树荫、噪声和坡度给路线打分。
iPhone 17 Pro Max 上的 undervoice 真实浅色说话界面
AT YOUR DESK01
在工位上对着 iPhone 小声说话,语音传到 Mac

工位上可以直接讲 prompt

不用对着整间办公室说话。把手机拿到嘴边,小声讲清需求、报错和修改方向就行。

NEAR-FIELD AUDIO02
嘴部靠近 iPhone 麦克风进行近距离收音

先把人声送到麦克风前面

近讲不是把办公室变安静,而是让你的声音在进入识别模型之前,比周围声音更突出。

CODING FLOW03

不需要换掉现在的工具

焦点留在 Codex、Claude Code、Xcode、Terminal 或浏览器输入框。识别结果直接写到当前光标。

02 / 与使用有关的数字

先看这些数字。
它们和办公室使用直接相关。

这里只列和工位体验直接相关、而且能解释清楚口径的数字:说话可以多小声、录音会不会离开设备,以及识别后还要不要切窗口。

5–10 cm

声音只需要走几厘米

手机可以拿到嘴边;MacBook 通常还在桌面上,离嘴约 50–80 cm。

14–24 dB

同等入声强度下,可以降低发声音量

按 5–10 cm 对 50–80 cm 的距离衰减换算。房间、持机方向和两台设备的麦克风差异会影响实际结果。

0 cloud audio

录音不上传语音服务

语音识别在你的 Mac 上完成。模型准备好后,本地使用不依赖公网。

0 audio files

没有录音文件需要清理

音频只在内存里处理,用完即释放,不会在 iPhone 或 Mac 上留下录音文件。

0 copy / paste

不用搬运识别结果

识别结果直接写进当前输入框。你不必打开另一个 App、复制,再切回开发工具。

1 hour

本机历史默认保留时间

转写历史默认只保留 1 小时,也可以完全关闭。记录不会同步到 undervoice 服务器。

你可以检查的边界:只有配对设备能连接;录音不上云、不落盘;焦点改变后停止写入;密码框和安全输入状态下不会写入。

03 / 模型与语言

7 种主要语言。
技术术语可以自然切换成英语。

undervoice 不用一套通用模型硬扛所有语言。中文、日语、德语、法语、西班牙语和韩语分别有对应语言包;说这些语言时,可以直接说出英文变量名、库名和技术术语。另外提供纯英语模式。

中文 + EnglishEnglish日本語 + EnglishDeutsch + EnglishFrançais + EnglishEspañol + English한국어 + English
ZH + ENLOCAL

中文语句中的英语术语

流式预览使用 Streaming Paraformer Bilingual;最终文本默认使用低延迟 Paraformer,也可以切换到更重的 FireRedASR2 CTC 准确度优先档。中文标点由本机 CT-Transformer 补全。

运行时
sherpa-onnx
优化
INT8 ONNX
选择理由
预览速度与最终准确度分开处理
EN / DE / FR / ESLOCAL

四种欧洲语言与英语

使用 NVIDIA Parakeet TDT 0.6B v3。上游模型支持 25 种欧洲语言;undervoice 当前开放英语、德语、法语和西班牙语四个经过产品配置的语言包。

运行时
sherpa-onnx
优化
INT8 ONNX
公开基准
上游平均 WER 6.34%
JA + ENLOCAL

日语语句中的英语术语

使用 Kotoba Whisper Bilingual v1.0。这个模型同时针对日语、英语和两者之间的语音转文字任务训练,不需要把英文术语交给另一套云端模型。

运行时
whisper.cpp
优化
Q5_0
公开基准
日语 CER 9.3–16.8%
KO + ENLOCAL

韩语语句中的英语术语

使用 Whisper Large v3 Turbo。它负责韩语主句与其中的英文名称、命令和缩写;Turbo 版本用于控制本机最终转写的等待时间。

运行时
whisper.cpp
优化
Q5_0
选择理由
多语种覆盖与本机速度之间的平衡
准确度数字怎么读

WER 和 CER 都是越低越好。6.34% 与 9.3–16.8% 来自上游完整模型的公开测试集,不是 undervoice 在 iPhone 近讲、量化模型和混合英语场景下测出的总准确率。不同语言、数据集和量化方式不能直接排成一张“谁更准”的榜单。

MODEL

模型文件先验完整性

每个下载文件都有固定 SHA-256;校验不一致就删除,不载入识别进程。

PAIR

设备身份绑定

Curve25519 完成密钥协商,HKDF-SHA256 为配对与连接派生密钥。

PACKET

音频包认证加密

ChaCha20-Poly1305 同时隐藏内容并检查篡改;每次连接使用新的会话密钥。

DEVICE

密钥和录音各归其位

身份材料保存在 Keychain;录音只进内存,不写成音频文件。

04 / 和 MacBook 自带麦克风相比

先看收音距离,
再谈识别模型。

两种方式都可以在 Mac 上使用同一套本机识别模型。iPhone 方案把收音位置从桌面拉到嘴边,因此你不用先提高音量,再让软件处理一个更差的输入。

办公场景iPhone 放到嘴边MacBook 自带麦克风
口部到麦克风5–10 cm50–80 cm
达到相同入声强度发声音量可低约 14–24 dB只按距离衰减换算作为桌面距离基准
小声说话时人声更靠前近讲声先进入麦克风人声与键盘、空调和旁人说话一起进入麦克风
办公室背景声占比更低近讲声先变强更容易同时收到键盘、空调和旁人说话
为了让设备听清可以继续小声说远距离时通常需要说得更响
旁人听见完整内容更难不需要对着房间说话提高音量后更容易被附近的人听见
识别位置Mac 本机Mac 本机
适合的办公情况开放办公室、共享工位独立房间或不介意别人听见时

距离换算使用自由场声压关系 20 × log10(r₂/r₁):5–10 cm 对 50–80 cm。房间反射、手机摆放和说话方向会影响最终结果。

公开资料对比 · 2026-07-30

它们都能语音输入。
但解决的不是同一个问题。

Wispr Flow 和 Willow 已经公开支持耳语输入,Superwhisper 与 VoiceInk 则提供成熟的本地识别方案。undervoice 的差异不是“别人不能小声识别”,而是直接把现有 iPhone 做成 Mac 的近讲入口,并在 Mac 本机完成识别。

01 / 识别、模型、语言与数据保护

把真正影响识别质量的项目,放在一起比较。

准确度数字沿用各厂商或上游模型的公开口径。WER、CER、zero-edit rate 与相对准确度不是同一种指标,因此表格同时写出数字代表什么,而不是只展示一个百分比。

表格可横向滚动

识别能力undervoiceApple DictationSuperwhisperWispr FlowWillowVoiceInk
公开的准确度口径不混用指标给出总百分比上游 Parakeet v3 平均 WER 6.34%;Kotoba 日语 CER 9.3–16.8%没有为所有语言与设备公布统一百分比Parakeet V2 英语 WER 6.05%引用公开 ASR 榜单90% zero-edit rate厂商基准,包含识别、纠错和格式整理“比系统听写准确 3 倍”官网未同时披露测试集与评分公式“99% accuracy”项目 README 未同时披露测试集与评分公式
底层模型是否公开公开Paraformer、FireRedASR2 CTC、Parakeet TDT、Kotoba Whisper、Whisper Turbo系统管理,不公开完整模型清单公开多种 Whisper、Parakeet 与云端模型公开为云端专有识别与上下文处理,不提供用户可选 ASR 清单公开云端与离线模式,未公开完整模型清单公开 Whisper、Parakeet 等本地模型及可选云端提供商
模型怎么选按语言固定优选中文还能在低延迟 Paraformer 与准确度优先 FireRedASR2 CTC 间切换由系统自动决定用户选择模型大小、本地/云端以及后处理模型服务端自动选择,用户主要配置语言、词典和上下文服务自动选择;可切换离线模式用户自行选择本地模型、云端提供商与模式
识别计算位置Mac 本机依语言和系统设置在设备端或 Apple 服务处理本地或云端,由用户选择始终在云端默认云端;可切换离线模式本地优先;云端由用户配置
本机模型优化INT8 ONNX/Q5_0sherpa-onnx 与 whisper.cpp,针对 Apple Silicon由 Apple 管理,不对用户开放按设备提供多个本地模型尺寸识别始终在云端,本机不运行 ASR 模型提供离线模式;具体模型优化未在官网展开本地模型可选,具体优化取决于用户配置
产品开放的语种7 种主要语言中文、英语、日语、德语、法语、西班牙语、韩语多种语言;依系统版本、语言和地区而异100+ 语言,具体覆盖依所选模型多语言;官方建议同时配置 2–3 种语言100+ 语言依用户选择的本地或云端模型而异
英语技术术语识别逐语言包明确支持使用中/日/德/法/西/韩时,可以直接说出英语术语;另有纯英语模式多语言可切换;跨语言效果依系统语言支持依所选模型的自动检测与多语言能力支持多语言和 code-switching 处理,但没有逐语言包承诺支持语言切换;官网没有逐语言说明英语术语效果依所选模型和模式而异
低声与背景噪声iPhone 近讲是产品主流程5–10 cm;识别在 Mac 本机没有专门的低声模式可选择和调节麦克风;官网未披露专用低声方案Discreet Dictation近嘴麦克风+云端识别,必须联网Whisper mode厂商称可处理耳语、背景噪声和快速说话官网未披露专用低声方案
公开的数据保护方法模型与会话分别保护模型 SHA-256;Curve25519 + HKDF-SHA256;ChaCha20-Poly1305;Keychain;录音不落盘可显示是否设备端处理;用户控制是否分享录音及删除听写历史可完全本地;云端请求经代理;官方称 SOC 2 Type II、HIPAA始终云端处理;Privacy Mode 控制训练,Cloud Sync 控制留存,可组合为 ZDR官网称端到端加密、SOC 2 Type II、HIPAA、ZDR;默认 Private Mode本地模式不离开 Mac;云端提供商由用户配置

这一张表才是识别能力对比。准确度数字不能直接排行:WER/CER 越低越好,zero-edit rate 越高越好,而“3 倍”“99%”还取决于厂商没有完全公开的测试口径。

02 / 输入链路与使用方式

再比较声音怎么进来,文字怎么出去。

表格可横向滚动

产品边界undervoiceApple DictationSuperwhisperWispr FlowWillowVoiceInk
主要解决什么开放办公室里的低声输入面向 coder系统自带的通用听写跨 App AI 听写、格式整理和文件转写跨平台云端听写、上下文格式化与低声输入跨平台 AI 听写、风格匹配、个人词典与 Whisper modemacOS 本地优先、可高度配置的听写
iPhone 如何参与 Mac 输入专用近讲入口拿到嘴边,按住说,文字进 Mac可把 Continuity iPhone 麦克风选为系统输入;Apple 要求设备固定、稳定放置iOS App 独立听写;官网未披露 iPhone 作为 Mac 按住说入口iPhone 通过 Flow 键盘独立听写;桌面端建议选择贴近嘴的内置、有线或外接麦克风同一账号覆盖 iPhone 与桌面端;各设备独立听写,官网未披露专用跨设备近讲入口以 Mac 麦克风为主;官网未披露跨设备近讲入口
口麦距离设计5–10 cm产品主流程取决于用户选择的麦克风;Continuity 官方流程偏固定放置可以选择输入设备和自动调节音量;未给出办公室近讲距离指标官方建议麦克风距嘴几英寸;MacBook 内置麦克风需要俯身靠近宣传 Whisper mode,但未给出口麦距离指标未把办公室近讲距离作为产品指标
没有公网时同一局域网可用模型准备完成后设备端处理可用时不依赖公网本地模式可用不能完成转写切换到离线模式可用本地模式可用
录音是否发给厂商不发送没有 undervoice 语音中转设备端处理时不发 Siri 服务器;其他情况取决于系统提示与隐私设置本地模式不发送;云端模式会发给所选服务会上传完成云端转写;隐私模式控制训练,云同步控制服务端留存云端模式会处理录音;官方称默认隐私模式不在服务器保存音频本地模式不发送;可选云端模式会发给用户选择的提供商
本机录音文件0只在内存中处理功能页未给出统一的本机保留期限取决于模式与历史设置;官网确认本地模式不上传失败重试会保留录音:桌面端最长 14 天,iOS 直到手动或自动删除录音可保存在设备上用于重新转写;服务器不保存提供本机历史;官网未给出统一的录音保留期限
文字怎么进入目标 App直接写入当前光标焦点变化即暂停;安全输入框不写入写入当前文本字段系统范围输入,支持任意 App自动插入;失败时可能回退到剪贴板在当前 App 直接生成格式化文字写入当前光标;部分场景使用剪贴板粘贴
针对编程工作核心场景Codex、Claude Code、Xcode、Terminal、任意文本框没有专门的 coder 工作流提供开发者用例及 Claude Code、OpenCode 集成通用上下文格式化与个人词典支持技术工具、自动学习词典和上下文格式化支持按 App/网站切换模式、个人词典和本地增强

“官网未披露”只表示在本次核对的官方资料中没有找到对应承诺,不等于技术上无法做到。竞品功能会变化,本表按 2026 年 7 月 30 日的公开资料整理。

怎么选,比较直接:
  • 不想安装新软件:先用 Apple Dictation。
  • 接受云端处理,想要跨平台和现成的耳语模式:Wispr Flow 或 Willow 更成熟。
  • 想自己选择本地模型和处理方式:Superwhisper 或 VoiceInk 更自由。
  • 想直接拿现有 iPhone 贴近嘴边,并让 Mac 本机识别:这是 undervoice 的专门工作流。

05 / 安全与网络

录音从 iPhone
直接到你选的 Mac。

undervoice 没有语音中转服务器。同一局域网内,iPhone 直接连接 Mac;跨网络时可以走你自己的 Tailscale。无论走哪条路,undervoice 都会再做一层应用级身份认证和加密。

查看安装与权限说明
PAIRED

只接受你配对的设备

Mac 不会因为处在同一个 Wi-Fi 就接受任意手机。更换 iPhone 时,需要在 Mac 上明确重置并重新配对。

E2E

离开 iPhone 前已经加密

录音、文字和控制消息都经过身份认证和端到端加密。内容被修改或来自错误设备时,Mac 会拒绝处理。

ROTATE

每次连接换会话密钥

每次重新连接都会使用新的会话密钥。旧连接中的加密数据不能直接拿到下一次连接中重放。

RAM

录音不写入磁盘

音频只在内存里处理和释放,不保存成录音文件。转写历史保存在本机,可关闭,默认保留 1 小时;诊断日志不记录录音和转写正文。

0 CLOUD

没有 undervoice 语音中转

同一局域网内,录音从 iPhone 直接到 Mac。模型准备好以后,不需要公网语音服务。

REMOTE

跨网络可以走 Tailscale

需要跨 Wi-Fi 或蜂窝网络时,可以走你自己的 Tailscale;undervoice 的设备认证和加密仍然保留。

06 / 输入到任何编辑器

光标在哪,
识别结果就写到哪。

CodexClaude CodeXcodeTerminal任意文本框

“保留现有接口,把重试改成指数退避,再补三个边界测试。”

listening

Mac 会在开始说话时记住当前应用和文本选区。识别过程中如果焦点或选区被其他操作改动,写入会暂停;密码框和开启 Secure Keyboard Entry 的控件不会被写入。

undervoice App 图标

Talk to your Mac, not the room.

Speak softly.
Code freely.

先在 Mac 安装模型,再用 iPhone 扫描配对二维码。之后把手机拿到嘴边,按住说话即可。