三个姿势
姿势不由场地定义,由「屏幕给谁看、出不出声」定义。
一场真实对话往往跨两三个姿势。切换不结束这一场 —— 记录连续、术语不丢、对方还是同一个人。
两条车道
「说不出」有两种,产品得分得清。
听:任何语言 → 中文
连续切段是统一的引擎:切段、判语种、两版并行、先出灰草稿,云端定稿到了原地替换一次,关键信息标出来。「按住说」只是手动切段。
说:每门语言一个开关
这门语言我会说 → 帮你说得地道:我要说、改口吻、会后把你说过的话变成更地道的版本。
我不会说 → 替你说:中文进,对方语言出声 + 大字,数字先确认再念。
第一次问一次,之后记住。
三个面
一个产品,三台设备各管一件只有它能做的事。
Mac —— 我,在电脑前
抓会议软件的系统音频(只有原生做得到),浮层盖在全屏的 Zoom / Teams / 腾讯会议上,键盘是主通道。
iPhone —— 我,在房间里
离线全链路:识别、翻译、出声都能在这部手机上完成,飞行模式下整场对话跑得通。口袋里唯一保证在场的屏幕。
网页 —— 给对方,和一群人
不装 App、扫码即开。对方看到的是一句大字,或者一群人各看自己语言的同一块板。中间的中继只转发不落盘,主持人一走房间就销毁。
实测数字 · 只写量过的
每个数字都带日期和出处,没量过的写「待测」。
延迟常驻在产品界面上,因为它们不该藏。官网上的表和界面上的是同一份读数。三条链路的横向对比在 实时翻译字幕延迟实测;回放用的公开数据集是 AMI Meeting Corpus 和 FLEURS。
听 · Mac · 第一场真实会议 · 2026-09-03 · 31 分钟 · 豆包链路
完整六项表 →- 中文首字 p50
- 2.81s
- 预算 ≤ 3 s,达标
- 句尾 → 中文定稿 p50
- 0.81s
- 预算 ≤ 2 s,达标
- 具体句上屏 p50
- 4.2s
- 预算 ≤ 2.5 s,没达标,所以模板句 0 秒先上
谈 · iPhone · 全端侧链路 · 2026-09-05 · FLEURS 各 100 句
七项验收 →- 说完到出声 p50
- 220ms
- 主链路线 ≤ 1 s,达标
- 乌克兰语识别 WER
- 8.47%
- 主链路线 ≤ 8%,差 0.47
- 中文识别 CER
- 5.64%
- 主链路线 ≤ 5%,差 0.64
结论:全端侧链路当兜底,不当默认。数字、日期、金额、人名走打字通道,因为念出来再听回去 20 句错了 5 句。
讲 · 网页 · 白板链路本机跑通 · 2026-09-07 · GLM
实测与假设 →一段话变成板上一个操作中位 3 333 ms(十段,1 703–5 434 ms),操作类型与目标图判对 9 / 10;我这边发出到别人屏幕上画完中位 10 ms;三种语言的骨架抽掉文字后逐字节相同。真实讲解的场次还很少 —— 那一页上写着这一条。
这是一个 App 吗?
是一个产品,装在三台设备上。Mac 上是一个 App(抓会议软件的系统音频、浮层盖在 Zoom 上),iPhone 上是一个 App(离线全链路,飞行模式下整场对话跑得通),网页那一面是给对方用的 —— 她扫个码就打开,不装、不注册。三个面共用同一份记录、术语表和对方档案。
名字里有 Translator,为什么说「语音能传意思,不能传事实」?
因为这是量出来的。2026-09-05 跑了 20 句零容忍的话(日期、金额、人名),语音回环之后 5 句的信息真的错了。所以数字、日期、金额、人名不走喇叭 —— 它们先在屏幕上以两边都认得的写法显示,你点头才念出去。翻译这一层免费工具已经做得很好,这个产品的力气花在它们不做的那一半。
三个姿势有什么区别?
由「屏幕给谁看、出不出声」定义,不由场地定义。听:整屏给我,不出声,他们说我看中文。谈:屏幕分给两边,出声,一来一回替我说。讲:板在对方的屏上,我这边是主持面。一场真实对话往往跨两三个姿势 —— 切换不结束这一场,记录连续、术语不丢。
我的对话去了哪里?
三档,你随时看得见自己在哪一档:完全本地(只有你这台设备)· 经我们中转(音频文本经我们的服务器到模型厂商,我们不落盘、不留日志,只记用了几分钟)· 自带 key(你和厂商,我们看不到)。记录、术语、对方档案都在你的设备上。完整的一页。
怎么收费?
每台设备一次性 5 分钟试用,任何链路都能用、包括最贵的那条。之后按你用的那条链计价:纯本地 $0.01 / 小时,云端按我们的成本收三倍。不订阅,充值不过期、用完再充、余额跨设备。完整价目。