
7 月
PolyAI 的语音 AI 延迟砍到 280 ms,碾压 OpenAI 三倍——但这有什么可吹的?
PolyAI 的语音 AI 延迟砍到 280 ms,碾压 OpenAI 三倍——但这有什么可吹的?
语音 AI 最烦人的不是它说错了什么,是它打断你。PolyAI 的 Dialog-RSN-1 把端到端响应延迟砍到了 280 ms 以内——这比人类的自然对话节奏还快。而 OpenAI 的 GPT-realtime-2.1 是 860-1900 ms。三倍差距,值多少钱?
换个角度看语音 AI
语音 AI 这两年卷的方向基本都是「更大模型」「更真人音色」「更有感情」。但没人认真卷过一件事:它能不能不打断我?
如果你用过任何语音助手——Siri、Alexa、小爱、车载语音——你一定经历过这种时刻:你说完一句话,刚想补充,AI 已经开始回话了。它没有理解你的停顿是「我还没说完」,而不是「轮到你了」。
PolyAI 这家专注企业级语音助手的公司,今天发布了 Dialog-RSN-1,一个直接感知和响应音频的语音对话模型。他们压的不是音色有多像人,而是延迟——280-500 ms,可靠小于 300 ms。
对比一下:
- OpenAI GPT-realtime-2.1:860-1900 ms
- 人类自然对话中的响应间隙:200-400 ms
PolyAI 的模型,实际上比真人平均反应速度还快一点。
快 3 倍的技术秘密
Dialog-RSN-1 的快不是靠更快的 GPU。而是靠架构设计。
1. 端到端音频理解,不转文字
传统语音 AI 的流水线是这样的:
语音 → ASR(转文字)→ LLM(理解+生成)→ TTS(转语音)→ 输出每一步都有几百毫秒的延迟,加上网络传输,用户体验就是「卡」。
Dialog-RSN-1 直接把音频塞进模型,不需要中间的 ASR 环节。模型理解音频语义 + 情感 + 停顿节奏,直接生成响应。
2. TTS 外置,可独立调优
有意思的是,PolyAI 故意没有把 TTS(语音合成)塞进同一个模型。他们把 LLM 的输出单独交给 TTS 模块。
这不是缺点,是聪明的工程决策。原因在于:
- 语音模型训练一次几十万美元,但 TTS 调个音色最多几千
- 客户想要自己的品牌音色(比如银行用沉稳的男声、电商用活泼的女声),不需要重训整个模型
- TTS 的改进(比如更自然的呼吸感)可以独立迭代,不动对话模型
3. 实时停顿感知
Dialog-RSN 分析和感知用户的说话节奏(cadence)和停顿时机(timing)。这听起来像细节,但它是防止「打断用户」的核心能力。
模型知道用户是「暂停思考」还是「说完了」,就像人在对话中能凭直觉判断对方是否还要接着说。这在 280 ms 延迟下能做到,是因为整个推理链路不需要走文字转换的弯路。
技术细节与工程现实
PolyAI 没有从零训练一个大模型,而是用开放权重的多模态模型做后训练(post-training):
训练方式:n - 监督微调(SFT)n - 强化学习调优(RL tuning)n n数据:n - 内部训练数据(PolyAI 有多年企业客服部署经验的数据积累)nn模型评估:n - Gemma, GPT-OSS, Qwen, Mistral 都测试过n - 目标:8B 密集模型 或 30B 稀疏模型nn硬件:n - NVIDIA A100 GPUn - 目标:300ms 以下延迟这个方案的关键洞察在于:对话能力是可以后训练出来的,不需要从预训练开始烧钱。 这对有专业领域数据的公司来说是好消息。
为什么这值得关注
如果语音 AI 的延迟不能降到「人类对话」的级别,它就永远是一个「你在对着机器说话」的体验。你会在心里留出一个「AI 缓冲期」——说完话,默默等一秒看看它能不能理解。
而 280 ms,足够快到你感觉不到等待。你按自然节奏说话,它按自然节奏回应。这才是真正的对话。
对业务场景来说更有想象空间:
- 客服:客户不会被 AI 打断激怒
- 电话销售:节奏感决定转化率
- 医疗问诊:病患的停顿可能是症状描述中的关键信息
- 实时翻译:不需要等一句话结束才能开始翻
局限性与商业现实
PolyAI 是面向企业客户(B 2 B),而非消费者。Dialog-RSN-1 目前的定价和可用性未完全公开。对于个人开发者和创业团队来说,280 ms 的语音对话能力可能还要等开源社区的跟进。
另外,延迟只是语音体验的一个维度。能否处理复杂对话、能否应对意外情境、能否处理多语言混合输入——这些才是真实场景中的长尾问题。PolyAI 在企业客服这个垂直场景积累深厚,但在泛化能力上的表现还没有独立的第三方评测。
FAQ
和 OpenAI 的实时语音 API 能直接比吗?
场景不同。OpenAI 做的是通用实时对话模型,覆盖闲聊、创作、教育等广泛场景。PolyAI 深耕企业客服,而 Qwen-Image-3.0 和 Cloudflare OS 分别从图像生成和 Agent 运行时层面扩展着 AI 应用的边界。PolyAI 深耕企业客服(比如接电话、预定餐厅),场景更窄但优化更深。在各自的目标场景中比较才有意义。
280 ms 这个数字可靠吗?
这是 PolyAI 自己公布的 A 100 上的数据。目前还没有独立的第三方延迟评测。实际部署中网络延迟会增加这个数字(通常在 50-150 ms 之间),但总体体验仍应在可接受范围。
什么时候能用到?
PolyAI 是企业服务,不直接面向消费者。但如果你是企业的技术采购方,Dialog-RSN-1 已可用。如果你只是普通用户想体验——可能需要等依赖这项技术的产品上线。











评论 (2)
[…] 咒语」到「自然语言创作」。这种工具能力的跃迁,正如 PolyAI 将语音延迟压到 280 ms 一样——把 AI […]
[…] Qwen-Image-3.0 突破图像生成 和 PolyAI 突破语音延迟,AI […]
评论被关闭。