Archive Vol · VOL-6456

AGI的临门一脚:语音是进入持续在场的最佳且最实际可行通道

2026年8月4日 3 min read 108 次阅读

最近这段时间,语音大模型赛道的迭代密集得反常。 8月3日,Greg Brockman 发布 GPT-Live,一套为实时音频重建的新架构,主打“说话的同时聆听”。OpenAI 从客户端到模型重写了整个语音栈,让模型在后台做深度推理、调用工具

阅读 108
转发到

最近这段时间,语音大模型赛道的迭代密集得反常。

8月3日,Greg Brockman 发布 GPT-Live,一套为实时音频重建的新架构,主打“说话的同时聆听”。OpenAI 从客户端到模型重写了整个语音栈,让模型在后台做深度推理、调用工具时,音频流不中断,对话不死。

今天,腾讯混元发布 Hy ASR 3.0,把语音识别直接长在大模型上,粤语 WER 压到 3.12%,然后放进元宝 App 免费开放。

同一天,arXiv 上出现 SwanTale,把 LLM 圈的 GRPO 后训练搬进了音频生成。

在此之前,OpenAI发布语音模型GPT-Live时,同步升级ChatGPT语音模式(ChatGPT Voice),新模型采用原生实时架构,可实现人类与AI之间更加自然的双向语音交流,不仅支持打断、停顿理解、实时翻译、听写等能力,还能够在后台调用Chat大模型完成复杂推理和联网搜索,将语音打造为ChatGPT新的统一交互入口。

语音大模型开始高频次迭代,语音栈正在完成垂直整合,而这场整合的终点,不是更好的语音助手,是 AGI 的在场方式。

先抛一个我个人的判断,语音是或许能让 AGI 进入“环境化、持续在场”状态的最佳通道。

这里先不能说唯一,不能这么绝对,但“最佳”通道和方式这种论断是成立的。

为什么这么说?

我们逐个模态排查。视觉需要镜头对准,是一个你需要主动操作的动作。

文本更复杂了,需要人在某个设备上打开对话框、组织语言,也是一个你主动进入操作的动作。

这两种模态的本质都是单向的,AGI 在那里等你,你不来,它就不存在。

这也是我最近一直研究超级智能助手遇到的一个最大的问题,如何让它变得主动起来这事一时半会解决不了。

除了视频、文本,就只剩下语音了。

语音支持随时插嘴、持续聆听、低摩擦介入。老人陪护、儿童陪伴、驾驶、家务,这些场景的共同点是手眼被占用。通俗易懂的说,文本和视觉把 AGI 关在一个需要敲门才能进入的房间里,而语音让它持续待在空气中。

一个只能活在对话框里的智能,无论多强,本质上都是工具——你取用,它工作,你离开,它熄灭。

而一个能活在环境音里的智能,开始接近“存在”,成为某种主体一样的存在。

从这个视角回看这周的新闻,就能理解这些大厂背后的意图了。

所以,语音是 AGI 最重要的场景这个命题必然是成立的。

流行论证是语音是人类最自然的交互方式。

但我认为真正硬核的理由是结构性的,视频、文本、语音这三种模态里,只有语音的物理属性支持 always-on。

always-on(常开 / 始终在线)指的是一种设备或服务始终保持连接和待命状态、无需用户手动启动或唤醒就能持续感知和响应的设计模式。核心是“随时可被触达,主动而非被动”。

但还有一个现实情况是,持续聆听意味着隐私和信任成本是所有模态里最高的。

一个永远在线、随时能插嘴的智能,既是陪伴,也是监控。最重要的场景,同时是最难被接受的场景。 这场博弈的结果,不取决于模型多聪明,而取决于我们愿意让渡多少隐私给它。

而这些都是值得继续思考的问题。

DISCUSSION

文章评论

0 条

批注针对原文,评论讨论整篇文章。所有评论都会直接发布。

    还没有评论,欢迎留下第一个想法。