Archive Vol · VOL-6456
AGI的临门一脚:语音是进入持续在场的最佳且最实际可行通道
最近这段时间,语音大模型赛道的迭代密集得反常。 8月3日,Greg Brockman 发布 GPT-Live,一套为实时音频重建的新架构,主打“说话的同时聆听”。OpenAI 从客户端到模型重写了整个语音栈,让模型在后台做深度推理、调用工具
最近这段时间,语音大模型赛道的迭代密集得反常。
8月3日,Greg Brockman 发布 GPT-Live,一套为实时音频重建的新架构,主打“说话的同时聆听”。OpenAI 从客户端到模型重写了整个语音栈,让模型在后台做深度推理、调用工具时,音频流不中断,对话不死。
今天,腾讯混元发布 Hy ASR 3.0,把语音识别直接长在大模型上,粤语 WER 压到 3.12%,然后放进元宝 App 免费开放。
同一天,arXiv 上出现 SwanTale,把 LLM 圈的 GRPO 后训练搬进了音频生成。
在此之前,OpenAI发布语音模型GPT-Live时,同步升级ChatGPT语音模式(ChatGPT Voice),新模型采用原生实时架构,可实现人类与AI之间更加自然的双向语音交流,不仅支持打断、停顿理解、实时翻译、听写等能力,还能够在后台调用Chat大模型完成复杂推理和联网搜索,将语音打造为ChatGPT新的统一交互入口。
语音大模型开始高频次迭代,语音栈正在完成垂直整合,而这场整合的终点,不是更好的语音助手,是 AGI 的在场方式。
先抛一个我个人的判断,语音是或许能让 AGI 进入“环境化、持续在场”状态的最佳通道。
这里先不能说唯一,不能这么绝对,但“最佳”通道和方式这种论断是成立的。
为什么这么说?
我们逐个模态排查。视觉需要镜头对准,是一个你需要主动操作的动作。
文本更复杂了,需要人在某个设备上打开对话框、组织语言,也是一个你主动进入操作的动作。
这两种模态的本质都是单向的,AGI 在那里等你,你不来,它就不存在。
这也是我最近一直研究超级智能助手遇到的一个最大的问题,如何让它变得主动起来这事一时半会解决不了。
除了视频、文本,就只剩下语音了。
语音支持随时插嘴、持续聆听、低摩擦介入。老人陪护、儿童陪伴、驾驶、家务,这些场景的共同点是手眼被占用。通俗易懂的说,文本和视觉把 AGI 关在一个需要敲门才能进入的房间里,而语音让它持续待在空气中。
一个只能活在对话框里的智能,无论多强,本质上都是工具——你取用,它工作,你离开,它熄灭。
而一个能活在环境音里的智能,开始接近“存在”,成为某种主体一样的存在。
从这个视角回看这周的新闻,就能理解这些大厂背后的意图了。
所以,语音是 AGI 最重要的场景这个命题必然是成立的。
流行论证是语音是人类最自然的交互方式。
但我认为真正硬核的理由是结构性的,视频、文本、语音这三种模态里,只有语音的物理属性支持 always-on。
always-on(常开 / 始终在线)指的是一种设备或服务始终保持连接和待命状态、无需用户手动启动或唤醒就能持续感知和响应的设计模式。核心是“随时可被触达,主动而非被动”。
但还有一个现实情况是,持续聆听意味着隐私和信任成本是所有模态里最高的。
一个永远在线、随时能插嘴的智能,既是陪伴,也是监控。最重要的场景,同时是最难被接受的场景。 这场博弈的结果,不取决于模型多聪明,而取决于我们愿意让渡多少隐私给它。
而这些都是值得继续思考的问题。