9 月 15 日,Google DeepMind 发布 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking 两款实时对话模型,直接把枪口对准了一周前 OpenAI 的 GPT-Live-1 全双工语音。

不是"更会聊",是"更能干活"

Gemini 3.8 Live 主打实时语音_agent_:遇到复杂任务,Extended Thinking 版本会先回一句、再边推理边汇报进度,需要查资料或调接口时,工具调用可以在后台运行,不打断对话。它还支持 97 种语言自动切换和近实时视觉输入——你开着摄像头,它就能"看"着东西跟你聊。

价格成为第二战场

据行业媒体梳理,Gemini 3.8 Live 的定价明显低于 OpenAI 的 GPT-Live-1。随后 Artificial Analysis 的语音质量榜显示,Extended Thinking 版本以 82.6 分登顶,τ-Voice 单项也小幅领先 GPT-Live-1 Astra。不过评测也指出,在银行这类高风险场景里,整体任务成功率只有约 35%,说明"听得清、答得顺"和"办得对"之间还有距离。

语音 Agent 进入性价比阶段

从 GPT-Live-1 到 Gemini 3.8 Live,大厂在实时语音上的比拼已经从"能不能同时听和说"转向"便宜不便宜、能不能真办事"。对做客服、陪伴、车载语音的团队来说,这条赛道正在快速变得用得起——只是落地到严肃场景前,仍得把准确率和责任边界算清楚。