导读部分 返回列表
2026年9月15日,谷歌正式发布了两款全新的实时语音对话模型——Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。📖 这并非一次寻常的版本迭代,...
正文内容
2026年9月15日,谷歌正式发布了两款全新的实时语音对话模型——Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。📖 这并非一次寻常的版本迭代,而是一次关于“AI 如何用声音与人协作”的表达方式重构。换言之,谷歌想要回答的核心问题只有一个:如何让机器在开口说话的同时,依然保持思考。
📝 首先,我们不妨理清这两款模型的分工。Gemini 3.8 Live 面向规模化与成本效率,主打流畅对话、视觉理解与实时响应;Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,强调多步推理与更高的智能上限。换句话说,前者适合客服应答、陪练对话、实时翻译等高频场景,后者适合需要边思考边执行的专业工作。谷歌将这两款模型定位为“构建可靠、可上生产的语音智能体”的基础组件,而非单纯的演示品。
🔍 其次,从谷歌披露的硬指标来看,这组数据值得留意。据官方说明,Extended Thinking 在 Artificial Analysis 的“语音到语音质量指数”上取得 82.6 分,位列榜首;在智能体任务完成度上,它在 τ-Voice 基准拿到 68.6%,在 Sierra 的 τ-Voice-banking 基准拿到 35.1%,并在 Big Bench Audio 上取得 97.7% 的成绩。至于 Gemini 3.8 Live,则在 Speech Agent Arena 中排名第二,官方强调其成本效益突出,适合大规模铺开。在 ServiceNow 的 EVA-Bench 上,谷歌称这组模型成功平衡了准确率与对话质量,把复杂工作流的帕累托前沿向前推进了一步。

⭐ 然后,我们再来看看最值得关注的交互设计。Gemini 3.8 Live 能够近实时地处理视觉输入,并在对话中途自动检测与切换 97 种受支持语言;它还能在对话继续推进的同时,于后台执行工具调用与 API 请求——先给出回应,再完成实际任务。对于需要深度推理的任务,Extended Thinking 则实现了“边推理边说话”,用早期的口头提示自然确认用户诉求,并用实时进度播报引导用户走完多步流程,而不打断交流节奏。官方演示中,它能把粗略草图与近乎实时的语音反馈,直接转化为可运行的 React 组件,也能在不中断对话的前提下,用异步函数调用协调多步餐厅预订。
📌 值得注意的是,这类“边聊边做”的能力,其实与站点此前讨论过的两个方向遥相呼应。一是DeepSeek 新模型把智能体缓存成本压到新低,让长链条任务的经济性变得可行;二是Anthropic 公开模型越狱事件复盘、重建三层安全防线,提示我们:语音智能体越是深入业务,安全与可控就越不能缺席。
再者,从落地路径看,谷歌的铺开节奏相当清晰。开发者可通过 Gemini API 与 Google AI Studio 使用;企业侧在 Gemini Enterprise 中处于私有预览;普通用户则能在 Search Live、Gemini Live,以及 Workspace 的 Docs、Gmail、Keep 中逐步体验。官方还提到,Agoda、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台已基于 Gemini Live API 构建语音驱动界面;同时,所有由谷歌 AI 产品生成的音频都嵌入了 SynthID 不可感知水印,以便内容可被检测,帮助抑制误导信息。
综上所述,Gemini 3.8 系列真正想表达的,不只是“语音更自然”,而是“语音成为智能体执行任务的入口”。当模型能够一边倾听、一边推理、一边调用工具,语音交互便从演示走向生产。对我们而言,理解这一层逻辑,比记住几个分数更重要——因为技术的意义,最终要落在它如何改变人与工具协作的方式上。
本文出自 AI一族,原文链接:https://www.aiyizu.cn/?p=5278
转发请注明出处,禁止未经允许用于任何商业用途。