做语音 Agent 的人都被同一幕折磨过:用户说完需求,agent 回一句「您稍等,我帮您查一下」,然后是两三秒的死寂。用户以为断线了,开始「喂?喂?」。北京时间 9 月 16 日凌晨,Google 发布的 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 就是冲着这两三秒死寂来的:工具调用挪到后台,模型一边说话一边干活,还把进度实时讲给你听。
动手写这篇之前,我把 Google 官方公告、Live API 能力文档和多份第三方报道逐条对照过,文中每个数字都标了出处;AI Studio 的试玩步骤和 API 代码也一并整理好了,你可以照这条路径直接上手。
两款模型怎么分工
先给结论:这两款不是「标准版和专业版」的关系,是「聊天」和「干活」的分工。
| 模型 | 模型 ID | 定位 | 关键能力 |
|---|---|---|---|
| Gemini 3.8 Live | gemini-3.8-live | 高频简单对话 | 97 种语言自动识别、近实时视觉理解、异步工具调用、约 0.84 美元/小时 |
| Gemini 3.8 Live Extended Thinking | gemini-3.8-live-extended-thinking | 多步任务 | 在 base 全部能力上叠加「边说边推理」:语音进行中后台做多步推理、调工具、播报进度 |
价格和跑分放在一起看更直观,数据来自 OfficeChai 的对比报道:
| 模型 | AA 语音质量指数 | 小时成本(AA 口径) |
|---|---|---|
| Gemini 3.8 Live Extended Thinking | 82.6(第一) | $3.50 |
| GPT-Live-1 Astra | 81.5 | $5.83 |
| Grok Voice Think Fast 2.0 | 81.3 | $4.80 |
| Gemini 3.8 Live | Speech Agent Arena 第二 | $0.84 |
ET 比 GPT-Live-1 便宜 40%,分数还更高;base 模型的价格只有 GPT-Live-1 的七分之一左右。智能体基准上 ET 也占优:τ-Voice 任务完成率 68.6% 对 67.9%,τ³-Banking(退款、客服工单这类多步任务)35.1% 对 32.0%,Big Bench Audio 97.7%。
如果你做的机器人九成对话是「营业时间是几点」这种一轮问答,base 够用;如果流程要查库、算账、回写系统——比如「帮我处理这单退款」——ET 的价值才兑现。
「边说边干」在技术上是什么
这轮发布真正值得拆的不是跑分,是一个架构选择:按 Live API 能力文档的说法,Extended Thinking 只支持异步(async)模式——这不是营销话术,是接口设计。
先看传统语音 Agent 的主流做法,级联管线:音频进来自动语音识别(ASR)转文字,文字丢给 LLM,回复再经 TTS 合成语音。每一环都吃延迟,叠加起来 450 到 1000 毫秒;更麻烦的是转写环节会把语气、迟疑这些韵律信息抹掉,模型听到的是「脱水」后的句子。Gemini 3.8 Live 是端到端 speech-to-speech 单模型,官方目标是端到端延迟 200 毫秒以内,还保留声学上下文。
体验差异落在等待的「质感」上:模型接到一个要查数据的请求,先口头确认(「我帮你查一下」),工具调用在后台跑,语音流不中断,模型还能持续播报「订单找到了,正在核对物流」。「我帮你查一下」在这里不是安抚性的填充语,而是后台真实执行的同步旁白。冷场问题被从架构层拿掉了,而不是靠「请稍候」的提示音糊住。
AI Studio 免费试玩:五分钟出体验报告
两个模型都已经进了 Google AI Studio,不用写代码、不用 API Key,登录就能试。这是它和 GPT-Live-1 在试玩门槛上的实际差别——实时语音 API(比如站内写过的 GPT-Live)得自己搭音频采集和播放链路,AI Studio 这边打开网页就能开口说话。
测试环境:macOS + Chrome,需要能访问 Google 服务的网络(国内读者自备网络条件,这点后面选型部分还会说到)。
- 打开 aistudio.google.com,登录 Google 账号;
- 右侧模型下拉选 Gemini 3.8 Live 或 Extended Thinking,进「Stream Realtime」(实时流)入口;
授权麦克风,直接说中文,重点观察四件事:
中文响应延迟:体感有没有明显等待,和网页版 Gemini 普通对话比差多少;
- 边说边干:让它「帮我算 237 乘 48,再除以 7」,看它是否先口头确认、后台计算、再报结果,中间有无冷场;
- 中途打断:它播报时直接插话,能否自然接住不重启会话;
- 语言切换:中文说到一半切英语,97 种语言的自动检测是否真跟上。
API 接入:会话规格和两段代码
先记规格,写代码前心里有数(口径来自官方文档与 byteiota 的技术拆解,两源一致):
Gemini 3.8 Live 会话规格(Live API)
─────────────────────────────────
连接方式 有状态 WebSocket
音频输入 16-bit PCM / 16kHz
音频输出 24kHz PCM
上下文窗口 128k tokens
纯音频会话 上限 15 分钟
音频+视频会话 上限 2 分钟
语言 97 种,中途自动检测切换
水印 输出音频带 SynthID运行环境:Python 3.10+,Google 官方 google-genai SDK,装好就能跑:
pip install google-genai最小连接示例——基于 google-genai SDK 的 Live API 既有连接模式,把模型 ID 换成本次发布的两个新 ID:
import asyncio
from google import genai
from google.genai import types
client = genai.Client(api_key="你的 GEMINI_API_KEY")
MODEL = "gemini-3.8-live" # 或 "gemini-3.8-live-extended-thinking"
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
system_instruction="你是一个中文语音助手,回答保持口语化,数字念清楚。",
)
async def main():
async with client.aio.live.connect(model=MODEL, config=config) as session:
# 实际项目里这里接麦克风波形数据;此处用 16kHz 单声道 PCM 文件代替
audio = open("question.pcm", "rb").read()
await session.send_realtime_input(
media=types.Blob(data=audio, mime_type="audio/pcm;rate=16000")
)
async for response in session.receive():
if response.data is not None: # 24kHz PCM 音频块
play(response.data) # 接入你的播放器
elif response.text is not None:
print("转写:", response.text)
asyncio.run(main())ET 的异步工具调用是这次最值得学的新模式:声明工具后,模型先口头确认,后台执行期间语音流不断,结果回来再汇报。接收循环要按这个时序处理 tool_call 事件:
# Extended Thinking 的异步工具调用:工具在后台跑,语音流不中断
tools = [types.Tool(function_declarations=[{
"name": "query_order_status",
"description": "按订单号查询物流状态,返回快递公司与最新轨迹",
"parameters": {
"type": "OBJECT",
"properties": {
"order_id": {"type": "STRING", "description": "订单号,纯数字"},
},
"required": ["order_id"],
},
})])
async for response in session.receive():
if response.tool_call is not None:
# 后台执行工具;执行期间模型继续语音播报进度
results = []
for fc in response.tool_call.function_calls:
status = query_order_status(**fc.args) # 你的业务函数
results.append({"id": fc.id, "name": fc.name,
"response": {"status": status}})
await session.send_tool_response(function_responses=results)有个版本坑先说在前面:send_realtime_input 的参数名在 google-genai SDK 各版本间有过调整,跑不通先查你装版本的函数签名,再对照官方能力文档确认字段名,别照抄网上的旧示例。
对 Gemini API 生态不熟的读者,可以先看站内这篇 Gemini 3.6 Flash 与 computer use 的开发者指南,Key 申请和计费开通流程是共用的。
价格:把账算到每小时
官方口径:音频输入每分钟 0.005 美元、输出每分钟 0.018 美元(约合每百万 token 输入 3 美元、输出 12 美元)。腾讯新闻的全球科技早参也确认了这两个数字。
换算成整小时账单(以 AA 口径小时成本估算):一个每月跑 10000 小时的客服机器人,GPT-Live-1 约 58300 美元,ET 约 35000 美元,简单场景直接换 base 只要 8400 美元。对以小时计费的语音业务来说,这不是「降价几个点」,是换了量级的成本结构。
两个容易被忽略的计费项:ET 会对推理 token 额外计费,视频和文档输入也单独收费。所以我的选型规则只有一条:先数任务里有几步工具调用——一步以内的用 base,多步链路再上 ET。简单高频对话套 ET,等于给跑步机装 V8 引擎。
三个坑,迁移前先看
坑一:视频会话只有 2 分钟。 纯音频会话上限 15 分钟,音频+视频只有 2 分钟,差了 7.5 倍。想做「摄像头看着屏幕帮我操作」的视觉接地场景,会话恢复(session resumption)不是可选项而是必选项,这块的工程量在排期和报价时别漏算。
坑二:ET 强制异步,旧代码行为会变。 如果你的 Live API 代码按「调工具→等结果→再说话」的同步假设写的,迁到 ET 上工具不会阻塞语音流。业务逻辑里凡是依赖「结果回来才有下一步」的时序判断,接收循环都要重写。这是 ET 和其他模型的本质差别,不是参数差异。
坑三:级联管线不用急着扔。 站内写过腾讯 Hy ASR 3.0 的接入方案,不少团队的语音链路稳定跑在 ASR+LLM+TTS 上。迁到 speech-to-speech 会失去中间文本层——日志审计、合规抽查、人工接管都依赖那段转写文本。客服、金融这类有合规要求的场景,先想清楚中间文本层怎么补,再谈 200 毫秒的延迟优化。个人判断:这是 speech-to-speech 落地企业级场景最被低估的一步。
选型建议和后续
按场景给建议:
- 多步工具链的语音 Agent → Extended Thinking,价格优势 + 基准领先都在;
- 高频简单对话 → base 模型,0.84 美元/小时目前没有对手;
- 需要中间文本层、合规审计 → 保留级联管线,Hy ASR 那套方案依然是正解;
- 国内项目、无法稳定访问 Google API → 豆包 SeedRealtime 全双工方案是更现实的替代,全双工体验同一档。
语音 Agent 这条线站内已经攒了几篇:GPT-Live、SeedRealtime,还有 xAI 语音 Agent 的上手文;另一边,OpenAI Agents API 把托管式 Agent 做成了文本世界的标配。Gemini 3.8 Live 这次把「对话中后台干活」带进了语音世界,还顺手压了价格——语音 Agent 的工程门槛又降了一档。
语音 Agent 这条线还在快速变化,等延迟体感和中文语音质量有了更多实测样本,我会继续补充。