GPT-Live 发布:全双工语音模型上线 ChatGPT,后台可委托 GPT-5.5
原文链接:https://openai.com/index/introducing-gpt-live/ 参考来源:OpenAI 官方博客(2026-07-08)、@OpenAI / @athyuttamre 等 X 官方口径、Help Center 与发布后 24 小时内公开讨论 信息整理时间:2026-07-09

OpenAI 于 2026 年 7 月 8 日发布新一代语音模型 GPT-Live,接替 Advanced Voice Mode 驱动 ChatGPT Voice。官方把它描述为「更接近真实对话」的语音体验。
核心是两点:一是 全双工(full-duplex) 架构,可同时听与说;二是遇到需要搜索、深度推理或更复杂工作时,会在后台委托最新 frontier 模型(上线时为 GPT-5.5),再把结果带回当前语音对话。这相当于把语音交互层和推理层拆开了:以后 frontier 模型升级,Live 换个后端即可,不需要动语音交互层本身。
本次一并推出两个版本:
| 型号 | 默认用户 | 说明 |
|---|---|---|
| GPT-Live-1 | Go / Plus / Pro | 付费档默认,驱动 ChatGPT Voice |
| GPT-Live-1 mini | Free | 免费档默认,同样为全双工 |
官方表示 API 将在后续提供(Coming soon),开发者可登记通知。发布次日(7 月 9 日)@OpenAI 更新:Go / Plus / Pro 已全量;免费用户 rollout 进行中,需更新最新版 ChatGPT App。
一、语音交互三代演进
官方把此前的路线概括为两类,并说明了各自的取舍。

1. 级联语音系统(Cascaded)
原始 ChatGPT Voice 由三条链路串起来:语音转写(STT)→ 大语言模型 → 语音合成(TTS)。它第一次让人能「对前沿模型说话」,但信息在模型之间会损耗,响应偏慢、偏生硬。
2. 轮次语音模型(Turn-based)
Advanced Voice Mode 把音频的处理与生成收进单一模型,延迟更低、对话更顺,但仍按离散轮次运行:模型要等用户说完再答。轮次边界往往依赖静音检测,短暂停顿或背景噪音容易被误判为「该你说了」,造成不自然打断。
3. GPT-Live:连续交互 + 深度工作委托
GPT-Live 用两项架构改动回应上述问题:
连续交互(Continuous interaction)
全双工架构下,模型在生成输出的同时持续处理输入,可在每秒多次级别决定:说、继续听、停顿、打断,或调用工具。官方称这带来更自然的来回、更好的时间感,并支持 live translation(实时翻译)。
深度工作委托(Delegation)
日常连续交互由 GPT-Live 负责;需要搜索、推理或更 agentic 能力时,任务委托给 GPT-5.5 等后台模型。官方强调:Live 可一边维持对话流,一边在后台并行处理任务。
社区归纳的数据流大致如下:
用户语音 ──► GPT-Live(全双工交互层)
│
├─ 日常对话 / 伴随反馈 / 打断与静默决策
│
└─ 复杂任务 ──delegate──► GPT-5.5(搜索 / 推理 / agent)
│
└─ 结果无缝带回语音对话

二、产品能力
官方称每周有超过 1.5 亿 人使用 ChatGPT 的 Voice 与听写等能力。接入 GPT-Live 后,点 Voice 按钮即用。官方列出的产品能力包括:

更自然的对话
- 可中途打断、停顿整理思路,或要求模型放慢语速
- 倾听时可用 "mhmm"、"got it" 等伴随反馈表示在跟进
- 九个 音色针对 GPT-Live 重新录制
更聪明的回答
- 后台可调用最新 frontier 模型
- 用户可选推理强度:Instant(更快)、Medium、High(花更多时间思考)
- 官方注释:Instant / mini 后台对应 GPT-5.5 Instant;Medium / High 对应 GPT-5.5 Thinking 的 medium / high 推理档
更好的倾听
- 用户思考时会等待,而不是抢话
- 可要求模型保持安静、只听不说
- 背景噪音(车流、旁人说话等)下更聚焦用户声音
可视化回答
对话中可弹出富媒体卡片,覆盖天气、股票、体育赛事等;同时继续支持搜索、Memory、图片与文件上传。



三、Benchmark 表现
官方新建了面向「愉悦度」与「对话流畅度」的人工评测:在匹配的 5–10 分钟对话中,对整体偏好、轮次切换、打断、对话流与自然度等维度做头对头比较,GPT-Live-1 与 mini 均明显优于 Advanced Voice Mode。
客观基准测试上,官方给出了相对 Advanced Voice Mode 的对照数据(图表包含 Instant / Medium / High 三档,社区流传的信息图对这些数值的转述基本一致):
GPQA(专家级科学推理,生物 / 化学 / 物理)

| 模型 / 档位 | 约分(社区转述官方图表) |
|---|---|
| Advanced Voice Mode | 45.3% |
| GPT-Live-1 Instant | 76.5% |
| GPT-Live-1 Medium | 81.7% |
| GPT-Live-1 High | 84.2% |
BrowseComp(Agentic 网页搜索 / 难找信息)

| 模型 / 档位 | 约分(社区转述官方图表) |
|---|---|
| Advanced Voice Mode | 0.7% |
| GPT-Live-1 Instant | 35.1% |
| GPT-Live-1 Medium | 60.6% |
| GPT-Live-1 High | 75.2% |
BrowseComp 差距最大:旧 Voice 几乎不具备 agentic 搜索能力;Instant 档就已经远超 Advanced Voice Mode。
一句话读数:GPQA 上 Instant 档比旧 Voice 高出 31 个百分点,High 档逼近 84%;BrowseComp 从 0.7% 到 75.2%,是从「几乎不会搜」到「能搜」的跨越。至少在这两项基准上,语音模型和文本 frontier 模型的差距已经明显收窄。
τ³-Voice Telecom(全双工语音 Agent / 多轮电信客服类任务)

官方称 GPT-Live-1 在 τ³-Voice Telecom(内部变体)上同样优于 Advanced Voice Mode,用于衡量真实、多轮、语音形态的 agent 任务。
官方脚注:评测中 Instant / mini 使用 GPT-5.5 Instant 后台;Medium / High 使用 GPT-5.5 Thinking。τ 类评测使用了由最新推理模型驱动的定制 user model。
四、安全加固
官方强调 GPT-Live 默认安全设计,在最新模型安全能力之上增加了面向语音的专项训练与防护。
| 方向 | 内容 |
|---|---|
| 扩展评测 | 新增 audio-native 评测与合成音频评测,覆盖自伤、精神病性 / 躁狂、对 AI 的情感依赖、暴力、性内容等;内部专家对语音特有风险做 red team |
| 实时干预 | 检测到潜在不安全输出时,可在说话过程中转向更安全回应、展示安全信息 / 资源,或在更高风险场景结束语音会话 |
| 自伤支持 | 将 ChatGPT 既有支持流程适配到语音,包括提供经专家审核的危机热线资源 |
| 青少年 | 年龄适宜行为写入模型;家长可通过 Parental Controls 决定青少年是否可用 Voice;更高风险的自伤迹象场景可通知已关联家长 |
| 长期监测 | 针对情感依赖做上线后监测与度量,延续此前对情感使用与情绪健康的研究 |
| 声音边界 | 使用 ChatGPT 内预置音色;设有防护,避免模仿真实人物声音 |
官方称在已评测的安全维度上,GPT-Live 表现与 Advanced Voice Mode 相当或更好。细节见官方博文与 System Card。
五、可用性与已知限制
可用性(发布后约 24 小时)
| 项目 | 状态 |
|---|---|
| 平台 | ChatGPT iOS / Android / Web |
| Go / Plus / Pro | GPT-Live 已全量(2026-07-09 官方声明) |
| Free | rollout 进行中;默认 GPT-Live-1 mini |
| 入口 | Voice 按钮;Settings → Voice → Model 可见 Live |
| 客户端 | 需更新至最新 ChatGPT App |
| API | 尚未开放(Coming soon) |
| 语言 | 对部分热门语言做了优化;部分语言可能有口音或流利度缺口,官方称多语言与口音为优先改进项 |
上线首日功能缺口(Help Center / 社区汇总)
GPT-Live 上线时暂不支持、或需切回旧版 Voice 能力路径的功能包括:
- 视频通话
- 屏幕共享
- connected apps / plugins
- Temporary Chats
- desktop app
- Work
- Codex
- custom GPTs
官方明确:launch 时 ChatGPT 内 不支持 语音 + 视频 / 屏幕共享,这些能力还在做;需要时可继续走 Standard / Advanced Voice Mode 中仍保留这些能力的旧路径。
已知产品问题
ChatGPT Voice 负责人 @athyuttamre 公开表示,GPT-Live 下的 Memory 不够可靠,团队已在排查。另一个高频吐槽是打断和伴随反馈过频:官方 demo 与首日用户反馈中,「插话过多」「mhmm / uh-huh 过密」被反复提到,官方的建议是可以直接使用模型“保持安静”。
还有 Reddit 用户反馈 Plus 使用 Live-1 约 1 小时后就会触发 daily limit 并自动切到 mini,还有人报告遇到切档循环的 bug。
此外,GPT-Live 与 API 侧现有的 Realtime 产品线是两个不同的东西:GPT-Live 是 ChatGPT Voice 产品侧 的新一代模型,它「即将上 API」与 Realtime API 不是同一件事,不要搞混了。
六、社区反馈
我们整理了一些 24 小时内 X / HN / Reddit 等公开讨论信息。

正面反馈
- @fdaudens:内测几周后默认开语音,「回不去了」;GPT-Live 配合 interactive widgets 是 next level
- @romainhuet(OpenAI DX):强调「最聪明」与「极自然」,具体指可同时听与说、实时翻译、边看图边聊
- @wanerfu(中文实测):「对话终于像个人了」;语气更自然,会自然打断,有情绪反馈
- @Rabbuttz_VR(日文):违和感几乎消失,附长视频 demo
- @2okutameo(日文):相对 Alexa「性能差是天与地」
- @masahirochaen:巴黎古书店英语→法语实时同传场景;判断 C 端翻译转业创业公司可能受严重冲击
- @ArtemisArgento(投研视角):语音周活约 1.5 亿、约 15% 渗透;语音≈5× 文字算力,视频≈10× 语音;延迟路径 Siri 1–3s → 旧 Voice ~500ms → Live ~300ms
中性 / 场景化反馈
- @ArtemR:最干净的「双刃剑」一句:「理论上爱更快的全双工响应,但 GPT-Live 一直用无用的闲聊与 filler words 插嘴,太烦了。未来更近了,但肯定需要调参」
- @digg:50 万次浏览后反应以正面为主;压力在于语音能否不再像 demo
- @sitinme(HN/Reddit 整理):喜欢的点是终于不像对讲机、后台接 GPT-5.5、适合散步/开车/通勤 brainstorming;背景噪音处理变好但仍不完美
- @xiaohu(中文):不止全双工,还能调 GPT-5.5 并生成实时 UI 卡片;「个人 AI 助理」叙事,Siri / 苹果生态受威胁
- @nanhaier(中文):昨天 OpenAI 发 GPT-Live,xAI 发 Grok 4.5,感慨「一个押注人机交互体验,一个押注编码能力。AI 竞赛进入日更模式」
负面反馈与争议
- 官方 demo 打断老太太成为即时梗:@AutismCapital「一直在打断她 lmao」;@brian_lovin「电脑一直打断人」;@robfromeighty1「一个会打断用户、抢话的语音模型?不要」
- @WilliamVWrites:要求加滑杆降低 uh-huh 频率,理由是「人这样抢话已经够烦了,机器人?抓狂」
- @DJSanghera:插话需要视觉输入才能判断,没有就永远差一点
- @Ozakinico(日文):uncanny valley 样本,「太真了有点可怕/恶心」
- @ConnorCuriousUS:基础小测仍翻车,「two E's in seventeen」与尴尬的「自然告别」都出了问题
- @dotey(中文长帖,约 2.1 万浏览):核心归纳为三点:第三代语音(对讲机→全双工)、语音交互层与推理层的拆分,以及首日「为自然设计的回应词反而烦人」与功能缺口;评论区金句「从对讲机进化成相声揼子,第一关是先学会别抢话」
- #keep4o 情绪:主帖下持续出现 #keep4o / #BringBack4o 的标签,这是用户对旧模型下架的长期抗议,跟 Live 全双工技术本身是两件事,应该分开看待
有个高频话题:GPT-Live 跟豆包语音对比。大部分人认为GPT Live的英文表现和智能程度、同传能力普遍获得肯定;但中文语境下的丝滑度和陪伴感调参似乎没有占优,视频能力也被提到有些落后。
七、接入与使用
- 更新 iOS / Android ChatGPT 到最新版,或使用 Web
- 打开 Voice;在 Settings → Voice → Model 确认 Live / Live mini
- 付费用户默认应为 GPT-Live-1;若仍是旧模式,可检查 App 版本或等待 rollout
- 插话过多时,可口头指令:「stay quiet / 先听我说完」
- 需要视频、屏幕共享、插件、Codex 等时,暂时走旧版 Voice 能力路径(若产品仍提供)
- 开发者:等待 GPT-Live 的 API 开放;勿与现有 Realtime API 混为一谈
八、Roadmap
官方与社区披露的后续计划:
- API:尚未开放(Coming soon),开发者可登记通知;与 API 侧既有的 Realtime 产品线不是同一件事
- 多语言与口音:官方称 top priority,部分热门语言已优化,其余存在口音或流利度缺口
- 视频与屏幕共享:仍在做,launch 时 ChatGPT 内不支持语音 + 视频 / 屏幕共享;旧版 Voice 路径暂时保留这些能力
- Memory:ChatGPT Voice 负责人 @athyuttamre 已公开承认 GPT-Live 下 Memory 不够可靠,在排查
- 打断 / filler 调参:首日「插话过多」「uh-huh 过密」是高频反馈,社区呼吁加滑杆控制伴随反馈频率
参考链接
- 官方博客:https://openai.com/index/introducing-gpt-live/
- 官方发布主帖:https://x.com/OpenAI/status/2074907025537224840
- 付费档全量更新:https://x.com/OpenAI/status/2075019750569378007
- Memory 问题声明(@athyuttamre):https://x.com/athyuttamre/status/2075052389980401829
- @dotey 中文长帖:https://x.com/dotey/status/2075085137990005164
- @fdaudens 默认语音帖:https://x.com/fdaudens/status/2075011510045233457
- @ArtemR 双刃剑反馈:https://x.com/ArtemR/status/2074951440968106152
- @wanerfu 中文实测:https://x.com/wanerfu/status/2075079276865659128
