Luxsynthesis Blog
返回全部
模型

GPT-Live 发布:全双工语音模型上线 ChatGPT,后台可委托 GPT-5.5

OpenAI 于 2026-07-08 发布 GPT-Live(Live-1 / Live-1 mini),以全双工架构取代 Advanced Voice Mode;复杂任务后台委托 GPT-5.5。含架构、评测、可用性、已知限制与社区反馈。

作者
Luxsynthesis
发布日期
阅读时长
8 分钟阅读
GPT-Live 发布:全双工语音模型上线 ChatGPT,后台可委托 GPT-5.5

GPT-Live 发布:全双工语音模型上线 ChatGPT,后台可委托 GPT-5.5

原文链接:https://openai.com/index/introducing-gpt-live/ 参考来源:OpenAI 官方博客(2026-07-08)、@OpenAI / @athyuttamre 等 X 官方口径、Help Center 与发布后 24 小时内公开讨论 信息整理时间:2026-07-09

GPT-Live 官方发布封面


OpenAI 于 2026 年 7 月 8 日发布新一代语音模型 GPT-Live,接替 Advanced Voice Mode 驱动 ChatGPT Voice。官方把它描述为「更接近真实对话」的语音体验。

核心是两点:一是 全双工(full-duplex) 架构,可同时听与说;二是遇到需要搜索、深度推理或更复杂工作时,会在后台委托最新 frontier 模型(上线时为 GPT-5.5),再把结果带回当前语音对话。这相当于把语音交互层和推理层拆开了:以后 frontier 模型升级,Live 换个后端即可,不需要动语音交互层本身。

本次一并推出两个版本:

型号默认用户说明
GPT-Live-1Go / Plus / Pro付费档默认,驱动 ChatGPT Voice
GPT-Live-1 miniFree免费档默认,同样为全双工

官方表示 API 将在后续提供(Coming soon),开发者可登记通知。发布次日(7 月 9 日)@OpenAI 更新:Go / Plus / Pro 已全量;免费用户 rollout 进行中,需更新最新版 ChatGPT App。


一、语音交互三代演进

官方把此前的路线概括为两类,并说明了各自的取舍。

语音交互三代演进:级联 → 轮次 → 连续交互

1. 级联语音系统(Cascaded)

原始 ChatGPT Voice 由三条链路串起来:语音转写(STT)→ 大语言模型 → 语音合成(TTS)。它第一次让人能「对前沿模型说话」,但信息在模型之间会损耗,响应偏慢、偏生硬。

2. 轮次语音模型(Turn-based)

Advanced Voice Mode 把音频的处理与生成收进单一模型,延迟更低、对话更顺,但仍按离散轮次运行:模型要等用户说完再答。轮次边界往往依赖静音检测,短暂停顿或背景噪音容易被误判为「该你说了」,造成不自然打断。

3. GPT-Live:连续交互 + 深度工作委托

GPT-Live 用两项架构改动回应上述问题:

连续交互(Continuous interaction)
全双工架构下,模型在生成输出的同时持续处理输入,可在每秒多次级别决定:说、继续听、停顿、打断,或调用工具。官方称这带来更自然的来回、更好的时间感,并支持 live translation(实时翻译)

深度工作委托(Delegation)
日常连续交互由 GPT-Live 负责;需要搜索、推理或更 agentic 能力时,任务委托给 GPT-5.5 等后台模型。官方强调:Live 可一边维持对话流,一边在后台并行处理任务。

社区归纳的数据流大致如下:

用户语音 ──► GPT-Live(全双工交互层)
                │
                ├─ 日常对话 / 伴随反馈 / 打断与静默决策
                │
                └─ 复杂任务 ──delegate──► GPT-5.5(搜索 / 推理 / agent)
                                              │
                                              └─ 结果无缝带回语音对话

GPT-Live 架构:连续交互 + 深度工作委托


二、产品能力

官方称每周有超过 1.5 亿 人使用 ChatGPT 的 Voice 与听写等能力。接入 GPT-Live 后,点 Voice 按钮即用。官方列出的产品能力包括:

GPT-Live 产品能力:更自然的对话 / 更聪明的回答 / 更好的倾听 / 可视化回答

更自然的对话

  • 可中途打断、停顿整理思路,或要求模型放慢语速
  • 倾听时可用 "mhmm"、"got it" 等伴随反馈表示在跟进
  • 九个 音色针对 GPT-Live 重新录制

更聪明的回答

  • 后台可调用最新 frontier 模型
  • 用户可选推理强度:Instant(更快)、MediumHigh(花更多时间思考)
  • 官方注释:Instant / mini 后台对应 GPT-5.5 Instant;Medium / High 对应 GPT-5.5 Thinking 的 medium / high 推理档

更好的倾听

  • 用户思考时会等待,而不是抢话
  • 可要求模型保持安静、只听不说
  • 背景噪音(车流、旁人说话等)下更聚焦用户声音

可视化回答

对话中可弹出富媒体卡片,覆盖天气、股票、体育赛事等;同时继续支持搜索、Memory、图片与文件上传。

ChatGPT Voice 天气可视化卡片示例

ChatGPT Voice 体育赛事可视化卡片示例

ChatGPT Voice 地图 / 附近地点可视化示例


三、Benchmark 表现

官方新建了面向「愉悦度」与「对话流畅度」的人工评测:在匹配的 5–10 分钟对话中,对整体偏好、轮次切换、打断、对话流与自然度等维度做头对头比较,GPT-Live-1 与 mini 均明显优于 Advanced Voice Mode

客观基准测试上,官方给出了相对 Advanced Voice Mode 的对照数据(图表包含 Instant / Medium / High 三档,社区流传的信息图对这些数值的转述基本一致):

GPQA(专家级科学推理,生物 / 化学 / 物理)

GPQA 评测:GPT-Live-1 各档 vs Advanced Voice Mode

模型 / 档位约分(社区转述官方图表)
Advanced Voice Mode45.3%
GPT-Live-1 Instant76.5%
GPT-Live-1 Medium81.7%
GPT-Live-1 High84.2%

BrowseComp(Agentic 网页搜索 / 难找信息)

BrowseComp 评测:GPT-Live-1 各档 vs Advanced Voice Mode

模型 / 档位约分(社区转述官方图表)
Advanced Voice Mode0.7%
GPT-Live-1 Instant35.1%
GPT-Live-1 Medium60.6%
GPT-Live-1 High75.2%

BrowseComp 差距最大:旧 Voice 几乎不具备 agentic 搜索能力;Instant 档就已经远超 Advanced Voice Mode。

一句话读数:GPQA 上 Instant 档比旧 Voice 高出 31 个百分点,High 档逼近 84%;BrowseComp 从 0.7% 到 75.2%,是从「几乎不会搜」到「能搜」的跨越。至少在这两项基准上,语音模型和文本 frontier 模型的差距已经明显收窄。

τ³-Voice Telecom(全双工语音 Agent / 多轮电信客服类任务)

τ³-Voice Telecom 评测对比

官方称 GPT-Live-1 在 τ³-Voice Telecom(内部变体)上同样优于 Advanced Voice Mode,用于衡量真实、多轮、语音形态的 agent 任务。

官方脚注:评测中 Instant / mini 使用 GPT-5.5 Instant 后台;Medium / High 使用 GPT-5.5 Thinking。τ 类评测使用了由最新推理模型驱动的定制 user model。


四、安全加固

官方强调 GPT-Live 默认安全设计,在最新模型安全能力之上增加了面向语音的专项训练与防护。

方向内容
扩展评测新增 audio-native 评测与合成音频评测,覆盖自伤、精神病性 / 躁狂、对 AI 的情感依赖、暴力、性内容等;内部专家对语音特有风险做 red team
实时干预检测到潜在不安全输出时,可在说话过程中转向更安全回应、展示安全信息 / 资源,或在更高风险场景结束语音会话
自伤支持将 ChatGPT 既有支持流程适配到语音,包括提供经专家审核的危机热线资源
青少年年龄适宜行为写入模型;家长可通过 Parental Controls 决定青少年是否可用 Voice;更高风险的自伤迹象场景可通知已关联家长
长期监测针对情感依赖做上线后监测与度量,延续此前对情感使用与情绪健康的研究
声音边界使用 ChatGPT 内预置音色;设有防护,避免模仿真实人物声音

官方称在已评测的安全维度上,GPT-Live 表现与 Advanced Voice Mode 相当或更好。细节见官方博文与 System Card。


五、可用性与已知限制

可用性(发布后约 24 小时)

项目状态
平台ChatGPT iOS / Android / Web
Go / Plus / ProGPT-Live 已全量(2026-07-09 官方声明)
Freerollout 进行中;默认 GPT-Live-1 mini
入口Voice 按钮;Settings → Voice → Model 可见 Live
客户端需更新至最新 ChatGPT App
API尚未开放(Coming soon)
语言对部分热门语言做了优化;部分语言可能有口音或流利度缺口,官方称多语言与口音为优先改进项

上线首日功能缺口(Help Center / 社区汇总)

GPT-Live 上线时暂不支持、或需切回旧版 Voice 能力路径的功能包括:

  • 视频通话
  • 屏幕共享
  • connected apps / plugins
  • Temporary Chats
  • desktop app
  • Work
  • Codex
  • custom GPTs

官方明确:launch 时 ChatGPT 内 不支持 语音 + 视频 / 屏幕共享,这些能力还在做;需要时可继续走 Standard / Advanced Voice Mode 中仍保留这些能力的旧路径。

已知产品问题

ChatGPT Voice 负责人 @athyuttamre 公开表示,GPT-Live 下的 Memory 不够可靠,团队已在排查。另一个高频吐槽是打断和伴随反馈过频:官方 demo 与首日用户反馈中,「插话过多」「mhmm / uh-huh 过密」被反复提到,官方的建议是可以直接使用模型“保持安静”。

还有 Reddit 用户反馈 Plus 使用 Live-1 约 1 小时后就会触发 daily limit 并自动切到 mini,还有人报告遇到切档循环的 bug。

此外,GPT-Live 与 API 侧现有的 Realtime 产品线是两个不同的东西:GPT-Live 是 ChatGPT Voice 产品侧 的新一代模型,它「即将上 API」与 Realtime API 不是同一件事,不要搞混了。


六、社区反馈

我们整理了一些 24 小时内 X / HN / Reddit 等公开讨论信息。

社区反馈分布:正面 / 中性场景化 / 负面争议(24h 公开讨论)

正面反馈

  • @fdaudens:内测几周后默认开语音,「回不去了」;GPT-Live 配合 interactive widgets 是 next level
  • @romainhuet(OpenAI DX):强调「最聪明」与「极自然」,具体指可同时听与说、实时翻译、边看图边聊
  • @wanerfu(中文实测):「对话终于像个人了」;语气更自然,会自然打断,有情绪反馈
  • @Rabbuttz_VR(日文):违和感几乎消失,附长视频 demo
  • @2okutameo(日文):相对 Alexa「性能差是天与地」
  • @masahirochaen:巴黎古书店英语→法语实时同传场景;判断 C 端翻译转业创业公司可能受严重冲击
  • @ArtemisArgento(投研视角):语音周活约 1.5 亿、约 15% 渗透;语音≈5× 文字算力,视频≈10× 语音;延迟路径 Siri 1–3s → 旧 Voice ~500ms → Live ~300ms

中性 / 场景化反馈

  • @ArtemR:最干净的「双刃剑」一句:「理论上爱更快的全双工响应,但 GPT-Live 一直用无用的闲聊与 filler words 插嘴,太烦了。未来更近了,但肯定需要调参」
  • @digg:50 万次浏览后反应以正面为主;压力在于语音能否不再像 demo
  • @sitinme(HN/Reddit 整理):喜欢的点是终于不像对讲机、后台接 GPT-5.5、适合散步/开车/通勤 brainstorming;背景噪音处理变好但仍不完美
  • @xiaohu(中文):不止全双工,还能调 GPT-5.5 并生成实时 UI 卡片;「个人 AI 助理」叙事,Siri / 苹果生态受威胁
  • @nanhaier(中文):昨天 OpenAI 发 GPT-Live,xAI 发 Grok 4.5,感慨「一个押注人机交互体验,一个押注编码能力。AI 竞赛进入日更模式」

负面反馈与争议

  • 官方 demo 打断老太太成为即时梗:@AutismCapital「一直在打断她 lmao」;@brian_lovin「电脑一直打断人」;@robfromeighty1「一个会打断用户、抢话的语音模型?不要」
  • @WilliamVWrites:要求加滑杆降低 uh-huh 频率,理由是「人这样抢话已经够烦了,机器人?抓狂」
  • @DJSanghera:插话需要视觉输入才能判断,没有就永远差一点
  • @Ozakinico(日文):uncanny valley 样本,「太真了有点可怕/恶心」
  • @ConnorCuriousUS:基础小测仍翻车,「two E's in seventeen」与尴尬的「自然告别」都出了问题
  • @dotey(中文长帖,约 2.1 万浏览):核心归纳为三点:第三代语音(对讲机→全双工)、语音交互层与推理层的拆分,以及首日「为自然设计的回应词反而烦人」与功能缺口;评论区金句「从对讲机进化成相声揼子,第一关是先学会别抢话」
  • #keep4o 情绪:主帖下持续出现 #keep4o / #BringBack4o 的标签,这是用户对旧模型下架的长期抗议,跟 Live 全双工技术本身是两件事,应该分开看待

有个高频话题:GPT-Live 跟豆包语音对比。大部分人认为GPT Live的英文表现和智能程度、同传能力普遍获得肯定;但中文语境下的丝滑度和陪伴感调参似乎没有占优,视频能力也被提到有些落后。


七、接入与使用

  1. 更新 iOS / Android ChatGPT 到最新版,或使用 Web
  2. 打开 Voice;在 Settings → Voice → Model 确认 Live / Live mini
  3. 付费用户默认应为 GPT-Live-1;若仍是旧模式,可检查 App 版本或等待 rollout
  4. 插话过多时,可口头指令:「stay quiet / 先听我说完」
  5. 需要视频、屏幕共享、插件、Codex 等时,暂时走旧版 Voice 能力路径(若产品仍提供)
  6. 开发者:等待 GPT-Live 的 API 开放;勿与现有 Realtime API 混为一谈

八、Roadmap

官方与社区披露的后续计划:

  • API:尚未开放(Coming soon),开发者可登记通知;与 API 侧既有的 Realtime 产品线不是同一件事
  • 多语言与口音:官方称 top priority,部分热门语言已优化,其余存在口音或流利度缺口
  • 视频与屏幕共享:仍在做,launch 时 ChatGPT 内不支持语音 + 视频 / 屏幕共享;旧版 Voice 路径暂时保留这些能力
  • Memory:ChatGPT Voice 负责人 @athyuttamre 已公开承认 GPT-Live 下 Memory 不够可靠,在排查
  • 打断 / filler 调参:首日「插话过多」「uh-huh 过密」是高频反馈,社区呼吁加滑杆控制伴随反馈频率

参考链接

返回全部