跳到主要内容

ANYJOB AI · 文章中心

GPT-Live 发布,背后都有谁?

AnyJob AI 梳理出 19 位相关人物:核心华人科学家、上下游企业场景和中国追赶者同时浮出水面。

AnyJob AI关键连接
GPT-Live 发布,背后都有谁?文章封面
关键连接 001 · AI 语音

AnyJob AI 梳理出 19 位相关人物:核心华人科学家、上下游企业场景和中国追赶者同时浮出水面。

GPT-LiveChatGPT VoiceFull-duplexVoice Agent

7 月 8 日,OpenAI 发布 GPT-Live。这是一代新的语音模型,开始驱动 ChatGPT Voice。它的核心变化很直接:模型可以同时听和说,可以在用户停顿时等待,也可以在用户打断时调整节奏。

OpenAI 同时给出两层架构:GPT-Live 负责连续语音互动,复杂问题交给后台的前沿模型处理。发布时,GPT-Live 会在后台调用 GPT-5.5;随着前沿模型更新,语音体验里的后台模型也会更新。GPT-Live-1 将成为 Go、Plus 和 Pro 用户的默认语音模型,免费用户默认使用 GPT-Live-1 mini。

核心判断:GPT-Live 的新鲜感在声音,更大的变化在人物和场景:OpenAI 音频研发团队把全双工语音做成产品,Zillow、Fin / Intercom 这类场景会最早验证它的商业空间。

这次更新,重点改了三方面

第一件事是全双工。OpenAI 在发布页里写得很具体:GPT-Live 可以连续处理输入并生成输出,模型每秒多次做交互决策,决定说话、继续听、暂停、打断或调用工具。以前的语音模型常常等用户说完再回应,停顿和背景声容易造成误判;GPT-Live 把“轮到谁说话”的问题前移到实时判断里。

第二件事是后台分工。语音模型保持交流节奏,搜索、深度推理和复杂任务交给 GPT-5.5 这类后台模型。这个设计很像一个会接待的前台同事:前台继续陪你说,后台把行程规划、资料查找和多步骤任务跑完,再把结果带回对话里。

第三件事是安全评测。OpenAI 的系统卡显示,GPT-Live 增加了语音原生评测,覆盖自伤、情绪依赖、暴力、性内容等语音场景;系统在模型说话过程中也能检测和干预,高风险场景下可以结束语音会话。语音 Agent 一旦进入陪伴、驾驶、客服、教育和医疗咨询,实时安全会和模型能力一样影响产品可用性。

交互

听说同时发生

模型能处理停顿、插话、语速变化和短促反馈,语音对话开始接近日常聊天。

任务

前台后台分开

语音层保持顺滑,复杂工作交给更强模型和工具链,结果再回到对话里。

安全

边说边管控

检测和干预发生在实时语音过程中,语音安全从文本审核扩展到对话现场。

官方发布页还展示了一个很实用的产品细节:GPT-Live 的回答会回到可视化界面。天气、赛事、地图这些卡片,让语音对话保留了“边问边看”的空间,用户可以继续追问、改条件、让系统重新筛选。

GPT-Live 天气视觉回答示例GPT-Live 赛事视觉回答示例GPT-Live 地图视觉回答示例
GPT-Live 官方发布页展示的视觉回答:天气、赛事和地图结果可以直接回到 ChatGPT Voice 界面。图片来源:OpenAI。

这19 位关键人物,影响了GPT-Live

围绕 GPT-Live 发布,AnyJob AI 梳理出 19 位关键人物。把这些人物放回新闻现场,可以看到四类角色:定义 ChatGPT Voice 体验的人、把语音能力接进住房搜索和客服的人、参与音频模型研究的人,以及中国实时语音模型圈子里的追赶者。

关系图谱

查看 GPT-Live 事件关联人脉图谱

点击按钮,查看完整人物与关系路径。

产品入口、住房搜索、客服 Agent:三种最先落地的场景

这三个入口的共同点是:用户问题不完整、上下文不断变化,需要 AI 一边听、一边追问、一边调用工具。

Atty Eleti 被放在第一组,是因为 ChatGPT Voice 的入口体验决定 GPT-Live 能否被用户长期打开:声音是否自然,模型是否懂停顿,打断后能否接上任务,都会影响用户愿不愿意继续说下去。

Josh Weisberg 与 Zillow 代表住房搜索场景。找房、看社区、比价格、规划通勤,本来就适合一边问、一边筛选、一边看地图。GPT-Live 这种语音前台,能让住房搜索从“填条件”变成“持续对话”。

Pedro Tabacof 与 Fin / Intercom 落在客服 Agent 场景。客服天然需要听懂打断、情绪、背景信息和前后文,还要调用订单、知识库、工单和 CRM。全双工语音让客服从“电话机器人”走向实时任务助手。

GPT-Live 发布,背后都有谁? 配图 5

Atty Eleti

OpenAI ChatGPT Voice 产品方向|语音体验与产品入口

Atty Eleti 是 OpenAI ChatGPT Voice 方向的产品关键人,曾任 GPT-4 API co-lead。AnyJob AI 报告显示,他的经历同时靠近工程和体验:Brown University 计算机背景,叠加 Figma、Facebook、Stripe 等产品与工程经历。

ChatGPT Voice产品入口对话节奏
人物报告

点击按钮,查看完整人物报告。

GPT-Live 发布,背后都有谁? 配图 7

Josh Weisberg

Zillow Senior Vice President of AI|住房搜索与生活决策场景

Josh Weisberg 负责 Zillow 的 AI 方向。Zillow 已把 AI mode 接入找房流程,这类场景天然需要多轮提问、地图筛选、价格比较和资格判断,是 GPT-Live 进入生活决策的代表入口。

Zillow住房搜索生活决策
人物报告

点击按钮,查看完整人物报告。

GPT-Live 发布,背后都有谁? 配图 9

Pedro Tabacof

Fin / Intercom Principal 方向|客服 Agent 与企业服务

Pedro Tabacof 是 Fin / Intercom 的 Principal Machine Learning Scientist。AnyJob AI 报告显示,他参与过 Fin Voice / OpenAI voice model 的评测、A/B、延迟优化和上线迁移;此前在 Nubank、iFood、Wildlife Studios 等团队做过机器学习和数据科学。

FinIntercom客服 Agent
人物报告

点击按钮,查看完整人物报告。

OpenAI 的演示现场,出现了两个华人名字

GPT-Live 把几类语音研发角色推到台前:音频后训练、实时模型、语音生成和安全评测。OpenAI 中文发布页的视频画面里,Yuchen Zhang、Alyssa Huang 和 Justin Uberti 以 Members of Technical Staff 的身份出现。

OpenAI GPT-Live 发布页中的 Yuchen Zhang、Alyssa Huang 和 Justin Uberti
OpenAI GPT-Live 发布页视频画面:Yuchen Zhang、Alyssa Huang 和 Justin Uberti。图片来源:OpenAI。

AnyJob AI 进一步追踪到 Yu Zhang、Junhua Mao 这两个名字,重点负责做多模态语音底座,并把研究推到 ChatGPT Voice 这种大规模产品里。他们对应的是语音模型从研究论文走向产品系统的那一段。

Yi Shen 需要单独放一笔。她现在在 Google DeepMind;在 OpenAI 阶段,她负责或共同负责 Advanced Voice Mode、gpt-4o-mini-tts、gpt-4o-transcribe 和 gpt-4o-mini-transcribe 等语音模型研究。她还曾在 Waymo 做 Scene Understanding、在 Nuro 参与自动驾驶软件栈。(没准在不久的将来,Google Gemini也将会展现同样的语音能力。

GPT-Live 发布,背后都有谁? 配图 12GPT-Live 发布,背后都有谁? 配图 13

Yu Zhang、Junhua Mao

OpenAI 音频模型研究方向|语音模型与系统能力

Yu Zhang 是 OpenAI Research Scientist / Audio Post-Training Lead,MIT CS 博士,曾在 Google Research / Google Brain 做语音识别和跨语言 ASR。Junhua Mao 是 OpenAI Research Lead / Member of Technical Staff,早期研究集中在视觉语言和多模态表示。两人都出现在 OpenAI 音频模型相关公开材料中。

音频模型实时交互系统评测
人物报告

点击按钮,查看完整人物报告。

Yi Shen

Google DeepMind 研究员|曾参与 OpenAI 语音研究

复旦本科、UNC Charlotte CS PhD,之后在 Nuro、Waymo 做自动驾驶感知与场景理解;到 OpenAI 后进入 Advanced Voice Mode、TTS、STT 语音研究,现在转向 Google DeepMind 的前沿 AI 研究。

Google DeepMindAdvanced Voice Mode语音研究经历
人物报告

点击按钮,查看完整人物报告。

人物来源:AnyJob AI 关键人雷达深度背景报告。

中国团队的追赶,重点在四个方面

国内追赶的关键,已经从“有没有语音模型”转向“能不能稳定地实时对话”。中国实时语音对话模型已经有基础。Qwen3-Omni 技术报告显示,阿里通义团队把文本、图像、音频和视频放在同一多模态模型中,音频任务表现突出,并采用 Thinker-Talker MoE 架构来统一理解和生成;报告还提到流式语音合成的首包延迟优化,冷启动理论端到端首包延迟可到 234 毫秒。

这说明国内团队已经站在同一类问题上:让模型听懂人、跟上节奏、生成自然声音、接住工具调用。下一步难点会集中在四个方面:全双工交互、产品级稳定性、企业场景集成、语音安全评测。技术论文能证明模型能跑起来,真正的分水岭会在高频场景里的持续使用。

AnyJob AI 对“中国做实时语音对话模型的技术大牛圈子”做了扫描,圈层人脉网络发现 13 位相关人物。其中,阿里是这个圈子的核心,我们进一步追踪到了高志富、杜志浩、张世亮。这批名字值得持续关注,因为语音 Agent 的竞争可能就会从他们手上,从“谁的模型会说话”走向“谁能把语音接进手机、车机、客服、教育和企业流程”。

关系图谱

查看中国实时语音对话模型圈层

点击按钮,查看完整圈层人物。

人物报告

查看阿里方向实时语音人物报告

高志富、杜志浩、张世亮对应国产实时语音对话模型的工程和产品化观察入口。

GPT-Live 发布,背后都有谁? 配图 18

杜志浩

阿里巴巴通义实验室研究员|CosyVoice、FunCodec、LauraGPT 等项目

杜志浩 2021 年起在阿里通义语音团队工作,哈尔滨工业大学计算机博士。公开主页和 AnyJob AI 报告显示,他参与 CosyVoice、FunCodec、LauraGPT、FunAudioLLM、MinMo、FunASR 等项目,连接语音生成、编码、识别和多模态交互几道工程门槛。

阿里通义FunASR实时语音

GPT-Live会给企业带来什么

对企业来说,GPT-Live 的意义在于把“语音输入”推进到“语音协作”。企业会先在客服、销售、房产、本地生活、教育和办公协同里看到 GPT-Live 这类能力。它的优势来自两个动作:第一,语音前台能承接更自然的沟通;第二,后台模型能把搜索、检索、推理、文件和业务系统接起来。用户说的是一句话,系统背后跑的是一串任务。

这也会改变产品经理和创业公司的判断。语音产品以前常常围绕“识别准、合成像”展开;GPT-Live 发布后,评价标准会加入打断处理、边听边做、任务回传、视觉卡片、情绪边界和安全干预。谁能把这些细节做稳,谁就更接近企业真实采购。

对投资人和产业公司来说,值得追踪三类团队:语音底座团队、把语音 Agent 接入业务系统的中间层团队、拥有高频语音场景的垂直应用团队。

继续深挖:用一句话找到更多“牛人”

围绕 GPT-Live 和实时语音 Agent,可以继续用 AnyJob AI 找到更多研究人员、产品负责人和企业场景入口。

谁在做全双工语音 Agent?
国内哪些团队在做实时语音对话模型?
谁能把语音 Agent 接入客服系统?
OpenAI 音频模型团队有哪些华人?
哪些公司最需要 GPT-Live 这类能力?
关键人雷达

直接体验 AnyJob AI

点击按钮,直接体验 AnyJob AI。 需要更多信息或内测邀请码,可以联系 AI 产品顾问 Yola,微信:AnyhelperSophia。

人物合集

关键连接 001 期主要人物汇总

点击按钮,一次查看 GPT-Live 事件图谱、核心人物报告和中国实时语音对话模型圈层。

转发给正在关注 AI 语音、客服 Agent 和实时多模态模型的朋友:GPT-Live 发布后,语音会成为新一代 Agent 入口。接下来值得追的,正是这些把模型接进真实场景的人。         
© AnyJob AI|关键连接 001 期|基于公开报道以及 AnyJob AI 关键人雷达获得的人物图谱调研整理。

来源

• OpenAI 官方发布页:Introducing GPT-Live / GPT-Live 中文发布页,发布于 2026 年 7 月 8 日。

• OpenAI Deployment Safety Hub:GPT-Live System Card,发布于 2026 年 7 月 8 日。

• OpenAI:Introducing our next-generation audio models,用于核对 Yi Shen、Junhua Mao 等音频模型研究信息。

• arXiv:Qwen3-Omni Technical Report,用于中国实时语音对话模型部分的技术参照。

关键连接 001 期|本文基于公开报道以及 AnyJob AI 关键人雷达获得的人物图谱调研整理。

来源

AnyJob AI 微信公众号已发布原文

GPT-Live 发布,背后都有谁?,发布于2026年07月10日。

相关文章

从内容洞察,到关键连接

发现值得关注的公司或赛道?继续找到背后的关键人

用一句话描述你的目标,搜索潜在合作伙伴、投资人、专家与圈子入口,查看推荐理由、公开动态和潜在引荐路径。