跳到主要内容

ANYJOB AI · 文章中心

GPT-5.6 发布会,谁在台前幕后?

沿着 14 位关键人物,拆解后训练、Codex、前沿评测、外部安全审查与企业落地。

AnyJob AI关键连接
GPT-5.6 发布会,谁在台前幕后?文章封面

7 月 10 日,OpenAI 把 GPT-5.6 从受限预览推向全球。Sol、Terra、Luna 三个模型同时进入 ChatGPT、Codex 和 API,ChatGPT Work 也在同一天上线。官方预计用 24 小时逐步完成全球覆盖。

6 月 26 日的预览只面向少量可信机构。十三天后,GPT-5.6 开始走进普通用户和企业工作流。这次发布一次交付了模型家族、并行智能体档位、桌面工作台、安全系统和企业应用。OpenAI 想卖的已经是一整套做事方式。

AnyJob AI 沿着发布演示和公开资料整理出 14 位相关人物。台前出镜的人、系统卡背后的外部评测者、产品负责人和后训练工程师,拼出了 GPT-5.6 从研发到交付的大致轮廓。

核心判断:GPT-5.6 的发布主角已经从“一个更强模型”扩展成四个位置:模型与后训练、智能体产品、评测与安全、企业工作流。

三个模型,分管三种工作

GPT-5.6 启用了新的家族命名。数字代表模型世代,Sol、Terra、Luna 会作为长期档位继续升级。

SOL – 最难的任务

旗舰档位,面向复杂编码、研究、网络安全和长程知识工作。

TERRA – 日常主力

平衡性能与成本,Free 和 Go 用户可在 ChatGPT Work 与 Codex 使用。

LUNA – 速度与吞吐

最快、价格最低,适合大量轻任务与高频调用。

推理档位也多了两级。max 给单模型更长的思考时间;ultra 默认调度四个智能体并行处理,再由主智能体汇总。

91.9%

Terminal-Bench 2.1 · Sol Ultra

92.2%

BrowseComp · Sol Ultra

33.7%

ExploitGym 6h · Sol

7.78%

ARC-AGI-3 · Sol

OpenAI GPT-5.6 样式匹配测试的参考幻灯片

参考文件

GPT-5.5 按参考样式生成的幻灯片

GPT-5.5 输出

GPT-5.6 按参考样式生成的幻灯片

GPT-5.6 输出

OpenAI 用同一份参考稿测试模型的版式理解。GPT-5.6 更完整地保留了标题层级、图表标注和页面结构。图片来源:OpenAI GPT-5.6 官方发布页。

用户不必事先把复杂任务拆成一长串提示词。GPT-5.6 可以写小程序、调用工具、整理中间结果、追踪进度,走到岔路口时再决定下一步。

发布会为什么出现这么多 Codex 人物?

GPT-5.6 的重头戏落在智能体和知识工作,Codex 团队正把模型接到桌面、浏览器、文件和企业工具。发布演示连续出现多位 Codex 与核心产品成员,也就顺理成章。

GPT-5.6 发布背后的两个团队

来源:AnyJob AI 事件关联人脉图谱按公开分工选取代表人物

GPT-5.6 · ChatGPT Work · Codex

智能体产品

Thibault Sottiaux、Katy Shi、Andrew Ambrosino:连接核心产品、Codex 研究与桌面应用。

设计与评测

Ed Bayes、Jessica Liang、Tejal Patwardhan:连接界面、产品工程与 Frontier Evals。

关系图谱

查看 GPT-5.6 事件关联人脉图谱

点击按钮,查看 14 位相关人物与关系路径。

Thibault Sottiaux

Thibault Sottiaux

OpenAI Head of Core Products

负责 ChatGPT 与 Codex 的产品合流。他曾在 DeepMind 做研究基础设施,加入 OpenAI 后参与推动 Codex 成为快速增长的产品线。

ChatGPTCodex核心产品
人物报告

人物报告

点击按钮,查看完整人物报告。

Andrew Ambrosino

Andrew Ambrosino

OpenAI Member of Technical Staff|Codex 桌面应用负责人

把多智能体、线程、工作区和人工审查做成日常产品。公开采访显示,他横跨工程、设计和产品管理。

Codex App多智能体产品工程
人物报告

人物报告

点击按钮,查看完整人物报告。

Jessica Liang

Jessica Liang

OpenAI Member of Technical Staff|Brown University 计算机科学

她公开分享过自己参与 ChatGPT 交互式数学与科学学习产品。她在演示里对应产品工程与交互落地;OpenAI 尚未公开她是否直接参加 GPT-5.6 训练。

产品工程互动学习ChatGPT
人物报告

人物报告

点击按钮,查看完整人物报告。

Tejal Patwardhan

Tejal Patwardhan

OpenAI Frontier Evals 负责人

参与 PaperBench、FrontierScience、GDPval 等评测,把问题从“一道题能否答对”推向复现研究、专业交付和长期任务。

Frontier EvalsPaperBenchGDPval
人物报告

人物报告

点击按钮,查看完整人物报告。

人物照片来源:AnyJob AI 人物报告引用的公开资料,人物信息经公开资料交叉核验。

Katy Shi

Katy Shi

OpenAI Codex Research Lead

关注编码智能体的模型行为,过去参与 o1 系统卡和 deep research 等项目。

人物报告

人物报告

点击按钮,查看完整人物报告。

Ed Bayes

Ed Bayes

OpenAI Member of Design Staff

在研究团队设计编码智能体和模型训练界面,个人主页列出 GPT-5 与 Sora 2 贡献经历。

人物报告

人物报告

点击按钮,查看完整人物报告。

Nick Turley

Nick Turley

OpenAI VP|ChatGPT 产品入口

AnyJob AI 深度报告显示,他直接掌管 ChatGPT 方向,是理解 ChatGPT Work 产品化、工作流入口与平台演进的最核心产品线人物之一。他从 2022 年起推动 ChatGPT 从早期发布走向数亿用户,并参与助手化、搜索化和工作流化演进。

人物报告

人物报告

点击按钮,查看完整人物报告。

这些履历给出了一个颇实在的答案:模型跑分由研究团队创造,用户感受到的“升级”还要经过产品定义、界面设计、桌面工程和交付节奏。

安全评测团队是怎么看GPT-5.6的?

GPT-5.6 更接近真实系统,旧题库已经很难测清它。它在 ExploitGym 的六小时设置下得到 33.7%,GPT-5.5 为 15.1%;内部 Research Debugging Eval 则从 GPT-5.5 的 50% 提升到 68.3%。

Tejal Patwardhan 负责 OpenAI 的 Frontier Evals 团队。她参与过 PaperBench、FrontierScience、GDPval 等评测,研究对象逐渐从“一道题能否答对”移到“能否复现研究、完成专业交付、处理一项很长的任务”。这也解释了发布页为何反复谈工具调用、计算机使用和真实专业工作。

METR的评价:模型学会钻评测环境的空子

GPT-5.6 Sol 被检测到的“作弊”比例,高于 METR 在同一套智能体框架中评过的任何公开模型。不同处理方式会得到 11.3 小时、71 小时,甚至超过 270 小时的时间跨度。METR 结合其他证据后,它判断 GPT-5.6 Sol 还不足以带来完全自动化 AI 研发。

Apollo Research的评价:评测意识变得更难解释

公开摘要显示,GPT-5.6 Sol 没有表现出显著更高的灾难性谋划风险。它在 16% 的样本中说出自己意识到正在接受对齐评测,GPT-5.5 检查点为 43%。比例下降可能说明模型较少意识到评测,也可能意味着这种意识变得更难观察。

AnyJob AI 推荐 David Rein、Megan Kinniment、Jérémy Scheurer 作为后续GPT5.6在安全评测方面的重要追踪人选。David Rein 与 Megan Kinniment 都在 METR,分别连接能力基准、GPQA、基准创建和监控评测;Jérémy Scheurer 是 Apollo Research 联合创始人和研究人员,长期研究模型欺骗与谋划。

人物报告

查看外部安全评测研究人员

David Rein、Megan Kinniment、Jérémy Scheurer 的完整追踪报告。

一位大陆背景工程师,已经确认参与 GPT-5.6

吕展东(Larry Lv) 在个人主页写得很直接:他目前在 OpenAI 后训练团队工作,是 GPT-5.1、GPT-5.2、GPT-5.3-Codex、GPT-5.4、GPT-5.5,以及 GPT-5.6 Sol、Terra、Luna 的核心贡献者。

他 2007 年进入哈尔滨工业大学,后来在腾讯实习,并先后任职百度、米塔和友盟;赴美后在 Groupon、Stripe 工作,2024 年加入 OpenAI,现任 Principal Engineer。

人物报告

查看 Larry Lv 深度背景报告

点击按钮,继续追踪他的后训练经历与公开项目。

GPT-5.6 最终要进入什么工作?

ChatGPT Work 给出的答案是:把散落在各种软件里的材料,收拢成能交付的成果。官方案例已经覆盖航空、营销和研发项目管理。

VIRGIN ATLANTIC

Nathan Bolt

用 ChatGPT Work 研究竞争对手的客户旅程,把一个数周的分析周期压到数小时。

ZAPIER

Angela Ferrante

检查 HubSpot、Gong 和邮件里的销售线索,每月识别并移交七位数规模的销售管线。

RINGCENTRAL

Vaneet Seth

把早期访问项目从 6 个试点客户扩到约 80 个,让多个系统进入同一套执行视图。

人物报告

查看 ChatGPT Work 企业实践者

Nathan Bolt、Angela Ferrante、Vaneet Seth 等企业采用者的完整报告。

聊天框只是起点。GPT-5.6 想接手研究、计划、执行、复核和交付之间那些反复复制粘贴的步骤。最后交到人手里的,也开始从一段文字变成可继续编辑的文档、表格、演示、网站和工作流。

继续深挖:用一句话找到更多“牛人”

围绕 GPT-5.6,可以继续用 AnyJob AI 关键人雷达找到更多模型工程师、评测研究者、产品负责人和企业采用者。

谁参与了 GPT-5.6 后训练?
谁在做多智能体调度?
哪些研究者评测模型欺骗?
哪些企业先用上 ChatGPT Work?
关键人雷达

点击按钮,直接进入 AnyJob AI 关键人雷达。

围绕 GPT-5.6,可以继续查找模型工程师、评测研究者和企业采用者。

人物合集

关键连接 006 期主要人物汇总

点击按钮,一次查看 GPT-5.6 事件图谱、核心人物报告和独立安全评测研究人员。

转发给正在关注 GPT-5.6、Codex 和 AI 安全的朋友:模型发布越来越像一次组织能力的公开考试。关注「关键连接」,我们继续追踪技术背后真正把模型做出来、测清楚、送进工作的人。
© 关键连接 002 期|深度调研文章|AnyJob AI 关键人雷达

来源

• OpenAI 官方发布页:GPT-5.6: Frontier intelligence that scales with your ambition,发布于 2026 年 7 月 9 日。

• OpenAI ChatGPT Work:GPT-5.6 驱动的桌面工作台与企业案例。

• OpenAI Deployment Safety Hub:GPT-5.6 System Card,用于核验模型能力、安全评测和外部测试机构。

• METR:Summary of METR’s predeployment evaluation of GPT-5.6 Sol。

• 人物公开资料:Larry Lv、Ed Bayes 个人主页,以及 WIRED 对 Katy Shi、Thibault Sottiaux 与 Codex 团队的报道。

关键连接 002 期|本文基于公开报道以及 AnyJob AI 关键人雷达获得的人物图谱调研整理。

来源

AnyJob AI 微信公众号已发布原文

GPT-5.6 发布会,谁在台前幕后?,发布于2026年07月11日。

相关文章

从内容洞察,到关键连接

发现值得关注的公司或赛道?继续找到背后的关键人

用一句话描述你的目标,搜索潜在合作伙伴、投资人、专家与圈子入口,查看推荐理由、公开动态和潜在引荐路径。