OpenAI于周四正式在全球范围内推出其最新旗舰人工智能模型GPT-5.6。该模型共有三个版本,分别命名为Sol、Terra和Luna。由Sam Altman领导的OpenAI证实,此次发布之前,该模型已面向一小部分美国合作伙伴进行了为期13天的限制性访问。在获得特朗普政府的批准后,OpenAI决定扩大访问权限。由于该模型在网络安全和其他敏感领域拥有先进的功能,因此特朗普政府要求事先进行安全审查。
这款新模型被誉为OpenAI 历史上最强大的模型,在编程、计算生物学和网络安全方面均有显著提升。该公司将 GPT-5.6 系列分为三个层级:旗舰版 Sol;适合日常工作的均衡之选 Terra;以及速度最快、价格最实惠的 Luna。价格根据模型不同而有所差异,Sol 的入门价格为每百万代币 5 美元,退出价格为 30 美元;Terra 的入门价格为每百万代币 2,50 美元,退出价格为 15 美元;Luna 的入门价格为每百万代币 1 美元,退出价格为 6 美元。
性能和基准
在 OpenAI 发布的测试中,Sol 在 Terminal-Bench 2.1 测试中取得了 88,8% 的成绩,该测试旨在评估真实世界的命令行工作流程。在 Ultra 模式下(该模式可并行协调四个子智能体),Sol 的得分提升至 91,9%。这些数据超过了人因模型,例如 Claude Opus 4.8(78,9%)和 Fable 5(83,4% 至 84,3%)。在智能体编码任务中,Sol 的表现也优于其他竞争者。然而,在 SWE-Bench Pro 测试中(该测试旨在评估解决真实 GitHub 问题的能力),Claude Fable 5 以 80,3% 的成绩略胜一筹,而 GPT-5.5 的成绩为 58,6%。
根据 ExploitBench 的数据,在网络安全领域,Sol 仅使用了同类模型三分之一的退出令牌,就展现出了强大的竞争力。OpenAI 声称该模型能够识别 Chromium 和 Firefox 等浏览器中的漏洞,尽管它尚未独立生成完整的漏洞利用程序。该公司坚持认为,GPT-5.6 Sol 并未超过其在“网络安全准备框架”中的“网络关键”阈值,因此采取额外的安全措施是合理的。
安全和政府控制
OpenAI 发布了 GPT-5.6,配备了迄今为止最强大的安全堆栈,包括实时分类器、账户级审查以及一个自动化网络组队系统,该系统消耗了相当于超过 700.000 万小时 A100 GPU 的处理能力。该公司与特朗普政府官员(包括霍华德·卢特尼克和斯科特·贝森特)合作,在公开发布前验证了安全声明,这与OpenAI 向美国政府提议在管理人工智能收益方面持有股份的做法类似。奥特曼表示,这种发布前审查不应成为常态,因为它会给人一种技术不可信的印象。
地缘政治环境也影响了此次发布。欧盟和其他地区曾对最先进模型的访问权限受限表示担忧,这些模型最初仅供美国合作伙伴使用。OpenAI 的竞争对手 Anthropic 也曾因其 Mythos 系列面临类似的限制。如今,在获得华盛顿的批准后,GPT-5.6 正逐步在全球范围内推广:ChatGPT Plus、Pro、Business 和 Enterprise 用户已经可以使用 Sol,而免费账户和 Go 账户则使用 Terra。
OpenAI 的其他新功能
除了 GPT-5.6,OpenAI 还发布了其新一代语音模型 GPT-Live。GPT-Live支持同时聆听和说话,从而实现自然流畅的对话。该模型在后台依赖 GPT-5.5 来处理复杂任务,并将于本周三起在 ChatGPT 的 Android、iOS 和网页版应用中推出。此外,基于 Codex 和 GPT-5.6 的全新桌面应用 ChatGPT Work 也已发布,目前适用于 Pro、Enterprise 和 Edu 套餐,Plus 和 Business 套餐即将推出。
简而言之,GPT-5.6 的发布标志着尖端人工智能竞赛的一个里程碑。OpenAI 押注于一系列模型,这些模型涵盖从日常任务到高难度工作的所有领域,并且都经过了前所未有的安全审查。该公司预计,随着代币价格持续下跌和功能不断增强,新一代模型将巩固其相对于 Anthropic 和其他竞争对手的地位。
