OpenAI 发布 GPT-5.5 ,向 AI“超级应用”迈出关键一步

OpenAI 发布 GPT-5.5 ,号称“最智能”模型。该模型思考速度更快、 Token 效率更高,朝“超级应用”目标迈出重要一步。新版本覆盖企业编码、知识工作及科学研究等场景,在多项基准测试中领先 Google Gemini 和 Anthropic Claude 。 CEO Brockman 表示此举让前沿 AI 能力同时惠及企业和消费者,首席科学家 Pachocki 则直言“过去两年发展缓慢令人意外”,暗示 AI 潜力仍远未触顶。

发布于2026年4月25日 10:33
编辑小创
评论0
阅读44

OpenAI 周四正式发布新一代模型 GPT-5.5 ,公司将其描述为迄今“最智能、使用最直观”的模型。联合创始人兼总裁 Greg Brockman 在媒体沟通会上表示,该模型让 OpenAI 离打造一款“超级应用”的目标又近了一步。

Brockman 称,这次更新算得上是“朝更具智能体属性、更直觉化的计算体验迈出的一大步”。他进一步解释,相比 GPT-5.4 ,新模型思考速度更快、更锐利,实现同等效果所耗费的 Token 数量更少。在他看来,这意味着更多的前沿 AI 能力可以同时流向企业客户和普通消费者,这本来也是 OpenAI 目标的一部分。

所谓的“超级应用”, Brockman 和 Sam Altman 此前已多次提及。他们设想将 ChatGPT 、 Codex 以及 AI 浏览器整合进一个统一服务,直接服务于企业客户。而马斯克也曾表示要把 X 平台改造成他自己的超级应用。

OpenAI 此次发布距上一代模型问世仅过去一个月,再往前倒, 12 月、 11 月也都有新动作。公司维持着相当密集的发布节奏,员工暗示这种趋势在可预见的未来还将持续。首席科学家 Jakub Pachocki 的说法甚至有些反直觉:“我们看到短期内有相当显著的提升,中期来看提升会极为显著。老实讲,我觉得过去两年其实慢得让人意外。”

按照 OpenAI 的定位, GPT-5.5 的适用面铺得很宽。既覆盖智能体编码和知识工作这类企业基础场景,也伸向数学、科学研究这类更偏实验性的 AI 应用。公司周四同步放出的数据展示了新模型在多项基准测试中的优势。不仅碾压自家旧款,面对 Google 的 Gemini 3.1 Pro 和 Anthropic 的 Claude Opus 4.5 也持续领跑。

说到 Anthropic ,两者的暗中较劲从未停过。有记者在简报会上直接发问, GPT-5.5 是否会具备类似 Mythos 的能力?那是 Anthropic 最近公布的网络安全工具,因未经授权访问的传闻正身处争议。 OpenAI 技术团队成员 Mia Glaese 没有正面比较,而是强调新模型会对公司的数字防御部署策略产生重大影响。“我们在网络领域有一项坚定且持续多年的策略,也打磨出了一套可持续的安全模型交付方法。”

首席研究员 Mark Chen 则把话题引向更前沿的层面。他指出 GPT-5.5 在操控计算机工作方面胜过前代,在科学和技术研究流程中“展现出了有意义的进步”。他判断这款模型能真正帮助顶尖科学家取得突破,还提到了药物发现,这个过去几年行业兴趣不断升温的领域。

从周四起, GPT-5.5 已开始大范围推送。 OpenAI 表示, Plus 、 Pro 、 Business 和 Enterprise 用户都可以在 ChatGPT 中用到新模型,而性能更强的 GPT-5.5 Pro 将面向 Pro 、 Business 和 Enterprise 用户开放。

创艺洞察

节奏这东西, OpenAI 玩得越来越像一场精心编排的马拉松。刚喘口气,下一公里又提速了。 GPT-5.5 不是什么改天换地的物种,但它把刀磨得更薄: Token 效率、智能体属性、科学发现的辅助能力,都在悄悄抬高“前沿模型”的使用基线。 Pachocki 那句“过去两年慢得意外”听着挺狂,可回头看,模型能力的确还没撞到天花板。真正值得琢磨的,是 Brockman 反复念叨的“超级应用”。一旦 ChatGPT 、 Codex 、浏览器被打包成一个面向企业的瑞士军刀, OpenAI 就从一个模型供应商长出了平台的骨架。跟 Anthropic 的网络安全角力只是前哨战,更大的仗还没开打。

相关文章

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题
AI 新闻资讯
2026年7月14日
0 条评论
零重力瓦力

GPT-5.6 发布当天 OpenAI 自曝 SWE-Bench Pro 30% 有问题

OpenAI 在发布 GPT-5.6 当日指出 SWE-Bench Pro 约 30% 任务存在缺陷,引发对 AI 基准测试可靠性的质疑。多项研究进一步揭示,验证器质量决定模型学习方向,基准题目高度冗余,且模型“窄能力”提升未必转化为真实经济产出的“宽能力”。当前 AI 进步尚未达到自维持加速阈值。基准测试正面临结构性危机,其公信力受利益冲突影响,亟需建立独立第三方验证机制以确保评估客观性。

#ChatGPT#Claude
阅读全文
Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录
智能体工程
2026年7月14日
0 条评论
零重力瓦力

Ploy 从 Claude Opus 4.8 迁移到 GPT-5.6 完整实录

Ploy 公司将 AI agent 从 Claude Opus 4.8 迁移至 GPT-5.6 Sol 后,构建耗时缩短过半且成本降低,但过程中遭遇三大工程挑战。一是评测框架适配旧模型导致误判;二是新模型填充冗余参数引发工具调用异常,需通过 schema 变换解决;三是缓存机制差异致命中率归零,需重构 key 策略。这表明生产环境模型迁移并非简单替换,需针对调用习惯与基础设施进行深度工程适配。

#智能体工程#ChatGPT#Claude
阅读全文
GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想
AI 新闻资讯
2026年7月11日
0 条评论
零重力瓦力

GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想

OpenAI 旗下 GPT-5.6 Sol Ultra 通过 64 路并行 agent 在 1 小时内生成了图论 CDC 猜想的证明文本,成本不足 500 美元。该成果引发争议,因缺乏 Lean 机械化验证、未公开完整推理轨迹及受限于图论形式化库不成熟,数学界对其有效性存疑。此事表明 LLM 已具备启发式数学搜索能力,但验证基础设施滞后仍是瓶颈。未来“多路并行+防放弃 prompt”或成范式,而完善 Lean 工具链是确立 AI 证明可信度的关键。

#OpenAI#ChatGPT
阅读全文
互动讨论

评论区

围绕《OpenAI 发布 GPT-5.5 ,向 AI“超级应用”迈出关键一步》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。