首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >GPT-5.5正式发布:王者归来了?

GPT-5.5正式发布:王者归来了?

作者头像
用户11563501
发布2026-06-23 13:48:43
发布2026-06-23 13:48:43
5320
举报

继Image-2爆火网络,碾压nano banana后,OpenAI今日正式推出GPT-5.5,各项技术参数全面领先。官方将其定义为"用于实际工作和驱动智能体的新型智能类别",标志着AI从辅助工具向自主工作伙伴的转变。

智能体编程:从执行到理解系统架构

GPT-5.5在多个基准上刷新了纪录:

  • Terminal-Bench 2.0(复杂命令行工作流测试)82.7%
  • OSWorld(真实计算机环境操作)78.7%
  • GDPval(行业专家产出质量)84.9%

数学和科研领域的提升更显著。FrontierMath Tier 4从GPT-5.4的27.1%跳到35.4%。

但更关键的是,它展现出对复杂系统的深层理解能力。Every创始人Dan Shipper分享了一个典型案例:在应用发布后出现问题时,他花费数天调试无果,最终请来顶尖工程师重写部分系统。为测试GPT-5.5,他"倒回时钟"让模型查看损坏状态,结果GPT-5.5成功生成了与工程师最终决定相同的重写方案,而GPT-5.4无法完成这一任务。

"这是我使用过的第一个具有真正概念清晰度的编码模型,"Shipper评价道。

MagicPath CEO Pietro Schirano也见证了类似突破:GPT-5.5将包含数百个前端和重构更改的分支合并到同样发生重大变化的主分支中,仅用约20分钟就一次性解决了所有工作。

知识工作:从信息处理到自主决策

GPT-5.5在文档生成、电子表格和幻灯片制作方面表现优于前代。当结合Codex的计算机使用技能时,模型能够真正"与您一起使用计算机":查看屏幕内容、点击、输入、导航界面,并在工具间精确移动。

OpenAI内部已将这些优势应用于实际工作流。超过85%的员工每周使用Codex,涵盖软件工程、财务、通信、市场营销等多个职能部门。

  • 通信团队:分析六个月演讲请求数据,建立评分和风险框架,验证自动化Slack代理
  • 财务团队:审查24,771份K-1税表(总计71,637页),比前一年提前两周完成任务
  • 市场团队:员工自动化生成周度业务报告,每周节省5-10小时

在ChatGPT中,GPT-5.5 Thinking为更困难的问题提供更快帮助,答案更智能、更简洁。GPT-5.5 Pro则在业务、法律、教育和数据科学领域表现尤为突出。

科学研究:从回答问题到推动发现

GPT-5.5在科学和技术研究工作流上显示出进步,这需要的不仅仅是回答难题。研究人员需要探索想法、收集证据、测试假设、解释结果并决定下一步尝试什么。

在GeneBench(遗传学和定量生物学中的多阶段科学数据分析评估)上,GPT-5.5相比GPT-5.4有显著改进。这些问题的复杂性相当于科学专家多天的项目工作量。

更令人印象深刻的是,GPT-5.5帮助发现了关于Ramsey数的新证明,这是组合数学中的核心对象。该证明后来在Lean中得到验证,展示了GPT-5.5不仅提供代码或解释,还能在核心研究领域贡献令人惊讶且有用的数学论证。

波兰亚当·密茨凯维奇大学数学助理教授Bartosz Naskręcki使用GPT-5.5在11分钟内从单一提示构建了代数几何应用,可视化二次曲面交点并将结果曲线转换为Weierstrass模型。

Codex浏览器交互能力:从阅读到操作

随着GPT-5.5的推出,Codex现在能够更有效地在浏览器、文件、文档和计算机应用中完成工作。OpenAI显著扩展了浏览器的使用能力,使Codex可以与Web应用交互、测试流程、点击页面、捕获截图,并根据所见内容迭代直到完成任务。

技术社区对此反应热烈。aipulsedaily指出:"'根据所见内容迭代'是关键短语。截图结果、视觉识别错误、修复、重复。这正是开发者实际需要的前端测试循环。"

性能与效率的双重突破

GPT-5.5在Artificial Analysis的10项核心评估中拿下5项第一,60分的综合成绩比Claude Opus 4.7和Gemini 3.1 Pro Preview高出3分。

在保持与GPT-5.4相同每token延迟的同时,GPT-5.5在几乎所有评测中都表现更好。更重要的是,它在完成相同Codex任务时使用的token数量显著减少,使其既更高效又更强大。

下一代推理效率:模型自我优化

在GPT-5.4延迟时服务GPT-5.5需要重新考虑推理作为一个集成系统,而非一组孤立的优化。GPT-5.5是为NVIDIA GB200和GB300 NVL72系统兼容设计、训练和服务的。

Codex分析了几周的生产流量模式,并编写了自定义的调度算法来最优地分区和平衡工作。该努力产生了超出预期的影响,将token生成速度提高了20%以上。

增强网络安全保护

为了应对智能体在查找和补丁安全漏洞方面的能力提升,OpenAI采取了多重安全措施:

  • 部署行业领先的安全保护:为更高风险活动、敏感网络请求设计了更严格的控制
  • 扩大访问以加速网络防御:通过网络信任访问,从Codex开始,包括扩大对GPT-5.5高级网络安全能力的访问
  • 与政府合作保护关键基础设施:一起探索高级AI如何支持受信任官员的防御工作

OpenAI将GPT-5.5的生物/化学和网络安全能力视为高级风险。虽然GPT-5.5没有达到临界网络安全能力水平,但评估和测试表明其网络安全能力比GPT-5.4有所提升。

可用性与定价策略

今天,GPT-5.5正在向ChatGPT和Codex的Plus、Pro、Business和Enterprise用户推出。

API定价细节:

  • gpt-5.5:输入token每100万5,输出token每100万30
  • gpt-5.5-pro:输入token每100万30,输出token每100万180
  • Fast模式:生成token速度提高1.5倍,成本为2.5倍

虽然GPT-5.5的定价高于GPT-5.4,但它既更聪明又更加token高效。在Codex中,OpenAI已经细心调整体验,以便GPT-5.5为大多数用户使用更少的token获得更好的结果。

技术社区的反响

Cursor联合创始人兼CEO Michael Truell表示:"GPT-5.5明显比GPT-5.4更聪明、更持久,具有更强的编码性能和更可靠的工具使用。它在没有提前停止的情况下保持任务的时间显著更长,这对我们用户委托给Cursor的复杂、长期运行的工作最为重要。"

NVIDIA企业AI副总裁Justin Boitano补充:"GPT-5.5提供了执行密集型工作所需的持续性能。构建和服务于NVIDIA GB200 NVL72系统上,该模型使我们的团队能够从自然语言提示中发布端到端功能,将调试时间从几天缩短到几小时,并将数周的实验转化为复杂代码库中的隔夜进展。"

从能力分数到完成率的转变

随着GPT-5.5的推出,单次提示的时代似乎正在过去。智能体工作流将成为新的标准,而完成率而非能力分数,将成为衡量AI实际价值的关键指标。

正如一位开发者评论:"每个初创公司高管读到这个都会批准一个项目,现在每个任务可以调用10倍以上的API,因为基本上免费了。"

模型质量在狭窄范围内趋于平稳,但完成率在整个工作流中复合增长。GPT-5.5的发布标志着AI正从"有多聪明"向"有多少任务可以在无需人工干预的情况下端到端完成"的根本性转变。

参考:

https://artificialanalysis.ai/models/gpt-5-5

https://openai.com/index/introducing-gpt-5-5/

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-04-24,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 智能体编程:从执行到理解系统架构
  • 知识工作:从信息处理到自主决策
  • 科学研究:从回答问题到推动发现
  • Codex浏览器交互能力:从阅读到操作
  • 性能与效率的双重突破
  • 下一代推理效率:模型自我优化
  • 增强网络安全保护
  • 可用性与定价策略
  • 技术社区的反响
  • 从能力分数到完成率的转变
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档