首页
学习
活动
专区
工具
TVP
发布
精选内容/技术社群/优惠产品,尽在小程序
立即前往

OpenAI员工指责马斯克Grok 3基准测试结果具有误导性

三言科技2月24日消息,据报道,日前,OpenAI一名员工指责马斯克xAI发布的Grok 3模型基准测试结果具有误导性。而XAI联合创始人伊戈尔·巴布什金表示公司并无不当。

xAI 在其博客上发布了一张图表,展示了 Grok 3 在 AIME 2025(一项近期邀请制数学考试中的高难度数学题集)上的表现。图表显示,Grok 3 的两个版本 ——Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning—— 在 AIME 2025 上的表现超过了 OpenAI 当前最强的可用模型 o3-mini-high。

不过,OpenaI的员工指出,xAi的图标并未包含o3-mini-high在“cons@64”条件下的 AIME 2025 得分。“cons@64”是指“consensus@64”,即允许模型在基准测试中对每个问题尝试 64 次,并将出现频率最高的答案作为最终答案。

在 AIME 2025 的“@1”条件下(即模型首次尝试的得分),Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning 的得分低于 o3-mini-high。但是xAI仍然宣传Grok 3 是“最聪明的AI”。

对此,巴布金什回应称,OpenAI曾经也发布过类似的误导性基准测试图表。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OGFGGV9wdKeAFfb_DXdImE0g0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

扫码

添加站长 进交流群

领取专属 10元无门槛券

私享最新 技术干货

扫码加入开发者社群
领券