关闭广告

GPT-5第一波用户反馈:笨拙,还我4o

华尔街见闻官方2025-08-09 12:00:029610人阅读

OpenAI备受瞩目的新一代模型GPT-5在发布后遭遇了意想不到的初步反应,部分早期用户抱怨其表现“笨拙”,甚至不如前代产品。

许多用户表示,这款被誉为能将ChatGPT提升至“博士级专家”水平的新模型,在实际使用中却频频在简单的数学和拼写问题上出错,甚至会编造信息。有许多付费用户表达了失望情绪,甚至呼吁恢复使用其前代模型GPT-4o。

OpenAI首席执行官Sam Altman于周五迅速做出回应。他承认GPT-5的发布过程“坎坷”,并将用户体验不佳归咎于技术故障。Altman表示,一个负责根据用户提问自动选择不同复杂程度模型的“自动切换器”在发布当天大部分时间处于失灵状态,导致系统调用了较弱的模型,使得GPT-5看起来“笨拙得多”。

对OpenAI而言,此次发布的成败攸关重大。该公司不仅需要以此证明其在人工智能领域的持续领先地位,更需要说服企业和个人用户为其高级服务付费。这些收入对于抵消其在人才、芯片和数据中心等方面的巨额投入至关重要,而一个不稳定的开局无疑会为这一商业目标蒙上阴影。

“自动切换”机制引发困惑

此次用户负面反馈的根源,很大程度上指向了GPT-5底层一个全新的运行机制。与以往版本不同,GPT-5引入了一个“自动切换器”(autoswitcher),系统会根据用户查询的复杂程度,自动在不同等级的模型之间进行切换。OpenAI希望通过这种方式最大限度地优化其宝贵的计算资源。

然而,这种设计也意味着用户并非总能调用OpenAI最强大的技术。当该切换机制未能准确判断或出现故障时,用户的体验便会大幅下降。

一个测试案例生动地说明了这一点:当被问及单词“blueberry”中有几个字母“b”时,GPT-5最初给出了错误的答案“三个”。但在被提示“再想一想”之后,系统似乎调用了更高级的推理模型,最终给出了正确答案。这一机制的不透明性是用户感到困惑和不满的主要原因之一。

尽管负面反馈占据了社交媒体的头条,但GPT-5的早期评价呈现两极分化。部分专业人士在试用后给出了积极评价。开发者Simon Willison在一篇博客文章中称GPT-5是“我最喜欢的新模型”,认为它“能胜任工作”且“偶尔表现出色”,但也补充说,“它与我们之前拥有的模型没有本质上的区别”。

宾夕法尼亚大学沃顿商学院教授Ethan Mollick则对其研究、写作和简化编程的能力感到惊叹:

“GPT-5 只是自己做一些事情,通常是非凡的事情,有时是奇怪的事情,有时是非常人工智能的事情,这就是它如此有趣的原因。”
Altman承认首秀失误并承诺改进

面对汹涌的负面评价,OpenAI管理层试图平息用户的担忧。在周五于Reddit平台举行的“Ask Me Anything”(AMA)活动中,Altman坦承了发布初期的技术问题。他承诺,“从今天开始,GPT-5会显得更智能”。

他表示,OpenAI正在研究允许Plus付费用户继续使用GPT-4o的方案,并将为Plus用户提供双倍的使用速率限制,以鼓励他们更好地适应新模型。

“在我们完成推广后,我们将把 Plus 用户的速率限制提高一倍。”

此外,针对发布会上引发“图表犯罪”(chart crime)嘲讽的一张严重失准的图表,Altman在社交平台X上承认这是一个“巨大的图表失误”,进一步显示了此次发布的仓促与混乱。


根据用户排名的流行榜单LMArena,GPT-5在周五中午已升至多个类别的榜首。但另一个基准测试ARC-AGI-2则显示,GPT-5落后于xAI的最新版Grok模型。

GPT-5的此次发布正值人工智能领域竞争空前激烈的时刻,这使其表现出的任何不稳定性都备受关注。OpenAI正努力维持其近三年前由ChatGPT引爆的生成式AI热潮所带来的领先优势,而包括马斯克的xAI在内的竞争对手正穷追不舍。

对于每周拥有近7亿用户的ChatGPT而言,一个平稳、可靠的用户体验是维持其市场地位和证明其商业价值的关键。此次发布的波折,无疑对投资者和市场信心构成了一次考验。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

马上测丨充会员也不能免广告!实测:五款视频APP各有套路

澎湃新闻 浏览 7013 08-13

OpenAI确认旗下首款AI硬件今年发布,形态有望为“一支笔”

IT之家 浏览 13 01-21

金鸡奖开幕星光黯淡,周冬雨开场陈飞宇主持,网友感慨电影圈萧条

萌神木木 浏览 42 11-12

B费:我们获得了很多进球机会,可惜未能破门

体坛周报 浏览 2807 08-18

赖清德声称"安倍促成五眼联盟"遭批 新闻稿被悄悄修改

环球网资讯 浏览 90 09-26

波兰斥资38亿美元升级全部F-16战斗机

国际在线 浏览 6082 08-14

被两任妻子抛弃,与李媛媛情深缘浅,如今90岁焦晃仍想拍戏

娱乐白名单 浏览 1769 08-16

乔治亚理工和微软团队重磅推出:让AI推理更聪明的"思维开关"技术

科技行者 浏览 55 11-04

Win 11升级这个劫,我是非渡不可吗?

差评XPIN 浏览 4050 07-24

股市:开门红

小白读财经 浏览 16 01-05

外卖大战再升级 “集中式外卖厨房”能成新风口吗?丨新经济观察

封面新闻 浏览 315 07-23

王晶谈蔡少芬演《甄嬛传》:一直在消耗情怀

联友军事 浏览 7931 08-20

通大附院成功实施脑机接口技术,用科技唤醒失去的功能

扬子晚报 浏览 75 09-26

对话泛能网:三驾马车让能源进入无人驾驶新常态

网易科技报道 浏览 7123 08-06

雷军辟谣:小米SU3渲染图肯定是假的 目前还没有规划

太平洋汽车 浏览 14 01-08

伊萨克遭范德芬剪刀脚,伤病分析师:前者很大可能伤缺8-10周

懂球帝 浏览 21 12-21

刘亦菲内衣照被骂上热搜?神仙姐姐的性感穿搭惹了谁

Yuki女人故事 浏览 1141 07-01

PCH 芯片直吹降温:联想来酷斗战者战 7000 酷睿版预热

IT之家 浏览 9614 07-20

特朗普宣称"巴西是个糟糕的贸易伙伴" 巴西总统回应

国际在线 浏览 4809 08-15

拉莫斯:虽然浙江队实力很强,但我们最近的火力也很强盛

懂球帝 浏览 38 10-25

美元霸权换新“锚”?特朗普的《天才法案》与稳定币战略

澎湃新闻 浏览 889 07-28
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除沪ICP备20017958号-3