关闭广告

实测GPT-5 Pro:别被普通版骗了!Pro才是OpenAI真正的顶级模型

新智元2025-08-10 00:00:02444人阅读


新智元报道

编辑:定慧 桃子

【新智元导读】GPT-5的实测众说纷纭,那GPT-5最强的Pro版本表现如何?实测后,我们认为GPT-5 Pro有可能确实就是当下的最强模型。

GPT-5终于来了,全世界的眼睛都盯着它。

但是目前的评价嘛,却是毁誉参半。我们也赶紧上手深度实测了一波。

发现GPT-5这家伙,表现还真有点「飘忽不定」,猜测可能和那个叫「路由」功能有关。

但是,一旦切换到GPT-5 Pro模式,强制使用最强能力时。天呐!感觉是真的有点强。


废话不多说。我们直接上案例,看看它到底有多牛。以下所有实测Demo均由GPT-5 Pro出品。

GPT-5 Pro实测展示

1. 首先就是喜闻乐见的「前端能力」展示

我们让GPT-5 Pro制作了一个黑客帝国的风格的可调参数城市,附带一个控制面板。

不得不说,编程能力确实提升巨大。


在完整视频中,你能看到GPT-5的参数面板非常丰富,可以调节很多细节,这个直观上就比我们以前测试的所有例子都要好。

2. 看图求解数独

只需要1分钟10s中,完美解决数独问题。



3. 比大小变体

比较9.9和9.11已经有了变体形式,通过求解方程来进一步测试模型的推理和计算能力。


4. 时钟难题

GPT-5 Pro一开始也是认错的,但是只要提示词强调「短的是时针,长的是分针」,然后Bingo!

6个钟表5个完全正确,只有黄色时钟识别错误。

不过,红色钟表由于时针和分针里的太近,被认为是12点(实际11点55,非常接近)



作为对比,Gemini 2.5 Pro的识别错误率就非常的高,几乎全错,多次询问正确率依然不高。


5. IMO数学问题

IMO的问题虽然都是OpenAI和谷歌都解出来了1-5题,但是他们是用的都是特调参赛用模型。

使用GPT-5 Pro求解第一道题目,在近16分钟的思考后,也得出了正确答案。


并且给出了非常详细的答案。



6. GeoGuessr看图猜地址挑战

将GeoGuessr上的挑战,交给GPT-5 Pro。


GPT-5 Pro根据砖墙颜色、房屋风格、交通标志、植被等全方位的分析,2min判断这是南非。


可以进一步要求深入分析,具体经纬度在哪里。


这是最终的结果,确实就是南非。


网友已玩儿嗨

网友们也都玩出了花!

有人在实测后认为GPT-5 Pro确实是一个顶级模型,是最优秀的。

OpenAI在Pro版本上取得了巨大的进步!

Peter进行了12次测试。

结论是:没有任何其他模型能够匹敌,无论是OpenAI、Google、xAI还是Anthropic的模型。

所有这些测试都只用了 1-3 次尝试,输出结果确实非常出色。


沃顿商学院CS教授EthanMollick惊叹道,自己全程没有输出一行代码,就让GPT-5做出一个建筑生成器。

只需要重复一句话——改进它,就实现了如下的效果。


一个提示,可以单次生成「我的世界」克隆版。


类似奥特曼制作的鼓点音乐,网友也尝试了GPT-5创建旋律和可视化效果。

GPT-5氛围编程,直出一个社交模拟器。


在SVG图生成方面,GPT-5可以说达到了全新高度。

OpenAI科学家SebastienBubeck表示,「在OpenAI,团队已前后攻克了预训练和推理两大技术难题。

现在正在全力探索一套,能最大限度发挥两者协同效应的新技术体系。GPT-5仅仅是这个方向的第一步」。


GPT-5还能看图精准定位,网友将童年一张照片扔给ChatGPT,没想到它直接定位到一英里范围内。



硅谷爆红经济学家TylerCowen认为,GPT-5在专业领域表现远超o3,并称这是自己用过最出色的学习工具。


同样,在编程方面,OpenAI研究员SuvanshSanjeev表示,「GPT-5重新定义并拓展了不同规模模型的成本和智能边界」。


可以说。正如METR最新报告所指出的,AI的指数级增长仍未放缓。


GPT-5完成任务时长延伸了52%

GPT-5提示指南

各路大神都进行了实测,但是要想自己玩得好,还要看官方指南。

OpenAI自己出了官方指导手册「GPT-5 prompting guide」。


指南基于官方团队与早期测试者(如Cursor)的实践经验,总结了在不同场景下提升GPT-5输出质量的提示策略,涵盖智能体主动性调控、上下文收集优化、Responses API 的高效利用,以及在前端/全栈开发中的最佳实践。

OpenAI表示他们从规划到执行,尽可能的最大化编码性能。

比如前端开发,GPT-5 在训练中具备了出色的基准审美品味,同时拥有严谨的实现能力。

对于新应用,OpenAI建议使用以下框架和包,以最大程度地发挥该模型在前端方面的能力:

  • 框架:Next.js(TypeScript)、React、HTML

  • 样式/UI:Tailwind CSS,shadcn/ui,Radix 主题

  • 图标:Material Symbols、Heroicons、Lucide

  • 动画: Motion

  • 字体:San Serif、Inter、Geist、Mona Sans、IBM Plex Sans、Manrope

并且网友们也整了一套GPT-5的提示词范例。比如

1.深度推理与问题解决(Deep Reasoning & Problem-Solving)

先把问题拆解成清晰步骤,再输出答案,减少推理错误。

2.先批评再定稿模式(Critique Before Final Mode)

先完成初稿,再让GPT-5批评并修改,提升质量。

3.角色+目标+约束(Role + Objective + Constraints)

设定身份、目标和严格约束,让输出更贴合需求。

4.逐步加深(Progressive Deepening)

先给高层概述,再逐步深入细节,避免一次性信息过载。


彩蛋

被网友催的狠了,现在OpenAI已经把GPT-5之前的所有模型都放了出来。

快去看看你的ChatGPT里是否已经有了。


方法是进入设置并打开「显示传统模型」,就能在下拉菜单中看到之前的模型了。


同时,你也可以选择将颜色设置尊贵的「黑色」


参考资料:

https://cookbook.openai.com/examples/gpt-5/gpt-5_prompting_guide#collaborative-coding-in-production-cursors-gpt-5-prompt-tuning


版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

演员任敏生理期南极跳海,回船喝酒

失宠的小野猪 浏览 26 12-19

9年爱情长跑,3个孩子后妈,她终于被求婚了

Yuki女人故事 浏览 344 08-15

英特尔业务重组加速,计划分拆网络部门为独立公司

华尔街见闻官方 浏览 5993 07-26

15岁少年疑被骗柬埔寨用支付宝联系家人:你们闹去北京

大风新闻 浏览 5159 08-05

证监会对林清轩、华大北斗、巴奴国际、驭势科技等36家企业出具补充材料要求

财通社 浏览 107 08-25

3艘美国军舰最快今日抵达 委内瑞拉全国征兵超450万人

每日经济新闻 浏览 158 08-24

上汽通用五菱与华为深化合作 首款车宝骏华境S亮相

网易汽车 浏览 58 09-08

济南时报:韩国主帅表决心定要击败中国队 明晚男篮将帅切莫大意

直播吧 浏览 4740 08-13

美国微软公司:10月14日起Windows 10将“停服”

财闻 浏览 42 10-13

尹锡悦拒捕现场披露:僵持140分钟 尹锡悦"强烈抵抗"

红星新闻 浏览 5613 08-02

海上无人作战方队驶过天安门广场

新华社 浏览 53 09-04

被收39%高关税 瑞士联邦主席:特朗普在最后通话中大怒

红星新闻 浏览 3422 08-05

更衣室事件发生后,马赛老板发声:我支持并信任马赛的管理层

懂球帝 浏览 83 08-23

美媒:苏-57与F-22或在阿拉斯加空域首次正面相遇

环球网资讯 浏览 4090 08-16

白宫又爆丑闻:为特朗普老婆拍片烧7500万

你得漂亮 浏览 3 01-28

结束亚洲杯张子宇98字总结!大谈学习,强调遗憾,感谢队内帮助!

篮球资讯达人 浏览 9696 07-21

奔驰全新纯电 CLA 车型开启预订:续航达 866 公里,本土辅助驾驶

IT之家 浏览 8804 08-02

29.2万辆!难怪比亚迪9月跟“疯了”一样,原来是给这几天憋大招

小李车评李建红 浏览 66 10-09

罗马诺:贝蒂斯拒绝斯图加特对阿尔蒂米拉的报价,认为其潜力巨大

直播吧 浏览 78 08-27

邮报:水晶宫上诉至国际体育仲裁法庭,8月11日公布裁决结果

直播吧 浏览 6601 07-31

鲁加尼告别图多尔:真正的男人,永不言弃,谢谢您的一切

懂球帝 浏览 30 10-29
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除沪ICP备20017958号-3