Archive Vol · VOL-0119 · AI 协同实验室

GPT-5发布!全球顶尖团队的低级失误为什么没办法避免?

2025年8月9日 3 min read 22 次阅读 原始公众号链接

迫近的任务占据了全部注意力资源 → 大脑“自动屏蔽”其他信息 → 产生可避免的低级错误。

阅读 22

郭敬恒 2025年8月9日 09:14

GPT-5发布了,我也来说说我的观点。真正强大的工具,这是毋庸置疑的,我希望身边所有人都能用起来。

其次,这次发布会现场,除了解读哪些强大的能力之外,也一些多槽点。

今天我们不是来无脑夸GPT的,我们来详细分析一下,为什么人们会犯低级错误?而且越是在高压、稀缺情境下,这种细节失误反而更容易发生。

在GPT-5发布会上,居然出现了一个让人匪夷所思的低级失误——在展示编程能力测试成绩时,“不经过思考”的GPT-5版本准确率为52.8%,而上一代o3版本是69.1%,可在柱状图上,52.8%竟比69.1%画得更高更壮观。更离谱的是,同一张图里,o3的69.1%和4o的30.8%,柱子的高度竟然一模一样。

Image

这种错误,在国内恐怕初中生都不至于犯,却堂而皇之地出现在一家全球顶尖AI团队的重磅发布会上。要知道,这些核心成员中,任何一个如果被Meta的扎克伯格挖走,年薪都可能过亿美金。

更让人恍惚的是,这并非孤例。马斯克的xAI发布会上,也曾出现过类似的图表失真。面对这样一场全球瞩目的盛会,他们内部难道没有任何人逐一复核细节?甚至,他们为什么没有干脆让GPT-5自己检查一下PPT呢?

那么为什么这种低级错误会出现在顶级AI团队的发布会上?

这种事情并不是“他们数学没学好”,而是 心理和认知机制在高压情境下的产物 。我们从管窥效应的角度来仔细分析。

首先,在准备这种面向全球级别的发布会发布之前,团队的工作在场景、时间、精力、注意力等方面全都是高压的、稀缺的。团队的焦点往往被迫集中在 核心信息传递 (如“GPT-5能力提升”“技术亮点”)上,这就会导致在视觉细节、数据比例等“非核心”在他们的感知中优先级下降。

而且,这种时候,大脑自动聚焦在眼前最迫切的目标(让产品亮点被观众记住),忽略其他重要但看似“次要”的细节(比如柱状图比例的严谨性)。

为什么会这样呢,这是因为“目标抑制机制”的原因,详细来说就是,当一个目标占据了认知资源(比如赶工完善Demo、打磨演讲稿),其他竞争目标(如数据复核、美学与准确性平衡)会被自动抑制。于是,数据比例错误这种事,即便有人“看到”,也可能被忽略,或者被下意识认为“不重要,先不管”。

这种错误初中生就不会犯,但在顶尖团队里会是经常发生。很多人又要开始吐槽这个世界是草台班子了,这话我们姑且不论。

这种现象的发生其实也是“专家型错误”的一种,也就是说,在现实中,一般初学者比如在画柱状图时,会小心翼翼地对比例进行核对。而专业人士在习惯化的任务中,容易依赖 经验自动化 ,并假设自己和团队的流程足够可靠。

而且一旦进入高压和时间稀缺的情境,专家也会失去 元认知警觉 ,即对“我可能犯错”的警惕。这就和开高速的老司机打瞌睡类似:并不是技术不行,而是过度依赖习惯 + 隧道视野,让细节溜走了。

这种心理机制可以解释很多日常低级错误:

比如写文章赶稿 ,聚焦在段落逻辑,却没发现标题错别字;做项目赶进度,只盯关键功能,忘了检查配置文件里的过期参数;在出差的时候忙着赶火车,忘了带身份证。

他们共同模式是:

迫近的任务占据了全部注意力资源 → 大脑“自动屏蔽”其他信息 → 产生可避免的低级错误。

要防止这种失误,光靠“更细心”没用,因为目标抑制是无意识发生的。
更有效的方法是:

  1. 建立“第二层检查机制” :让不在核心任务隧道中的人来复核(fresheyes原则)。
  2. 强制时间缓冲 :即使赶工,也留出1-2小时“冷却”,再回头看细节。

所以,先不去纠结这个世界究竟是不是个草台班子,可以肯定的是——它真的很有趣。每一个细节里都可能藏着意想不到的故事,而每一个问题背后也总能找到答案。有些错误确实是不认真导致的,但很多问题也不是仅仅靠认真就能解决的

GROWTH LAYER

生长批注

0 条

选中正文,在右侧留下批注。

还没有批注。

DISCUSSION

文章评论

0 条

批注针对原文,评论讨论整篇文章。所有评论都会直接发布。

    还没有评论,欢迎留下第一个想法。