章节 02
技术性能
Stanford 展示的是一个性能继续上升、但测量体系正在失稳的领域:基准快速饱和,差距收窄,而失败模式仍然是不均匀而非线性的。
为什么重要
如果基准测试的有效窗口继续缩短,那么单纯比较分数会越来越不够,可靠性、成本和领域适配性会变得更关键。
如何运用
这章最适合被读作对"谁是最佳模型"这种简单思维的提醒:能力增长是真实的,但测量噪声和任务不均衡也同样真实。
核心信号
核心信号
性能在持续进步,但两个信号让解读变得复杂:基准测试饱和速度超过了替换速度,而模型的优势也呈现出不均匀、难以预测的特点。
基准测试正在更快饱和
前沿模型在 Humanity's Last Exam 上一年内提升了 30 个百分点,使得一个基准真正有决策价值的时间窗口迅速缩短。
智能很强,但依然不均匀
一个模型可以拿到 IMO 金牌级成绩,却仍然只能大约一半时间正确读懂模拟时钟。Stanford 用这个例子说明能力前沿的"锯齿型"特征。
精选数据点
精选数据点
从 Stanford 官方章节材料中提炼出的数字和对比。
| 信号 | 数值 | 上下文 |
|---|---|---|
| Humanity's Last Exam 提升 | +30 pts | 前沿模型在一年内提升了 30 个百分点。 |
| Arena Elo 顶层集群 | 1,503 to 1,481 | 截至 2026 年 3 月,Anthropic、xAI、Google 和 OpenAI 之间只相差 25 个 Elo 点以内。 |
| 闭源与开源差距 | 3.3% | 到 2026 年 3 月,最佳闭源模型领先最佳开源模型 3.3%,高于 2024 年 8 月的 0.5%。 |
| 中美顶尖模型差距 | 2.7% | 截至 2026 年 3 月,美国最强模型仅领先中国最强模型 2.7%。 |
| 基准题目无效率区间 | 2% to 42% | Stanford 引用的错误或无效题比例,从 MMLU Math 的 2% 到 GSM8K 的 42% 不等。 |
影响与启示
- 榜单分差收窄后,竞争重心会转向成本、稳健性和领域可信度。
- 基准设计本身正在变成一种战略能力。
- 高分并不意味着可以跳过面向具体任务的生产验证。