返回 AI Index 2026 总览

章节 02

技术性能

Stanford 展示的是一个性能继续上升、但测量体系正在失稳的领域:基准快速饱和,差距收窄,而失败模式仍然是不均匀而非线性的。

为什么重要

如果基准测试的有效窗口继续缩短,那么单纯比较分数会越来越不够,可靠性、成本和领域适配性会变得更关键。

如何运用

这章最适合被读作对"谁是最佳模型"这种简单思维的提醒:能力增长是真实的,但测量噪声和任务不均衡也同样真实。

核心信号

核心信号

性能在持续进步,但两个信号让解读变得复杂:基准测试饱和速度超过了替换速度,而模型的优势也呈现出不均匀、难以预测的特点。

基准测试正在更快饱和

前沿模型在 Humanity's Last Exam 上一年内提升了 30 个百分点,使得一个基准真正有决策价值的时间窗口迅速缩短。

智能很强,但依然不均匀

一个模型可以拿到 IMO 金牌级成绩,却仍然只能大约一半时间正确读懂模拟时钟。Stanford 用这个例子说明能力前沿的"锯齿型"特征。

精选数据点

精选数据点

从 Stanford 官方章节材料中提炼出的数字和对比。

信号数值上下文
Humanity's Last Exam 提升+30 pts前沿模型在一年内提升了 30 个百分点。
Arena Elo 顶层集群1,503 to 1,481截至 2026 年 3 月,Anthropic、xAI、Google 和 OpenAI 之间只相差 25 个 Elo 点以内。
闭源与开源差距3.3%到 2026 年 3 月,最佳闭源模型领先最佳开源模型 3.3%,高于 2024 年 8 月的 0.5%。
中美顶尖模型差距2.7%截至 2026 年 3 月,美国最强模型仅领先中国最强模型 2.7%。
基准题目无效率区间2% to 42%Stanford 引用的错误或无效题比例,从 MMLU Math 的 2% 到 GSM8K 的 42% 不等。

影响与启示

  • 榜单分差收窄后,竞争重心会转向成本、稳健性和领域可信度。
  • 基准设计本身正在变成一种战略能力。
  • 高分并不意味着可以跳过面向具体任务的生产验证。