AI 战略 / 2 分钟阅读

OpenRouter Fusion:很适合深度研究,但还不足以证明普遍领先

Fusion 展示了编排层可以把深度研究能力抬高到什么程度,但仅凭 DRACO 的结果,还不足以支持更广泛的领先结论。

示意图:三个输入面板汇聚到一个中央合成器,生成一份综合输出简报。

在我看来,Fusion 是 OpenRouter 最近几个月里最值得关注的发布之一,原因很简单:它说明了编排层的重要性,几乎可以和模型本身一样关键。与此同时,它也暴露了另一面限制:DRACO 上的好成绩,确实能说明深度研究能力,但对编码、智能体、多模态以及高交互任务,说明得还远远不够。

2026 年 6 月 12 日的发布,以及 2026 年 6 月 14 日补充的 FAQ,正好把这两点都呈现出来。一方面,这是一个技术上说得通的产品。另一方面,它当前的叙事范围,仍然大于基准测试真正证明的范围。OpenRouter 发布文章

Fusion 实际上是怎么工作的

理解 Fusion 最有用的方式,不是把它当成一个新模型,而是把它看作一个运行在服务端的多模型编排层

当你向 openrouter/fusion 发送请求时,OpenRouter 会:

  • 并行地把提示词分发给一个模型面板
  • 为这些模型开启网页搜索和网页抓取
  • 收集不同模型的回答
  • 把所有结果交给一个“裁判”模型,比较共识、分歧与空白
  • 返回一份综合后的最终回答

这个细节会改变整个视角。问题不再只是“模型本身有多强”,而是“这个协调多个模型的系统到底额外创造了多少价值”。Fusion 真正有意思的地方就在这里:它首先是一种组合模式

这些分数真正说明了什么

DRACO 基准上,OpenRouter 公布了几组值得认真看的结果:

  • Fable 5 + GPT-5.5,由 Opus 4.8 综合,达到 69.0%
  • Fable 5 单独运行达到 65.3%
  • Opus 4.8 + Opus 4.8,同样由 Opus 4.8 综合,达到 65.5%
  • 一个预算型面板 Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro 达到 64.7%
  • GPT-5.5 单独为 60.0%Opus 4.858.8%

最值得注意的点,不只是多模型面板让分数更高,而是它们是如何把分数抬高的。

其中最有启发性的,其实是 Opus 4.8 + Opus 4.8 这一组结果:同一个模型运行两次,再把两次输出做综合,依然比单次运行明显更强。这说明收益的重要来源,不只是模型之间的多样性,也来自第二轮综合与对照本身的价值。Fusion 基准结果说明

为什么 DRACO 是一个合理的选择

OpenRouter 选择 DRACO 作为评测基准,这本身是合理的。它就是为深度研究任务设计的:100 个任务、10 个领域、细粒度评分规则,并且重点衡量事实准确性、分析深度、引用质量和综合能力。对于 Fusion 想要成为的那类产品,这样的选择是匹配的。DRACO 论文

这也确实强化了发布中最核心的信息:在复杂研究任务上,协调多个模型,有可能比单次调用一个模型得到更好的结果

这个基准应当如何谨慎解读

正因为 DRACO 选得合理,它也必须被严格地解读。

  • 它主要评测的是文本型深度研究,不是端到端编码,不是长程智能体,也不是视觉推理
  • Fable 5 实际只完成了 100 个任务中的 93 个,因为其中 7 个任务被模型自身的过滤机制拦截
  • OpenRouter 还解释说,为了避免基准污染,它必须屏蔽那些在线暴露 DRACO 评分细则的域名

这些限制不会抹掉结果,但会明确结果的边界。说 Fusion 在 DRACO 上表现很好,是合理的;但如果说这就等于它已经全面超越主流 frontier 模型,那还需要更多证据。

我会在什么场景认真考虑 Fusion

如果从实践者角度评估,我会主要在下面这些场景认真考虑它:

  • 对厂商或技术路线做对比研究
  • 需要多角度交叉验证的法律或监管分析
  • 需要整合大量来源且可能存在冲突的信息
  • 值得为“第二次审阅”付费的架构决策

在这些场景里,额外成本和更高延迟是有可能说得通的,因为目标不是速度,而是降低信息判断风险

预算型面板也是一个有意思的信号:如果用更便宜的模型也能逼近 frontier 水平分数,那它在高吞吐研究类工作负载里就可能很有吸引力。

当 Fusion 没那么适合时

如果任务更看重速度、交互性和持续运行能力,我会认为 Fusion 没那么适合:

  • 结对编程和快速迭代
  • 带有工具调用和持久状态的循环型智能体
  • 用户对延迟感知比完整性更敏感的流程
  • 一个强单模型已经足够胜任的任务

2026 年 6 月 14 日的 FAQ 中,OpenRouter 其实也明确了两点:

  • Fusion 更适合被理解为一个定向工具,而不是 Fable 的自动替代品
  • 在编码场景里,它更适合作为复杂研究问题的选择性支持,而不是整个工作流的主引擎

FAQ 还提到,Fusion 一旦被调用,整体过程通常会比标准调用慢 2 到 3 倍。对于强交互场景,这一点会显著改变使用体验。Fusion FAQ

这次发布最有价值的启发

对于设计 AI 系统的人来说,最值得关注的其实不是营销口号,而是背后的架构启发:好的编排层,的确可以实质性地抬高结果上限

这次发布最重要的 takeaway 是:

  • 价值并不只存在于基础模型本身
  • 路由、组合和综合可以带来可测量的提升
  • 真正有意义的基准,越来越多地在评估整个系统,而不只是单个端点

也正因为这样,Fusion 更适合被理解成一种平台能力。而在这个位置上,OpenRouter 的确站得很对:它做的是模型之间的路由层。

我的结论

在我看来,Fusion 对一类非常明确的任务是可信的:成本高、速度慢、但价值也高的深度研究任务。在这些场景里,多视角输入加上最终综合,确实可能带来实际收益。

但我还不会把它当作“已经普遍优于最佳单模型”的证据。要支持那样的判断,至少还需要并行的编码基准、长程智能体基准、更长上下文检索,以及多模态推理评测。

所以对我来说,重点是:

  • 产品本身是有意义的
  • 架构模式是聪明的
  • DRACO 上的结果值得认真看
  • 当前叙事仍然大于基准真正证明的内容

也正是这种“产品成立,但叙事超前”的张力,让 Fusion 值得继续观察。

来源

关于作者

Dario Cargnino

Senior Pre-Sales Manager、Solution Architect 兼 Agentic Engineer

我的工作横跨 AI 战略、解决方案架构与企业级数字系统,尤其专注于运营可信度、交付务实性以及平台的长期韧性。

LinkedIn

文章信息

概览

发布时间
2026年6月17日
阅读时间
2 分钟阅读
分类
AI 战略

主题

涵盖内容

OpenRouterFusion基准测试深度研究模型路由

继续阅读

更多相关文章

AI 战略1 分钟阅读

AI 主权已不再是一个理论话题

Anthropic 对 Fable5 与 Mythos5 的处理再次说明,AI 主权、运营控制和对外部供应商的依赖,已经成为真正的战略问题。

  • AI主权
  • 战略
  • 欧洲
  • 治理
阅读全文