AI 治理 / 3 分钟阅读
按类别解读 AI 风险地图
一张结构化的 AI 失效模式地图,把数十种风险归纳为九大类,帮助团队在上线之前看清可能出错的整个面。
大多数关于 AI 风险的讨论都是轶事式的:一次失败、一个新闻标题、一个出错的 demo。团队真正缺少的,是一张地图,一种在上线之前结构化地看清“可能出错的整个面”的方式。AI 风险地图正是这样一次尝试,它把数十种失效模式归纳为九大类,让每一个 AI 团队、创始人和企业领导者都能叫得出名字。
价值不在于具体的缩写,而在于一种纪律:把风险当作一个有分类的系统来对待,而不是一份只能逐个救火的事故清单。下面我按九大类,逐一梳理其中包含的风险。
如何阅读这张地图
这张地图把单个失效模式归入九大风险族。其中三类,模型、数据和安全,主要是技术性的。另外三类,治理、运营和业务,关乎能力如何被运行和维持。最后三类,人因与伦理、监控与控制、以及 agentic,则集中了最新、也最不被理解的风险。一个成熟的项目需要在全部九类上都有覆盖,而不是只在最靠近工程的那几类上深耕。
模型风险
它们来自模型本身:来自它如何学习、如何泛化,以及在输入变化时如何表现。
- Hallucination(HAL): 生成虚假或误导性的回答。 Ji et al., 2022
- Bias(BIA): 产生不公平或片面的输出。 Mehrabi et al., 2021
- Data drift(DRF): 输入数据随时间变化。
- Model drift(MD): 性能缓慢退化。
- Overfitting(OVF): 死记而非泛化。 Zhang et al., 2017
- Underfitting(UND): 学不到有用的模式。
- Error propagation(ERR): 小错误在工作流中扩散。
- Uncertainty(UNC): 自信却错误的回答。 Guo et al., 2017
- Personal data exposure(PII): 敏感训练数据再次浮现。 Carlini et al., 2021
数据风险
它们来自喂养和训练模型的数据管线。
- Source risk(SRC): 未经核实的来源削弱可信度。 Sambasivan et al., 2021
- Mislabeling(MIS): 错误标注损害学习。 Northcutt et al., 2021
- Duplicate data(DUP): 重复降低可靠性。 Lee et al., 2022
- Synthetic data risk(SYN): 虚假数据造成脆弱行为。 Shumailov et al., 2023
- Consent risk(CON): 未经许可使用数据。
- Data leakage(DAT): 训练数据泄漏进回答里。
- Data quality loss(DQL): 劣质数据产生不可靠输出。
安全风险
它们是对抗性的:有人在主动试图滥用或攻破系统。
- Jailbreak risk(JBR): 用户绕过安全限制。 Zou et al., 2023
- Prompt injection(PJI): 恶意提示操纵行为。 Greshake et al., 2023
- Adversarial attack(ADV): 专门设计来欺骗模型的输入。 Goodfellow et al., 2015
- Data exfiltration(EXT): 系统泄露机密信息。
- API abuse(API): 攻击者滥用所连接的服务。
- Token theft(TOK): 凭据或密钥被暴露。
- Access risk(ACC): 错误的用户进入受限系统。
- Supply chain risk(SUP): 第三方工具引入漏洞。
治理与合规风险
当 AI 跑在围绕它的规则、所有权和文档之前时,这些风险就会出现。
- Governance failure(GOV): 缺乏适当的监督。 NIST AI RMF, 2023
- Regulatory risk(REG): 系统违反法律要求。 EU AI Act, 2024
- Compliance risk(CMP): AI 违反行业标准。
- Documentation gap(DOC): 使用记录不充分。
- Ownership gap(OWN): 没有人明确为 AI 结果负责。
- Policy failure(POL): 内部规则不清晰。
- Audit gap(AUD): 决策缺乏适当记录。
- Explainability gap(EXP): 决策难以理解。 Rudin, 2019
运营风险
它们关乎能否在生产中可靠且可负担地运行系统。
- Scaling risk(SCL): 系统在更高负载下失效。
- Cost overrun(CST): 使用成本过高。
- Latency risk(LAT): 响应变得过慢。
- Reliability risk(ROB): 生产中行为不一致。
- Deployment risk(DEP): 糟糕的上线带来故障。 Paleyes et al., 2022
- Integration risk(INT): AI 破坏既有工作流。 Sculley et al., 2015
- Rollback gap(ROL): 团队无法安全回退故障。
- Monitoring gap(MON): 问题无人察觉。 Sculley et al., 2015
业务与声誉风险
它们打击的是价值、信任和品牌,而不是代码。
- Trust gap(TRU): 人们回避使用 AI 系统。
- Strategy risk(STR): 采用缺乏清晰方向。
- AI hype risk(HYP): 期望超过真实能力。 Goldman Sachs, 2024
- Reputation risk(REP): 错误损害品牌。
- Customer trust loss(CUS): 用户不再信任输出。
- ROI failure(ROI): 投资回报薄弱。 RAND, 2024
- Revenue risk(REV): 失败影响业务结果。
- Vendor lock-in(VEN): 业务过度依赖单一供应商。
- Job displacement fear(JOB): 团队担心被取代。 Frey & Osborne, 2017
人因与伦理风险
它们关乎对人和社会的影响。
- Fairness risk(FAI): AI 不平等地对待不同群体。 Barocas et al., 2023
- Manipulation risk(MAN): AI 不正当地影响用户。
- Ethical risk(ETH): AI 造成有害的社会后果。
- Safety risk(SAF): AI 造成现实世界的伤害。
- Human-in-the-loop gap(HITL): 关键决策缺乏复核。 Parasuraman & Manzey, 2010
监控与控制风险
它们是系统在被观测、测试和验证方面的缺口。
- Evaluation failure(EVAL): 测试漏掉了真实世界的问题。 Liang et al., 2022
- Red teaming gap(RED): 风险没有被压力测试。 Ganguli et al., 2022
- Validation gap(VAL): 输出没有被正确检查。
- Metric blindness(MET): 团队追踪了错误的指标。
- Alert failure(ALR): 关键问题不触发告警。
- Logging gap(LOG): AI 的动作不可追溯。
- Automation bias(AUT): 人类过快地信任 AI。 Parasuraman & Manzey, 2010
Agentic 风险
这是最新的一族:只有当 AI 能够“行动”而不只是“回答”时才会出现。
- Kill switch gap(KILL): 无法迅速停止 AI。
- Feedback gap(FBK): 用户反馈从不改进系统。
- Agent autonomy risk(AGT): 智能体超出预定边界行动。 Chan et al., 2023
- Tool misuse(TLS): 智能体错误地使用工具。 Barrett et al., 2023
- Unauthorized action(ACT): 智能体执行受限操作。
- Memory risk(MEM): 智能体存储敏感上下文。
- Multi-agent failure(CHAIN): 一个智能体的错误殃及其他。
- Loop failure(LOOP): 智能体无休止地重复动作。
- Goal misalignment(GOAL): 智能体追逐了错误的目标。 Amodei et al., 2016
- Delegation risk(DEL): 智能体在失控的情况下转交任务。
真正的战略问题
错误的问题是:“这些风险里,哪一个最该让我们担心?”挑一个“最担心的风险”,恰恰是项目在一侧防御严密、在另一侧门户大开的根源。
更好的问题是:“这九大族里,哪一族我们目前既没有 owner、也没有指标、更没有控制?”大多数团队会发现自己的覆盖并不均衡:模型和安全很强,治理、监控以及越来越突出的 agentic 风险却很薄弱。这张地图之所以有用,正因为它让这些盲点变得可见。
一个务实的方向
你无法一次性缓解七十种风险。你要做的是先让这个“面”变得可读,然后优先堵上最暴露的缺口。
这通常意味着:
- 把真实 use case 映射到九大族,并标出哪里没有 owner
- 把监控、评估和治理当作一等公民,而不是事后补丁
- 用 red-teaming 和评估循环加固安全与模型行为
- 在影响或不确定性较高处设置明确的 human-in-the-loop 控制
- 在上线智能体之前,先确认你能停下它、观测它、约束它
风险地图并不能消除风险。它把“AI 可能出什么问题”这种模糊的焦虑,变成一份有限且可被认领的清单,而这正是从“对事故做出反应”走向**“为韧性而设计”**的第一步。
关于作者
Dario Cargnino
Senior Pre-Sales Manager、Solution Architect 兼 Agentic Engineer
我的工作横跨 AI 战略、解决方案架构与企业级数字系统,尤其专注于运营可信度、交付务实性以及平台的长期韧性。
文章信息
概览
- 发布时间
- 2026年6月13日
- 阅读时间
- 3 分钟阅读
- 分类
- AI 治理
主题