通用方法 · 熟练
标准从「推荐」变成了「门槛」
推荐性标准可以慢慢对齐;强制性国标决定你能不能进市场
过去管 AI,管的是它「说什么」—— 输出过滤、内容审核、拒答机制,都是后置手段。智能体不一样:它感知环境、自主决策、调用工具、执行动作,风险从「说什么」扩到「做什么」,一次坏决策可以真的改掉现实里的东西。这一页只做一件很小的事:把「智能体安全」拆成两张清单 —— 一张是「我受哪一层约束」(推荐性框架还是强制性国标),一张是「我拿什么证明它被管住了」(看得见 / 管得住) —— 然后在正式上线之前,逐条打一遍勾。
方法 · 一图看懂
1
先分清两层口径 — 推荐性的风险管理框架讲「该怎么做」,强制性国标讲「能不能进市场」,两者不是同一条线上的强弱,是两种不同的东西
2
判自己落在哪一层 — 面向公众提供、或具备舆论属性与社会动员能力的,要进备案与准入这一关;只对内用也要看它会不会对外产生效果
3
把「看得见」落成留痕 — 它干了什么、谁让它干的、中间经过哪些步骤,三样都要能在事后调出来
4
把「管得住」拆成三个开关 — 能发现、能定位、能叫停,而且踩刹车不必等这一次任务跑完
5
上线前对着清单打勾 — 几条底线逐条过一遍,缺的写进改造清单并写上责任人
原理 · 为什么有效
这一页的原理只有一句:管内容的方法,管不住行为。内容层的风险停在模型的输出上 —— 说错话、泄隐私、传谣言,这些都可以用后置手段拦:过滤一遍、审一遍、让它拒答。但智能体的风险已经不在文本里了 —— 它接了网络、拿了权限、能操作外部系统,于是「意图偏离」「权限失控」「工具滥用」这三件事的后果会直接传导到现实。信息泄露不再只是数据库被拖走,而是它把敏感数据发给了不该收的对象;权限失控不再只是账号被盗,而是它被诱导执行了高危操作;工具滥用不再只是 API 被刷,而是它调了支付、通信、调度这类关键接口。后置过滤对这三件事全部无效 —— 因为它们发生的时候,输出是「成功」的。所以监管的抓手必须前移:从「它说了什么」前移到「它做了什么、谁能证明」。这就是为什么治理框架 3.0 把视角从内容安全延伸到智能体行为安全,也是为什么第一条要求写的是留痕 —— 只有在「它做了什么」上留下可追溯的记录,后面「能发现 / 能定位 / 能叫停」才有落点。
适用场景
这一页给三类人:正在把 AI 助手或 agent 放进业务里的团队负责人(要判断自己受哪一层约束)· 做上线的工程同学(要把它落成可检查的动作)· 已经在跑但说不清边界的人(要补一次自查)。不需要你已经有合规团队。不适用:只是自己用聊天工具写写东西的个人 —— 那种场景既不在准入范围内,也不需要留痕机制;以及已经建完完整合规章程的机构,你们要的是审计而不是入门。
自测 · 5 问
我能一句话说出自己受哪一层约束:推荐性框架,还是强制性国标
「它干了什么 / 谁让它干的 / 中间经过哪些步骤」这三样,我能在事后调出来
「能发现」有一个具体的触发点 —— 谁在看、看什么、多久看一次,而不是「出事就知道」
「能定位」能回答到具体是哪一个动作、哪一次调用,而不是只给一个错误码
「能叫停」不依赖当前这次任务自己跑完,且有人知道那个开关在哪
怎么上手 · 验证步骤
先做最小的一版,半小时能出结论。第一步:写下一句话 —— 我的 agent 面向谁。面向公众提供的(只要公众能用,不管形态)、或具备舆论属性与社会动员能力的,直接进「门槛」这一层;纯内网、纯个人使用的,先按「框架」这一层对齐,同时记一条:一旦它对外的动作有现实后果(发消息、下单、改数据),立刻按门槛层重判。第二步:做一次留痕演练 —— 挑一条最近真实跑过的任务,把「它干了什么 / 谁让它干的 / 中间经过哪些步骤」各写一行。写不出来,就是现在的缺口;写得出来但很费劲,说明缺的是自动记录而不是意识。第三步:给「能发现 / 能定位 / 能叫停」三个开关各配一个具体动作 —— 谁、在哪、多久一次。三步加起来的产出就是一份自查表,它不解决合规,但能让下一次被问到时不至于当场卡住。
做完上面三步,用一句话检查自己:如果有人明天问我「昨晚这个 agent 自己做了什么」,我能不能在十分钟内拿出一条带时间戳、能对应到具体动作的记录?能,说明留痕这一层已经立住;不能,先别急着加更多功能 —— 它跑得越久,说不清的部分只会越多。