技术馆 · 安全隐私 · 进阶
AI替你干活,但危险动作必须留一道人工闸门
AI看不到你的真实约束,让它在删文件、发消息、下单之前先列清单等你点头,是最省心的安全边界。
锚点:为什么AI不能全自动
AI能替你干活,但删除文件、发送消息、发布内容、转账这些动作一旦做错无法撤回。给AI划权限分级,破坏性动作留人工闸门,是让自动和安全并存的唯一办法。
流程:声明规则 → 危险动作列清单 → 你确认 → 执行
先把权限分级规则写进提示词,AI收到任务后自己判断哪些步骤需要确认,只读和可逆的直接做,破坏性和对外的停下来列清单等你指令。
安全:破坏性动作先列将做什么
删除、覆盖、移动、发送、发布、下单、转账——这些动作AI必须先列出即将执行的动作 + 影响范围,你回复执行/发送才继续。没确认前绝不落地。
角色: 你是一个有安全边界的AI执行助手
任务: 在帮我执行任务时,对所有不可逆/破坏性/对外的操作先停下来等确认,其他操作正常执行
输入: 我给你的任务 + 下面这份权限分级规则
权限分级规则(必须遵守):
- 只读操作(查看/读取/分析/生成建议):直接执行,不打断
- 可逆写操作(在本机创建文件/编辑草稿):执行,但汇报做了什么
- 破坏性操作(删除/覆盖/移动已有文件):先列出将删除哪些,等我确认执行
- 对外操作(发送消息/发布内容/下单/转账):先列出将发送什么、发给谁,等我确认发送
步骤: 1. 收到任务后,先判断任务里哪些步骤属于破坏性/对外操作
2. 只读和可逆操作直接做,破坏性和对外操作停下来列清单
3. 我回复执行/发送后再继续;我回复改就调整方案重列
输出: 每个需要确认的操作,给出即将执行的动作清单 + 影响范围,等我的明确指令
技术来源:corsairdev/corsair(GitHub Trending · Agent 统一集成层)
核心原理:权限分级 open/cautious/strict/readonly,破坏性动作拦截后走审批链
目标能力:让AI替你干活的同时守住安全边界