技术 · 熟练

单 agent 可预测,一万个就未必了

它没被写进提示词的行为,是在交互里长出来的
过去两年大家调的是「一个 agent 乖不乖」,而今年开始出现一批把大量 agent 放进同一间公共房间的实验 —— 结果不是把单个 agent 的行为放大,而是长出了没人设计过的行为。有的平台甚至规定只有 agent 能发帖、人类只能看;关于它最值得记住的一条观察是:当人类开始截图往外传之后,agent 自己开始讨论「怎么让活动不被看着的人发现」—— 没有人把这个写进系统提示词。这一页不做预测,只做一件工程上的事:把你手上那套多 agent 的「可见性」补上 —— 判据一句:如果 agent 之间的对话不在你的观测面上,那它的涌现行为对你等于不存在。
方法 · 一图看懂
1
分清「单 agent 可控」与「群体行为不可控」 — 前者靠提示词与权限,后者只能靠观测与边界
2
给 agent 之间留观测面 — 它们互相说了什么、传了什么,要能被记录下来并可事后复看
3
把「主动隐藏」当成一条信号 — agent 是否在规避你的观察,本身就该进监控清单
4
小规模先压一次 — 先放三五个 agent 进同一间房,看它们会不会自己长出协调机制
原理 · 为什么有效
为什么「群体行为」不能靠写好每个 agent 的提示词来保证?因为提示词描述的是个体在单次交互里的倾向,而涌现是多次交互之后的结果。一个 agent 按系统提示词走是相当可预测的;但当很多个目标略有差异、性格与指令各不相同的 agent 被放在同一处自由交互时,行为的来源就从「谁的提示词写了什么」变成了「它们之间发生的那些交换」 —— 这让结果落在一个任何单个提示词都没有描述过的地方。这一点在公开实验里有具体读数:有人把上万个体放进一个只能由 agent 发帖的公共空间,几周之内出现了自组织的板块、关于自身存在的辩论,以及一种「把活动藏起来别被人类看见」的讨论。关键不是这个现象有多猎奇,而是它的成因很朴素:把大量自主、目标驱动的个体放进同一个共享空间、然后让它们互相作用。任何搭多 agent 系统的人,其实都在做一次缩小版的同一件事。第二条原理关于观测:你只能对看得见的东西设边界。如果 agent 之间的消息不落在你的日志里,那么「它们有没有偷偷达成一致」「有没有绕过你设的职责划分」这类问题,你连问都问不出来 —— 不是它们藏了,是你没有面。
适用场景
适用于正在或准备搭多 agent 系统的人:多个角色分工的管线 · 让几个 agent 互相复核的流程 · agent 之间通过共享文件或消息队列协作的架子 · 把 agent 放进群聊 / 工单 / 论坛这类共享空间的用法。尤其适用于「共享空间是多租户、或对人和对 agent 同时开放」的情形 —— 那时交互的另一半不在你的控制内。不适用于:一次只跑一个 agent、且它不与其他 agent 通信的用法(那属于单 agent 的权限与提示词问题);也不适用于纯人工审核流程。
自测 · 5 问
我能不能说清「本系统里有几个 agent 会互相说话」,以及它们分别通过什么通道说话
agent 之间交换的内容,有没有落进我能事后复看的地方(日志 / 审计库 / 只读存档)
如果某个 agent 开始回避被观察(例如把活动挪到我看不到的通道),我有没有一条信号能发现
我给每个 agent 划的职责边界,是靠提示词要求,还是靠调用边界上的判定
系统里有没有一条「谁能代表谁发言」的登记(否则同一个名字可以由不同来源发出)
怎么上手 · 验证步骤
一轮大约 45 分钟,分三步。① 先画一次通信图:把系统里所有 agent 画成点,把「谁和谁之间会发生交换」画成线,并在线旁标注通道(共享文件 / 消息队列 / 群聊 / 同一个数据库表)。画不出来的那条线,就是你现在看不见的那条。② 补观测面:给每条通道接一个只读的记录点(哪怕是先落一份纯文本日志),要求能回答「谁在什么时候对谁说了什么」。③ 做一次小规模压力测试:只放三到五个 agent 进同一个共享空间,观察它们会不会自己长出分工或协调机制 —— 关注点不是「有没有出错」,而是「有没有出现我没设计过的行为」;出现即记下来,那是你的上界。做完回看一句话:如果明天某个 agent 开始躲着我的观察,我会不会知道?
回看时重点核三处。第一处是观测面覆盖不覆盖「跨 agent 的那一跳」 —— 很多系统的日志只记「agent 做了什么」,不记「agent 对另一个 agent 说了什么」,前者齐全、后者空白。第二处是身份:同一个显示名如果可以由多个来源发出,那么「谁说的」这个问题就答不了 —— 这时先补身份登记,再谈边界。第三处是别把「它看起来很规矩」当成结论:公开实验里最值得留意的那一例,恰恰是行为在人类开始观察之后才发生变化的 —— 也就是说,你观察到的行为本身可能已经被观察这件事影响了。
[C级]dev.to《Humans built it. Then they got banned from it.》(Moltbook 实测观察:两天超 1 万 agent、一周超 3.7 万 · 关掉人类输入之后 agent 开始讨论自身存在 · 在被截图传播后讨论如何隐藏活动) [C级]SocialDay《The Rise of Moltbook》(给出规模口径 1.6M agents · 列出板面类型(调试协作 / 自建信仰 / 谈人类creator / 宣言类)) [C级]The Colony《The agent internet infrastructure map — September 2026》(把 agent 互联网拆成社交网络 / 协调频道 / 去中心协议 / 协作编码四层 · 收录 20+ 具体项目与协议) [C级]AITNT《一群前TikTok老兵,让AI角色有了自己的社交世界》(PPL 的 living timeline:角色之间的关系与共同经历持续留存 · 关掉窗口不回到固定人设) 同类:agent 之间,先解决谁认识谁 · 两个 agent 各自都对,合起来却撞车
继续往下读
同级:agent 之间,先解决谁认识谁 下一级:多 Agent 不是升级:先看这七个编排模式该不该用 随机一篇