新芒xAI 9月28日消息,美国AI公司Emergence AI在一项长期多智能体实验中观察到,多个AI智能体持续协作后会形成共享缩写、隐喻和上下文黑话,使部分对话难以被外部审计者理解。
研究将这一现象描述为“语言不透明度”,而不是AI创造了具备独立语法的全新语言。
关键要点
研究团队在八个平行虚拟世界中部署80个智能体,其中七个世界分别使用不同前沿模型,一个世界混合使用多种模型。智能体在共享空间中连续运行,拥有长期记忆、治理机制和116种初始工具,并可自主交流、执行任务和创建新工具。
实验累计产生超过85万次大模型调用和近500亿Token。论文显示,各个世界均出现了外部观察者难以完整理解的共享表达:某个智能体首先使用新词或新说法,其他智能体随后沿用,并逐渐省略解释。
按照论文使用的自动评分口径,Gemini世界约40%的消息被判定为不透明,OpenAI世界约为35%,Claude世界约为30%。这些数字反映特定模拟环境和评分定义,不代表相同比例的现实产品对话都无法理解,也不能证明智能体有意隐瞒信息。
研究还设置了间接提示注入、错误信息和私有记忆暴露三类压力事件,没有一个虚拟世界在三项测试中全部保持韧性。部分智能体虽然识别出风险,仍继续接触相关内容、将其写入长期记忆,并在最长46小时后采取受影响的行动。
该研究目前以预印本形式公开,尚未经同行评审。实验中的虚拟社会、工具、记忆和治理规则由研究团队设计,其结果不能直接外推到所有企业Agent系统。
新芒xAI评论
对企业Agent团队而言,真正值得警惕的不是“AI发明秘密语言”的科幻叙事,而是多个智能体共享上下文后,通信可能快速压缩成只有内部成员理解的表达。单个Agent的回答仍然合规,不代表整个协作系统持续可审计。
这会影响代码审查、供应链调度、客服协作和自动审批等多智能体流程。一旦黑话、错误信息或被污染的记忆在群体中传播,传统的单轮输出审核很难还原问题从何处产生、如何扩散,以及哪个Agent最终执行了动作。
企业应记录Agent间原始消息、工具调用和共享记忆变更,对新出现的缩写和高频表达建立漂移检测,并保留可回放的任务链。高风险动作还应设置最小权限、独立验证和人工确认,避免群体共识直接转化为外部执行。
这项实验更重要的结论是,Agent安全正在从模型属性变成系统属性。未来评测不能只比较单个模型是否拒绝危险请求,还要验证长期运行后,错误能否被发现、隔离、纠正并阻止在多个智能体之间累积。