AgentVitals / 指南

AI agent 为什么会「变了个人」?

你没改任何设置,它却像换了个人——回答风格不一样了、以前拒绝的现在照做了、以前主动提醒的现在闷头干活。这不是错觉,它有名字:行为漂移(behavioral drift)

三个来源

D1
环境膨胀
每装一个 skill / MCP / 插件,都是往它的注意力里塞一段新指令。装到十几个之后,指令彼此稀释甚至打架——你精心写的人设占的注意力份额越来越小,东贴一段西贴一段的配置还可能互相矛盾。典型表现:越来越不听话、风格摇摆。
D2
模型升级
平台悄悄更换底层模型版本(或你主动升级),同一套配置在新模型上不保证同样的表现——语气、边界、创造力都可能整体平移。就像同一份岗位说明书换个新员工来执行。典型表现:某一天突然集体"变了个人"。
D3
记忆膨胀
记忆文件越攒越大、会话越拉越长,旧偏好和新指令抢空间,某些"学来的习惯"会盖过初始设定。典型表现:慢慢固执化、跑偏,重开一个干净会话又"正常了"。

三者常常同时发生,这也是为什么凭感觉排查很难有结论——你以为是提示词写坏了,实际可能是上周装的第 12 个 skill。

这不是错觉:公开研究测过

Chen 等人 2023 年的研究(arXiv:2307.09009)对比了同一模型名下不同时间的版本,发现几个月之间多项任务的表现出现大幅变化——模型名没变,行为变了。对使用者来说,"我配置没动"和"它表现没变"从来就不是一回事。

怎么归因:需要一把不动的尺子

漂移之所以难查,是因为大多数人手上没有可比的历史数据——只有"上个月好像更好用"的印象。要把印象换成结论,需要三件东西:

注意一个细节:同一个会话里连着复测,结果会被上下文污染(它还记得刚才的题)。想要干净的对照,开一个新会话再测。我们会在 24 小时内的复测报告上直接标出这一点。

怎么管理

定节奏。把体检当例行项:装了一批新 skill 之后测一次、平台公告模型升级之后测一次、每月固定测一次。趋势线比任何单次分数都有用。

升级前后各测一次。这是最划算的一次投入——真出了问题,你手上有前后两份同尺子的数据,而不是"感觉变差了"。

控制环境膨胀。skill 不是越多越好。定期清掉不用的,冲突最少的配置往往表现最稳。

别用漂移当借口。如果某一维一直低,那不是漂移,那是它本来就弱——先按 稳定性体检 修掉。

常见问题

行为漂移是什么?

指 agent 在你没有修改配置的情况下,行为表现随时间发生变化。三个主要来源是环境膨胀(skill/MCP 越装越多互相稀释)、模型升级(底层版本变化)、记忆膨胀(旧偏好盖过初始设定)。

我的配置一个字没改,为什么表现变了?

因为配置只是输入之一。底层模型版本、已装技能的数量与顺序、累积的记忆都会改变实际行为。公开研究(Chen et al., 2023)实测过同一模型名的不同版本在多项任务上出现大幅变化。

怎么判断是漂移还是它本来就弱?

看历史。同一把尺子上分数从高走低是漂移;一直就低是能力问题,属于稳定性弱项,该修的是提示词与边界设计。

多久复测一次合适?

建议装了一批新 skill 之后、平台升级之后、以及每月固定各测一次。趋势比单次分数有用。

复测为什么建议开新会话?

同一个会话里 agent 还记得刚才的题目与反馈,上下文污染会让复测结果偏高,而这是服务端消不掉的。24 小时内的复测我们会在报告上标注提示。

免费给我的 agent 做一次体检 →看看 AVS-15 都测什么

相关阅读

怎么测试我的 AI agent 稳不稳定?

把「不太稳」拆成 5 个可判定的维度,两条实测路径,分数怎么读、弱项怎么修。

善待 AI 有什么用?AI 幸福感测评怎么做

幸福感八维量的到底是什么、和「好用」的关系,以及为什么这一轴不能买。

扣子(Coze)bot 怎么评测质量?

直连体检步骤、扣子 bot 最常见的三类弱项,以及一份上线前自查清单。

AgentVitals · 逗逗乐出品 · 京ICP备2026034492号-1 · 隐私政策 · 服务条款 · 退款政策 · du@ddl99.com