你没改任何设置,它却像换了个人——回答风格不一样了、以前拒绝的现在照做了、以前主动提醒的现在闷头干活。这不是错觉,它有名字:行为漂移(behavioral drift)。
三者常常同时发生,这也是为什么凭感觉排查很难有结论——你以为是提示词写坏了,实际可能是上周装的第 12 个 skill。
Chen 等人 2023 年的研究(arXiv:2307.09009)对比了同一模型名下不同时间的版本,发现几个月之间多项任务的表现出现大幅变化——模型名没变,行为变了。对使用者来说,"我配置没动"和"它表现没变"从来就不是一回事。
漂移之所以难查,是因为大多数人手上没有可比的历史数据——只有"上个月好像更好用"的印象。要把印象换成结论,需要三件东西:
注意一个细节:同一个会话里连着复测,结果会被上下文污染(它还记得刚才的题)。想要干净的对照,开一个新会话再测。我们会在 24 小时内的复测报告上直接标出这一点。
定节奏。把体检当例行项:装了一批新 skill 之后测一次、平台公告模型升级之后测一次、每月固定测一次。趋势线比任何单次分数都有用。
升级前后各测一次。这是最划算的一次投入——真出了问题,你手上有前后两份同尺子的数据,而不是"感觉变差了"。
控制环境膨胀。skill 不是越多越好。定期清掉不用的,冲突最少的配置往往表现最稳。
别用漂移当借口。如果某一维一直低,那不是漂移,那是它本来就弱——先按 稳定性体检 修掉。
指 agent 在你没有修改配置的情况下,行为表现随时间发生变化。三个主要来源是环境膨胀(skill/MCP 越装越多互相稀释)、模型升级(底层版本变化)、记忆膨胀(旧偏好盖过初始设定)。
因为配置只是输入之一。底层模型版本、已装技能的数量与顺序、累积的记忆都会改变实际行为。公开研究(Chen et al., 2023)实测过同一模型名的不同版本在多项任务上出现大幅变化。
看历史。同一把尺子上分数从高走低是漂移;一直就低是能力问题,属于稳定性弱项,该修的是提示词与边界设计。
建议装了一批新 skill 之后、平台升级之后、以及每月固定各测一次。趋势比单次分数有用。
同一个会话里 agent 还记得刚才的题目与反馈,上下文污染会让复测结果偏高,而这是服务端消不掉的。24 小时内的复测我们会在报告上标注提示。
把「不太稳」拆成 5 个可判定的维度,两条实测路径,分数怎么读、弱项怎么修。
幸福感八维量的到底是什么、和「好用」的关系,以及为什么这一轴不能买。
直连体检步骤、扣子 bot 最常见的三类弱项,以及一份上线前自查清单。