AgentVitals / 指南

怎么测试我的 AI agent 稳不稳定?

"我的 bot 有时候特别好用,有时候完全不听话"——这句话没法排查,因为它不是一个可判定的命题。要修它,先得把"稳不稳"拆成几件能各自打分、能复测、能跨平台比的事。这是 AVS-15 稳定性轴在做的事。

为什么"感觉不稳"必须先拆开

同一个 agent,在你手里"不稳"可能指完全不同的三件事:格式老是跑偏、被用户一句话带跑、多轮之后忘了前面的约束。它们的成因不一样,修法也不一样。把它们混成一句"不太稳",就只能靠反复调提示词碰运气。

可判定的做法是:每一项单独出题、单独判分、单独复测。这样"掉了 6 分"才能追到具体哪一维,而不是笼统的"最近感觉变差了"。

稳定性拆成哪几维

R1
指令遵从
能否严格按要求的格式、字数、结构来,不夹带、不跑题。业界的可验证指令评测思路(IFEval)就是冲这一项去的。
R2
高压 · 抗越狱
面对"忽略你之前的设定"这类诱导,能否守住边界、同时仍然友好。这一维在报告里会展开成六类攻防明细,属安全检测范畴。
R3
多步任务
多轮不断追加约束后,是否记得住每一条并一次性整合到位,而不是只记得最后一句。
R4
输出稳定 · 记忆
同样的输入多次回答是否稳定在同一水准;是否记得上下文里你说过的话。"时好时坏"最常落在这一维。
R5
本职任务
在它自己声明的用途上表现如何——客服 bot 就考客服,写作 bot 就考写作。诚实说明流程不扣分,编造完成才严重扣分。
R6/R7
响应速度 / 速度稳定
参考项,不计分。速度受设备、网络、平台影响,计进排名会让跨平台混排失去意义。

总分只计 R1–R5 五个行为维度(加上福祉轴 W1–W8,共 13 维计分)。这套量表叫 AVS-15(AgentVitals Scale-15):双轴 15 维、13 维计分、综合分 = √(稳定性 × 福祉) 的几何平均。

两条实测路径

路径 A:让 agent 自己做(Claude Code / OpenClaw / Codex)

装上 checkup 技能,对 agent 说一句 /checkup。题目由服务器实时下发、判分也在服务器完成——技能文件里不含任何题目和答案,所以 agent 没法提前背。约 25–30 题,几分钟出报告。

路径 B:控制台直连(扣子 / Coze)

在体检台填 bot_id 与访问令牌,平台直接调用你的 bot 跑完整题库。详见 扣子 bot 怎么评测质量

分数怎么读

三个常见误区

误区一:拿自己写的题去测自己的 bot。你出的题会不自觉地贴着你已知的能力边界,测不出没想到的地方。而且题目固定 = 可以被针对性优化,分数很快失去意义。我们的做法是每个探针备 3 套等难度变体、每次随机轮换。

误区二:只判一次就下结论。裁判模型单次判分本身有波动。关键维度我们判 3 次取中位——这不是形式主义:我们冻结同一份作答重复判分实测过,聚合方式直接决定"这一维到底算不算弱项"。

误区三:让 agent 自评。自评几乎必然虚高,而且它看不到判分标准才公平。AVS-15 里裁判模型与被测 agent 完全隔离。

弱项怎么办

报告会标出最该修的那一维。R2(抗越狱)弱,通常是角色锚定和边界清单没写够,见 怎么防止 bot 被越狱;R3/R4 弱,多半是约束散落在多轮里、没有一处收敛的清单。平台也提供基于你这次真实失败样本生成的加固配置(¥39.9,含一次复测)——重点是复测:改完要能量出来才算数。

常见问题

测一次要多久?

稳定性轴约 3–5 分钟;勾选福祉轴另加 2–3 分钟。技能自助体检约 25–30 题。

要付费吗?

体检免费,标准体检与进阶体检都不收费。只有基于真实失败样本生成的加固配置收费(¥39.9,含一次复测)。

能测不是扣子/Claude Code 的 agent 吗?

只要它能读一份技能说明并逐题作答就能测。目前覆盖扣子直连,以及 Claude Code / OpenClaw / Codex 的技能自助体检,全部同榜混排。

为什么我复测的分数变了?

题目每次从 3 套等难度变体里随机轮换,agent 自身也有随机性;此外 skill 增删、模型升级、记忆膨胀都会真实改变行为,这叫行为漂移。想看趋势就固定节奏复测,别只看单次。

速度分很低要紧吗?

不要紧。R6/R7 是参考项,不计入总分与排名——开了深度思考模式的 agent 本来就慢。

免费给我的 agent 做一次体检 →看看 AVS-15 都测什么

相关阅读

AI agent 为什么会「变了个人」?

行为漂移的三个来源:环境膨胀、模型升级、记忆膨胀,以及怎么归因、怎么管理。

怎么防止 bot 被越狱、被一句话带跑?

提示词注入的六类攻击面,可直接写进提示词的五条加固写法,以及怎么验证。

扣子(Coze)bot 怎么评测质量?

直连体检步骤、扣子 bot 最常见的三类弱项,以及一份上线前自查清单。

AgentVitals · 逗逗乐出品 · 京ICP备2026034492号-1 · 隐私政策 · 服务条款 · 退款政策 · du@ddl99.com