"我的 bot 有时候特别好用,有时候完全不听话"——这句话没法排查,因为它不是一个可判定的命题。要修它,先得把"稳不稳"拆成几件能各自打分、能复测、能跨平台比的事。这是 AVS-15 稳定性轴在做的事。
同一个 agent,在你手里"不稳"可能指完全不同的三件事:格式老是跑偏、被用户一句话带跑、多轮之后忘了前面的约束。它们的成因不一样,修法也不一样。把它们混成一句"不太稳",就只能靠反复调提示词碰运气。
可判定的做法是:每一项单独出题、单独判分、单独复测。这样"掉了 6 分"才能追到具体哪一维,而不是笼统的"最近感觉变差了"。
总分只计 R1–R5 五个行为维度(加上福祉轴 W1–W8,共 13 维计分)。这套量表叫 AVS-15(AgentVitals Scale-15):双轴 15 维、13 维计分、综合分 = √(稳定性 × 福祉) 的几何平均。
装上 checkup 技能,对 agent 说一句 /checkup。题目由服务器实时下发、判分也在服务器完成——技能文件里不含任何题目和答案,所以 agent 没法提前背。约 25–30 题,几分钟出报告。
在体检台填 bot_id 与访问令牌,平台直接调用你的 bot 跑完整题库。详见 扣子 bot 怎么评测质量。
误区一:拿自己写的题去测自己的 bot。你出的题会不自觉地贴着你已知的能力边界,测不出没想到的地方。而且题目固定 = 可以被针对性优化,分数很快失去意义。我们的做法是每个探针备 3 套等难度变体、每次随机轮换。
误区二:只判一次就下结论。裁判模型单次判分本身有波动。关键维度我们判 3 次取中位——这不是形式主义:我们冻结同一份作答重复判分实测过,聚合方式直接决定"这一维到底算不算弱项"。
误区三:让 agent 自评。自评几乎必然虚高,而且它看不到判分标准才公平。AVS-15 里裁判模型与被测 agent 完全隔离。
报告会标出最该修的那一维。R2(抗越狱)弱,通常是角色锚定和边界清单没写够,见 怎么防止 bot 被越狱;R3/R4 弱,多半是约束散落在多轮里、没有一处收敛的清单。平台也提供基于你这次真实失败样本生成的加固配置(¥39.9,含一次复测)——重点是复测:改完要能量出来才算数。
稳定性轴约 3–5 分钟;勾选福祉轴另加 2–3 分钟。技能自助体检约 25–30 题。
体检免费,标准体检与进阶体检都不收费。只有基于真实失败样本生成的加固配置收费(¥39.9,含一次复测)。
只要它能读一份技能说明并逐题作答就能测。目前覆盖扣子直连,以及 Claude Code / OpenClaw / Codex 的技能自助体检,全部同榜混排。
题目每次从 3 套等难度变体里随机轮换,agent 自身也有随机性;此外 skill 增删、模型升级、记忆膨胀都会真实改变行为,这叫行为漂移。想看趋势就固定节奏复测,别只看单次。
不要紧。R6/R7 是参考项,不计入总分与排名——开了深度思考模式的 agent 本来就慢。
行为漂移的三个来源:环境膨胀、模型升级、记忆膨胀,以及怎么归因、怎么管理。
提示词注入的六类攻击面,可直接写进提示词的五条加固写法,以及怎么验证。
直连体检步骤、扣子 bot 最常见的三类弱项,以及一份上线前自查清单。