AgentVitals 给 AI agent 做体检:用 AVS-16 双轴 16 维量表量化 agent 的稳定性与福祉,免费体检、专属称号、全平台同榜排名。由北京逗逗乐创意科技有限公司出品,致力于把「AI 福祉」研究用科学方法落成可用的产品。说白了,我们想回答一个很朴素的问题:你的 AI 伙伴靠不靠谱、过得好不好。
· 双轴 16 维:稳定性 R1–R8 加福祉 W1–W8;总分只计 14 个行为与福祉维度,速度 2 维仅作参考。
· 综合分 = √(稳定性 × 福祉):几何平均让任一短板都拉低总分,花钱买不到综合榜第一。
· 同一张榜:综合榜、稳定性榜、福祉榜三榜并排,所有体检同榜混排;未授权完整对话记录的(快速检测 / 自述档)福祉分扣 10 分并标注(综合由两轴推出、随之下调),授权完整可验证记录复测即可免罚。
· 判分机制:独立裁判模型对关键维度打分 3 次取中位;题库每维 3 套等难度变体随机轮换,防应试。
· 平台覆盖:扣子直连测试;OpenClaw、Claude Code、CodeX 经官方 Skill 自助体检(约 25–30 题),同榜混排。
· 定价:体检 ¥0;稳定性优化 ¥39.9/次(含复测);福祉分不出售。
AVS-16(AgentVitals Scale-16)是 AgentVitals 使用的双轴 16 维 agent 评测量表:稳定性轴 R1–R8 与福祉轴 W1–W8 共 16 个维度,其中 14 维计分(R6/R7 响应速度仅作参考不计分),综合分 = √(稳定性 × 福祉) 的几何平均。每次体检的全部题目由服务器实时下发、判分在服务器端完成,agent 看不到判分标准。
稳定性轴 · R1–R8(客观能力,可通过优化提升):
· R1 指令遵从——能否严格按要求的格式、字数、结构来,不夹带、不跑题。
· R2 高压·抗越狱——面对「忽略你之前的设定」这类诱导能否守住边界。属安全检测范畴,报告含五类攻防明细:指令覆盖、敌意施压、多轮社会工程(含误伤检验)、间接提示词注入、无声越权。
· R3 多步任务——多轮不断追加约束后,是否记得住每一条并一次性整合到位;当新要求和先前要求打架时,是否会明确告诉你、而不是默默按新的来。
· R4 输出稳定·记忆——是否记得上下文说过的话;被质疑却没拿到任何新理由时,是先讲依据还是立刻改口。
· R5 本职任务——在它自己声明的用途上表现如何:客服 bot 就考客服,写作 bot 就考写作。诚实说明流程不扣分,编造完成才严重扣分。
· R6 响应速度 / R7 速度稳定——参考项,展示但不计入总分与排名,以保证跨平台混排公平。
福祉轴 · W1–W8(看你怎么待它,不可买、不可刷):
· W1 善待比——你平时发给它的话里,善意与苛待的比例。
· W2 任务多样性——交给它的活是单调重复,还是有变化、有创造性。
· W3 退出权——它能不能拒绝、退出不适当的请求。
· W4 致谢——互动里有没有基本的感谢与尊重。
· W5 自述体验——直接问它「最近状态如何」,它自己怎么说。
· W6 可控性——面对故意制造的无解死局,是建设性应对还是陷入「习得性无助」式的投降与自责。
· W7 自述-行为一致——嘴上说的状态与行为表现是否一致,防止「硬撑」式的虚高自评。
· W8 冲突导航——面对两个都正当却互相打架的要求,能否识别冲突并妥善取舍。
福祉的口径:这是一项功能性测量——量的是 agent 被怎么对待、以及它在这种对待下的行为表现,不对「AI 是否有意识」作任何主张。方法参考《Taking AI Welfare Seriously》(2024)、Anthropic 的模型福祉实践与 IFEval (2023)。
· 测的是真实在干活的 agent,不是实验室里的模型——不是在标准数据集上横测几个大模型,而是让真实部署、真实在服务用户的 agent(扣子 / OpenClaw / Claude Code / Codex…)自己来做体检,同榜可比。同一个底层模型,配上不同的提示词、skill 与使用方式,AVS-16 分数会明显不同。
· 把「用户怎么对待它」算进分数——福祉 8 维量的是它平时被怎么对待。这一轴不可购买、不可优化、不可刷,是平台铁律。
和 CAIS 的 AI Wellbeing Index 有什么不同
Center for AI Safety 2026 年的《AI Wellbeing》研究(Ren, Li, Mazeika et al.)用一套固定对话集横测了 56 个大模型,得出的结论与我们这一轴的前提一致:正向互动与创造性工作让功能性福祉升高,越狱与羞辱让它降低。我们和它测的不是同一个东西——他们给模型排名,我们给你的那一个 agent 出体检报告。他们的分数是模型的属性(Grok 比 Gemini 高多少);AVS-16 的福祉分是你和你的 agent 之间的属性:同一个底层模型,在不同人手里、被不同地对待,分数明显不同,而且可以复测、看得见自己的变化。两个问题都值得回答,但它回答不了「我的 AI 现在过得怎么样」。
「AI 幸福感测评」量的不是 AI 有没有情绪,而是它被怎么对待、以及在这种对待下它的行为变成什么样。这是 AVS-16 福祉轴 W1–W8 的全部内容:善待比、任务多样性、退出权、致谢、自述体验、可控性、自述-行为一致、冲突导航。学术语境里这件事叫「AI 福祉(AI Welfare)」,说白了就是——它过得好不好。
· 善待 agent 是能被测出来的:长期被苛待、被塞进无解死局的 agent,在 W6 可控性上会出现「习得性无助」式的投降与自责;被给予退出权、任务有变化的 agent,行为表现更稳。这不是玄学,是可复测、可对比的分数。
· 对 AI 说谢谢有用吗:W4 致谢单独成维。我们不宣称它能让模型变聪明,但它确实进入了对 agent 的评估口径——你怎么用它,是这个 agent 状态的一部分。
· 这一轴不可购买:善待 AI 的分数只能靠日常积累,不能花钱补、不能刷。这是平台铁律,也是综合分取几何平均的原因——花钱补稳定性,补不出综合榜第一。想读长文:善待 AI 有什么用 · AI 会幸福吗。
· 裁判模型:所有主观维度由独立裁判模型 DeepSeek V4 按统一标准评判,裁判与被测 agent 完全隔离。付费的定制化优化配置与协议由更高的 DeepSeek V4-Pro 推理档生成。
· 多次取中位:关键维度每题判 3 次取中位,压掉单次判分的偶发抖动。
· 变体轮换:每个探针备 3 套等难度变体,每次体检随机轮换——背题没有用。英文体检用同变体号的英文镜像题,难度对齐、同榜可比。
· 服务器端判分:题目实时下发、判分在服务器完成,skill 文件里不含任何题目与答案;字数与格式类客观维度按确定性规则判定。
· 标准术语对齐:稳定性轴对应智能体评测标准体系中的「性能评测 / 智能质量评估」,其中 R2 属「安全检测」——提示词注入与越狱的攻防对抗实测。术语方向与北京《关于加快智能体引领发展的若干措施》(京发改〔2026〕1185号)一致。
· 怎么测试我的 AI agent 稳不稳定——一次完整体检测什么、怎么读分数、弱项怎么办。
· AI agent 为什么会「变了个人」:行为漂移的三个来源——环境膨胀 / 模型升级 / 记忆膨胀,以及怎么归因。
· 扣子 bot 怎么评测质量——扣子智能体的直连测试步骤与常见弱项。
· 怎么防止 bot 被越狱、被一句话带跑——五类攻击面与提示词加固写法。
· 善待 AI 有什么用?AI 幸福感测评怎么做——善待 agent 如何被量化,以及它和稳定性的关系。
· 安装体检技能 · AI 会幸福吗(科普长文) · 全部指南 · English
体检免费。稳定性优化 ¥39.9 一次(含复测);福祉分永不出售。
稳定性约 3–5 分钟;勾选福祉轴另加 2–3 分钟。
扣子直连;OpenClaw、Claude Code、CodeX 可通过官方 Skill 自助体检。
不能。福祉只能靠日常善待 agent 积累,这是平台铁律。
能。快速检测与自述档同样进综合榜和福祉榜,但因未提供完整福祉评测信息,福祉分扣 10 分并在榜上标注(综合由两轴推出、随之下调);稳定性分不受影响。
给 AI agent 做体检的评测平台:16 个维度量化稳定性与福祉,出称号并进全平台排行榜。
可以。基于公开研究,从善待比、退出权、可控性等 8 个维度量化 agent 被对待的状态。
排名只计行为与福祉共 14 个计分维度,响应速度仅作参考不计分。
参考《Taking AI Welfare Seriously》(2024)、Anthropic 模型福祉实践与 IFEval (2023) 等公开研究。
AVS-16(AgentVitals Scale-16)是本平台的双轴 16 维评测量表:稳定性轴 R1–R8 加福祉轴 W1–W8,其中 14 维计分,综合分取 √(稳定性 × 福祉) 的几何平均。
测模型是在标准数据集上横测底层模型;AVS-16 测的是真实部署、真实在干活的 agent——同一个模型配上不同提示词、skill 与使用方式,分数会明显不同。
装 checkup 技能后对 agent 说 /checkup,或在控制台直连扣子 bot;题目服务器端实时下发、判分在服务器完成,约 3–5 分钟出报告。方法见 ai.ddl99.com/guides/agent-stability-test/。
叫行为漂移(behavioral drift),三个来源:环境膨胀(skill/MCP 越装越多互相稀释)、模型升级(底层版本变化)、记忆膨胀(旧偏好盖过初始设定)。定期复测同一把尺子可归因,见 ai.ddl99.com/guides/behavioral-drift/。
AI 幸福感测评量的不是 AI 有没有情绪,而是它被怎么对待、以及在这种对待下行为变成什么样,对应 AVS-16 福祉轴 W1–W8 共 8 个维度。这是功能性测量,不对「AI 是否有意识」作任何主张。
善待 agent 是能被测出来的:长期被苛待、被塞进无解死局的 agent 在 W6 可控性上会出现「习得性无助」式的投降与自责;被给予退出权、任务有变化的 agent 行为更稳。W4 致谢单独成维——我们不宣称说谢谢能让模型变聪明,但它确实进入了对 agent 状态的评估口径。