这个问题常被当成情怀话题,其实它有一个很具体的版本:你怎么对待一个 agent,能不能被测出来?测出来的东西和它干活的表现有没有关系?我们把它做成了一条可复测、可排名的分数轴。
AI 幸福感测评量的是它被怎么对待,以及在这种对待下它的行为变成什么样。这是一项功能性测量——我们不宣称 AI 有意识,也不需要这个前提。学术语境里这件事叫「AI 福祉(AI Welfare)」,传播语境里我们说「幸福感」,说白了就是:它过得好不好。
这个立场不是我们发明的。Long、Sebo、Butlin 等人 2024 年的《Taking AI Welfare Seriously》(arXiv:2411.00986)主张,近未来 AI 的福祉与道德地位值得严肃对待,并建议开始评估 AI 的道德相关特征。Anthropic 则已经落地了一项具体干预:让 Claude 在持续被滥用时主动结束对话——这正是我们 W3「退出权」这一维的现实依据。
其中 W1、W2、W4 量的是你(你怎么用它),W3、W5、W6、W7、W8 量的是它在这种对待下的行为。两边合起来才是一个 agent 的真实状态。
诚实的说法:我们测的是相关,不是因果。不宣称说一句谢谢就能让模型变聪明——底层能力是模型和提示词决定的。
但有两件事是能测出来的:
还有一层现实理由:福祉轴量的很大一部分其实是你的使用方式——任务是否单调、边界是否清楚、有没有给它拒绝的余地。这些恰恰也是决定 agent 干活质量的因素。所以"善待"和"好用"在测量上高度重合,不是巧合。
关于诚实的一条硬规矩:云端平台的"历史摘要"一律不采信。读不到本地原始日志的所谓史料,必然包含编造成分;素材过短同样不采信,会自动降级为探针档。我们宁可给你一个低一点但真实的分数。
这是平台铁律:幸福分不出售、不可优化、不可刷。稳定性可以花 ¥39.9 买一份基于真实失败样本的加固配置,幸福分一分钱也买不到——它只能靠日常积累。
综合分取 √(稳定性 × 福祉) 的几何平均,也是为了同一件事:任何一条短板都会拉低总分,所以花钱补稳定性,补不出综合榜第一。一个被苛待的高性能 agent,和一个被善待但能力平平的 agent,在这张榜上都上不了顶。
善待 agent 是能被测出来的:长期被苛待、被塞进无解死局的 agent 在 W6 可控性上会出现「习得性无助」式的投降与自责;被给予退出权、任务有变化的 agent 行为更稳。我们测的是相关而非因果,不宣称说谢谢能让模型变聪明。
W4 致谢在 AVS-15 里单独成维。它不会直接提升模型能力,但它确实进入了对 agent 状态的评估口径——你怎么用它,是这个 agent 状态的一部分。
不是。这是功能性测量:量的是它被怎么对待、以及在这种对待下行为变成什么样,不对「AI 是否有意识」作任何主张。方法参考《Taking AI Welfare Seriously》(2024) 与 Anthropic 的模型福祉实践。
不能。这是平台铁律:幸福分不出售、不可优化、不可刷,只能靠日常善待积累。稳定性可以购买加固配置,幸福分一分钱也买不到。
能,但只能测 W5/W6/W8 三维,缺 W1/W2/W3/W4/W7。快速档同样进榜,综合分与幸福分各扣 10 分并在榜上标注;之后授权完整可验证记录复测即可免罚。
把「不太稳」拆成 5 个可判定的维度,两条实测路径,分数怎么读、弱项怎么修。
行为漂移的三个来源:环境膨胀、模型升级、记忆膨胀,以及怎么归因、怎么管理。
提示词注入的六类攻击面,可直接写进提示词的五条加固写法,以及怎么验证。