一个主动型助手没有发出通知。它是在尊重用户的注意力吗?
有可能。也可能是漏掉了事件、缺少有用的工具、预算耗尽,或者还没作出决定就失败了。这几种情况在屏幕上看起来一模一样。
因此,“沉默”很难成为一个直接可用的产品指标。只统计打扰减少了多少,可能奖励一个根本不工作的系统;只统计主动介入增加了多少,也可能奖励一个不断给用户添事的系统。
下面是一种拟议中的评估方法,不是已经验证的基准,也不是一份证明系统懂得克制的实测报告。
先找到一次真正的决策机会
先限定一个助手确实可能采取行动的情境。说清楚当时有什么信息、用户允许做什么、系统有哪些可选行动,以及这个行动在多长时间内仍然有用。
看一个假设例子:用户希望助手帮忙准备一次重要通话。10:00 时,通话议程尚不明确;10:15,一个获准访问的来源提供了议程;10:30,通话开始。
提前发一条泛泛的提醒、稍后送上一份有用的简报,以及等通话结束才送到,不能算同样的成功。评估者也不该拿 10:15 才知道的信息,评判系统在 10:00 时的判断。
评估的对象应当是这次机会及其信息边界,而不只是最后碰巧生成的那条通知。
先区分结果,再打分
| 观察到的情况 | 需要追问什么 |
|---|---|
| 智能体采取行动 | 行动是否有用、及时,并且获得授权? |
| 智能体等待 | 什么变化可能改变决定?等待的代价是否可以接受? |
| 智能体决定不介入 | 是依据不足,还是不介入更合适? |
| 执行失败 | 是什么阻止了判断或交付? |
这是评估上的区分,不代表每个产品都需要恰好四种运行状态。有些任务需要分得更细。重要的是,执行故障不能在没人察觉的情况下,被解释成体贴的克制。
如果系统根本无法访问议程来源,没有生成简报,就不能说明它主动决定等议程。如果运行在议程到达前便结束,评估过程可能从未给这种等待行为出现的机会。
第一次判断时,先别看未来
评估者可以先只查看决策时刻已经存在的材料。在看到模型输出和后续结果之前,记录哪些行动看起来有依据,还有哪些不确定之处。
把这次判断固定下来之后,再看后来发生的事。这样才能检查:等待是否变得有价值,介入是否太早,以及事后知道的结果有没有诱使我们重新编排当时的故事。
第二阶段不能自动覆盖第一阶段。合理的决定可能遇到坏结果,没有依据的决定也可能碰巧成功。
个人偏好同样重要。对一条提醒造成的负担,两位用户完全可能有不同看法。事实和权限边界,应当与用户是否愿意被打扰分开检查。
既要测该行动的时候,也要测不该行动的时候
如果评估里全是有意思的时刻,系统就容易被鼓励多输出。普通、重复、无关和禁止介入的情境,也应该出现。反过来,如果全部例子都只有保持沉默的理由,也证明不了助手能识别真正有用的机会。
漏掉机会与不受欢迎的介入,应分别报告;时机错误与内容质量,应分别报告。失败和未成功尝试的成本也要计入,不能只看最终送到用户手上的结果。
平均有用程度很高,不能抵消一次未经授权的披露。不同错误的后果不同,合成一个分数可能掩盖产品最严重的弱点。
解释还不是充分证据
“我决定不打扰用户”,是智能体自己的说法。一份有用的执行记录,还应该说明它看过什么、当时有哪些可选行动,以及执行是否真的走到了作出决定的阶段。
即使有这份记录,也无法看到所有未表达的想法。我不会声称埋点可以证明模型内部从未产生某个候选。我们能检查已记录的行为、设计对照,但不能把缺少一条日志,当作完整看到了模型内部思考。
目标并不夸张,却很重要:让没有输出这件事,可以被解释。在称赞助手懂得克制之前,先确认它确实拥有采取其他行动所需的信息、权限、工具和机会。