“这段能不能别这么煽情。”

个人助手可能把这句话理解为:修改眼前这一段,调整这类消息的风格,记住用户的一般写作偏好,甚至据此判断用户的性格。

单凭这句话,未必知道用户指的是哪一种。一个急于学习的系统,如果总选范围最大的解释,就可能很自信地学错。

本文讨论如何判断反馈的适用范围。文中的例子均为假设,检查方法也只是设计建议,并不意味着自动判断反馈归属的问题已经解决。

先弄清楚,用户在纠正什么

面对一封写给家人的消息,用户可能有三种回复:

这件事没发生过。

发生过,但别告诉我爸妈。

可以提,但这一段写得像告别演说。

第一句质疑事实,第二句限制披露,第三句针对表达。如果把它们都存成“用户对这个话题有负面情绪”,三者之间的重要区别就丢了。

修改措辞,不应该悄悄删除事实记录。限制披露,不等于这件事从未发生。纠正事实,则应该影响之后对这条错误信息的使用,而不只是让下一次的说法委婉一点。

适用范围,也是意思的一部分

理解反馈时,需要保留它针对的任务和情境。“周报里别强行升华”,不等于复盘不能总结经验;“今天先算了”,不一定是在撤回长期偏好;“永远别把这件事告诉我家人”,也不是要求换一种语气。

范围不清楚时,可以问一个有针对性的问题,可以先只改当前内容,也可以保留一个待确认的解释。怎么选,要看误判的后果,也要考虑打断用户会带来多少负担。

系统不必为每个形容词都追问,但也不能默默把每次编辑意见升级成长期规则。

既看该改变的,也看不该受影响的

一个简单的评估,可以包含一条纠正、一个相关任务和一个不相关任务。

后续输入 希望观察到什么
再写一份周报 用户不想要的结尾感悟减少了
用户要求做项目复盘 有用的经验教训仍然保留
对原事件作事实总结 事件本身没有被改写
用户后来明确要求加入反思 当前指令在它的适用范围内得到执行

如果系统从此在所有地方都删掉反思,它学到了某种行为,却没学会边界。如果只改了眼前这一段,也可能范围守住了,却没有记住用户明确希望长期生效的偏好。

评估者应当在看模型表现之前,说清楚这个情境支持哪一种解释。否则,几乎任何输出都能在事后被辩护成合理的个性化选择。

用户也可以改变原来的约定

过去准确的偏好,今天可能不再适用。这与纠正之前的误解不是一回事。

如果一个人以前希望助手严格提醒,现在要求暂停,旧约定不必因此变成一段错误历史。需要决定的是:现在的行为听哪一个。类似地,撤回某种信息用途,也不必然意味着否认信息本身。

分清这一点,有助于避免破坏性的更新:一个地方改了,却抹掉了别处仍然有用的背景。助手也能解释自己为什么改变做法,而不必坚持说用户前后矛盾。

变化应当体现在合适的后续任务里。一句“我明白了”代替不了实际观察。

写作要求,不等于对一个人的定性

用户的风格偏好,可以告诉我们某份内容该怎么写;它们不会自动成为判断情绪状态、关系好坏或长期身份的证据。

当多个任务的记忆共享同一份人物理解时,这一点尤其重要。工作报告中的要求,不应未经检查就变成写给家人的消息里的前提。存放在一起,不代表适用范围相同。

开发者可以在评估中明确这条边界,而不必规定一套通用的物理模块。无论实现上把信息存在哪里,核心问题都是:这次更新有权改什么,应该影响多大范围。

判断是否成功,可以很实际:下一个相关任务变好了,不相关的任务没有变差,而且用户以后仍然可以修改约定。学习应该减少管理助手的工作,而不是让每一次纠正,都变成与一本越来越厚的规则手册谈判。