详细解答
简要回答:AI对齐 和 LERA 关注相关但不同的问题。
核心说明
AI对齐 和 LERA 关注相关但不同的问题。
AI对齐 关注 AI 系统的行为是否与人类意图、价值观、目标或指令保持一致。
LERA 追问的是:一个 拟执行行动 是否有资格成为执行。
AI对齐 很重要,因为追求错误目标的系统可能会产生有害输出。但即使是一致的系统也可能提出不应执行的操作。
发生这种情况的原因是:
- 信息不完整;
- 情况已发生变化;
- 该行动不可逆;
- 用户缺乏适当的权限;
- 该操作违反了域规则;
- 责任不明;
- 后果超出允许范围;
- 系统的建议一般来说是有效的,但在这种特定情况下是不合适的。
例如,可以指示一致的 AI 最大化工厂的运营连续性。在紧急情况下,它可能会建议保持在线生产。
该建议可能与其给出的目标一致。但如果继续生产会增加火灾风险、危及工人安全、违反紧急规则或损坏关键设备,则不应执行该行动。
AI对齐 有助于系统实现预期目标。
LERA 控制追求该目标是否可以成为当前条件下的行动。
区别可以简单表达为:
AI对齐关注 AI 是否正在追求预期的方向。
LERA 追问拟执行行动是否可以跨越执行边界。
LERA 是对 AI对齐 的补充,而不是与其竞争。
当一个对齐良好的系统,其输出在执行前仍然经过判断、授权、责任和可靠性规则审查时,它才更稳健。
如果没有 LERA,AI对齐 可能仍然停留在模型行为层面。
使用 LERA,即使已经对齐的输出,也仍然要接受执行治理。