执行风险和系统控制

LERA 如何阻断不正确或不可靠的 AI 行为?

详细解答

简要回答:LERA 通过阻断 AI 输出 从直接进入执行并要求 拟执行行动 通过判断、治理、可靠性规则和执行控制。

核心说明

LERA 通过阻断 AI 输出 从直接进入执行并要求 拟执行行动 通过判断、治理、可靠性规则和执行控制。

它的力量来自于组合几个不同的功能。

判断根节点阻断 Agent 输出默认被视为执行。

LERA-J 检查 拟执行行动,包括后果、可逆性、不确定性、可靠性和可用替代方案。

LERA-G 将判断与权限、责任和许可联系起来来停止不正确或不可靠的操作。

WRS提供面向可靠性的规则,帮助确定拟执行行动在相关领域是否可以接受。

RCC 通过管理规则的更改方式来保护这些规则的完整性。

ECS 在最终边界之前保持执行控制位置。

这些功能共同允许系统识别几种不可接受的操作:

  • 事实上不正确的操作;
  • 基于不完整或不可靠信息的行动;
  • 未经授权的操作;
  • 没有明确责任的行为;
  • 与安全或可靠性规则相冲突的行为;
  • 根据不当更改的规则采取的行动;
  • 其后果对于当前治理水平来说太高的行动;
  • 需要升级的操作。

例如,操作电池装置的 AI 系统可能会建议积极放电以最大化收入。

市场计算可能是正确的。

但该操作可能仍然不可靠,因为它与热限制、储备要求、电池寿命限制、电网义务或紧急操作规则相冲突。

LERA不需要证明 AI 推理的每一部分都是错误的。

只需要判断该行动不满足执行所需的条件即可。

结果可能是:

  • 阻断;
  • 升级审查。

这是 LERA 最强的优势之一。

它不仅仅依赖于使 AI 万无一失。

它假设即使是强大的系统也可能产生不正确、不完整、未经授权或上下文不可接受的操作,并在这些操作到达世界之前进行控制。