Skip to content

04 / 安全、权限与护栏

Agent 能执行动作,就必须明确它可以做什么、什么时候需要确认,以及失败后如何停止或回滚。

按风险分级

风险级别示例建议控制
读取公开资料、生成草稿自动执行,保留日志
修改工作区文件、发送内部消息限定范围,执行前确认
删除数据、发布内容、修改生产配置强制审批、备份和回滚

最小护栏

  • 凭据不写进提示词、日志或输出文件。
  • 写入、发送、删除和发布动作要有明确的边界。
  • 工具失败时返回可读错误,不让模型凭空猜测成功。
  • 每个长任务都要有最大迭代次数和停止条件。