Selected product work / Anonymized case study
为企业运维 Agent 划定可控的自主边界
把“Agent 能不能执行”拆成分级授权、确定性门禁、熔断与证据链,让自动化能力随风险逐级开放。
- Status
- Product design · Validated prototype
- Scope
- Agent governance · Enterprise IT operations
- Topics
- AI Agents · Governance · AIOps
An anonymized case study based on enterprise product design work. Client, company, implementation and commercial details are intentionally omitted.
背景
企业运维 Agent 不只回答问题。它会读取监控与配置数据、生成判断,并可能调用工具改变生产系统。能力越接近执行,错误的影响范围就越大。
因此,产品问题不是“是否使用 Agent”,而是不同场景下允许 Agent 走到哪一步、由谁批准、如何停止,以及事后能否还原决策依据。
需要解决的问题
把自主能力设计成一个开关,会把低风险建议与高风险写操作混在一起。用户无法理解权限边界,平台也无法对不同动作实施差异化治理。
另一个风险是把模型自己报告的置信度当成执行依据。概率输出可以帮助排序,但不能替代权限、规则与业务约束。
本案例呈现的工作
- 定义从建议到受控执行的自主等级,并把每一级映射到明确的用户责任与系统门禁。
- 将审批、白名单、熔断、审计、人工接管和证据链纳入同一个产品模型,而不是作为上线后的补丁。
- 通过交互原型验证建议、批准、执行、失败与回退在一条任务链中的信息连续性。
约束
- 生产环境中的写操作必须遵循最小权限,读取能力不能自然继承为修改能力。
- 高风险动作需要确定性规则和人工责任点,不能仅依赖模型判断。
- 用户必须能够看到动作原因、输入证据、执行记录与失败位置。
- 任何自动化路径都需要可停止、可降级、可回退。
关键产品决策
- 用等级表达自主权,而不是一个自动化开关
- L1 只给建议;L2 生成动作草案并等待人工批准;L3 只在预先授权、规则确定且动作进入白名单时自动执行。不设计无人监督的 L4。
- 模型负责推理,确定性系统负责放行
- 置信度用于排序和解释;权限、对象范围、时间窗口、变更规则与风险条件由可审计的门禁决定。
- 证据链与动作链同时设计
- 每个建议与动作都保留来源、理由、审批、工具调用、结果和异常,使用户能在一次阅读中回答“为什么做”和“实际做了什么”。
- 把失败视为正式状态
- 熔断、超时、部分成功、权限拒绝与人工接管都有明确出口,避免 Agent 在异常后继续尝试或静默失败。
系统模型
Observe
读取事件、对象、关系与当前运行状态。
Reason
形成建议,标注证据、假设与不确定性。
Gate
检查自主等级、权限、白名单、规则与风险条件。
Approve
需要时由责任人确认动作、范围与影响。
Act
调用受限工具并持续检查超时、失败与熔断条件。
Record
写入结果、差异、异常、人工干预与后续建议。
明确舍弃的方案
- 通用、无边界的 AI 助手
- 它隐藏权限与责任差异,也无法让用户预测一次请求会触发什么动作。
- 用模型自报置信度直接放行
- 统计置信度不是业务授权,不能替代确定性控制。
- 默认开放写工具
- 读取和修改是两种不同风险等级,必须分别授权。
- 无人监督的最高自治
- 在企业运维语境下,缺少责任点与紧急停止机制的自治不可接受。
证据类型
原始材料位于非公开产品仓库。这里列出用于形成判断的产物类型,不提供内部文件、截图或链接。
- Autonomy model
- 自主等级、用户责任、动作权限与升级条件。
- Action register
- 动作风险、门禁、审批、熔断与回退要求。
- Interaction prototype
- 建议、批准、执行、失败与审计状态的端到端原型。
- Governance specification
- 权限、证据、人工接管与可追溯性规则。
当前公开状态
已完成产品模型与交互原型层面的验证。
本案例不声称已经生产上线,也不公开内部实施状态、客户信息或业务结果。
An anonymized case study based on enterprise product design work. Client, company, implementation and commercial details are intentionally omitted.