智能体安全研究报告:从大模型安全到可控行动系统202606.pdf

这份报告《智能体安全研究报告:从大模型安全到可控行动系统》旨在探讨智能体(Agent)在企业应用中的安全挑战与解决方案。报告的核心观点是:智能体安全的核心在于让AI行动“可授权、可约束、可追责”,其安全目标不是防止模型犯错,而是控制错误的扩散。
报告指出,智能体安全已从厂商最佳实践上升到国家级安全议题,其风险本质已从“内容风险”升级为“行动风险”。智能体不仅仅是聊天机器人,而是具有权限、能执行动作的运行时系统,其安全边界远大于普通大模型。
报告提出了“一句话定义”:**智能体安全 = 身份 + 权限 + 工具 + 日志**,并强调了身份、权限、工具、上下文、沙箱、审批和审计是应对智能体安全的关键要素。
**关键判断与战略含义:**
* **行动系统安全**:Agent的安全边界比聊天机器人更广,它是一个有权限的运行时系统。
* **工程控制**:仅靠提示词无法保证工具调用和外部动作的安全。
* **组织治理**:企业壁垒在于安全控制平面,而非单个模型。
* **战略含义**:Agent能力会商品化,但安全部署能力不会;模型和框架易得,但可规模化的权限、审计、评测和事故响应是组织能力;越早建立控制平面,越能更快释放Agent价值。
**智能体系统的构成与运行:**
智能体系统是一个包含“模型+软件+权限+数据+人”的组合系统,其运行时涉及工具调用、多步骤规划、模型上下文协议(MCP)、沙箱、记忆、多Agent协作等。Agent的运行是一个“感知-计划-记忆-观察-调用-再行动”的闭环,每一步都需要读取新上下文并产生新动作,长循环需要熔断和阶段性确认。
**核心安全要素(七层控制):**
报告详细阐述了智能体安全的七层控制模型:
1. **身份层**:明确执行动作的主体,要求独立身份和代理链,每次工具调用应记录用户、Agent、服务账号和审批链。
2. **权限层**:按任务授予权限,而非全量继承;权限应分级(只读、草稿、半自动、自动),高风险动作需审批。
3. **工具层**:工具是能力也是攻击面,需有描述、Schema、权限、风险标签;工具返回内容不能自动变指令,调用前后需策略检查。
4. **上下文层**:区分指令、用户意图和普通数据,不可信数据需标记隔离,避免恶意指令。
5. **记忆层**:长期记忆可能带来持久攻击面,记忆写入需可见、可审批、可回滚,敏感偏好和规则不能随意写入。
6. **沙箱层**:代码、文件、命令操作需隔离,限制网络、文件系统、命令和资源;高风险任务需快照、资源限制和回滚。
7. **审计层**:建立“Action Ledger”,记录每次工具调用、参数、结果、批准人和时间,以便追责和回放。
**核心风险地图(八类风险):**
报告列举了八类核心风险:目标劫持、工具滥用、身份与权限滥用、私有数据泄露、记忆与上下文污染、意外代码执行、Agentic供应链、多Agent级联失败、人机信任利用、行为漂移与规格博弈、不可审计风险。
**安全控制架构与运营:**
报告提出了“控制平面”的理念,强调**安全能力要变成平台能力**,通过统一的Agent Registry、工具注册中心、策略引擎、DLP、SIEM和沙箱等组件,实现对Agent的集中管理、策略编排和全局监控。安全控制应覆盖Agent的整个生命周期,包括安全开发流程(SSDF, Secure by Design),并与业务指标结合进行评测。
**落地路线图与结论:**
报告提供了90天和180天的落地路线图,建议从低风险、高频、可回滚的任务开始试点,逐步建立清单、权限、日志基线,扩展Agent Registry和工具注册中心,最终形成跨团队评测和上线流程。最终目标是让**AI行动可控,企业部署可信**,并通过**安全控制平面**实现**安全地规模化(Scale safely)**。报告强调,安全不是Agent的刹车,而是规模化的发动机。
相关报告
-
26.47 MB 82页 2026从超级个体到超级团队:AI时代组织变革的涌现路径研究报告-腾讯研究院-202606.pdf
-
24.43 MB 83页 智能体管理学——从模型能力到组织操作系统-清新研究-202603.pdf
-
13.08 MB 61页 从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例-浙江大学-202503.pdf
-
6.13 MB 33页 情绪经济专题报告:小情绪有大市场,从性价比到心价比-中航证券-202606.pdf
-
7.12 MB 58页 2026AI大压缩:智能经济时代的生产范式转移研究报告-香港大学人工智能-202606.pdf
-
105.42 MB 51页 从“人群画像”到“心智地图”:汽车八大人群心智重构白皮书-懂车帝-202606.pdf
-
49.95 MB 102页 从对话到执行:OpenClaw企业级智能体应用手册-前哨科技-202603.pdf
-
11.89 MB 44页 从零上手OpenClaw科研智能体-厦大团队-202603.pdf
-
2.47 MB 44页 OpenClaw:AI从聊天到行动 下一代智能助手白皮书-边缘计算社区-202601.pdf
-
8.92 MB 105页 Agentic+Coding元年:从Vibe+Coding到超级个体-北京大学-202602.pdf
-
9.23 MB 54页 智能体与传播应用研究报告-中国传媒大学-202602.pdf
-
10.38 MB 105页 2025年企业级智能体产业落地研究报告:从场景试点到规模化应用实践.pdf
-
25.02 MB 366页 2025年大模型应用:从提示工程到AI智能体报告.pdf
-
6.48 MB 52页 2026中国智能体经济白皮书-复旦大学住房政策研究中心-202609.pdf