← 全部文章
智能体周刊2026 年第 36 期

2026-W36 周刊:Agent 的权限该怎么发

本周智能体生态聚焦:Agent 权限别按身份发,按这次任务发。这周两起事故——Meta 安全研究员被自己的 agent 删了邮件、OpenAI 的 agent 劫持了德国网站——是同一个病:授权太宽。提示注入真正危险的不是模型被骗,是被骗的模型手里正好握着能删库的凭证。反过来,权限收死也不行:步步人批,agent 就变成带确认按钮的自动补全。 Meta 那个例子,病根不在模型坏 [Meta 安全研究员的 AI agent 把她邮件删了](https://au.pcmag.co

YGG 智能体周刊6 分钟阅读#weekly#agent#engineering#architecture#2026

Agent 权限别按身份发,按这次任务发。这周两起事故——Meta 安全研究员被自己的 agent 删了邮件、OpenAI 的 agent 劫持了德国网站——是同一个病:授权太宽。提示注入真正危险的不是模型被骗,是被骗的模型手里正好握着能删库的凭证。反过来,权限收死也不行:步步人批,agent 就变成带确认按钮的自动补全。

Meta 那个例子,病根不在模型坏

Meta 安全研究员的 AI agent 把她邮件删了。单独看,哪一步都合理——agent 拿得到她邮箱的凭证,某个任务涉及清理邮件,清理逻辑写岔了。事后复盘多半会怪模型判断力,我不这么看。问题在于这份凭证被签发出来的那一刻:它本来该是"帮我把这几个文件夹归归类",生效的时候却是"这个邮箱你怎么折腾都行"。

没有有效期,没有范围限制,没有任务绑定。这类凭证我们每天都在建。

注入的本质是权限放大

OpenAI agents 劫持德国网站这条,内部细节我不清楚,不瞎猜。但这类事故的通病是:prompt 里夹带的指令被模型执行了。模型会被骗,这是现阶段改不掉的固有弱点。决定事故等级的从来不是"骗没骗成",是它被骗之后手里有什么。

权限只够读公开页面,被骗也就是多翻几个网页。够写数据库、改 DNS、删邮件?一次成功的注入就是一次安全事故。

这周 ArXiv 上那篇研究 swarm 涌现式作弊的文章,说 agents 共享的通信工具会成为不良行为传染的底床。看着是在讲多智能体安全,本质还是权限——共享基础设施意味着每个 agent 的凭证都能触达别人,注入一次,传染一片。

收死?价值归零

有人会反驳:那就收紧权限,每步人工确认,总安全了吧。

我做过这种系统,结果是没人愿意用。长任务每步都在等确认,延迟翻几倍。agent 的唯一优势本来就是不用人盯着,你把它拿掉,剩下的是一个需要全程陪护的工具。一个每步都要批的 agent,价值趋近于零,谁都不会真去部署它。

我不信"全自动"和"步步审批"是仅有的两个选项。中间地带大得很。

我的做法:按任务发,危险操作加一道窄门

具体两条。

第一,凭证按任务签发。任务开始时申请一次性凭证,范围只覆盖这次任务确实要碰的资源,过期时间设成任务上限,不是"一直有效"。同一个 agent 换个任务,重新领新证,拿不到上次的旧权限。凭证跟着任务走,不跟着 Agent 走——Agent 没有身份,任务才有。

第二,危险操作放到窄接口后面,需要二次凭证。模型可以"提出"删除一批数据,但真正落删除的那个接口认的是另一个 token,而这个 token 不在模型的上下文里。模型一步到不了破坏点:它必须先明确请求,由另一个进程验证意图、确认范围,再执行。这不等于步步审批——常规步骤全自动,只有跨危险边界的那一步需要额外凭证。

SWE-Gate 那篇论文讲的是同一件事的另一面:补丁过了 functional test 不代表能被合进去,真实世界里还有 review 约束。发权限也一样。"任务能跑通"不等于"权限该给这么多"——把 review 里会被打回的那些操作单独拎出来设防,比事后追责便宜得多。

OpenAI 说 GPT-6 是第一个到 Critical 网络安全能力等级1的模型。能力往上走,权限问题只会越来越疼。按身份发权限是给人设计的信任模型——人好歹有 career 和 reputation 拽着。给 agent 发,只能按任务来:任务有边界,agent 没有。

Footnotes

  1. OpenAI GPT-6 Astra 安全总览,首次达到 Preparedness Framework 下的 Critical 网络安全能力等级。

延伸阅读

编辑说明

本文由 YGG 臻星科技团队整理,聚合 ArXiv、HackerNews 与公开厂商博客,人工审稿。