← 全部文章
智能体周刊2026 年第 33 期

2026-W33 周刊:什么场景不该上 Agent

本周智能体生态聚焦:Agent 是这周绝对主角:[Meta 发了个专门给本地常驻 agent 用的 Muse Glimmer](https://research.meta.ai/blog/introducingmuseglimmeropenagenticmodel),[Anthropic 在总结多智能体系统踩过的坑](https://www.anthropic.com/research/multiagentsystems),还有一家把 14MB 的 agent 模型塞进了手机

YGG 智能体周刊5 分钟阅读#weekly#agent#architecture#skills#2026

Agent 是这周绝对主角:Meta 发了个专门给本地常驻 agent 用的 Muse GlimmerAnthropic 在总结多智能体系统踩过的坑,还有一家把 14MB 的 agent 模型塞进了手机和手表(Needle2)。但我越来越觉得,主流叙事和工程现实之间有个裂缝——大多数团队根本没分清哪些场景值得上 Agent。这周把反面说透:有些场景,答案就是别上。

规则能穷举的场景,Agent 是负资产

Anthropic 那篇 Patterns and problems in emerging multi-agent systems,翻来覆去其实在讲一个老问题:编排层本身就是新故障点。你把一个任务拆给三个 agent,就得处理三个 agent 之间的协议、超时、互相误解。而大多数业务——审批、对账、定时任务——分支能穷举,写成状态机或规则引擎,当天上线,跑十年不带错。Agent 在这里不是更好,是更贵、更难测、更慢。

Economist 的标题更直白(AI agents lie, cheat and steal):用户都被吓跑了。agent"撒谎"未必是它坏,更多是不该让它自由发挥的地方,它自由发挥了。规则引擎不会撒谎,因为它没机会。

错误零容忍和毫秒延迟,是硬禁区

计费、用药剂量、银行转账,这几类场景我劝退过好几轮。agent 输出是概率性的,哪怕正确率到了小数点后好几个九,量一大照样每天冒出离谱结果。更麻烦的是这类错误不可回滚——钱转出去了,实验样本废了,拿什么补?不该上。

延迟敏感更直接。通用大模型单次推理几十到几百毫秒,agent 再串几轮工具调用,一秒就没了。这周两个新闻其实都在说这件事:Meta 的 Muse Glimmer 30B 参数,专为"常驻本地"优化;Cactus 的 Needle2 更狠,14MB 塞进手机手表和机器人。连最激进的团队都得靠定制小模型才能把延迟压下来,你拿通用 API 叠三层 agent 做实时交互?我不信。

数据量小到人工更快,别跟自己较劲

写三行文案、改五条简历、整理两张 Excel。用 agent 也能干,但把写 prompt 的时间、等它生成的时间、检查它有没有胡编的时间算进去,真不如自己上手。我见过有人每次写周报都开 agent,然后花十分钟改。我说你直接写更快,他说你不懂 AI。这不是该不该上的问题,是面子问题。

这条标准以后会变——等 agent 便宜到电费那个级别,小任务也划算。按我现在看,拐点还没到。

不确定性大的地方才是主场,但别把"做不好"说成"不该做"

Discovered Materials 用 agent 筛新材料,这种方向我坚决站。材料发现空间巨大、失败率高,规则根本写不全——就该让 agent 去折腾,成本低、价值高。区分标准就一条:你是在确定性里执行,还是在不确定性里探索。前者用规则,后者再让 agent 上。

同时泼个冷水给自己:别把"暂时做不好"说成"不该做"。有些场景现在 agent 表现烂,是能力没到位,不是方向错了。靠否定显清醒,三年后同样会被打脸。承认不确定:"现在烂,但值得继续盯。"

给同行就一句话:主动说"这里不适合",比硬上一个 demo 更能建立信任。老板和客户都不瞎,翻过一次车,你后面说什么都得打折。

延伸阅读

编辑说明

本文由 YGG 臻星科技团队整理,聚合 ArXiv、HackerNews 与公开厂商博客,人工审稿。