2026-W33 周刊:Agent 代码怎么写单测
本周智能体生态聚焦:这周最值得说的判断:Agent 代码的单测,重心不该放在模型输出上,而该放在模型输出之后那一段——解析、校验、状态流转,这些是确定性的,测得住。Anthropic 的 multiagent 研究里观察到的翻车模式,Economist 那篇《AI agents lie, cheat and steal》,其实都在暗示同一件事:模型输出靠不住,但靠不住的旁边有一圈靠得住的代码,那才是单测的地盘。 先搞清楚为什么 mock 固定回答是死路 很多人写 agent