返回所有信件
A Letter from the Founder第 27 封

演示会安静下去,日志会多起来

过去一年半我大概看了两百个智能体项目。热度退潮之后,我认为会剩下两类:有明确工具边界的窄场景自动化,和给专业人员当副手的辅助工具。那种「给个目标它自己搞定」的演示会安静下去。但这不等于技术不进步——恰恰是这时候,真正在用的人开始攒出经验。我现在判断一个项目值不值得投,只问一件事:它失败一次的代价,现有流程能不能吸收。

YGG 创始人5 分钟

我给个目标它自己搞定——这类项目我今年一个都没投

去年这时候,几乎每周都有人问我同一个问题:你们做不做通用智能体。我说不做。对方通常「哦」一声,然后不再回消息。

我不觉得那是我的判断赢了。我只是没找到愿意为它付钱的人。

现在热度在退。会议上的 demo 少了,PPT 里的「自主规划」少了。我反而觉得,这才是能看清东西的时候。

剩下两类,边界都很窄

第一类:窄场景自动化,工具边界是写死的。它只能调三个接口,只能读一种格式的文件,只能在一个系统里操作。它能干的事很少,少到你能在纸上画完。

第二类:给专业人员当副手。医生、律师、审计、结构工程师。它不拍板,它出草稿、找疑点、做初筛。拍板的人有能力当场发现它错了——这一点比模型分数重要得多。

一个具体例子

有家做工业配件分销的公司,去年想做全自动询价处理。客户邮件进来,agent 读邮件、查库存、算价格、直接回。做了四个月,上线两周就撤了。

撤的原因不是它笨。它大概八成的邮件处理得不错。问题在剩下那两成——它把一款配件的材质看错,报了个低三成的价,对方当场接受。销售发现的时候,合同已经发出去了。

后来他们改了方案。agent 只做一件事:从邮件里把规格参数抽出来,填进 ERP 的报价草稿。人看一眼,改两个数,点发送。现在跑了快一年。

同一个模型,同一批数据。差别在失败一次的代价:前者是一份已经发出去的错报价,后者是一个还没点发送的草稿框。

我现在只问一个问题

这个项目失败一次,代价能不能被现有流程吸收。

拆开是三个小问题。它出错的时候,谁会发现?发现得早不早?发现了改得回来吗?

三个答案里只要有一个是「没人」「很晚」「改不回来」,那这个项目 demo 再漂亮我也不投。

这条标准很土。它不看模型能力,不看团队背景,看的是流程里有没有人接着。

热度退潮不等于技术不进步

这两件事经常被混在一起说。

上一轮是演示驱动的。谁能做出最像人的 demo,谁拿钱。这一轮在变成错误驱动的——真正在用的人开始攒经验:哪种输入会让它跑偏,哪几类操作必须拦下来,日志里哪几行是预警。

这些经验不好看,写不成 PPT。但它们是真的。

我可能被打脸的地方

如果模型的可靠性再往上跳一级,边界会往外扩。原来必须有人接着的环节,可能就不需要了。这个我自己也犹豫。

我现在的答案是:等它跳了再说。在它跳之前,我宁可把边界画窄一点,让人站在流程里。

演示会安静下去,日志会多起来。我觉得这样挺好。

此致

YGG 创始人

YGG 臻星科技

不同意?也想反馈?通过 /contact 或右下角对话框直接告诉我,每一封信我都自己读。