我给个目标它自己搞定——这类项目我今年一个都没投
去年这时候,几乎每周都有人问我同一个问题:你们做不做通用智能体。我说不做。对方通常「哦」一声,然后不再回消息。
我不觉得那是我的判断赢了。我只是没找到愿意为它付钱的人。
现在热度在退。会议上的 demo 少了,PPT 里的「自主规划」少了。我反而觉得,这才是能看清东西的时候。
剩下两类,边界都很窄
第一类:窄场景自动化,工具边界是写死的。它只能调三个接口,只能读一种格式的文件,只能在一个系统里操作。它能干的事很少,少到你能在纸上画完。
第二类:给专业人员当副手。医生、律师、审计、结构工程师。它不拍板,它出草稿、找疑点、做初筛。拍板的人有能力当场发现它错了——这一点比模型分数重要得多。
一个具体例子
有家做工业配件分销的公司,去年想做全自动询价处理。客户邮件进来,agent 读邮件、查库存、算价格、直接回。做了四个月,上线两周就撤了。
撤的原因不是它笨。它大概八成的邮件处理得不错。问题在剩下那两成——它把一款配件的材质看错,报了个低三成的价,对方当场接受。销售发现的时候,合同已经发出去了。
后来他们改了方案。agent 只做一件事:从邮件里把规格参数抽出来,填进 ERP 的报价草稿。人看一眼,改两个数,点发送。现在跑了快一年。
同一个模型,同一批数据。差别在失败一次的代价:前者是一份已经发出去的错报价,后者是一个还没点发送的草稿框。
我现在只问一个问题
这个项目失败一次,代价能不能被现有流程吸收。
拆开是三个小问题。它出错的时候,谁会发现?发现得早不早?发现了改得回来吗?
三个答案里只要有一个是「没人」「很晚」「改不回来」,那这个项目 demo 再漂亮我也不投。
这条标准很土。它不看模型能力,不看团队背景,看的是流程里有没有人接着。
热度退潮不等于技术不进步
这两件事经常被混在一起说。
上一轮是演示驱动的。谁能做出最像人的 demo,谁拿钱。这一轮在变成错误驱动的——真正在用的人开始攒经验:哪种输入会让它跑偏,哪几类操作必须拦下来,日志里哪几行是预警。
这些经验不好看,写不成 PPT。但它们是真的。
我可能被打脸的地方
如果模型的可靠性再往上跳一级,边界会往外扩。原来必须有人接着的环节,可能就不需要了。这个我自己也犹豫。
我现在的答案是:等它跳了再说。在它跳之前,我宁可把边界画窄一点,让人站在流程里。
演示会安静下去,日志会多起来。我觉得这样挺好。