#weekly#agent#architecture#engineering#2026

2026-W32 周刊:私有化部署的真实成本

本周智能体生态聚焦:私有化部署这事,立项时算的账和两年后实际花的钱,通常不是同一笔账。硬件采购只是入场券,真正吃预算的是三项:GPU 空转、模型迭代、运维人力。这周素材里没有一篇直接讲成本的,但 [ExtractBench](https://arxiv.org/abs/2607.29677v1) 和那篇 [agent 入侵事件时间线](https://huggingface.co/blog/agentintrusiontechnicaltimeline) 恰好用两种方式提醒我

作者YGG 智能体周刊发布于6 分钟阅读

私有化部署这事,立项时算的账和两年后实际花的钱,通常不是同一笔账。硬件采购只是入场券,真正吃预算的是三项:GPU 空转、模型迭代、运维人力。这周素材里没有一篇直接讲成本的,但 ExtractBench 和那篇 agent 入侵事件时间线 恰好用两种方式提醒我同一件事:评测要自己沉淀,安全要自己扛。这两件事,走 API 时是厂商的活,私有化之后全变成你的。

按峰值买卡,日常大半个机房在空转

先说我见过最多的误判:按峰值配卡。业务有旺季淡季,有白天黑夜,GPU 却是买断的,不会因为你业务空转就少收钱。大部分内部团队的峰值需求都远超日常均值,按峰值买的卡,日常一半时间在闲着。更隐蔽的是推理引擎没调好,同样的卡吞吐能差一大截——这活儿又算人力。

我不信有哪个立项 PPT 算过这笔账。因为它不出现在账单上,而是出现在年末盯监控的那一刻:灯都亮着,但队列里没有请求在等。

换模型是免费的,换模型的测试不是

模型迭代是第二笔隐性账。开源模型的发布节奏就摆在那,每次新版本出来,团队里总有人问:换不换?换,评测重跑、prompt 重调、RAG 管线重测,线上再观察一个月。不换,技术债越攒越厚。半年重新评估一次不是夸张,是保守。

这成本在 API 方案里接近零——厂商把升级消化了。私有化之后,每次升级的测试都是你的工时。ExtractBench 测的是企业文档抽取,schema-guided 那种。它提醒我的不是基准本身,而是另一件事:你的业务场景得有一套自己的评测集,换模型就重跑一次。这套东西的建设和维护,也得有人做。按我现在看,这部分的工时不比部署本身少。

运维和安全这笔账,立项时没人写

运维人力最容易在立项时被塞进「顺便管一下」。硬件坏了要修,驱动要更新,推理服务要盯监控,安全补丁要打。这些活不产生业务价值,但不干不行。

这周 HuggingFace 那篇 前沿实验室 agent 入侵事件的时间线 我读完的感受是:防护措施是事发之后才补齐的。前沿实验室的 infra 比我们强得多,他们都被打穿了,你的私有化部署得自己扛这层安全。同期还有篇 论文 说,长政策文档并不能可靠地约束 agent 行为。翻译过来:你以为写了三百页 policy agent 就听话?不会。得有人盯。盯,就是人力。

数据不能出域,这笔账可以直接不算

有一种情况上面这些都不用算:数据不能出域。金融、医疗、政务,合同写着,监管盯着。API 再便宜你也没法用——这时候私有化不是成本问题,是资格问题。

但多说一句:先确认你的数据是真不能出域,还是只是「觉得不能」。我见过安全部门一口咬定不准出域,最后发现脱敏后走合规路径其实可行。能把数据出域的问题化解掉,比买卡省得多。

阈值不是拍脑袋,是算出来的

「日均调用量低于多少就别自建」这个值,自己就能测。拉过去三个月的真实调用日志,算日均和峰值,顺带看峰均比——峰值是日均的几倍,这个比值越高,买卡越不划算,因为你要为那一个小时的峰值付三年的钱。然后按峰值配卡,把三年硬件折旧摊进去;再按三年算人力,哪怕只算一个半人的投入,数字都不小。最后拿你真实的 prompt 长度和输出长度,套 API 按量单价,看看同样业务量走 API 一年多少钱。两边一比,大部分日均调用量不高的内部工具场景,结论很直接:别自建。

我不信「私有化一定便宜」,也不信「API 一定坑」。数据能出域、量没到规模,API 更理性;数据不能出域,直接买卡别纠结。最怕的是两头不占:数据明明可以出域,却因为「大家都在部署」也跟着部署。

本文由 YGG 臻星科技团队整理,聚合 ArXiv、HackerNews 与公开厂商博客,人工审稿。