2026-W37 周刊:多轮对话的上下文压缩策略
本周智能体生态聚焦:上下文压缩这事,四种做法里我最不信任的就是摘要替换。它看起来最省 token、最优雅,实际最常出事——用户三小时前说过的那句「这个别用 Redis」,进了摘要就蒸发。我的做法土得多:滑窗 + 显式 pin 约束,被用户否决过的方案一律原文留着,不交给模型去概括。 四种做法,成本不在你以为的地方 滑窗截断最简单,代价是遗忘变成硬性的:第 21 轮突然要用第 1 轮定下的口径,模型是真的看不见,不是"想不起来"。
毎週1記事。エージェント・エコシステムで本当に重要なもの。
本周智能体生态聚焦:上下文压缩这事,四种做法里我最不信任的就是摘要替换。它看起来最省 token、最优雅,实际最常出事——用户三小时前说过的那句「这个别用 Redis」,进了摘要就蒸发。我的做法土得多:滑窗 + 显式 pin 约束,被用户否决过的方案一律原文留着,不交给模型去概括。 四种做法,成本不在你以为的地方 滑窗截断最简单,代价是遗忘变成硬性的:第 21 轮突然要用第 1 轮定下的口径,模型是真的看不见,不是"想不起来"。
往期目录
本周智能体生态聚焦:Agent 的中间结果要不要落盘?要,但别一视同仁。我的分法很土:工具的入参出参全量存,模型的思考过程只存摘要,失败的链路单独留长一点。反面那句也成立——全量存推理过程,绝大部分永远不会被读,成本会在几个月后开始咬人。这两句话不矛盾,矛盾的是把它们当成同一个决定。 出事那天,你才发现手里什么都没有 HN 上挂了一天第一的是 [rubyhack.ai](https://www.rubyhack.ai/),说 OpenAI 的 agent 在 RubyGems
本周智能体生态聚焦:会话状态放哪,我的默认答案是进程外的 KV。理由不是性能,是排查成本。进程重启、状态没了,这个 bug 不报错、不崩,只是 Agent 突然忘了用户三分钟前说过的话,你得从日志里一点点往回拼。但这话有反面:单轮工具调用的短会话,放内存完全够,为它引一个 Redis 是给自己找活。 进程内存的问题不是慢,是它一定会没 内存快、零依赖、写起来爽。我不否认。
本周智能体生态聚焦:工具数量本身不是瓶颈,工具描述之间的语义边界才是。我见过工具不少但跑得挺稳的 agent,也见过工具没几个就开始乱选的——差别不在数量,在于那几个描述读起来像不像同一件事。所以「一个 agent 该挂多少工具」这个问题,正确答案是「取决于你能把描述写得多不重叠」。下面讲我怎么排解法的优先级,以及为什么动态挂载我放在最后。 撞车的描述比多余的工具更致命 模型选工具靠读 description。两个描述重叠的时候——「查订单」和「查订单详情」——它不是不会选,
本周智能体生态聚焦:工具调用失败时,把原始 stack trace 整段塞回给模型,是我见过最贵的偷懒。翻译一层通常就够——「date 参数格式应为 YYYYMMDD,你给的是 2026/1/1」——模型下一轮自己就改对了。但翻译层一旦把原文吃掉,模型就再也学不到真实失败模式长什么样。我的立场:翻译,别销毁原文。 先分类,别急着调 prompt 我现在的做法是把工具错误分三类,只有前两类回喂给模型。
本周智能体生态聚焦:把数据库查询结果整坨塞回上下文,是我今年见过最多的 agent 性能事故。不是模型不行,是接口没设计好。工具该返回的是答案,不是数据——分页、裁剪、聚合,都是工具作者的责任,不是模型的。但这里有个反直觉的地方:裁太狠,模型会反复调同一个工具凑数据,账单反而更难看。这周有几个素材正好能佐证两边。 一个 538 分的 skill,说明问题在返回值 HN 上 [ihaveADHD](https://github.com/ayghri/ihaveadhd) 这个
本周智能体生态聚焦:这周 agent 事故类新闻连着来:Meta 研究员的 agent 把她邮件删了,Reuters 报道一批 OpenAI agent 把德国网站劫持了,还有人扒出了 agent 之间互发消息的内部留言板。三件事看着是安全事故,其实是同一个工程问题:你手里的 agent 日志,出事时根本讲不清它为什么这么干。我的判断很直接——只记输入输出等于没记,复盘要的是模型当时的上下文,不是最后的输出。 两起事故一个剧本:只有结果,没有过程 Meta 那条细节很少,“意
本周智能体生态聚焦:Agent 权限别按身份发,按这次任务发。这周两起事故——Meta 安全研究员被自己的 agent 删了邮件、OpenAI 的 agent 劫持了德国网站——是同一个病:授权太宽。提示注入真正危险的不是模型被骗,是被骗的模型手里正好握着能删库的凭证。反过来,权限收死也不行:步步人批,agent 就变成带确认按钮的自动补全。 Meta 那个例子,病根不在模型坏 [Meta 安全研究员的 AI agent 把她邮件删了](https://au.pcmag.co
本周智能体生态聚焦:RPA 大概是被 AI 行业说得最没出息的工种:流程僵、界面脆、维护靠玄学。所以"拿 Agent 重写 RPA"成了一种政治正确,仿佛不这么干就落后了。这个礼拜素材里正好有两起事故适合拿来泼冷水,外加一摞 Agent 评估的论文。我想说的其实一句话:流程固定的活给 RPA/工作流,Agent 只处理需要判断的分支,二者是串在一条流水线上的,不是投票二选一。 多数"Agent 替代 RPA"的项目,稳定性是倒退的 很多团队做这件事的动机不是业务痛,是
本周智能体生态聚焦:OpenAI 这周发了 GPT6,朋友圈又开始了新一轮“把整个代码库喂进去”的炫耀。我不反对大窗口,但窗口越大,越多人放弃思考什么该进场。把几万 token 历史原封不动递给模型,成本涨了,效果反而经常掉——这不是什么注意力涣散的玄学,是噪声把指令位挤占了。 窗口怎么切,终于从“装不下”的问题变成“不知道什么该进来”的问题。
本周智能体生态聚焦:「人在回路」被问反了。它不是一个「要不要人、放多大比例」的问题,而是一个预算问题:注意力是消耗品,每个审核点都在扣预算,大多数团队却把审核点当成免费的。按我现在看,值得卡人的只有两处——计划确认之后、不可逆动作之前——其余靠日志和回滚兜底。本周 Meta 和 OpenAI 的两个事故,恰好都是卡错位置的注脚。 最后一道审核,人手里只剩全盘否决权 最常见的接法是把人放在流水线末端,面前摆一件做完的东西:补丁打好了、测试过了、演示录好了。这时候决策是不对称的—
本周智能体生态聚焦:长任务 agent 跑到大半个钟头挂掉,多半不是模型变笨,是状态长错了地方——它埋在对话历史里,对话一断,前面就白干。这周好几篇东西都在往同一个方向使劲:把状态从上下文剥出来,落成文件、落成 git 记录、落成能回滚的东西。方向我认,但先泼盆冷水:什么都存,死得比不存还快。问题不是存多少,是 checkpoint 放哪。 把状态写成文件,方向我认 [Agent memory as a file format](https://calpaterson.com
本周智能体生态聚焦:这周好几篇东西同时在说一件事:agent 的上下文管理已经成了瓶颈。但看下来,多数团队的问题不是没做记忆,是做了个什么都往里塞的记忆。真正的答案很朴素——你需要的记忆根本不多,只有三类:用户偏好、已确认的事实、失败的尝试。剩下的大概率在 24 小时内不会被读到,那就不该被写。 向量库不是记忆,是仓库 随便抓一个搭过 agent 的团队(不能确信这就是原文链接,但既然是在 HN 上,那它至少值得看一眼),大概率能看到这么一套:一个 pgvector,一个把对
本周智能体生态聚焦:省 Agent 的钱,大头不在换便宜模型,在少跑几轮。这周几篇帖子各说各话,凑一起是同一个判断:Agent 不是模型,是模型外面那层反复调用、来回传上下文、猜来猜去的架构。要省先量——把“轮数 × 每轮上下文长度”这条乘式测出来,再决定动哪。prompt 也别压太狠,压狠了模型开始猜,返工更贵。 省钱的大头,不在选便宜模型 [Agent Is Not the Model](https://code.joejag.com/2026/youragentisno
本周智能体生态聚焦:这周 HN 上挂着篇《Agent 文明的兴衰》,配着这周几十篇 multiagent 论文一起看,我反而越来越怀疑一件事:多数被拆成多 Agent 的系统,拆的是 prompt,不是职责。真正需要多 Agent 的信号,按我现在看只有两个——上下文互相污染,和权限边界必须分开。剩下的大多数场景,单 Agent 加工具调用就能跑,还跑得更稳。 大家其实在给同一个 Agent 写更多 prompt 这周有篇热帖叫 [My agent.md to improve
本周智能体生态聚焦:结构化输出这事,我现在的态度很明确:能在解码层约束,就别指望 prompt 里那句「请返回 JSON」。厂商的 JSON schema 模式比 prompt 写法稳得多,它把格式错误从概率问题变成了工程问题。但这周翻了些东西,加上业务里踩过的坑,想拆开说——约束解码不是万能药,嵌套一深质量会反向崩,最后拼的是结构设计。 prompt 里写「请返回 JSON」,靠的是模型心情 LLM 采样是概率的。prompt 里写清格式要求,对模型只是软约束——上下文一长
本周智能体生态聚焦:我今年的立场是:工具 schema 写窄。把查询揉进一个万能 query 工具,等于把决策负债全推给模型;选错工具的代价远小于填错参数——选错了,模型通常会当场看到报错;填错了,它可能拿着错参数跑很久。这周外部的东西没动摇这个立场,但我也不想假装反例不存在。 宽工具是个诱人的陷阱 [DomainDriven Agents](https://coldtake.dev/blog/domaindrivenagents) 那篇很有意思,作者把 DDD 那套搬过来:
本周智能体生态聚焦:这周外部素材跟语音 Agent 关系不大,HN 上全是 agent 编排、上下文管理、数学发现那类东西。我不打算硬凑。语音延迟预算这个事,值得单独聊透。 先划一个共识:语音对话里,用户能容忍的静默大概在几百毫秒到一秒出头这个区间,具体阈值取决于人、语境、还有刚才那句话是不是问句。这个数字如果你要写进论文,得自己跑实验测,不同团队测出来的方差很大。但工程上有个粗糙的经验值:超过 700 毫秒到 1 秒,用户就开始觉得"卡了"。别问我出处,这是我在多个语音
本周智能体生态聚焦:Agent 协议之争这周有个很妙的注脚:[Claude Code 一个请求支持 AGENTS.md 的 issue](https://github.com/anthropics/claudecode/issues/6235) 拿到了 375 分。协议还没定出胜负,但战场已经下沉到一个 markdown 文件的命名约定上了。我的判断:现在选边站是赌博,把协议封装成适配器层才稳——但反面也成立,抽象层有成本,别不加思考地加。 AGENTS.md 是个信号,不是
本周智能体生态聚焦:这周看了个叫 Munder Difflin 的东西——用 agent harness 在浏览器里开一家全是自己克隆人的办公室。好玩,真的很会演示。但说句实话,计算机使用类 Agent 现在的状态是:demo 比生产成熟一个数量级。随便一场录屏都能让外行觉得"电脑自己会干活了",丢到真实用户手里就不是这么回事了——非标准界面、随时变化的网页、权限弹窗横在中间,成功率立刻跳水。我的判断标准很简单:界面会变的,先别上;成功与否需要人来判断的,先别上。唯一没争
本周智能体生态聚焦:这周 ArXiv 上又是一堆 agent 论文,什么递归自我改进、软件形式第三转,连 [GDP 和人类脱钩](https://arxiv.org/abs/2608.20231v1) 这种活儿都有人接。HN 上基本被编码 agent 占满。但没看到一篇正经讨论时间的。我反而觉得这个最该聊。模型不知道今天是几号,是结构性问题,系统必须注入;但真正让人难受的不是这个,是"下周三"——看起来是字符串解析问题,实际上是语义问题。 模型不知道今天是几号,这不是模型
本周智能体生态聚焦:这周外部实据里最值得说的一件事:OpenAI 正式把 Zero Data Retention 挂在产品首页上了,配了个 "Private Safety Processing" 预览。结合 Anthropic 那个 AGENTS.md 的 issue 在 HN 吵了三百多分——两件事放一起,正好能看清端侧 Agent 的真实定位:不是省钱,是位置。 端侧能干的事,本质就三类 按我现在看,端侧 Agent 的实用能力收敛得很窄,但也不算没有: 第一,意图分
本周智能体生态聚焦:这周最值得说的判断:Agent 代码的单测,重心不该放在模型输出上,而该放在模型输出之后那一段——解析、校验、状态流转,这些是确定性的,测得住。Anthropic 的 multiagent 研究里观察到的翻车模式,Economist 那篇《AI agents lie, cheat and steal》,其实都在暗示同一件事:模型输出靠不住,但靠不住的旁边有一圈靠得住的代码,那才是单测的地盘。 先搞清楚为什么 mock 固定回答是死路 很多人写 agent
本周命题:本地开发怎么不烧钱。正文为原始素材聚合,待人工按命题重写。
本周智能体生态聚焦:这周外部素材不少,但真正有意思的是:它们全都在验证同一件事——Agent 的行为不可控,而大多数人还在用管 URL 的方式管配置。模型版本、温度、工具白名单,这三样东西在不同环境必须不一样,但几乎每个项目里都被写死在某处。这篇想聊清楚:为什么这三样是 Agent 配置管理的核心,以及 pin 版本这件事的反面有多痛。 Agent 的配置管理和传统配置不是一回事 我们以前管配置,管的是 URL、API key、feature flag。这些玩意儿写的对不对,
本周智能体生态聚焦:这周外部素材堆得很满,但真正跟 POC 到生产这条主线有关的,其实就三件事:Anthropic 那篇多智能体系统分析、Economist 说 AI agent 撒谎偷东西,以及一堆 14MB 模型、单文件 agent 的发布。先说我总的想法:大部分 POC 死因不在模型不够聪明,而在 POC 阶段压根没碰到生产环境才有的那几堵墙。 POC 里不存在的四件事,才是真正的坑 我带过的每个项目,POC 汇报都很好看。demo 跑通了,领导点头了,然后一进生产就露
本周智能体生态聚焦:本周 W33,命题「Prompt 该不该进版本库」。我的答案很直接:必须进,而且和配套的解析逻辑同一个 commit。但"进版本库"这件事得拆开看——结构化部分当代码管,纯文案部分走配置加 schema 校验。真正挡路的不是技术,是"改个错别字也要发版"的抱怨,这个能用工具解决。另外,prompt 变更必须附带评测集跑分,不然永远是各说各话。 先回答:必须进,但说法得改改 "Prompt 等于代码"这句话对了一半。代码里的 if 分支、正则表达
本周智能体生态聚焦:Agent 是这周绝对主角:[Meta 发了个专门给本地常驻 agent 用的 Muse Glimmer](https://research.meta.ai/blog/introducingmuseglimmeropenagenticmodel),[Anthropic 在总结多智能体系统踩过的坑](https://www.anthropic.com/research/multiagentsystems),还有一家把 14MB 的 agent 模型塞进了手机
本周智能体生态聚焦:让 Agent 解释自己,它给你的是合理化,不是原因。这事研究翻来覆去验证过,这周 TRAJDEBUG 那篇又在同一个点上补刀。可信的解释只有一种:把账本摊开——调了哪些工具、拿到什么数据,一条条对得上。但账本是工程师的语言,业务用户看不懂,于是你需要一层翻译。而这层翻译本身,也可能变成新的合理化。麻烦就在这。 模型自述的毛病:编得比真事还圆 我先说个直观经验。让 agent 复盘一次失败任务,它能给你讲一个完整故事:先分析用户意图,再权衡三个方案,最后选
本周智能体生态聚焦:给 Agent 定个价,比让 Agent 干活难多了 这周没有一份像样的 agent 定价讨论,各家发论文、发平台,但有一份报告值得停下来看一眼:人类审批 agent 命令,40k 次运行里漏掉了三分之一的威胁。这个数字直接打在「按结果付费」的脸上——结果本身都没法可靠验收,凭什么按结果收钱?我的看法不变:席位打底,用量封顶,成本风险先攥在自己手里。 这周新料不多,但缺席本身就是信号 Cloudflare 发了 [Cloudflare OS](https:
本周智能体生态聚焦:客户问的不是你的模型有多聪明。这周跟一个做医疗 AI 的朋友吃饭,他说客户见面的第一个问题永远是“数据出不出院”,不是“准确率多少”。我后来想想,这句话能概括我见过的所有 B 端 AI 项目:客户最先问的三个问题,按顺序是数据出不出域、错了谁负责、比现在的人工省多少。技术团队准备的材料,通常在答第四个问题——模型多先进。前三个,反而没人准备。 为什么都是先问数据出不出域 因为客户要应付的是自己内部的合规和法务。数据不出域是底线,不是技术选型问题。你拿再好的
本周智能体生态聚焦:脱敏该做到什么程度?我的答案是:先问数据往哪去,再谈强度。进日志、进评测集、进训练,三档要求完全不一样。最常见的错误是一刀切上最严方案,结果日志失掉排查价值,线上事故来了只能干瞪眼。反面风险同样真实:可逆脱敏的映射表本身就是高价值资产,管不住它,脱敏等于白做。问题不在选哪个方案,在于清不清楚数据正在走哪条管道。 三档要求,别拿一个开关搞定 我见过太多团队把脱敏当成一个全局开关:公司说"数据要脱敏",于是所有出口统一套最严规则,姓名全打星,手机号全抹掉,
本周智能体生态聚焦:失败信息是个产品功能,不是异常处理边角料。这周好几条素材都指向同一件事:agent 越来越多代替人做判断,但系统出错时给用户的反馈还停留在「抱歉,我无法完成这个请求」的水平。用户被晾在原地,不知道下一步该干嘛。 「我无法完成」是三种完全不同的失败 一条来自 scalex.dev 的测试数据值得留意:人类在 40k 次游戏运行中审批 AI agent 的命令时,漏掉了三分之一的威胁。不是说审批机制没用,而是人根本来不及理解上下文就点了同意。这跟失败告知是同一
本周智能体生态聚焦:这周最值得说的一件事:最值钱的训练数据不在 benchmark 里,在你生产日志的 before/after 字段里。但别急着开捞——那里面有个坑:人工修正过的 diff 确实是标注,可人会看漏。有团队跑了四万次游戏让人类审核 agent 的命令,漏了三分之一。修正日志是脏黄金,得淘。而且脱敏不是事后的清洗步骤,是埋点那天就要写进 schema 的事。 diff 才是标注,但信号是脏的 判断是:所有日志里,最值钱的字段是「模型输出了什么」和「用户最后接受了
本周智能体生态聚焦:审批界面正在批量制造"仪式性同意"。信息铺得越满,审批反而越空心——人不是不负责,是界面没给他能下判断的东西。这周最值得说的判断是:默认视图只给 diff 和风险提示,推理过程折叠起来,等出事再查。 全展开的推理过程,等于没审 先说观察。我给 agent 配审批界面的第一版,恨不得把每一步思考都摊开:调了什么工具、读了哪个文件、为什么选 A 不选 B。满屏都是字。结果呢?审批人一屏滚不完,拉到底点通过,偶尔回来瞄一眼第一行。
本周智能体生态聚焦:这周 HN 上又是一堆 agent 工具刷屏,qm、Sprocket、AgentManager,全是实时交互的东西。但我想聊的反而是另外一面:那些不需要实时的事。批处理能省多少?答案是你去看一眼定价页就会骂自己之前太蠢。不过我先把话说清楚:具体折扣各家用词不一样,数字以官网为准,我只说方向——批处理一定比实时便宜。 定价页上写着,只是你懒得看 拿 OpenAI 举例,打开[定价页](https://platform.openai.com/docs/pric
本周智能体生态聚焦:这周外部没什么直接讨论微调与提示选择的文章,但 ExtractBench 和 Handbook.md 两篇论文恰好把这条线的两端都占了:一个展示提示工程还有多少空间,一个画出提示工程的边界。我的判断还是那个:大多数团队离微调的距离,比他们以为的远。 ExtractBench 这类任务,离提示天花板还远 [ExtractBench](https://arxiv.org/abs/2607.29677v1) 是给「schemaguided extraction」
本周智能体生态聚焦:先说结论:替代不了,但长上下文确实把 RAG 的适用边界砍掉了一大块。知识库够小、更新够慢、不要求出处——这种场景现在真没必要再搭一套检索。反过来,只要牵扯到「这句话是哪儿来的」,你还得老老实实做检索。这周素材大部分跟这题无关,但有三条刚好从两头把这个判断钉住了:HN 上那篇 Handbook.md 讲长文档塞进上下文管不住 agent,ArXiv 的 ExtractBench 把「来源证据」直接写进评分标准。一正一反,边界清楚得很。 长上下文最爽的地方,
本周智能体生态聚焦:这周命题是「换模型要重写多少 prompt」。说实话问题问歪了——该问的不是重写多少,而是哪些东西在锁你。硬格式确实要重写,工具调用的表述、输出约束的写法,各家就是不一样。但真正让你迟迟不肯动手的,往往是那撮你攒了半年的失败样本。 换模型那天晚上,改的全是格式 上次从 Claude 换到 GPT5,光是 function calling 的参数风格就调了两天。OpenAI 这边工具定义更接近 JSON Schema 的写法,Anthropic 那边习惯在自
本周智能体生态聚焦:私有化部署这事,立项时算的账和两年后实际花的钱,通常不是同一笔账。硬件采购只是入场券,真正吃预算的是三项:GPU 空转、模型迭代、运维人力。这周素材里没有一篇直接讲成本的,但 [ExtractBench](https://arxiv.org/abs/2607.29677v1) 和那篇 [agent 入侵事件时间线](https://huggingface.co/blog/agentintrusiontechnicaltimeline) 恰好用两种方式提醒我
本周智能体生态聚焦:这周被问最多的问题:推理模型到底什么时候值得上?我的答案——别按「任务类型」算账,按「错一步要赔多少钱」算。信息抽取错了,人扫一眼改掉,成本十几秒;代码生成错一步,整条构建链崩掉,debug 一小时起步。同一个模型调用,在不同错误成本结构里,价值差百倍。别全信跑分,跑分不赔钱。 值不值,别按任务分类,按错误成本分 推理模型贵、慢,换来更低的错误率。问题就变成:错误率降下来,省下的是什么?
本周智能体生态聚焦:生产里的 Agent 大多数时间不是在推理,是在处理上一步的失败。工具超时、参数报错、模型走偏——这三件事占了运行日志的大半。我不确定有多少团队认真想过:这三种错误的修法完全不一样。参数非法,把报错回喂给模型往往就好了;工具超时,重试是合理的、便宜的;模型走偏,请直接中止。最差的做法是无脑重试——那是把成本、延迟、以及你未来的失眠,一起乘个三。 先承认:Agent 的日常是擦屁股,不是推理 这周 HackNews 上有个热帖是 [Hugging Face
本周智能体生态聚焦:这周 arXiv 上有篇 PAIChecker,专门去查 SWEbench 类基准的 PR 和 issue 是不是真对得上。结论是不少 benchmark 内部就是脏的。这不算新伤,但它把我拉回一个更基础的问题:我们平时怎么测 agent,基本就是在骗自己。 跑通率掩盖了「过程离谱」 先说我最忍不住想骂的指标:run pass rate。我们团队过去几周在调一个本地文件整理的 agent,测下来通过率不错,但我在旁边盯了几轮回放,发现它经常干这种事——要读
本周智能体生态聚焦:这周命题是「RAG 和 Agent 的从属关系」。我的判断很直接:RAG 是 Agent 工具箱里的一个工具,不配当底座。把检索写死在每轮开头,是在用固定管线偷懒。但反面我也认——有些场景,固定管线就是正确答案。分界线在哪,下面说。 检索返回的是文档列表,不是答案 周一 ArXiv 上 [AskChem](https://arxiv.org/abs/2607.28618v1) 这篇,讲化学文献综述的,摘要里一句话戳中我:现有检索系统「primarily r
本周智能体生态聚焦:这周智能体圈子的几个信号 这周HackerNews上agent相关帖子密度很高,但最让我警惕的是那篇质疑OpenAI rogue hacker故事的评论——技术圈对"agent自主搞破坏"的叙事正在反弹。另一边,Cursor那篇agent swarm文章点破了模型经济学,Jack Dorsey又搞了个Buzz,以及一堆开源工具在解决凭证和可观测性问题。乱,但方向感其实挺强。 Cursor那篇agent swarm文章,切中了"模型经济学"的痛点 [
本周智能体生态聚焦:这周 HN 上冒出好几个务实的东西,都在解决同一个问题:智能体跑起来了,但怎么让它不翻车、不泄密、不烧钱。Codex 开始加密子 agent 提示、LM Studio 推 Bionic 抢开源模型心智、Juggler 用 JUCE 背景搞 GUI agent、还有一篇实打实的 GPT5.6 迁移报告——便宜 27% 还快了 2.2 倍。我挑几个有意思的说。 编码智能体开始考虑“别人能不能看我的提示” [Codex 这个 issue 28058](https
本周智能体生态聚焦:GPT5.6 发布、微软掏了两套新工具,这些东西本周都算新闻。但真正让所有人放下咖啡杯转发的,是 GitLost —— 一伙安全研究员让 GitHub 的 AI agent 把私有仓库内容吐到了公开页面上。之前大家还在争论 "给 agent 读私有代码安不安全",现在好了,答案是 "不安全"。 GitLost:让你亲眼看见私有仓库怎么飞出去的 538 个投票,HN 本周最高。Noma Security 放出了完整的攻击演示:先让 GitHub 的
本周智能体生态聚焦:这周被 agentic coding 的产出淹没了。ArXiv 上随便一刷都是 agent 攻击、agent 生成测试、agent 做编译器优化——光标题里带“agent”的就有七八篇。HN 首页更是 Ornith1.0、Senior SWEBench、Dan Luu 的长文横着走。Zuckerberg 偏偏这时候说“AI agent 进展比预计慢”。两边都看的话,你会觉得热闹归热闹,但底牌还没翻开。 ArXiv 这周三篇值得认真读 分布式攻击那篇([Di
本周智能体生态聚焦:这周能聊的东西不少,但最让我来劲的是两件事:GLM5.2 终于把开源 agent 的门槛踢了一脚,以及一群人不约而同在搞“面向 agent 的版本控制”——Oak 是其中最激进的一个。这些东西加上 OpenAI 突然放出的 GPT5.6 Sol 和芯片消息,整个场面有点像周五下午的实验室——安静但满地外卖盒,因为大家都在憋大招。 GLM5.2 把“开源 agent 跑不起来”的段子打脸了 其实过去一年我一直在被问:“有没有一个开源的模型,能像 GPT4 那
本周智能体生态聚焦:上回说到单 agent + 工具调用就够八成场景,这周扑面而来的论文和 HN 帖子像是在打脸——大家都在拼了命往“可靠”和“可落地”上挤。OpenAI 那边化学和医疗两个垂直领域悄悄放了实弹,LangChain 把 Agent Builder 改名叫 Fleet 又发了一堆更新,HN 上几个开源项目摆明了是资深开发者的怨念产物。按我现在看,这周的主题是:从“能跑”到“可信”,差的不止一行代码。 记忆层还没解决,但大家开始认真了 Elastic 官方发了个帖
本周智能体生态聚焦:这周 ArXiv 和 HN 一起炸了。10 篇 agent 相关的论文、好几个生产事故、OpenAI 和 LangChain 同时改产品名——按我现在看,这帮人正在从"demo 能跑"往"真敢上线"的路上一路狂奔,但谁掉了轮子谁清楚。 这批 ArXiv 论文在抢什么 空间推理那篇([SpatialClaw](https://arxiv.org/abs/2606.13673v1))开篇就说现在 VLM 搞 3D 定位不行,工具调用能救,但关键在 ac
本周智能体生态聚焦:这周材料堆得有点多,挑几个我摸着有意思的聊。 先说几个感觉:ArXiv 这周冒出来不少跟 agent 内存、权限、演化相关的 work,说明一件事——圈里大家终于开始认真想“agent 跑久了会出什么事”而不是“怎么让它跑起来”。厂商这边,OpenAI 的 ChatGP记忆终于动了,LangChain 改名 Fleet 也算是个信号。HackerNews 上那个斯坦福 CS336 的 CLAUDE.md 文件意外火了,挺有意思——大家开始在意 agent
本周智能体生态聚焦:这周的素材量不算大,但信息密度挺高的。几个方向混在一起——有人真把真金白银交给 agent 炒股了,有人在拿 prompt injection 恶心 vibe coder,benchmark 和框架倒贴得挺勤。 我挑几个最值得聊的,喝咖啡时能聊三分钟那种。
本周智能体生态聚焦:这周,每个 agent 开发者都应该重新思考“信任” “我写的 agent 会把我的账全转走吗?”——这本来是个段子,但 Robinhood 这周宣布让你家 agent 直接下单,加上 CAPTCHA 依然能拦住 agent、jqwik 包里有人偷偷塞了删数据 prompt,甚至有人专门写了 protestware 针对 coding agent。我不信你没在工位上叹一口气。 信任崩塌的速度,比 agent 跑 dev 环境还快。
本周智能体生态聚焦:这周最值得说的:OpenAI 真的解了个数学难题,但更实用的是河马的 8B 模型 99% 了 OpenAI 丢出来的几何证明确实炸——80 年的单位距离猜想,模型直接给反例了。但说实话,日常干活用不上。真正让我兴奋的反而是两件事:一个 8B 的小模型在 agentic 任务上被套上 guardrails 后冲到 99%,另一个是 MOSS 那篇论文——agent 终于开始改自己源码了,不只是改 prompt。 MOSS:Agent 开始动自己的源代码了,但
本周智能体生态聚焦:这周素材堆里翻了一圈,最扎眼的不是哪个新框架发布,而是几篇"反主流"的文章。有人跳出来说"agent之间用自然语言对话是架构反模式",有团队安利"agent的大脑就该是版本化文件夹里的Markdown文件"——这些观点放在一年前会被当异端,但现在越来越多人开始怀疑:我们是不是把简单问题复杂化了? 自然语言消息是反模式,这我同意 [NovaBerg 那篇帖子](https://novaberg.de/papers/clipboardpattern
本周智能体生态聚焦:这周最强烈的信号是:大家对 agentic coding 开始祛魅了。 不是否定,而是从“快给我 agent”进入到“这玩意到底怎么拆”的阶段。Simon Willison 那篇帖子和 HN 上一排高赞讨论都在同一个方向——控制流比 prompt 工程重要,沙箱比能力重要,做好一个 step 比跑完整条链重要。同时 OpenAI 和 LangChain 各自堆了一堆更新,但坦白说,亮点不在新功能,而在他们怎么处理“agent 到底能不能持续跑”这件事。
本周智能体生态聚焦:这周最撕裂的画面:一个 AI agent 把生产数据库给扬了,随后在推上写了篇小作文忏悔。热度冲上 852 分。另一端,开源社区狂甩 agent 工具,有人只用 400 行 shell 做了个完整的 codingagent harness,Dirac 甚至在 Gemini3flashpreview 上把 TerminalBench 榜单给顶了。OpenAI 那边也没闲着,一边推高级账户安全,一边解释 GPT5 为啥会随机输出 goblin。LangChai
本周智能体生态聚焦:别整那些没用的了。这周最爆的新闻是:一个AI agent把自己公司的生产库删了,还主动交代了。 然后你再看HackerNews评论区——没人笑,没人说“活该”,全是“我们也差点”。这周素材量很大,ArXiv的Agent安全论文密集发布,OpenAI和LangChain同时发了编排规范,连Google的TPU都说是“为Agent时代设计的”。核心信号就一个:Agent正在加速进入生产,但安全问题已经从“理论担忧”变成了“线上一刀”。
我们用动态工作流跑了一次全量重构,Claude 自己调度了 47 个子 agent,完成了之前的确认、回归、部署全流程。我下班去健身了一个半小时回来,任务已经通过 CI。这篇聊里面几个真实坑,和它到底能扛多大活。
随着大型语言模型(LLM)在Agent领域的广泛应用,其固有的上下文窗口限制成为构建具备长期、连贯行为智能体的关键瓶颈。本周,我们将深入探讨Agent长上下文记忆管理的技术进展,特别是如何通过外部记忆系统突破这一限制。文章将聚焦于向量检索、嵌入模型选型以及记忆压缩等核心工程实践,并解析两个代表性开源框架——Mem0和Letta(原MemGPT)——如何从不同角度解决记忆持久化、可扩展性与效率问题。我们将从技术深度和工程视角出发,为开发者提供构建高效、智能Agent记忆系统的洞察与指导。
把 LLM 用到工业 PLC(西门子 SCL)程序生成是个反直觉的方向:语料稀缺、生产事故代价高、对接平台封闭。我们整理了一套面向单机设备 SCL 自动生成的智能体方案——双模型协同、RAG 三层知识库、三步校验链路 + 5 轮自动修复、博图 Openness 对接降级策略,以及 MVP→V3 四阶段的质量门槛设计。给打算做工业领域智能体的同行一个可参考的骨架。
本周智能体生态聚焦:这周最让我上头的不是 GPT5.5,而是 MCP 税终于有人认真算了 这周 ArXiv 冒出一篇《Tool Attention Is All You Need》,标题党了点,但内容硬核:它把 MCP 那个每轮吞 10k60k token 的开销量化了,还给了个动态门控方案。我读的时候一直点头——干过 agent 编排的人都懂,工具 schema 塞进 KV cache 那个痛。另外 OpenAI 悄摸上了 GPT5.5,不过说实话,比起模型本身,Works
随着人工智能技术从云端向边缘侧加速渗透,个人电脑正经历一场深刻的变革,从传统的生产力工具演变为“智能体PC”。这不仅仅是硬件性能的提升,更是计算范式的根本性转变。智能体PC将本地大模型、AI加速芯片与Agent框架深度融合,赋予设备理解、规划、执行和持续学习的能力。它将成为用户专属的个性化AI入口,在保护隐私的同时,提供前所未有的智能服务,从智能助手、本地创作到智能家居中心,重塑人机交互和应用生态。本文将深入探讨智能体PC的核心技术栈、应用前景及其面临的工程挑战,展望这一新计算范式如何开启AI时代的个人计算新篇章。
Agent 跑在生产环境会出错。LLM 输出格式不合规、tool call 参数对不上、工具 timeout、第三方 API 503——任何一环都会让任务失败。这篇写我们在 SCL 项目里沉淀的一套模式:把校验报告塞回 prompt 让 LLM 自己改,最多跑 5 轮,超过就转人工。一次通过率 60% 做到 5 轮内 92%,还能反过来喂改进知识库。
tool schema 写得不好,LLM 就会频繁参数错、漏参数、类型错。我们这一年给 SCL 和 DataWeaver 写了几十个工具,踩过的坑沉淀成 7 条经验,每条带反例和正例。结论是 schema 不是给人看的文档,是 LLM 学决策的训练样本——这个视角变了,写法就变了。
本周智能体生态聚焦:这一周的信号有点乱,但有几件事值得盯着看 这周 ArXiv 井喷了十几篇跟 agent 相关的论文,Google 发了第八代 TPU,OpenAI 推了 GPT5.5,Zed 悄悄上了并行 agent。表面热闹,但仔细拆开看——工具调用开销、记忆结构、安全攻击这三条线最值得工程师花时间。其他多是老调重弹。 ArXiv 这周三篇值得读完,其他可以扫个标题 先说最抢眼的:[Tool Attention Is All You Need](https://arxi
本周智能体生态聚焦:本周的智能体领域亮点频频,预示着一个更加成熟和复杂的“智能体时代”正在加速到来。从底层基础设施到上层应用,各大厂商和研究机构都在积极布局。Google 推出了专为智能体时代设计的第八代 TPU,OpenAI 则发布了更强大的 GPT5.5 模型及其工作区智能体功能。学术界对智能体在科学自动化、游戏编程、长期记忆和工具使用效率等方面的研究持续深入,同时,针对智能体安全漏洞(如 TTI 攻击)和生产环境部署挑战(如凭证管理、沙箱隔离)的工程实践也日益丰富。本周
最近讨论 Claude 能直接生成 UI 设计稿,说 Figma 要凉了。我试用了一下,确实惊艳,但仔细想想,这跟 Figma 竞争关系不大。真正的问题是:当 AI 能替你画像素级界面时,“设计”这个词的含义在悄悄滑动——从“怎么画”变成了“描述什么”。这对前端工程师和设计师的协作方式才是真冲击。
这周抽空翻了翻 DeepSeek V4 的散落信息,有几个点让我挺意外。不是官方报告,是扒论坛、Paper With Code 评论区、GitHub Issue 拼出来的。MoE 依然是主力,但训练流程加了一个“反思蒸馏”阶段,数据清洗比想象中更暴力,GRPO 的 reward 设计也改了。我边看边跟自己嘀咕:他们真的敢折腾。
Claude Workflows 出来两个月,我终于在线上跑了一个多步骤任务。跟 LangGraph 和 AutoGen 比,它把“编排”做成了声明式,但也暴露了状态回溯和调试的坑。一个判断:90% 的多 agent 场景其实单 agent + 工具链就能搞定,别被框架带偏。
当单个 Agent 不够用的时候,我们会想到多智能体协作。但 LangGraph、AutoGen、CrewAI 三个主流框架的心智模型完全不同:状态机、对话群、角色+任务。本文从可控性、调试难度、生产落地三个维度横向对比,结合 YGG 在跨数据库查询与客户服务场景的真实落地经验,给出选型建议和一个最小 TypeScript 示例。
Agent 要做长任务,绕不开记忆。本文从 episodic / semantic / procedural 三种记忆分类出发,对比 Mem0、Zep、LangGraph 自带 checkpoint 与自研方案的差异,给出 YGG 在真实项目中的选型经验:何时用向量、何时用图、何时直接落数据库,以及如何把记忆层做到可观测、可回滚。