玩过 AI 智能体(Agent)的人,大概都遇到过两件头疼事。
第一件是”烧钱”。一个稍微复杂点的任务,AI 要拆成很多步去执行,每一步都要把上下文带进去,跑下来几十万 token 是家常便饭,账单蹭蹭往上涨。第二件是”翻车”。任务一长,AI 经常记不住前面做过什么,或者被塞进大量无关信息,执行到一半就开始出错,然后反复重试,越跑越乱。
8 月 12 日,IBM Research 公布了一套新的智能体记忆框架 ALTK-Evolve 的基准数据,恰好同时针对这两件事:相比当前主流的记忆方案,token 用量最多能省 85%,任务完成率还不降反升。
先解释一下背景。智能体在执行多步任务时,需要”记住”经验。目前比较流行的做法叫 Agentic Context Engineering(ACE):AI 每完成一个任务,就把经验教训记进一本不断更新的”剧本”里,之后每一步执行,都把整本剧本塞进上下文。
这样做的缺点是显而易见的:剧本越记越长,每次执行都要全量重读,token 成本水涨船高;而且经验笔记里大量内容是重复的,还容易互相干扰,反而拖累执行质量。
IBM 的 ALTK-Evolve 换了思路:不把全部经验一次灌进去,而是先做”记忆整理”——把大量近似的经验笔记去重、合并,变成一条条带”支持票数”的规则,每条规则还保留着指向原始执行过程的链接。到了执行的时候,只注入一小部分:一个固定的核心规则集,加上根据当前任务挑选出来的几条相关规则;只有当模型能力足够强、上下文装得下时,才给它喂完整规则库。
打个比方:ACE 是每次开工前,把公司所有员工的经验手册全搬出来重读一遍;ALTK-Evolve 则是只把最相关的几条标准作业流程递给眼前这个人。省力气,还不容易看花眼。
IBM 公布的数据,是在多应用基准 AppWorld 上与 ACE 的同框架对比。注意,两个方案都用的是同一个 ReAct 基础智能体,差异只在记忆机制上。
在 DeepSeek-V3.2 模型上:ALTK-Evolve 的任务目标完成率(TGC)是 89.3,ACE 是 80.4;每任务 token 用量从 63.4 万降到 26.3 万,省了大约 59%。
在 gpt-oss-120b 模型上:两者的完成率基本打平(56.0 对 54.8),但 token 用量从每任务 77.7 万骤降到 11.6 万——省了 85%。
也就是说,IBM 这套方案在”效果不输甚至更好”的前提下,把记忆相关成本砍掉了大半。对重度使用 AI 智能体的团队来说,这意味着同样的预算,能跑的自动化任务数量是过去的好几倍。
除了省钱,这套框架还提供了一个挺有价值的观察角度:智能体在多步任务里失败,通常不是因为它”不懂业务”,而是因为操作层出了错——比如 API 调用的分页参数写错了、接口返回格式变了没反应过来。这种问题靠”记住更多领域知识”解决不了,反而是”执行痕迹被杂乱上下文淹没”更容易诱发。ALTK-Evolve 追踪完整执行片段、不做过度的总结压缩,目的就是让每一步的执行上下文干净、可回溯,减少这类操作层失误。
对普通人来说,这则新闻的意义在于一个趋势判断:AI 智能体的竞争,正在从”谁的模型更强”延伸到”谁的工程更省、更稳”。模型层的能力差距在快速收敛,而记忆、上下文、工作流这些工程层的能力,正在成为新的分水岭。
也就是说,当大家都在用同一个顶流大模型时,谁能把 token 花得更聪明、让智能体记得更准,谁跑出来的效率和成本就会明显领先。这会直接影响到未来”用 AI 干活”这件事的普及度——成本降下来,普通人才真的用得起。
当然,还是要对这份数据保持一点审慎。目前公布的结果来自 IBM 团队自身的评测,尚未经过独立的第三方复现验证;”省 85%”是 gpt-oss-120b 这一最优配置下的最大降幅,不同模型、不同任务上的收益会有差异。论文里的对比也限定在 AppWorld 这一基准内。把它理解成”智能体记忆优化的一个重要方向已经跑通”,比理解成”省 85% 已普遍实现”更准确。
不过,方向本身是明确的:让 AI 记性好一点、花得少一点,正是智能体从”能用”走向”好用”的关键一步。