2026年9月14日SkillsResearchAgents

COBRA-Skills 靠「不全测」把技能调优成本砍掉一半

技能优化卡在一个很笨的瓶颈上:判断一个改写过的技能是不是更好,唯一办法是跑一遍,而跑一遍就意味着付一次完整智能体 rollout 的钱。候选技能会指数增长,评测要花真金白银,而预算的大头都用在确认平庸的变体确实平庸上。arXiv 2609.11682、9 月 10 日提交的 COBRA-Skills 就是冲着这个去的。https://arxiv.org/abs/2609.11682

它的贡献在框架。他们没有走"生成候选、评测候选"的老路,而是把技能优化建模成一个在预算约束下的顺序优化问题,而且候选空间本身是边走边变的。一个 contextual bandit 根据已经学到的东西,决定下一次执行花在哪个候选上。技能演化是有证据支撑的,也就是新变体从观察到的失败里推出来,而不是盲生成。两半互相喂:更好的优先级排序意味着预算花在有信息量的运行上,而有信息量的运行给演化那一步提供了真材料。

数字是:在六个异构的智能体基准、三个目标模型上取得最强平均表现,相比 SkillOpt 基线优化成本降低 55% 到 58%,而且每个基准只用了 50 个不重复的优化样本。最后这个数字才是做工程的人该注意的。50 个样本是一个团队一下午就能从自己日志里攒出来的量。大多数技能调优流水线都假设你有一个又大又干净的任务集,而大多数团队并没有。

作者是 Pingchen Lu、Xiangyi Wang、Xiang Li、Jie Mao、Zikun Qu、Junfeng Luo、Yao Shu、Bryan Kian Hsiang Low、Zhongxiang Dai。摘要里没有给代码仓库,这是老规矩的保留意见——在别人用自己的 harness 复现之前,55% 的成本下降只是关于他们那套 harness 的陈述。

它该跟 [同一个周末上趋势榜的那个技能注册表](https://clauday.com/article/19683942-d4c9-4c60-808e-c3044bd36345) 放在一起看,是因为技能已经悄悄变成了智能体能力的基本单位,而围绕它的工具正在分裂成每个包生态最终都会遇到的那两个问题:我怎么装一个而不被人打穿,我怎么改一个而不烧光预算。它跟 [Reflexio 把智能体的错误编译成规则](https://clauday.com/article/93d32f98-b48b-43df-bd4c-d77b7d556fe6) 也在同一层货架上——这一整片东西共同押的注是:能沉淀下来的资产是技能不是权重,因为技能你能带到下一个模型上去。
← 上一篇
终于有人给技能仓库做安全扫描了
下一篇 →
每个智能体沙箱省 8.7 倍内存,诀窍在于什么时候压
← 返回所有文章

评论

加载中...
>_