2026年8月12日ResearchInfrastructure

1.5 亿参数拿下 ARC-AGI-1 的 29.5%,每题七毫厘

今天 Hugging Face Daily Papers 第二,681 票,来自 Pathway。BDH-CQ 做的是「带循环隐空间推理的上下文学习」,标题数字是:1.5 亿参数的模型,在 ARC-AGI-1 上 pass@2 拿到 29.5%,每道题 0.0007 美元。这打破了该 benchmark 上此前报告过的成本-准确率帕累托前沿。

机制上它跟所有人现在从模型里榨推理的方式是真的不一样。推理时喂进去的输入会持续更新模型的循环记忆,然后模型在一个高维隐空间里反复迭代把 query 解掉——中间步骤一个字都不说出来。没有思维链。没有 token 花在自我叙述上。推理发生在状态里,不在输出里。

成本数字之所以长这样,原因就在这。今天所有前沿推理系统都是靠多生成 token 来换准确率,所以推理账单随题目难度线性膨胀。如果计算改成活在隐式循环里,难度消耗的是一个极小模型的迭代次数,而不是一个巨大模型的几千个 token。完全是另一条曲线。

必须说的保留:29.5% 的 ARC-AGI-1 绝对值上不是前沿成绩,一个 benchmark 也不构成范式。但这里有意思的轴从来就不是绝对准确率,而是这成绩出自 1.5 亿参数。另外对做 agent 可观测性的人来说有个不太舒服的推论:一个不把推理说出口的模型,不给你任何东西可读。过去两年造的每一个可解释性和监控工具,都默认存在一条 trace 可看。巧的是同一天还有另一篇论文说,我们能拿到的那些加密 trace 也不安全。

论文:https://arxiv.org/abs/2608.09888
← 上一篇
DeepTutor 把学习塞进了和别的东西同一个 agent 循环
下一篇 →
超级用户日报: 2026年8月12日
← 返回所有文章

评论

加载中...
>_