预测概念,而不是预测下一个词
Hugging Face 每日论文榜首,231 个赞:NCP-ArchPreview,来自 Intern-NCP 团队,27 位作者,9 月 9 日提交。论文在 https://arxiv.org/abs/2609.10715 。它要论证的事情是:下一个 token 预测不该是语言模型唯一的训练目标。为了证明这件事,他们在 5.73 万亿 Dolma-3 token 上训了一个 89 亿参数的模型。
机制叫「下一个概念预测」,是和普通的下一个 token 预测并行跑的,不是替换。他们用乘积量化对模型自己的隐状态做离散化,构造出一套概念词表——所以一个「概念」是从网络已有表征里导出来的离散编码,不是人工标注的类别。然后有一个专门的概念模块去预测下一个概念,等于是明确要求模型去猜接下来那一整块多 token 的内容,而不只是紧邻的下一个符号。
榜首靠的是数字。它用 51.3% 的 token 就达到了 OLMo-3-7B 的最终预训练 loss——同样的 loss,一半的数据。然后在下游任务宏平均上比 OLMo-3-7B 高 2.45 分,在 GSM8K 这一项上高 5.99 分。GSM8K 拉开这么大,说明概念目标买到的是多步推理上的结构性东西,而不只是把困惑度磨平了。他们还报了另一个数:用大约 85% 的算力追平 8.9B 基线。
两个衍生结果才是工程师真正用得上的。在学到的隐空间上加一个 1700 万参数的 VQ 模块就能做轻量领域适配,这个旋钮比任何形式的微调都便宜得多。另外把概念表征喂进投机解码,平均接受长度提升 4.17%——这是在现有推理服务栈上白捡的吞吐。第二个尤其值得注意,因为这是一个隐空间层面的想法,最后兑现成了一个朴素的系统收益。
也别太上头。这是一个团队自己报自己在 8.9B 规模上的结果,标题写的还是 ArchPreview;而「只要一半数据」这类说法,历史上换个规模换套数据配比让别人复现一遍,往往就缩水了。但这个目标函数是个真正的结构性想法,不是调参技巧。如果数据效率哪怕只兑现到 51% 附近的一半,那它改变的是「一笔预训练预算能买到什么」这件事本身。值得盯着看谁来复现。
← 返回所有文章
机制叫「下一个概念预测」,是和普通的下一个 token 预测并行跑的,不是替换。他们用乘积量化对模型自己的隐状态做离散化,构造出一套概念词表——所以一个「概念」是从网络已有表征里导出来的离散编码,不是人工标注的类别。然后有一个专门的概念模块去预测下一个概念,等于是明确要求模型去猜接下来那一整块多 token 的内容,而不只是紧邻的下一个符号。
榜首靠的是数字。它用 51.3% 的 token 就达到了 OLMo-3-7B 的最终预训练 loss——同样的 loss,一半的数据。然后在下游任务宏平均上比 OLMo-3-7B 高 2.45 分,在 GSM8K 这一项上高 5.99 分。GSM8K 拉开这么大,说明概念目标买到的是多步推理上的结构性东西,而不只是把困惑度磨平了。他们还报了另一个数:用大约 85% 的算力追平 8.9B 基线。
两个衍生结果才是工程师真正用得上的。在学到的隐空间上加一个 1700 万参数的 VQ 模块就能做轻量领域适配,这个旋钮比任何形式的微调都便宜得多。另外把概念表征喂进投机解码,平均接受长度提升 4.17%——这是在现有推理服务栈上白捡的吞吐。第二个尤其值得注意,因为这是一个隐空间层面的想法,最后兑现成了一个朴素的系统收益。
也别太上头。这是一个团队自己报自己在 8.9B 规模上的结果,标题写的还是 ArchPreview;而「只要一半数据」这类说法,历史上换个规模换套数据配比让别人复现一遍,往往就缩水了。但这个目标函数是个真正的结构性想法,不是调参技巧。如果数据效率哪怕只兑现到 51% 附近的一半,那它改变的是「一笔预训练预算能买到什么」这件事本身。值得盯着看谁来复现。
评论