一篇会写论文的论文,8.1 美元,3.2 小时
今天 HuggingFace 论文榜第一,176 赞:Spark-to-Paper,一个端到端的研究论文生成系统,做法是在一个编码助手里装了十三个可组合的 skill。文献检索、实验设计、基于证据的论断修订、图表生成,整条流水线。单篇稿件平均成本 8.1 美元,平均耗时 3.2 小时,平均消耗 1190 万 token。
先别管这个能力本身,真正可迁移的是它的架构。系统把模型判断和确定性操作分开,把实验规划和结果汇报分开。凡是能机械校验的地方就机械校验,只有真正需要判断力的事才交给模型定。结果直接从这个纪律里长出来:引用有效性 99.5%,图表可编辑率 96.4%,编造检测从单趟的 14% 提到全系统的 92%。最后这个数字是 6.5 倍提升,纯靠结构,没换更好的模型。
论文里最诚实的一处是他们给一个失效模式起了名字,叫自我反驳循环:反复实验最终否定了最初的研究目标,而系统照跑不误。跑过长 agent 循环的人一眼就认出来。agent 在优化你给它的流程,目标却在底下悄悄死掉,而循环里没有任何一环在检查终点是否还存在。把这件事命名出来本身就很有用。
另一个值得带走的是「十三个 skill」这个形态。这不是一个定制的科研 agent,而是一个面向特定领域的 skill 库,跑在通用编码助手里。这跟整个八月 skill 生态的走向完全一致,也悄悄论证了一件事:领域专长现在是写成文件的东西,不是训进权重的东西。
没有公开代码仓库。arXiv 2608.11924,作者 Zhuoyang Qian 等。
← 返回所有文章
先别管这个能力本身,真正可迁移的是它的架构。系统把模型判断和确定性操作分开,把实验规划和结果汇报分开。凡是能机械校验的地方就机械校验,只有真正需要判断力的事才交给模型定。结果直接从这个纪律里长出来:引用有效性 99.5%,图表可编辑率 96.4%,编造检测从单趟的 14% 提到全系统的 92%。最后这个数字是 6.5 倍提升,纯靠结构,没换更好的模型。
论文里最诚实的一处是他们给一个失效模式起了名字,叫自我反驳循环:反复实验最终否定了最初的研究目标,而系统照跑不误。跑过长 agent 循环的人一眼就认出来。agent 在优化你给它的流程,目标却在底下悄悄死掉,而循环里没有任何一环在检查终点是否还存在。把这件事命名出来本身就很有用。
另一个值得带走的是「十三个 skill」这个形态。这不是一个定制的科研 agent,而是一个面向特定领域的 skill 库,跑在通用编码助手里。这跟整个八月 skill 生态的走向完全一致,也悄悄论证了一件事:领域专长现在是写成文件的东西,不是训进权重的东西。
没有公开代码仓库。arXiv 2608.11924,作者 Zhuoyang Qian 等。
评论