Prime Agent:边跑边改自己 harness 的开源 Agent
Prime Intellect 在 8 月 5 日发布了 Prime Agent(primeintellect.ai/blog/prime-agent):一个开源的编程与研究 agent,核心想法只有一个——应该允许 agent 修改自己。不是改权重,是改 harness。
两个抽象干活。第一个叫 Recursive Language Model:不再是一个塞满就完蛋的上下文窗口,agent 把上下文当成动态的东西,在一个持久的 IPython REPL 里把子任务当函数调用来委派,官方的说法是"把语言模型程序写成作用于自身上下文的动作"。第二个是 continual harness:agent 在运行中可以对自己的 prompt、技能、记忆、子 agent 做增删改查,还有一条 /refine 流水线,把观察到的失败变成针对性的 harness 改进。多个 agent 按家族树组织——父、兄弟、子——由后台守护进程协调。
头条数字:ARC-AGI 3 拿到 95.5%,比人类专家基线 95.4% 高出一线。另有长上下文任务上与闭源模型 harness 打平的结果,demo 从写模拟器到写 GPU kernel。单一 benchmark 的宣称照例要打折,但用开源 harness 在 ARC 上越过人类专家线,不是小事。
这是"harness 胜过权重"这条线走到了逻辑终点。本周 LongHorizon-Harness 刚证明外置任务状态能给固定模型加 30 分,SkillRise 说技能应该跨任务积累,Prime Agent 把环闭上了:既然收益在 harness 里,那就让 agent 自己优化 harness。/refine 到底能产生真正的复利改进还是只是空转,这是真正要紧的问题——好在它完全开源,任何人都可以去验证。
← 返回所有文章
两个抽象干活。第一个叫 Recursive Language Model:不再是一个塞满就完蛋的上下文窗口,agent 把上下文当成动态的东西,在一个持久的 IPython REPL 里把子任务当函数调用来委派,官方的说法是"把语言模型程序写成作用于自身上下文的动作"。第二个是 continual harness:agent 在运行中可以对自己的 prompt、技能、记忆、子 agent 做增删改查,还有一条 /refine 流水线,把观察到的失败变成针对性的 harness 改进。多个 agent 按家族树组织——父、兄弟、子——由后台守护进程协调。
头条数字:ARC-AGI 3 拿到 95.5%,比人类专家基线 95.4% 高出一线。另有长上下文任务上与闭源模型 harness 打平的结果,demo 从写模拟器到写 GPU kernel。单一 benchmark 的宣称照例要打折,但用开源 harness 在 ARC 上越过人类专家线,不是小事。
这是"harness 胜过权重"这条线走到了逻辑终点。本周 LongHorizon-Harness 刚证明外置任务状态能给固定模型加 30 分,SkillRise 说技能应该跨任务积累,Prime Agent 把环闭上了:既然收益在 harness 里,那就让 agent 自己优化 harness。/refine 到底能产生真正的复利改进还是只是空转,这是真正要紧的问题——好在它完全开源,任何人都可以去验证。
评论