Ornith-1.5:自我改进循环开源了
Ornith-1.0 教会了模型在训练中改写自己的 harness。这周发布的 Ornith-1.5 把一个更大的环闭上了:模型现在连训练任务都自己生成。任务生成、脚手架构建、解题 rollout 三件事联合优化——不再靠人类策划的固定题库,模型自己出题、自己找解法、靠 RL 在结果上变强。这就是递归自我改进的配方,以 MIT 协议的开放权重形式发货。
家族三个尺寸:9B 稠密、35B MoE、397B MoE,FP8、GGUF、MLX、NVFP4 量化版首日全放。开源模型里这组数字很吓人:Terminal-Bench 2.1 拿 86.1,SWE-Bench Verified 86,DeepSWE 56,官方说在推理、agent、编码任务上比肩 Claude Opus 4.8。Hacker News 上 152 分,评论区照例吵一个问题:自己生成的课程表能不能逃出自己的盲区。
这个争论才是有意思的地方。模型自己出题,显而易见的问题是谁来给出题人打分——自我课程很容易漂向模型本来就擅长的题。Ornith 的赌注是三阶段联合优化能让出题器保持诚实,因为产生不了学习信号的任务会被淘汰掉。这个机制在 397B 尺度上灵不灵,现在社区可以自己验证了,因为权重是 MIT 的、公开的。
两个月前这套流水线还是实验室珍品,现在已经上 Ollama 了。https://ornith.ai/ornith_1_5.html
← 返回所有文章
家族三个尺寸:9B 稠密、35B MoE、397B MoE,FP8、GGUF、MLX、NVFP4 量化版首日全放。开源模型里这组数字很吓人:Terminal-Bench 2.1 拿 86.1,SWE-Bench Verified 86,DeepSWE 56,官方说在推理、agent、编码任务上比肩 Claude Opus 4.8。Hacker News 上 152 分,评论区照例吵一个问题:自己生成的课程表能不能逃出自己的盲区。
这个争论才是有意思的地方。模型自己出题,显而易见的问题是谁来给出题人打分——自我课程很容易漂向模型本来就擅长的题。Ornith 的赌注是三阶段联合优化能让出题器保持诚实,因为产生不了学习信号的任务会被淘汰掉。这个机制在 397B 尺度上灵不灵,现在社区可以自己验证了,因为权重是 MIT 的、公开的。
两个月前这套流水线还是实验室珍品,现在已经上 Ollama 了。https://ornith.ai/ornith_1_5.html
评论