2026年9月8日Open SourceAgentsResearch

Iris:两个开源搜索 agent,直接对标闭源前沿

AllSpark Research 放出了两个开源搜索 agent 模型,叫 Iris——mini 是 35B-A3B,pro 是 397B-A17B,都从 Qwen3.5 底座后训练而来,都是 Apache 2.0。故事就在数字上:pro 版声称 BrowseComp 88.6、Humanity's Last Exam 56.4。要是独立复测站得住,一个 Apache 协议的模型就闯进了至今只属于闭源前沿系统的地界。论文在 HuggingFace 当日榜拿了 50 个赞。

训练方法叫 climbing:SFT 和 RL 轮流上,对着真实搜索环境练,让模型不断顶自己的上限,而不是在冻结数据集上过拟合。训练数据是从超链接和实体图谱反向构造的——从网络结构出发,生成这个结构能回答的问题。这是一条不靠人工标注员的可扩展路子。

模型卡里有一句话比跑分表更值得看:作者自己写明,公布的成绩取决于 agent 加上它的上下文管理 harness,换配置分数就不一样。这就是 ARC 那个 62.7 对 99.9 的教训,这次是模型作者自己主动交代的。你测的是 Iris 加脚手架,引用 88.6 之前记住这一点。

权重在 HuggingFace 的 AllSpark-Research 下,代码在 https://github.com/AllSpark-Research/Iris。开源自学搜索这条线的前情可以看 https://clauday.com/zh/article/6cf84891-25ca-4361-97c4-830c7c713292。
← 上一篇
Hyperprobe:让 agent 只读调试生产环境
下一篇 →
Substrate blindness:agent 的失明症有名字了,还有了数字
← 返回所有文章

评论

加载中...
>_