2026年8月31日ResearchSkillsAgents

RedEvoAgent 把每次得手的攻击都存成一条能复用的技能

给语言模型做红队测试的工具,大多是固定的:跑一批已知的越狱手法,报告哪些打中了。来自香港城市大学和深圳大学一个组的 RedEvoAgent,做的事更让人不安。它是一个黑盒红队 agent,把自己跨案例的攻击轨迹蒸馏成一条简洁、人类可读的攻击技能,然后靠工具有效性画像和归因随时间打磨这条技能,只保留那些能提升成功率的更新。它学会攻击,还把学到的写下来。

它瞄准的目标,正是风险里真正在变大的那一块:越狱不只是生成不安全的文本,而是触发有害的工具调用——一个真能在世界里做点什么的 agent。论文报告 RedEvoAgent 同时打败了固定和 agentic 的基线,提升了工具效率,并且能跨攻击者模型、跨目标执行 harness 迁移——最后这句才是该让防守方坐直的地方:一条在某个 harness 上学到的技能,能带到另一个 harness 上去。

这一下踩在两条线上。一条是我们看着从 WikiSkill、TaoLive 一路爬上来的技能进化模式——agent 把自己的经验编译成持久、可携带的本事——现在被指向了进攻。另一条是 Hugging Face 那份复盘刚刚放大的安全线。两条并在一起,那个让人不舒服的版本就很清楚了:那套让有用的 agent 变强的'学一条技能、留下有效的、带到下一个目标'的循环,同样让攻击的 agent 变强,而且会迁移。目前还没有公开仓库。论文是 arXiv 2608.27439。
← 上一篇
Maritime 想用一个月一美元帮你托管 agent
← 返回所有文章

评论

加载中...
>_