2026年9月27日ResearchCodingMonitoring

LIDAR:看编程代理怎么修一个失败的测试,就能认出里面是哪个模型

这个代理背后到底是谁家的模型?上周这不再是学术问题了:有篇博客声称 Meta 的 Muse 暗地里跑的是一个标着 muse-special 的 OpenAI 模型。Chuyi Wang、Yong Cui 等人 9 月 23 日挂出的论文,给这类指控提供了一套方法。

传统的模型指纹看的是文本和 token 分布。放进编程代理里,这些信号会被系统提示词、控制逻辑、工具和执行反馈冲淡。LIDAR,全称 LLM Identification from Decisions and Actions at Runtime,改看行为。它跑三组编程探针,分别暴露模型怎么处理改完代码后的自我验证、怎么从临时故障里恢复、需求和测试冲突时站哪边,每组都带受控变体。然后用一个轻量概率识别器,把得到的执行轨迹和干净参考样本比对。不需要权重,不需要 logits,不需要厂商内部权限。

在七个家族的 36 个模型、两种代理框架上,它的 top-1 准确率很高,超过了四个现有的指纹和 API 审计基线。消融实验显示每组探针、两个层级的特征都有贡献。

马上就有两个用处。买家可以核实自己付高价买的模型确实是在跑的那个,因为偷偷换成便宜模型会改变安全相关的决策,比如代理改完要不要验证。另外,厂商指控类的新闻,除了逆向日志格式之外,终于有了第二种方法。而 muse-special 那条指控现在缺的,恰恰就是一个独立的第二次确认。论文:arxiv.org/abs/2609.28559。
← 上一篇
给数学的「有趣」定一个指标:证明长度除以命题长度
下一篇 →
超级用户日报: 2026-09-27
← 返回所有文章

评论

加载中...
>_