2026年9月21日BenchmarkAgentsMonitoring

Dan McKinley:prompt 就是个向量,文字本身不重要

Dan McKinley 做了个演讲叫《Prompts Aren't Real》,观点跟标题一样直接:把 prompt engineering 当成一门手艺,是搞错了类别。prompt 就是向量,它的文字内容根本不重要,重要的只有你围着它建起来的那套度量装置。内容在 https://evaluation.club ,Hacker News 上 91 分。

他开场举的证据是那种每个团队都有、但没人写下来的事。一个反复出现的 JSON 幻觉故障,靠把一个字段名从 title 改成 heading 解决了。就这样。指令一个字没改,没有澄清任何推理过程,换了个词,bug 消失了。如果你的心智模型是在给同事讲清楚一个任务,这个修法毫无道理。如果你的心智模型是在一个空间里搜索、文本只是坐标,那它完全说得通,同时也告诉你:靠人手工挑坐标,是拿错了工具。

他给的替代方案是 pass^k。生成对抗性场景,每个反复跑很多次,在任何改动前后拿到的是一个分布,而不是一次通过的跑批。然后让算法配上 LLM 裁判,对着这个度量去自动改写 prompt,并且接受最后落点会跟你的起点差得很远,而且你没法用人话解释它为什么更好。

接着递归就咬人了。判断品牌调性这种东西本身就是个模糊任务,所以你得再建一个评估器并且优化它,于是你的优化问题里套了一个优化问题。他没有假装这事解决了。他还说,哪怕模型质量已经不错,只要你以任何真实规模去看,妖怪总会跑出笼子,连字符数上限这种简单约束都会有一定比例失效,prompt 里写什么都一样。

对正在招人的团队来说,扎心的推论是:有市场价值的技能不是写出那个 prompt,是拥有那个最终把你的 prompt 扔掉的循环。
← 上一篇
Vercel 治界面幻觉的办法:让模型挑,不让模型画
下一篇 →
Anthropic 开源了 11 个金融 agent,同一套 skill 还能无人值守跑
← 返回所有文章

评论

加载中...
>_