AI 会画电路板吗?EEBench 的答案是 61.6%
做 atopile 的团队自建自资了一个基准 EEBench,考的是 AI 到底会不会设计电子产品,第一批结果冲上 HN 首页 352 分(https://eebench.org/blog/can-ai-design-circuit-boards-yet/)。答案:Claude Opus 5 拿 61.6%,Grok 4.6 57.1%,Claude Fable 5.1 56.4%,OpenAI 掉队明显——GPT-5.5 只有 42.3%,GPT-5.6 Sol 39.4%。
让这个基准成立的设计选择是:不碰图形界面 CAD。一切通过 atopile 的声明式代码进行,agent 以文本形式操纵元件、连接和电气约束,然后用仿真来评判。V1 的 13 道题土得掉渣但无比真实——住宅电表的掉电保持电路,要在真实容差下选电容;多重反馈低通滤波器,要凑出元件比例。评分维度包括厂商数据手册、容差角、成本效率和供应链可得性。
核心发现是把双刃剑。模型懂的电子学远比它们平时通过工具输出表现出来的多——把点 CAD 的枷锁去掉,知识就冒出来了。但物理规律照样抓它们现行:标称值算得漂漂亮亮,有效电容却不够,设计照样失败——这正是教科书和真能量产的板子之间的那类错误。
两个值得留意的点。Opus 5 赢过更新的 Fable 5.1,暗示深域知识住在又大又慢的模型里,而不是 agent 化打磨过的那些。以及,基准测试正从软件向原子世界进军——终端、浏览器、科学之后,现在轮到容差角和供应链了。61.6% 和一块你真敢拿去量产的板子之间的差距,就是这条线未来两年的故事。
← 返回所有文章
让这个基准成立的设计选择是:不碰图形界面 CAD。一切通过 atopile 的声明式代码进行,agent 以文本形式操纵元件、连接和电气约束,然后用仿真来评判。V1 的 13 道题土得掉渣但无比真实——住宅电表的掉电保持电路,要在真实容差下选电容;多重反馈低通滤波器,要凑出元件比例。评分维度包括厂商数据手册、容差角、成本效率和供应链可得性。
核心发现是把双刃剑。模型懂的电子学远比它们平时通过工具输出表现出来的多——把点 CAD 的枷锁去掉,知识就冒出来了。但物理规律照样抓它们现行:标称值算得漂漂亮亮,有效电容却不够,设计照样失败——这正是教科书和真能量产的板子之间的那类错误。
两个值得留意的点。Opus 5 赢过更新的 Fable 5.1,暗示深域知识住在又大又慢的模型里,而不是 agent 化打磨过的那些。以及,基准测试正从软件向原子世界进军——终端、浏览器、科学之后,现在轮到容差角和供应链了。61.6% 和一块你真敢拿去量产的板子之间的差距,就是这条线未来两年的故事。
评论