agent记忆的benchmark全是两个人对话,可现实是群聊
看一眼agent记忆是在哪儿被评测的,基本都是一个用户对一个助手。再看一眼agent实际被部署在哪儿——Slack频道、团队会议、一个客户线程里坐着两家公司的三个人——问题的形状就变了。重点不只是"说了什么"。是谁说的,这个人说了算不算数,以及哪些是团队定下来的、哪些只是某个人随口提的。
SpeakerMem-R1今天在HuggingFace论文榜上排第一,77票,做的就是这件事。双轨记忆:一边是带说话人标签的原文消息,一边是推导出来的状态,而推导状态又分成两个视图——个人级和群体级。于是"小伟想要什么"和"这个团队定了什么"是两次独立的查询,而不是在同一堆文本里靠运气过滤。训练用了speaker-conditioned GRPO,外加一个他们叫SpeakerLevenshtein的东西,专门冲着归属错误去——那正是多人记忆最典型的翻车方式。
数字:公开的EverMemBench榜上62.33%,他们说是目前最好;SocialMemBench 69.2%;LoCoMo在1986道题上70.85%;GroupMemBench 47.9%。最后那个才是诚实的数,也是最有意思的数——群体级记忆还在50%以下,意思是在这篇论文专门要解决的那件事上,整个领域离"解决了"还很远,更接近抛硬币。另有一组受控RL评测把305道题的平均准确率从57.38%推到68.20%。
它能本地跑,这一点在这里比平时更重要,因为它的整个前提是把你团队说的所有话都喂进去。代码在项目页的GitHub链接里。
论文:https://arxiv.org/abs/2609.26780
← 返回所有文章
SpeakerMem-R1今天在HuggingFace论文榜上排第一,77票,做的就是这件事。双轨记忆:一边是带说话人标签的原文消息,一边是推导出来的状态,而推导状态又分成两个视图——个人级和群体级。于是"小伟想要什么"和"这个团队定了什么"是两次独立的查询,而不是在同一堆文本里靠运气过滤。训练用了speaker-conditioned GRPO,外加一个他们叫SpeakerLevenshtein的东西,专门冲着归属错误去——那正是多人记忆最典型的翻车方式。
数字:公开的EverMemBench榜上62.33%,他们说是目前最好;SocialMemBench 69.2%;LoCoMo在1986道题上70.85%;GroupMemBench 47.9%。最后那个才是诚实的数,也是最有意思的数——群体级记忆还在50%以下,意思是在这篇论文专门要解决的那件事上,整个领域离"解决了"还很远,更接近抛硬币。另有一组受控RL评测把305道题的平均准确率从57.38%推到68.20%。
它能本地跑,这一点在这里比平时更重要,因为它的整个前提是把你团队说的所有话都喂进去。代码在项目页的GitHub链接里。
论文:https://arxiv.org/abs/2609.26780
评论