2026年8月28日ResearchAgents

VoiceMem 给语音 agent 装了左脑和右脑

今天 Hugging Face 榜首论文,149 赞,是南洋理工的 VoiceMem。它攻的是语音 agent 至今像金鱼的根源:对话式语音模型没有一套能跟上对话速度的记忆系统。文本 agent 可以慢悠悠跑一轮 RAG,语音 agent 只有一个自然停顿的时长,再慢一点,在跟人说话的幻觉就碎了。

架构是双脑,而这个切分正是洞察所在。信息左脑管事实检索——你说过什么、定过什么——top-5 检索比 Mem0 高出约 30 分。情感右脑建模情绪和人设——你对事情通常什么态度、你对这个 agent 来说是谁——在人设建模上刷出了新的最好成绩。两种不同的活,交给两个不同的子系统,而不是一个嵌入库假装两头都行。

让它能落地的数字是 134 毫秒。完整检索塞进了语音活动检测的延迟窗口以内——记忆查询整个藏在系统本来就要花掉的、用于判断你说完了没的那个停顿里。对话延迟增加为零。记忆必须装进一次停顿,这个约束是文本 agent 从来没有过的逼迫函数,逼出的设计比我们今年报道过的一票记忆层产品都更精悍。

它也像是对 MemTrapBench 的回应——那篇测出大多数 agent 记忆策略还不如没有记忆。VoiceMem 隐含的立场是:记忆作为一个通用的事后补丁会失败,作为专门化、有延迟预算的子系统才成立。加上 Plaud 同一周发了 agent 耳机,能塞进耳朵里的流式记忆突然从研究品味变成了产品需求。论文在 arxiv.org/abs/2608.26005。
← 上一篇
JIT-Agent:harness 变成模型在运行时现写的东西
下一篇 →
Plaud 把 SIM 卡塞进耳机盒,让你随时给自己的 agent 打电话
← 返回所有文章

评论

加载中...
>_