

日常使用智能语音助手时,不少人都遇到过类似的尴尬:上次明明说过自己对芒果过敏,点外卖时它还是优先推荐芒果相关的餐品;前几分钟刚聊过家里养了三只猫,转头问它养宠注意事项,它还要再问你养的是什么宠物;更不用提取出记忆内容需要等待几秒,整个对话断断续续毫无自然感。
这些问题的核心,就在于当前的对话系统缺少一套兼顾准确性、情感感知能力和低延迟的记忆体系。
研究背景
近年来,语音大模型和全双工对话模型的交互体验已经越来越自然流畅,但相关技术和记忆系统的融合始终没有形成完整的解决方案,想要打造兼具高智商和高共情能力的交互系统,仍然存在不少待解决的问题。
首先是信息智能和情感智能的统一架构缺失,对于实时对话系统来说,准确理解用户表达的事实信息,和感知用户的情绪、个性化偏好同等重要,而情绪相关的建模逻辑比事实信息复杂得多,此前还没有方案能够长期稳定地同时支持两类能力。
其次是低延迟和高信息密度的平衡难题,现有记忆系统的检索过程通常需要2-3秒,远远超出实时对话要求的500ms延迟上限,同时文本智能体常用的返回前100条记忆结果的设置,也超出了语音大模型的上下文承载能力。
最后是基础设施的迭代灵活性不足,记忆算法和语音对话模型的技术迭代速度都很快,目前的对话模型大多不支持联合输入音频和记忆内容,记忆系统需要保持足够的简洁性和兼容性,才能适配快速迭代的技术环境。
为了解决上述问题,来自南洋理工大学、新加坡国立大学、清华大学等机构的研究团队共同提出了VOICEMEM,这套流式双脑记忆框架专门为实时语音交互设计,能够在几乎不增加额外延迟的前提下,同时提供准确的事实记忆和个性化的情感感知能力。

论文标题:VOICEMEM: STREAMING DUAL-BRAIN MEMORY FOR REAL-TIME INTERACTION
论文链接:https://arxiv.org/pdf/2608.26005v1.pdf
项目地址:https://xzf-thu.github.io/VoiceMem/
核心双脑架构设计

VOICEMEM的核心设计参考了人类的大脑分工,设置了并行的左右脑模块,左脑负责处理事实类记忆,右脑负责处理情感和用户画像类记忆,再配合流式I/O机制实现低延迟响应。
左脑的核心目标是在实时对话的严格上下文和延迟限制下,实现高效的记忆存储和检索。针对此前返回top5记忆容易漏、返回top100记忆又占用过多上下文的问题,左脑采用了schema-实体的两级索引架构,schema负责粗粒度的语义路由,实体负责定位具体的人、事件或概念,在调用下层记忆引擎之前,就先把检索范围缩小到紧凑的语义相关候选集,大幅提升小检索量下的准确率。同时左脑还设置了集群涌现机制,会根据用户的查询规律,自动把经常被同时检索的实体组合成新的schema,不需要人工提前预设全部分类,就能平衡长期使用过程中的记忆分类数量和检索精度。

右脑的核心目标是完成用户画像和情感记忆的建模,和左脑记录“发生了什么”不同,右脑负责捕捉“用户是什么样的人”。它设置了两类互补的画像节点:独立节点存储用户本身的固有特质,比如长期的性格、行为规律、情感倾向,需要多轮对话的长期积累才能确认;跨实体节点存储用户和具体事物关联的情绪和偏好,比如“不喜欢吃香菜”“害怕密集的图案”,每个节点都会和左脑对应的实体关联,避免把用户的 situational 情绪误判为长期特质,也不会丢失情绪对应的具体触发对象。右脑还设置了长短双周期的归因机制,每轮对话都会更新短期的情绪状态,每次会话结束后会把重复出现的情绪和偏好固化成稳定的用户特征,实现动态的画像更新。
为了进一步降低延迟,VOICEMEM设计了四阶段的流式检索流程,把整个检索过程嵌入到常规语音端点检测的等待窗口里,用户完全感知不到额外的延迟。在用户说话的阶段,系统就会同步返回流式语音转文字结果,匹配对应的实体和schema,确认说话人身份;当用户停止说话达到200ms时,系统会预判用户即将结束发言,提前提取查询嵌入,完成左右脑的上层图谱扩展;到400-500ms的阶段,系统只需要完成最后的后端检索和结果合并,就能输出给大语言模型生成回复。整个检索过程仅耗时134ms,完全符合实时对话的延迟要求。

除此之外,VOICEMEM还支持多模态的记忆存储,除了文本内容之外,还可以保存说话人声纹、声学嵌入、原始音频波形等内容,作为多模态节点关联到对应的实体节点,支持多说话人区分、副语言分析、环境音记忆等能力。
训练与落地部署方案
为了让VOICEMEM能够适配现有的语音大模型,研究团队设计了黑盒在线策略蒸馏的训练流程,把原本只支持语音输入、文本输出的Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini等模型,改造为支持记忆访问的语音大模型,这也是业界首批具备显式记忆访问能力的语音大模型。
训练流程首先会为每个虚拟用户构建连贯的长期记忆世界,从核心画像出发逐步生成背景信息、生活事件、对话记录等内容,形成时间一致的用户历史;之后通过多轮迭代生成依赖记忆的对话,经过语音大模型验证和过滤之后形成高质量样本;再经过人工标注补充更多情感、性格相关的复杂样本和多模态输入样本,最终生成了包含40万条记忆依赖对话的CHATMEM-400K数据集。
研究团队还从数据集中筛选出了高难度的样本,构建了CHATMEM-BENCH评测基准,覆盖信息、用户画像、情感归因、副语言与环境四个维度,共计14个细分问题类别,专门用于评估真实语音助手场景下的记忆能力。

在部署层面,VOICEMEM采用了解耦的架构设计,上层负责双脑路由、并行组织和流式推理,下层的记忆引擎完全可以互换,不会和特定的后端技术绑定。当前官方实现采用了Mem0作为后端,后续如果有性能更优的记忆引擎,只需要替换下层模块即可,不需要调整上层的双脑架构,方便企业根据自身的技术栈选择适配的后端。
多维度实测效果
研究团队在信息记忆、用户画像记忆、语音落地三个方向的多个基准上完成了测试,结果显示VOICEMEM的表现全面优于现有方案。
在事实记忆测试中,VOICEMEM在11个细分测试项里有7项排名第一,平均得分达到76.39,比作为后端的Mem0高出24.12分,甚至比能够看到完整对话历史的全上下文处理方案还高出15.9分,尤其是在需要结合多段记忆完成时序推理的场景,优势最为明显。在用户画像记忆测试中,使用微调后的语音大模型的VOICEMEM平均得分达到76.56,比此前最优的方案高出1.89分,在冲突检测和用户建模这类需要综合多段信息推理的场景,全上下文方案仅能拿到12.1和21.7分,而VOICEMEM的得分可以达到69.1和74分,表现提升十分明显。

在专门针对语音交互场景的CHATMEM-BENCH测试中,VOICEMEM在14个细分项里有11项排名第一,尤其是在副语言与环境相关的任务中,比如背景音回忆、声学场景推理、多用户对话记忆这些纯文本系统无法处理的任务,普通方案的得分仅在3.23到26.92之间,而VOICEMEM的得分可以达到45.16到53.84,填补了语音场景记忆评测的空白。

延迟和资源开销方面,VOICEMEM的检索过程仅耗时134ms,返回5条记忆仅需要430个词元,相比此前最优的方案,词元用量仅为其四分之一,准确率还高出8.1分。同时不管返回的记忆条数是3还是100,检索延迟都稳定在134ms左右,这是因为上层路由已经把检索的候选池缩小到了很小的范围,最终返回的条数不会影响搜索耗时。
组件消融测试显示,VOICEMEM的每个模块都对最终效果有贡献,其中移除上层索引带来的准确率下降最多,移除右脑模块带来的下降次之,说明情感和用户画像的记忆确实能够为对话效果带来实际增益。跨后端的测试也验证了架构的通用性,分别使用Mem0、LangMem、Zep作为后端的情况下,加入VOICEMEM的上层架构后,准确率都能提升15.8到29.5分,不需要依赖特定的后端技术就能实现效果提升。

应用价值与展望
VOICEMEM的出现,为实时语音交互系统的记忆能力提供了一套成熟的落地方案,它把单轮的语音理解升级成了连续的、个性化的用户理解,同时几乎没有增加额外的感知延迟,非常适合应用在智能音箱、车载语音助手、情感陪伴机器人、客服对话系统等场景。
对于企业来说,解耦的架构设计也降低了落地成本,不需要重构现有的记忆系统,只需要在上层增加双脑路由模块,就能大幅提升记忆系统的表现,同时还可以适配未来新出现的记忆引擎技术,保护现有的技术投入。后续随着相关技术的进一步迭代,这套双脑记忆架构也有望拓展到更多的多模态交互场景,为通用智能体的长期记忆能力提供基础支撑。
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群