首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM

机智流 2026-09-07 09:00

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图1

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图2

日常使用智能语音助手时,不少人都遇到过类似的尴尬:上次明明说过自己对芒果过敏,点外卖时它还是优先推荐芒果相关的餐品;前几分钟刚聊过家里养了三只猫,转头问它养宠注意事项,它还要再问你养的是什么宠物;更不用提取出记忆内容需要等待几秒,整个对话断断续续毫无自然感。

这些问题的核心,就在于当前的对话系统缺少一套兼顾准确性、情感感知能力和低延迟的记忆体系。

研究背景

近年来,语音大模型和全双工对话模型的交互体验已经越来越自然流畅,但相关技术和记忆系统的融合始终没有形成完整的解决方案,想要打造兼具高智商和高共情能力的交互系统,仍然存在不少待解决的问题。

首先是信息智能和情感智能的统一架构缺失,对于实时对话系统来说,准确理解用户表达的事实信息,和感知用户的情绪、个性化偏好同等重要,而情绪相关的建模逻辑比事实信息复杂得多,此前还没有方案能够长期稳定地同时支持两类能力。

其次是低延迟和高信息密度的平衡难题,现有记忆系统的检索过程通常需要2-3秒,远远超出实时对话要求的500ms延迟上限,同时文本智能体常用的返回前100条记忆结果的设置,也超出了语音大模型的上下文承载能力。

最后是基础设施的迭代灵活性不足,记忆算法和语音对话模型的技术迭代速度都很快,目前的对话模型大多不支持联合输入音频和记忆内容,记忆系统需要保持足够的简洁性和兼容性,才能适配快速迭代的技术环境。

为了解决上述问题,来自南洋理工大学、新加坡国立大学、清华大学等机构的研究团队共同提出了VOICEMEM,这套流式双脑记忆框架专门为实时语音交互设计,能够在几乎不增加额外延迟的前提下,同时提供准确的事实记忆和个性化的情感感知能力。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图3

论文标题:VOICEMEM: STREAMING DUAL-BRAIN MEMORY FOR REAL-TIME INTERACTION

论文链接:https://arxiv.org/pdf/2608.26005v1.pdf

项目地址:https://xzf-thu.github.io/VoiceMem/

核心双脑架构设计

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图4
图1:VOICEMEM整体架构示意图,左脑负责事实记忆处理,右脑负责情绪与用户画像建模,二者配合实现几乎无额外延迟的个性化记忆能力

VOICEMEM的核心设计参考了人类的大脑分工,设置了并行的左右脑模块,左脑负责处理事实类记忆,右脑负责处理情感和用户画像类记忆,再配合流式I/O机制实现低延迟响应。

左脑的核心目标是在实时对话的严格上下文和延迟限制下,实现高效的记忆存储和检索。针对此前返回top5记忆容易漏、返回top100记忆又占用过多上下文的问题,左脑采用了schema-实体的两级索引架构,schema负责粗粒度的语义路由,实体负责定位具体的人、事件或概念,在调用下层记忆引擎之前,就先把检索范围缩小到紧凑的语义相关候选集,大幅提升小检索量下的准确率。同时左脑还设置了集群涌现机制,会根据用户的查询规律,自动把经常被同时检索的实体组合成新的schema,不需要人工提前预设全部分类,就能平衡长期使用过程中的记忆分类数量和检索精度。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图5
图2:VOICEMEM完整工作流程,分为流式预处理、双脑核心算法处理、可互换后端引擎检索三个阶段

右脑的核心目标是完成用户画像和情感记忆的建模,和左脑记录“发生了什么”不同,右脑负责捕捉“用户是什么样的人”。它设置了两类互补的画像节点:独立节点存储用户本身的固有特质,比如长期的性格、行为规律、情感倾向,需要多轮对话的长期积累才能确认;跨实体节点存储用户和具体事物关联的情绪和偏好,比如“不喜欢吃香菜”“害怕密集的图案”,每个节点都会和左脑对应的实体关联,避免把用户的 situational 情绪误判为长期特质,也不会丢失情绪对应的具体触发对象。右脑还设置了长短双周期的归因机制,每轮对话都会更新短期的情绪状态,每次会话结束后会把重复出现的情绪和偏好固化成稳定的用户特征,实现动态的画像更新。

为了进一步降低延迟,VOICEMEM设计了四阶段的流式检索流程,把整个检索过程嵌入到常规语音端点检测的等待窗口里,用户完全感知不到额外的延迟。在用户说话的阶段,系统就会同步返回流式语音转文字结果,匹配对应的实体和schema,确认说话人身份;当用户停止说话达到200ms时,系统会预判用户即将结束发言,提前提取查询嵌入,完成左右脑的上层图谱扩展;到400-500ms的阶段,系统只需要完成最后的后端检索和结果合并,就能输出给大语言模型生成回复。整个检索过程仅耗时134ms,完全符合实时对话的延迟要求。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图6
图3:VOICEMEM四阶段流式检索流程,将整个检索过程嵌入语音端点检测的等待窗口内,实现无额外感知延迟

除此之外,VOICEMEM还支持多模态的记忆存储,除了文本内容之外,还可以保存说话人声纹、声学嵌入、原始音频波形等内容,作为多模态节点关联到对应的实体节点,支持多说话人区分、副语言分析、环境音记忆等能力。

训练与落地部署方案

为了让VOICEMEM能够适配现有的语音大模型,研究团队设计了黑盒在线策略蒸馏的训练流程,把原本只支持语音输入、文本输出的Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini等模型,改造为支持记忆访问的语音大模型,这也是业界首批具备显式记忆访问能力的语音大模型。

训练流程首先会为每个虚拟用户构建连贯的长期记忆世界,从核心画像出发逐步生成背景信息、生活事件、对话记录等内容,形成时间一致的用户历史;之后通过多轮迭代生成依赖记忆的对话,经过语音大模型验证和过滤之后形成高质量样本;再经过人工标注补充更多情感、性格相关的复杂样本和多模态输入样本,最终生成了包含40万条记忆依赖对话的CHATMEM-400K数据集。

研究团队还从数据集中筛选出了高难度的样本,构建了CHATMEM-BENCH评测基准,覆盖信息、用户画像、情感归因、副语言与环境四个维度,共计14个细分问题类别,专门用于评估真实语音助手场景下的记忆能力。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图7
图4:VOICEMEM训练与验证流程,通过记忆世界构建、语音大模型验证的在线蒸馏、人工标注三个阶段生成CHATMEM-400K数据集与CHATMEM-BENCH评测基准

在部署层面,VOICEMEM采用了解耦的架构设计,上层负责双脑路由、并行组织和流式推理,下层的记忆引擎完全可以互换,不会和特定的后端技术绑定。当前官方实现采用了Mem0作为后端,后续如果有性能更优的记忆引擎,只需要替换下层模块即可,不需要调整上层的双脑架构,方便企业根据自身的技术栈选择适配的后端。

多维度实测效果

研究团队在信息记忆、用户画像记忆、语音落地三个方向的多个基准上完成了测试,结果显示VOICEMEM的表现全面优于现有方案。

在事实记忆测试中,VOICEMEM在11个细分测试项里有7项排名第一,平均得分达到76.39,比作为后端的Mem0高出24.12分,甚至比能够看到完整对话历史的全上下文处理方案还高出15.9分,尤其是在需要结合多段记忆完成时序推理的场景,优势最为明显。在用户画像记忆测试中,使用微调后的语音大模型的VOICEMEM平均得分达到76.56,比此前最优的方案高出1.89分,在冲突检测和用户建模这类需要综合多段信息推理的场景,全上下文方案仅能拿到12.1和21.7分,而VOICEMEM的得分可以达到69.1和74分,表现提升十分明显。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图8
图5:LoCoMo基准上的时间、成本、准确率对比,VOICEMEM以更少的内存开销和更低的延迟实现了更高的准确率

在专门针对语音交互场景的CHATMEM-BENCH测试中,VOICEMEM在14个细分项里有11项排名第一,尤其是在副语言与环境相关的任务中,比如背景音回忆、声学场景推理、多用户对话记忆这些纯文本系统无法处理的任务,普通方案的得分仅在3.23到26.92之间,而VOICEMEM的得分可以达到45.16到53.84,填补了语音场景记忆评测的空白。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图9
图6:LoCoMo基准上不同检索条数的准确率表现,VOICEMEM在仅返回5条结果时就已经达到很高的准确率

延迟和资源开销方面,VOICEMEM的检索过程仅耗时134ms,返回5条记忆仅需要430个词元,相比此前最优的方案,词元用量仅为其四分之一,准确率还高出8.1分。同时不管返回的记忆条数是3还是100,检索延迟都稳定在134ms左右,这是因为上层路由已经把检索的候选池缩小到了很小的范围,最终返回的条数不会影响搜索耗时。

组件消融测试显示,VOICEMEM的每个模块都对最终效果有贡献,其中移除上层索引带来的准确率下降最多,移除右脑模块带来的下降次之,说明情感和用户画像的记忆确实能够为对话效果带来实际增益。跨后端的测试也验证了架构的通用性,分别使用Mem0、LangMem、Zep作为后端的情况下,加入VOICEMEM的上层架构后,准确率都能提升15.8到29.5分,不需要依赖特定的后端技术就能实现效果提升。

首个零延迟、专为语音而生的记忆来了! 颜水成团队发布双脑记忆框架VOICEMEM图10

应用价值与展望

VOICEMEM的出现,为实时语音交互系统的记忆能力提供了一套成熟的落地方案,它把单轮的语音理解升级成了连续的、个性化的用户理解,同时几乎没有增加额外的感知延迟,非常适合应用在智能音箱、车载语音助手、情感陪伴机器人、客服对话系统等场景。

对于企业来说,解耦的架构设计也降低了落地成本,不需要重构现有的记忆系统,只需要在上层增加双脑路由模块,就能大幅提升记忆系统的表现,同时还可以适配未来新出现的记忆引擎技术,保护现有的技术投入。后续随着相关技术的进一步迭代,这套双脑记忆架构也有望拓展到更多的多模态交互场景,为通用智能体的长期记忆能力提供基础支撑。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
下周开展!一图速览IICIE 国际集成电路创新博览会|行业大咖齐聚,与产业链龙头面对面
从哈佛法学院辍学创业,Blue Voice用AI重塑警队“即时合规”防线
399美元开源鸭Microduck:软件全白嫖,硬件零图纸!扒完代码我才发现复刻没那么简单
投资4500万、年产16480片,赛富乐斯启动量子点全彩Micro-LED微显示项目技改
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型
【Omdia CDC 2026 仅剩2周】LCD中小尺寸显示驱动IC供需相对紧张
合见工软发布国产首个Agentic EDA体系,填补3DIC物理设计空白
谷歌入局创意设计:AI绘图工具“Google Pics”正式嵌入Workspace生态
直流快充SiC MOSFET寿命设计:充电策略、热管理与封装的关键影响
荣耀Magic9系列配置前瞻|9.7见 小米平板9ProMax外观公布
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号