VoiceMem:为实时语音交互打造的流式双脑记忆系统

论文:VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction arXiv:https://arxiv.org/abs/2608.26005 (arXiv:2608.26005v1 [eess.AS],2026-08-26 提交,18 页,9 图,6 表) 作者:Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan 机构:南洋理工大学、新加坡国立大学、清华大学、香港中文大学、Open Interaction Lab 项目主页:https://xzf-thu.github.io/VoiceMem/


一、一句话总结

VoiceMem 为全双工语音语言模型(SLM)设计了一套"双脑"记忆架构:左脑管信息(发生了什么),右脑管情感与人格(用户是谁),配合四阶段流式检索把全部记忆 I/O 藏进 VAD 本就等待的 500ms 静音窗口里,最终以 134ms 检索延迟、top-5 检索预算达到远超现有记忆系统的准确率。


二、研究背景与动机

论文以柏拉图名言开篇:"Through memory, the soul reveals traces of its former existence." 作者认为,记忆是将对话系统从"智能工具"转变为"以人为本的伙伴"的关键。当前记忆系统(Mem0、A-Mem、EverMemOS 等)与交互模型(SLM、全双工模型)各自快速发展,但二者尚未融合为一个完整方案。面向实时语音交互,存在三大障碍:

障碍 内容
O1:信息智能与情感智能的统一架构 实时对话中情感与 persona 的把握与信息同等重要,但情感机制远比信息复杂,如何在单一架构中长期建模二者尚未被探索
O2:零延迟下的高信息密度 (i) 现有系统 2–3 秒的检索延迟打破了实时对话 500ms 的延迟预算;(ii) 文本 Agent 常用的 top-100 输出超出语音模型的承载能力。记忆系统必须几乎不增加延迟、流式运行,并在 top-5 预算下保持准确率
O3:基础设施与可演化性 记忆方法与语音对话模型都在快速迭代;对话模型尚无法接受音频-记忆联合输入;记忆系统必须"简单而有效"才能持续跟进领域演进

三大核心优势(实验结论)

  1. Accuracy(准确性):top-5 检索下,左脑比 Mem0 在 top-200 下的表现还高出近 30 个点
  2. Emotional & Personal(情感与个性化):右脑在三个 persona 基准上达到 SOTA,微调模型下总分比此前最佳系统提升 4.29 分
  3. Real-Time & Cheap(实时且低成本):检索仅需 134ms,完全在标准 VAD 延迟之内,不增加任何额外对话延迟,同时保持高准确与低成本

三、方法设计

VoiceMem 的整体架构分三个 Phase(对应论文图 2):Phase I 流式预处理(提取说话人身份、ASR、实体、schema、情感与嵌入);Phase II 核心双脑算法;Phase III 通过可互换的后端记忆引擎查询管理后的记忆项。

3.1 左脑:信息记忆(Informational Left Brain)

目标:在在线语音交互紧张的上下文与延迟预算下,支持高效的记忆存储与检索。

Cluster–Entity–MemItem 三级索引 - 两级层级:schemas(图式)做粗粒度语义路由,entities(实体)定位具体的人、事件或概念 - 形式化为图 \(\mathcal{G}^L=(\mathcal{S},\mathcal{V},\mathcal{E})\):实体 \(v=(d_v,\mathcal{N}^{micro}_v,\mathcal{I}_v)\),图式 \(s=(d_s,\mathcal{N}^{macro}_s,\mathcal{V}_s)\);每个实体恰好属于一个 schema;边集含实体间 micro 连接与 schema 间 macro 连接 - 核心思想:将后端(如 Mem0)中存储的 memory items 与其上方的轻量语义索引解耦——先把检索缩小到紧凑且语义连贯的候选集,再访问底层记忆

检索流程:用户说话时,流式匹配器从部分转录文本中识别相关 schema 与实体,再经强/弱一跳连接扩展候选池 \(\mathcal{Z}_t=\mathcal{V}_t\cup\mathcal{V}_{\mathcal{S}_t}\cup\mathcal{N}^{strong}_1(\cdot)\cup\mathcal{N}^{weak}_1(\cdot)\),后端只在候选池中搜索而非全量记忆。

快速更新(Fast Update):每轮对话后,异步更新器提取新事实,通过 add / update / delete / keep 操作与邻近记忆调和,在关键路径之外更新 schema、实体与关系。

簇涌现机制(Cluster Emergence) - 问题:簇增长会降低信息密度,而频繁的规则拆分又会割裂相关记忆、降低检索覆盖率 - 方案:让相干子簇从重复的检索模式中"涌现"。定义查询相干度 \(\rho(H)=\frac{1}{|\mathcal{Q}|}\sum_{q\in\mathcal{Q}}\frac{|A_q\cap H|}{|A_q\cup H|}\) - 流程(论文 Algorithm 1):找出满足 \(\rho(H)>\alpha\) 的最大连通子图 \(H^\star\) → LLM Judge 评估其相关性(relevance)、重要性(importance)、完整性(completeness)→ 三者皆通过则 Promote 为新簇,否则 DisablePotential 防止未来重复拆分

3.2 右脑:情感记忆(Emotional Right Brain)

定位:左脑记录"发生了什么",右脑捕捉"用户是谁",维护 persona memory——稳定的性情、情感倾向、针对具体人/事/概念的态度。

Persona Graph:双节点建模 \(\mathcal{G}^R=(\mathcal{V}^I,\mathcal{V}^C)\)

节点类型 定义 作用
Independent nodes(独立节点) \(v^I=(d_v^I,\mathcal{I}_v^I)\) 编码用户内在属性:持久性情、行为规律、情感倾向,由纵向证据支撑 解释持久的用户特质
Cross-entity nodes(跨实体节点) \(v_e^C=(d_{v,e}^C,\mathcal{I}_{v,e}^C,\rho_{v,e})\) 捕捉上下文依赖的情感,通过 \(\rho_{v,e}\) 链接到左脑实体 保留"情感指向谁/什么"

这一区分是根本性的:混淆二者会把情境反应误认为稳定特质,或丢失赋予情感意义的真实世界原因。

双时程情感归因 - Short-Horizon Attribution(短时程):对每个输入 \(x_t\),情感估计器产生 \(e_t=\phi(x_t)\)\((x_t,e_t)\) 为 persona 节点的增、改、合并提供即时证据 - Long-Horizon Attribution(长时程):每个会话结束后,联合分析整个序列 \((x_1,e_1),\ldots,(x_T,e_T)\),将反复出现的证据固化为稳定的独立 persona 节点,而非累积每个瞬时状态

检索:流式匹配器联合激活独立节点与跨实体节点,并与左脑激活实体所链接的跨实体节点合并,无需搜索全量 persona 记忆。

3.3 流式记忆 I/O:四阶段流式检索

这是 VoiceMem 近零额外延迟的核心(对应论文图 3),四个阶段精确分配在 VAD 的 500ms 静音窗口内:

阶段 时间窗口 操作
(i) Speech Tail(语音尾段) 0–200ms 用户说话时实时获取转录、双脑匹配的实体/图式;若延迟则补充说话人身份
(ii) Anticipation(预判) 200–400ms 假设静音达 200ms 即将回复:提取 query embedding,扩展双脑上层图
(iii) Searching(搜索) 400–500ms 仅余后端搜索:双脑分别 MemSearch 后合并,注入提示

标准 VAD 阈值为 500ms,留出 400ms 窗口;VoiceMem 的密集双脑检索本身仅耗 134ms,留有余量。

3.4 音频记忆扩展

将记忆从文本扩展到音频,支持多说话人辨别、副语言分析、环境声记忆。启用时,Agent 可选择性地将音频保留为说话人声纹、声学嵌入或原始波形,作为多模态节点附加到对应实体节点。

3.5 Memory-Aware SLM 训练管线

将 Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini(原本设计为语音输入/文本输出)改造为记忆增强 SLM——据作者所知是首批具有显式记忆访问能力的语音语言模型。采用 SLM-verified blackbox OPD(在线黑盒在策略蒸馏):Qwen 系列以 Qwen3.5-Omni 为教师,Step-Audio2-Mini 以 Step-Audio2 为教师。四个阶段:

  1. Stage I:记忆世界构建:从核心 persona 出发,逐步实例化 Persona → Background → Events → Messages → Memory,生成时间一致的用户历史
  2. Stage II:SLM 验证的在线蒸馏:迭代六步管线——任务/主题采样 → 场景初始化 → 挑战与策略(回忆、指代消解、矛盾、多记忆推理)→ 对比蒸馏 → 验证(必要性、忠实性、质量)→ SFT 更新。循环产出 ChatMem-400K 大规模语料
  3. Stage III:人工策展:人工精炼语料,构建情感/个性动态更丰富、含声学问题的更难样本;挑战性子集构成 ChatMem-Bench
  4. Stage IV:验证:ChatMem-Bench 覆盖四维度 {Information, Persona, Affective Attribution, Paralinguistics & Environment},共 14 个细粒度类别

3.6 解耦部署架构

graph-on-graph 双层架构:上层专注路由、双脑并行组织与流式推理;下层记忆引擎(由 MemSearch 抽象)完全可替换。当前实现使用 Mem0 作为后端,避免与特定后端紧耦合,从而能及时采纳更新的记忆算法(包括参数化记忆、潜在记忆等方向)。


四、实验与结果

4.1 实验设置

  • 基准(三类):信息记忆(LoCoMo、LongMemEval (S)、Memora);Persona 记忆(ES-MemEval、PersonaMem、PersonaLens);语音记忆(ChatMem-Bench:316 个问题、53 小时音频、15,314 轮对话,每个会话均人工策展)
  • 基线(10 个系统,4 组):Full-Context(参考);Mem0、Zep、LangMem(记忆引擎);A-MEM、MemoryOS、MemOS(Agent 记忆);MemoryBank、EverMemOS、Emotional RAG(个人记忆)
  • 实现细节:所有基线以 GPT-4o-mini 为骨干 LLM、text-embedding-3-small 为嵌入模型,temperature=0;VoiceMem 在 \(K\in\{1,3,5,10,30,100\}\) 六种设置下评估,默认 K=5

4.2 信息记忆结果(论文表 1,LLM-judge 分数 %)

方法 平均分
Full-Context(参考) 60.49
Mem0 52.27
Zep 48.78
LangMem 48.15
A-MEM 48.58
MemoryOS 40.59
MemOS 65.83
MemoryBank 22.39
EverMemOS 65.75
Emotional RAG 38.99
VoiceMem 76.39
VoiceMem‡(微调 Qwen3.6 生成) 75.65
  • 领先 11 个信息子类别中的 7 个;比自身存储后端 Mem0 高 +24.12,比看到全部历史的 Full-Context 还高 +15.90
  • 优势最大的场景:多条记忆需同时到达(如时序推理 +54.9);优势最小:更新追踪(+7.4,单条最新记忆即可回答)
  • VoiceMem 在 LoCoMo 各子项达 94.60/91.60/89.80/85.60,在 LongMemEval 的 Multi 项达 95.00

4.3 Persona 记忆结果(论文表 2)

  • VoiceMem 达 74.16(GPT-4o-mini)/ 76.56(微调模型),超过最强基线 MemOS(72.27);微调版本领先 +4.29
  • 值得注意的"反转":Full-Context 在 ES-MemEval 上冲突检测仅 12.10、用户建模仅 21.70,而 VoiceMem 达 69.10 和 74.00——"证据就在输入中,它仍然无法归因",说明长上下文塞入不等于情感归因能力
  • 两张表均在比文本 Agent 常规 top-100 低一个数量级的检索预算下产生,说明增益来自更密集的候选池而非更大的候选池

4.4 ChatMem-Bench 长时程音频记忆(论文表 3)

  • VoiceMem 平均 68.73(基线最高 MemOS 仅 53.95),领先 14 个类别中的 11 个
  • Paralinguistics & Environment 差距最大:转录文本完全不含证据,所有文本系统在三个声学类别上仅 3.23–26.92,VoiceMem 达 45.16–53.84(Asa. 项达 98.50)
  • Affective Attribution 相反:文本基线保持竞争力(措辞已携带大部分情感信号),音频增量体现在依恋引导决策与情感感知措辞上

4.5 延迟–成本–精度(RQ2,论文图 5、6)

  • K=5 时 LoCoMo 达 91.2 分,仅用 430 个记忆 token、134ms 检索;最强基线 EverMemOS 需 1,899 token 才达 83.13——高 8.1 分且 token 少 4.4 倍
  • 基线整体 token 消耗在 541–6,956 之间
  • 延迟对 K 平坦:K=3 到 K=100 都保持在 134ms 附近(schema 路由先约束候选池)
  • K 扫描:K=1 时领先 EverMemOS +11.8、Mem0 +26.5;K=10 仅增 1.3 分,K=100 增 2.3 分但 token 多 8 倍——K=5 几乎无代价
  • 移除 schema 路由:K=3 掉 4.53 分,K=5 仅差 0.05——路由不提高上限,而是降低达到上限所需的预算;完全移除索引在 K=5 掉 9.9 分,索引才是真正贡献者

4.6 消融实验(RQ3,K=5,各禁用一个机制)

四个数据集(LoCoMo / ES-MemEval / ChatMem-Bench / Memora)上的分数损失:

禁用组件 损失
上层索引 −9.9 / −5.3 / −6.7 / −4.4(全面最大损失)
右脑 −6.3 / −4.3 / −5.4 / −4.4(情感与 persona 携带事实库没有的信息)
涌现聚类 −5.5 / −2.0 / −3.4 / −0.2(会话最长的 LoCoMo 上损失最大)
双时程更新 −5.4 / −2.0 / −3.2 / −1.4
联合检索 −2.6 / −3.1 / −2.7 / −0.4(分别排序取并集是可行退路)

结构分析:左库 510 个 item、6 个预设槽位;2 个涌现槽位(Pets & Outdoor 218 项、Engineering Project 36 项)覆盖 254 项(49.8%),且均横跨全部六个预设槽边界——涌现是在预设边界上重分区,而非在槽内细化。右库 251 个 item、4 个模块,经 280 条边连到左脑(daily_life 91 条、knowledge 99 条)。

4.7 后端迁移(RQ4,论文表 4)

索引只需后端支持标识符寻址、相似度搜索与更新写入。无需重调阈值即可提升三个后端:

后端 裸系统 +VoiceMem Δ
Mem0 61.68 91.20 +29.52
LangMem 56.18 71.94 +15.76
Zep 62.93 85.85 +22.92
均值 60.26 83.00 +22.73

注意:LangMem 与 Mem0 起点相差 5.50 分,终点相差 19.26 分——后端质量仍然决定恢复上限

4.8 附录实验

  • 表 5(邻居 schema 注入方式):压缩描述(ours)与 macro-expansion 在 LoCoMo 上难分伯仲(91.2 vs 91.10),但压缩在 ES-MemEval 上高 +2.76;完全忽略邻居分别掉 3.4 和 9.1 分。选择压缩是因为它约束了候选池规模(144.1 vs 165.7),代价是 LoCoMo 上多 71.2 个提示 token
  • 表 6(簇维护策略,ES-MemEval P1,K=5):static 72.60 / size threshold 71.61 / random split 72.40 / emergence 74.40。emergence 与 random_split 拆分次数相同仍高 2.00 分——增益来自在正确的位置拆分,而非拆分本身;错误的拆分比不拆分还差

五、图表概览

  • 图 1(teaser):VoiceMem 总览——左脑提供 SOTA 记忆能力,右脑捕捉情感与 persona,共同实现丰富、个性化的记忆且几乎不增加延迟
  • 图 2:架构三阶段——流式预处理 → 双脑核心算法(左脑 schema–entity 组织与涌现机制,右脑双节点建模与双时程归因)→ 可互换后端引擎查询
  • 图 3:四阶段流式检索过程(listening → speech tail → anticipation → searching),是降低检索延迟的"最后保障"
  • 图 4:训练与验证管线——ChatMem-400K 三阶段构建,人工策展子集构成 ChatMem-Bench
  • 图 5:LoCoMo 时间–成本–精度三轴对比,VoiceMem(K=5)全面占优
  • 图 6:检索预算扫描,VoiceMem 在每个 K 值均最高,预算越紧优势越大;虚线为移除 schema 路由的消融
  • 图 7:K=5 组件消融,五种消融在四个数据集上全部掉分
  • 图 8:两个记忆库的内容结构——左脑 item 按语义槽分布(圈出两个涌现子槽)、右脑 item 按模块分布、右到左链接的缎带图
  • 图 9:案例研究——四个代表性案例展示用户专属情感感知、偏好感知响应、长期回忆与多模态音频记忆

六、贡献与意义

  1. 架构贡献:首次将"信息记忆"与"情感/persona 记忆"在统一的双脑架构中长期建模,左脑 schema–entity 索引 + 右脑双节点 persona graph 各司其职又通过跨实体链接互通
  2. 系统工程贡献:四阶段流式检索把记忆 I/O 完全隐藏在 VAD 静音窗口内(134ms),回答了"记忆系统如何不破坏实时性"这一关键工程问题
  3. 生态贡献:ChatMem-400K 训练语料与 ChatMem-Bench 评测基准,以及将 Qwen/Step-Audio 系列改造为首批显式记忆访问 SLM 的完整训练管线
  4. 可插拔设计:graph-on-graph 解耦架构让上层索引可迁移到任意后端(三个后端 +15.76 ~ +29.52 分),在快速迭代的记忆系统领域保持生命力
  5. 反直觉发现:Full-Context 在 persona 归因任务上远低于 VoiceMem,说明"把所有历史塞进上下文"并不能替代结构化的记忆组织

七、局限与思考

  1. ChatMem-Bench 细节未公开:基准与标注管线的详细介绍被推迟到后续技术报告,当前可复现性受限
  2. 涌现机制收益不均:在 Memora(会话较短)上禁用涌现聚类仅损失 0.2 分,其价值主要体现在长会话场景
  3. 后端质量仍是上限:弱后端(LangMem)与强后端(Mem0)加装索引后的终点差距(19.26 分)反而大于起点差距(5.50 分)
  4. 依赖闭源模型:训练管线依赖 Qwen3.5-Omni、Step-Audio2 等专有教师模型,且簇涌现需 LLM Judge 仲裁,引入额外成本与外部依赖
  5. 多说话人实时性:流式阶段中说话人身份标注为"if delayed",多说话人场景下的实时性保障细节有限
  6. 双脑融合贡献相对较小:消融显示简单取两路排序并集仅损失 0.4–3.1 分,联合检索策略仍有优化空间

八、关键数字速查

指标 数值
检索延迟 134ms(K=3 到 K=100 平坦)
默认检索预算 K=5,430 个记忆 token
LoCoMo(K=5) 91.2 分
信息记忆平均 76.39(vs Mem0 52.27,+24.12;vs Full-Context 60.49,+15.90)
Persona 记忆平均 74.16 / 76.56‡(vs MemOS 72.27)
ChatMem-Bench 平均 68.73(vs MemOS 53.95)
后端迁移增益 Mem0 +29.52 / Zep +22.92 / LangMem +15.76
训练语料 ChatMem-400K
评测基准 ChatMem-Bench(316 题 / 53 小时音频 / 15,314 轮对话)