VoiceMem:为实时语音交互打造的流式双脑记忆系统
论文:VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction arXiv:https://arxiv.org/abs/2608.26005 (arXiv:2608.26005v1 [eess.AS],2026-08-26 提交,18 页,9 图,6 表) 作者:Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan 机构:南洋理工大学、新加坡国立大学、清华大学、香港中文大学、Open Interaction Lab 项目主页:https://xzf-thu.github.io/VoiceMem/
一、一句话总结
VoiceMem 为全双工语音语言模型(SLM)设计了一套"双脑"记忆架构:左脑管信息(发生了什么),右脑管情感与人格(用户是谁),配合四阶段流式检索把全部记忆 I/O 藏进 VAD 本就等待的 500ms 静音窗口里,最终以 134ms 检索延迟、top-5 检索预算达到远超现有记忆系统的准确率。
二、研究背景与动机
论文以柏拉图名言开篇:"Through memory, the soul reveals traces of its former existence." 作者认为,记忆是将对话系统从"智能工具"转变为"以人为本的伙伴"的关键。当前记忆系统(Mem0、A-Mem、EverMemOS 等)与交互模型(SLM、全双工模型)各自快速发展,但二者尚未融合为一个完整方案。面向实时语音交互,存在三大障碍:
| 障碍 | 内容 |
|---|---|
| O1:信息智能与情感智能的统一架构 | 实时对话中情感与 persona 的把握与信息同等重要,但情感机制远比信息复杂,如何在单一架构中长期建模二者尚未被探索 |
| O2:零延迟下的高信息密度 | (i) 现有系统 2–3 秒的检索延迟打破了实时对话 500ms 的延迟预算;(ii) 文本 Agent 常用的 top-100 输出超出语音模型的承载能力。记忆系统必须几乎不增加延迟、流式运行,并在 top-5 预算下保持准确率 |
| O3:基础设施与可演化性 | 记忆方法与语音对话模型都在快速迭代;对话模型尚无法接受音频-记忆联合输入;记忆系统必须"简单而有效"才能持续跟进领域演进 |
三大核心优势(实验结论)
- Accuracy(准确性):top-5 检索下,左脑比 Mem0 在 top-200 下的表现还高出近 30 个点
- Emotional & Personal(情感与个性化):右脑在三个 persona 基准上达到 SOTA,微调模型下总分比此前最佳系统提升 4.29 分
- Real-Time & Cheap(实时且低成本):检索仅需 134ms,完全在标准 VAD 延迟之内,不增加任何额外对话延迟,同时保持高准确与低成本
三、方法设计
VoiceMem 的整体架构分三个 Phase(对应论文图 2):Phase I 流式预处理(提取说话人身份、ASR、实体、schema、情感与嵌入);Phase II 核心双脑算法;Phase III 通过可互换的后端记忆引擎查询管理后的记忆项。
3.1 左脑:信息记忆(Informational Left Brain)
目标:在在线语音交互紧张的上下文与延迟预算下,支持高效的记忆存储与检索。
Cluster–Entity–MemItem 三级索引 - 两级层级:schemas(图式)做粗粒度语义路由,entities(实体)定位具体的人、事件或概念 - 形式化为图 \(\mathcal{G}^L=(\mathcal{S},\mathcal{V},\mathcal{E})\):实体 \(v=(d_v,\mathcal{N}^{micro}_v,\mathcal{I}_v)\),图式 \(s=(d_s,\mathcal{N}^{macro}_s,\mathcal{V}_s)\);每个实体恰好属于一个 schema;边集含实体间 micro 连接与 schema 间 macro 连接 - 核心思想:将后端(如 Mem0)中存储的 memory items 与其上方的轻量语义索引解耦——先把检索缩小到紧凑且语义连贯的候选集,再访问底层记忆
检索流程:用户说话时,流式匹配器从部分转录文本中识别相关 schema 与实体,再经强/弱一跳连接扩展候选池 \(\mathcal{Z}_t=\mathcal{V}_t\cup\mathcal{V}_{\mathcal{S}_t}\cup\mathcal{N}^{strong}_1(\cdot)\cup\mathcal{N}^{weak}_1(\cdot)\),后端只在候选池中搜索而非全量记忆。
快速更新(Fast Update):每轮对话后,异步更新器提取新事实,通过 add / update / delete / keep 操作与邻近记忆调和,在关键路径之外更新 schema、实体与关系。
簇涌现机制(Cluster Emergence) - 问题:簇增长会降低信息密度,而频繁的规则拆分又会割裂相关记忆、降低检索覆盖率 - 方案:让相干子簇从重复的检索模式中"涌现"。定义查询相干度 \(\rho(H)=\frac{1}{|\mathcal{Q}|}\sum_{q\in\mathcal{Q}}\frac{|A_q\cap H|}{|A_q\cup H|}\) - 流程(论文 Algorithm 1):找出满足 \(\rho(H)>\alpha\) 的最大连通子图 \(H^\star\) → LLM Judge 评估其相关性(relevance)、重要性(importance)、完整性(completeness)→ 三者皆通过则 Promote 为新簇,否则 DisablePotential 防止未来重复拆分
3.2 右脑:情感记忆(Emotional Right Brain)
定位:左脑记录"发生了什么",右脑捕捉"用户是谁",维护 persona memory——稳定的性情、情感倾向、针对具体人/事/概念的态度。
Persona Graph:双节点建模 \(\mathcal{G}^R=(\mathcal{V}^I,\mathcal{V}^C)\)
| 节点类型 | 定义 | 作用 |
|---|---|---|
| Independent nodes(独立节点) \(v^I=(d_v^I,\mathcal{I}_v^I)\) | 编码用户内在属性:持久性情、行为规律、情感倾向,由纵向证据支撑 | 解释持久的用户特质 |
| Cross-entity nodes(跨实体节点) \(v_e^C=(d_{v,e}^C,\mathcal{I}_{v,e}^C,\rho_{v,e})\) | 捕捉上下文依赖的情感,通过 \(\rho_{v,e}\) 链接到左脑实体 | 保留"情感指向谁/什么" |
这一区分是根本性的:混淆二者会把情境反应误认为稳定特质,或丢失赋予情感意义的真实世界原因。
双时程情感归因 - Short-Horizon Attribution(短时程):对每个输入 \(x_t\),情感估计器产生 \(e_t=\phi(x_t)\),\((x_t,e_t)\) 为 persona 节点的增、改、合并提供即时证据 - Long-Horizon Attribution(长时程):每个会话结束后,联合分析整个序列 \((x_1,e_1),\ldots,(x_T,e_T)\),将反复出现的证据固化为稳定的独立 persona 节点,而非累积每个瞬时状态
检索:流式匹配器联合激活独立节点与跨实体节点,并与左脑激活实体所链接的跨实体节点合并,无需搜索全量 persona 记忆。
3.3 流式记忆 I/O:四阶段流式检索
这是 VoiceMem 近零额外延迟的核心(对应论文图 3),四个阶段精确分配在 VAD 的 500ms 静音窗口内:
| 阶段 | 时间窗口 | 操作 |
|---|---|---|
| (i) Speech Tail(语音尾段) | 0–200ms | 用户说话时实时获取转录、双脑匹配的实体/图式;若延迟则补充说话人身份 |
| (ii) Anticipation(预判) | 200–400ms | 假设静音达 200ms 即将回复:提取 query embedding,扩展双脑上层图 |
| (iii) Searching(搜索) | 400–500ms | 仅余后端搜索:双脑分别 MemSearch 后合并,注入提示 |
标准 VAD 阈值为 500ms,留出 400ms 窗口;VoiceMem 的密集双脑检索本身仅耗 134ms,留有余量。
3.4 音频记忆扩展
将记忆从文本扩展到音频,支持多说话人辨别、副语言分析、环境声记忆。启用时,Agent 可选择性地将音频保留为说话人声纹、声学嵌入或原始波形,作为多模态节点附加到对应实体节点。
3.5 Memory-Aware SLM 训练管线
将 Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini(原本设计为语音输入/文本输出)改造为记忆增强 SLM——据作者所知是首批具有显式记忆访问能力的语音语言模型。采用 SLM-verified blackbox OPD(在线黑盒在策略蒸馏):Qwen 系列以 Qwen3.5-Omni 为教师,Step-Audio2-Mini 以 Step-Audio2 为教师。四个阶段:
- Stage I:记忆世界构建:从核心 persona 出发,逐步实例化 Persona → Background → Events → Messages → Memory,生成时间一致的用户历史
- Stage II:SLM 验证的在线蒸馏:迭代六步管线——任务/主题采样 → 场景初始化 → 挑战与策略(回忆、指代消解、矛盾、多记忆推理)→ 对比蒸馏 → 验证(必要性、忠实性、质量)→ SFT 更新。循环产出 ChatMem-400K 大规模语料
- Stage III:人工策展:人工精炼语料,构建情感/个性动态更丰富、含声学问题的更难样本;挑战性子集构成 ChatMem-Bench
- Stage IV:验证:ChatMem-Bench 覆盖四维度 {Information, Persona, Affective Attribution, Paralinguistics & Environment},共 14 个细粒度类别
3.6 解耦部署架构
graph-on-graph 双层架构:上层专注路由、双脑并行组织与流式推理;下层记忆引擎(由 MemSearch 抽象)完全可替换。当前实现使用 Mem0 作为后端,避免与特定后端紧耦合,从而能及时采纳更新的记忆算法(包括参数化记忆、潜在记忆等方向)。
四、实验与结果
4.1 实验设置
- 基准(三类):信息记忆(LoCoMo、LongMemEval (S)、Memora);Persona 记忆(ES-MemEval、PersonaMem、PersonaLens);语音记忆(ChatMem-Bench:316 个问题、53 小时音频、15,314 轮对话,每个会话均人工策展)
- 基线(10 个系统,4 组):Full-Context(参考);Mem0、Zep、LangMem(记忆引擎);A-MEM、MemoryOS、MemOS(Agent 记忆);MemoryBank、EverMemOS、Emotional RAG(个人记忆)
- 实现细节:所有基线以 GPT-4o-mini 为骨干 LLM、text-embedding-3-small 为嵌入模型,temperature=0;VoiceMem 在 \(K\in\{1,3,5,10,30,100\}\) 六种设置下评估,默认 K=5
4.2 信息记忆结果(论文表 1,LLM-judge 分数 %)
| 方法 | 平均分 |
|---|---|
| Full-Context(参考) | 60.49 |
| Mem0 | 52.27 |
| Zep | 48.78 |
| LangMem | 48.15 |
| A-MEM | 48.58 |
| MemoryOS | 40.59 |
| MemOS | 65.83 |
| MemoryBank | 22.39 |
| EverMemOS | 65.75 |
| Emotional RAG | 38.99 |
| VoiceMem | 76.39 |
| VoiceMem‡(微调 Qwen3.6 生成) | 75.65 |
- 领先 11 个信息子类别中的 7 个;比自身存储后端 Mem0 高 +24.12,比看到全部历史的 Full-Context 还高 +15.90
- 优势最大的场景:多条记忆需同时到达(如时序推理 +54.9);优势最小:更新追踪(+7.4,单条最新记忆即可回答)
- VoiceMem 在 LoCoMo 各子项达 94.60/91.60/89.80/85.60,在 LongMemEval 的 Multi 项达 95.00
4.3 Persona 记忆结果(论文表 2)
- VoiceMem 达 74.16(GPT-4o-mini)/ 76.56(微调模型),超过最强基线 MemOS(72.27);微调版本领先 +4.29
- 值得注意的"反转":Full-Context 在 ES-MemEval 上冲突检测仅 12.10、用户建模仅 21.70,而 VoiceMem 达 69.10 和 74.00——"证据就在输入中,它仍然无法归因",说明长上下文塞入不等于情感归因能力
- 两张表均在比文本 Agent 常规 top-100 低一个数量级的检索预算下产生,说明增益来自更密集的候选池而非更大的候选池
4.4 ChatMem-Bench 长时程音频记忆(论文表 3)
- VoiceMem 平均 68.73(基线最高 MemOS 仅 53.95),领先 14 个类别中的 11 个
- Paralinguistics & Environment 差距最大:转录文本完全不含证据,所有文本系统在三个声学类别上仅 3.23–26.92,VoiceMem 达 45.16–53.84(Asa. 项达 98.50)
- Affective Attribution 相反:文本基线保持竞争力(措辞已携带大部分情感信号),音频增量体现在依恋引导决策与情感感知措辞上
4.5 延迟–成本–精度(RQ2,论文图 5、6)
- K=5 时 LoCoMo 达 91.2 分,仅用 430 个记忆 token、134ms 检索;最强基线 EverMemOS 需 1,899 token 才达 83.13——高 8.1 分且 token 少 4.4 倍
- 基线整体 token 消耗在 541–6,956 之间
- 延迟对 K 平坦:K=3 到 K=100 都保持在 134ms 附近(schema 路由先约束候选池)
- K 扫描:K=1 时领先 EverMemOS +11.8、Mem0 +26.5;K=10 仅增 1.3 分,K=100 增 2.3 分但 token 多 8 倍——K=5 几乎无代价
- 移除 schema 路由:K=3 掉 4.53 分,K=5 仅差 0.05——路由不提高上限,而是降低达到上限所需的预算;完全移除索引在 K=5 掉 9.9 分,索引才是真正贡献者
4.6 消融实验(RQ3,K=5,各禁用一个机制)
四个数据集(LoCoMo / ES-MemEval / ChatMem-Bench / Memora)上的分数损失:
| 禁用组件 | 损失 |
|---|---|
| 上层索引 | −9.9 / −5.3 / −6.7 / −4.4(全面最大损失) |
| 右脑 | −6.3 / −4.3 / −5.4 / −4.4(情感与 persona 携带事实库没有的信息) |
| 涌现聚类 | −5.5 / −2.0 / −3.4 / −0.2(会话最长的 LoCoMo 上损失最大) |
| 双时程更新 | −5.4 / −2.0 / −3.2 / −1.4 |
| 联合检索 | −2.6 / −3.1 / −2.7 / −0.4(分别排序取并集是可行退路) |
结构分析:左库 510 个 item、6 个预设槽位;2 个涌现槽位(Pets & Outdoor 218 项、Engineering Project 36 项)覆盖 254 项(49.8%),且均横跨全部六个预设槽边界——涌现是在预设边界上重分区,而非在槽内细化。右库 251 个 item、4 个模块,经 280 条边连到左脑(daily_life 91 条、knowledge 99 条)。
4.7 后端迁移(RQ4,论文表 4)
索引只需后端支持标识符寻址、相似度搜索与更新写入。无需重调阈值即可提升三个后端:
| 后端 | 裸系统 | +VoiceMem | Δ |
|---|---|---|---|
| Mem0 | 61.68 | 91.20 | +29.52 |
| LangMem | 56.18 | 71.94 | +15.76 |
| Zep | 62.93 | 85.85 | +22.92 |
| 均值 | 60.26 | 83.00 | +22.73 |
注意:LangMem 与 Mem0 起点相差 5.50 分,终点相差 19.26 分——后端质量仍然决定恢复上限。
4.8 附录实验
- 表 5(邻居 schema 注入方式):压缩描述(ours)与 macro-expansion 在 LoCoMo 上难分伯仲(91.2 vs 91.10),但压缩在 ES-MemEval 上高 +2.76;完全忽略邻居分别掉 3.4 和 9.1 分。选择压缩是因为它约束了候选池规模(144.1 vs 165.7),代价是 LoCoMo 上多 71.2 个提示 token
- 表 6(簇维护策略,ES-MemEval P1,K=5):static 72.60 / size threshold 71.61 / random split 72.40 / emergence 74.40。emergence 与 random_split 拆分次数相同仍高 2.00 分——增益来自在正确的位置拆分,而非拆分本身;错误的拆分比不拆分还差
五、图表概览
- 图 1(teaser):VoiceMem 总览——左脑提供 SOTA 记忆能力,右脑捕捉情感与 persona,共同实现丰富、个性化的记忆且几乎不增加延迟
- 图 2:架构三阶段——流式预处理 → 双脑核心算法(左脑 schema–entity 组织与涌现机制,右脑双节点建模与双时程归因)→ 可互换后端引擎查询
- 图 3:四阶段流式检索过程(listening → speech tail → anticipation → searching),是降低检索延迟的"最后保障"
- 图 4:训练与验证管线——ChatMem-400K 三阶段构建,人工策展子集构成 ChatMem-Bench
- 图 5:LoCoMo 时间–成本–精度三轴对比,VoiceMem(K=5)全面占优
- 图 6:检索预算扫描,VoiceMem 在每个 K 值均最高,预算越紧优势越大;虚线为移除 schema 路由的消融
- 图 7:K=5 组件消融,五种消融在四个数据集上全部掉分
- 图 8:两个记忆库的内容结构——左脑 item 按语义槽分布(圈出两个涌现子槽)、右脑 item 按模块分布、右到左链接的缎带图
- 图 9:案例研究——四个代表性案例展示用户专属情感感知、偏好感知响应、长期回忆与多模态音频记忆
六、贡献与意义
- 架构贡献:首次将"信息记忆"与"情感/persona 记忆"在统一的双脑架构中长期建模,左脑 schema–entity 索引 + 右脑双节点 persona graph 各司其职又通过跨实体链接互通
- 系统工程贡献:四阶段流式检索把记忆 I/O 完全隐藏在 VAD 静音窗口内(134ms),回答了"记忆系统如何不破坏实时性"这一关键工程问题
- 生态贡献:ChatMem-400K 训练语料与 ChatMem-Bench 评测基准,以及将 Qwen/Step-Audio 系列改造为首批显式记忆访问 SLM 的完整训练管线
- 可插拔设计:graph-on-graph 解耦架构让上层索引可迁移到任意后端(三个后端 +15.76 ~ +29.52 分),在快速迭代的记忆系统领域保持生命力
- 反直觉发现:Full-Context 在 persona 归因任务上远低于 VoiceMem,说明"把所有历史塞进上下文"并不能替代结构化的记忆组织
七、局限与思考
- ChatMem-Bench 细节未公开:基准与标注管线的详细介绍被推迟到后续技术报告,当前可复现性受限
- 涌现机制收益不均:在 Memora(会话较短)上禁用涌现聚类仅损失 0.2 分,其价值主要体现在长会话场景
- 后端质量仍是上限:弱后端(LangMem)与强后端(Mem0)加装索引后的终点差距(19.26 分)反而大于起点差距(5.50 分)
- 依赖闭源模型:训练管线依赖 Qwen3.5-Omni、Step-Audio2 等专有教师模型,且簇涌现需 LLM Judge 仲裁,引入额外成本与外部依赖
- 多说话人实时性:流式阶段中说话人身份标注为"if delayed",多说话人场景下的实时性保障细节有限
- 双脑融合贡献相对较小:消融显示简单取两路排序并集仅损失 0.4–3.1 分,联合检索策略仍有优化空间
八、关键数字速查
| 指标 | 数值 |
|---|---|
| 检索延迟 | 134ms(K=3 到 K=100 平坦) |
| 默认检索预算 | K=5,430 个记忆 token |
| LoCoMo(K=5) | 91.2 分 |
| 信息记忆平均 | 76.39(vs Mem0 52.27,+24.12;vs Full-Context 60.49,+15.90) |
| Persona 记忆平均 | 74.16 / 76.56‡(vs MemOS 72.27) |
| ChatMem-Bench 平均 | 68.73(vs MemOS 53.95) |
| 后端迁移增益 | Mem0 +29.52 / Zep +22.92 / LangMem +15.76 |
| 训练语料 | ChatMem-400K |
| 评测基准 | ChatMem-Bench(316 题 / 53 小时音频 / 15,314 轮对话) |