Jev-Mem: System-One 控制的高效智能体记忆架构解读
论文:Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents arXiv:2609.23986(cs.AI / cs.LG,2026 年 9 月 21 日提交,v1) 作者:Dongming Jiang, Yi Li, Bingzhe Li(TypeSafe AI 团队) 一句话概括:把「快思考 / 慢思考」双过程认知架构引入智能体记忆系统——用一个轻量、非自回归的 System-One 控制器接管所有高频记忆决策(构建、路由、打分、停止),LLM(System-Two)只做最终推理与答案合成,从而在 LoCoMo 上同时实现质量提升 11.0% 与构建加速 6.6×。
一、研究背景与动机
长时程(long-horizon)AI 智能体越来越依赖智能体记忆(agentic memory):在与环境/用户持续交互中,智能体需要把观察写入持久记忆,并在后续查询时检索相关证据辅助推理。然而现有记忆系统普遍存在一个结构性问题:
用自回归 LLM 来控制记忆的组织、检索与使用,把昂贵的生成式计算放到了记忆操作的关键路径上。
作者的核心观察是:大量记忆操作是「语义性的但非生成性的」(semantic but not generative)——比如「这条观察属于哪种记忆类型」「两条记忆是否有因果关系」「当前证据是否足够回答问题」「还需不需要继续检索」。这些决策的输出是标签、概率或分数等有界结果,用 LLM 逐 token 生成一段自然语言推理再解析出答案,是巨大且不必要的开销。
Jev-Mem 借鉴认知科学中的双过程理论:
- System One(系统一):快速、轻量、直觉式决策 → 对应记忆控制平面;
- System Two(系统二):缓慢、审慎的推理 → 对应 LLM 推理平面,仅在复杂推理和答案合成时调用。
与 System 2 Attention、Tree of Thoughts 等「在单次推理 episode 内分配深思计算」的工作不同,Jev-Mem 把 System-One/System-Two 的分工架构化地应用到了记忆子系统本身。
二、总体架构
Jev-Mem 由三个协同组件构成(对应论文 Figure 2 的架构总览图):
| 组件 | 职责 | 特点 |
|---|---|---|
| System-One 控制平面 | 所有高频、结构化的记忆控制决策 | 轻量、输出有界(概率/标签/分数)、无自回归生成 |
| 记忆数据平面 | 共享的多关系结构化记忆存储 | 规范化节点 + 四种关系视图 + 向量/词法双索引 |
| System-Two 推理平面 | 复杂推理与最终答案合成 | 仅在需要开放式生成时调用(gpt-4o-mini) |
Figure 1 则给出了智能体记忆的通用工作流:第 t 步,查询 q_t 经检索函数 R 从记忆 M_t 中取出证据 E_t,交给语言模型生成输出 o_t,随后交互结果经更新函数 U 把记忆更新为 M_{t+1}。
2.1 System-One 控制平面:类型化控制器
控制器的核心抽象为 𝒥(S, 𝒬):
- S:结构化状态(structured state),例如一条观察、一个查询、当前已收集的证据集;
- 𝒬:一批显式的决策问题(batch of explicit decision questions)。
控制器产出两类结果:
- 独立命题的概率(如「两条记忆是否语义相关」「候选是否与查询相关」「证据是否充分」),取值 [0,1];
- 互斥选项上的分布(如在预定义的时间关系选项中选择其一)。
与自由形式提示的关键区别:
- 每个决策暴露小而已知的输出空间,直接以概率表达控制决策,无需生成中间自然语言再解析;
- 共享同一状态的决策可在单次批量调用中一起评估;
- 写路径与读路径共用同一套控制接口——记忆的全生命周期(构建、巩固、检索、停止)由同一 System-One 决策抽象管理,而不是「构建用一套启发式、检索用另一套启发式」。
实现载体:论文采用 Jev(TypeSafe AI 公司产品)作为 System-One 控制器的具体实现,通过 TypeSafeClient.system_one 接口调用,无需自回归生成即可产出类型化概率决策。具体形式:
- Noul:二元命题问题,含 instruction 与显式 true/false 判定标准,返回 [0,1] 值(论文明确指出这些值不被假设为校准概率);
- Choice:互斥选项选择(如巩固时的表示选择),返回选定标签与选项分布。
多个 Noul 作为独立命题评估(而非互斥标签)——例如一条观察可以同时是 episodic 和 semantic。问题标识符(如 pair_i_、candidate_i_ 前缀)仅为簿记键,不作为模型输入;批次内问题互不消费彼此的答案。
2.2 记忆数据平面:多关系记忆结构
形式化定义:
- 观察:o_t = (x_t, τ_t, μ_t),其中 x_t 为内容,τ_t 为可选时间戳,μ_t 为来源(provenance);
- 记忆状态:M_t = (V_t, {E_t^g}_{g∈𝒢}, I_t^vec, I_t^lex),关系类型集合 𝒢 = {semantic, temporal, causal, entity}。
结构设计要点:
- 所有关系视图共享同一组规范化记忆节点 V_t,不为每种关系复制记忆;
- 同一对节点之间可以并存多种类型的边(语义、时间、因果、实体可同时存在),区别于「每条记忆只进单一图」或「同一观察在多个存储中复制」的做法;
- 向量索引 I_t^vec 与词法索引 I_t^lex 提供进入同一记忆空间的互补入口;
- 每个规范化节点保留:原始观察内容、来源、时间戳、嵌入向量、实体、类型分数。
2.3 System-Two 推理平面
- 仅负责最终答案合成与需要开放式生成/深度推理的操作:y = SystemTwo(q, E),其中 E 为检索终止后得分最高的 K 条记忆;
- 不参与常规图路由、候选扩展或停止决策;
- 在记忆维护中,生成是「结构化控制决策的可选后果」:仅当 System-One 批准了 merge / promote 决策且满足阈值时,才可能升级到 System Two 生成高层文本抽象;
- 实验中的回答模型为 gpt-4o-mini。
三、记忆构建流程(写路径)
写路径整体流程:o_t → type → candidates → relations → M_t。
3.1 保留式摄入(无准入过滤)
- 每条有效观察创建一个规范化记忆节点,当前设计保留所有观察,不在摄入时做不可逆的「存或弃」决策(
admission_enabled=false)——防止初期看似不重要的信息在未来查询揭示其相关性前被永久丢失; - 选择性(selectivity)改在关系构建时和检索时引入。
3.2 记忆类型标注(Memory Typing)
控制器预测四个可重叠的记忆特征(非互斥分类):
t(v) = (t_episodic, t_semantic, t_procedural, t_preference)
这些分数用于标注节点而非归入单一类别。典型提示如「该观察是否描述了涉及参与者的特定经历或事件?」(episodic)、「该观察是否表达了参与者的偏好、厌恶或习惯性选择?」(preference)。批量包含 4 个 Noul。
3.3 候选发现与关系判断分离
核心挑战:新观察与日益庞大的记忆全量比较,会使控制器成本随记忆规模线性增长。解决方案为两阶段分离:
- 确定性候选发现:结合向量相似度、词法重叠、共享实体、时间邻近性,选出至多 K_w 个候选:C(v) = TopK_{u∈V_t} s_cand(v, u),其中 K_w = 10;
- System-One 关系判断:控制器只评估这些候选对。
3.4 关系构建规则
对每个候选对 (v, u),控制器估计:
- 语义相关性(semantic relatedness);
- 有向因果影响(
caused_by测试 candidate→new 方向,causes测试反向);提示标准明确区分「因果支持」与「共享主题或纯粹时间先后」; - 同情节成员关系(same-episode membership);
- 必要时实体等价性(entity equivalence)。
确定性捷径(避免不必要的学习推理):
- 时间戳排序直接创建时间关系;
- 精确共享标识符直接创建实体关系;
- 当时间顺序是隐式的,控制器在 {before, after, during, contains, overlaps, same_time, unknown} 中选择。
边插入阈值:P(g|v,u) ≥ θ_rel,θ_rel = 0.60。
3.5 周期性巩固(Periodic Consolidation)
- 触发频率:每 20 次成功写入;
- 对有界邻域检查:冗余、矛盾、过时、有用的额外链接(4 个 Noul);
- 表示选择(Choice 问题),四个互斥选项:
keep_separate:矛盾叙述、合并会丢细节、或无支持性一般模式;merge:同一事实/事件的兼容叙述可无损失合并;promote:重复情节明确支持稳定的一般模式,适合语义抽象;uncertain:证据不足;- 保守原则:巩固保留原始观察,常规路径只记录决策和链接,不自动替换源记忆;
- System-Two 升级条件:仅当 merge/promote 被选中且概率 ≥ 0.85、且矛盾分数 < 0.85 时,System-Two 摘要器才创建新表示。
四、自适应检索流程(读路径)
检索被视为闭环控制过程而非单次 top-k 搜索,迭代循环为:route → retrieve → assess → expand → reassess。
4.1 查询路由(Query Routing)
控制器对每个查询预测:
- 各关系视图的相关性概率 p_g(q)(g ∈ 𝒢);
- 多跳需求 h(q);
- 时效性重要性分数 r(q)。
概率独立评估,一个查询可同时激活多个图视图(而非被分配到单一检索意图)。路由请求共 6 个 Noul(semantic、temporal、causal、entity + multi_hop_need + recency_importance)。激活条件:p_g(q) ≥ θ_act,θ_act = 0.10。
4.2 检索预算分配(Retrieval-Budget Allocation)
给定总图扩展预算 B = 80:
- 权重:w_g(q) = p_g(q)^γ / Σ_{j∈𝒜(q)} p_j(q)^γ,γ = 1.0;
- 预算分配(先保证可行最小预算,再按比例分配剩余,最大余数取整法): b_g = m + LRound_g[(B − m·|𝒜(q)|)·w_g(q)],其中活跃图最小分配 m = 1;
- 遍历深度由多跳预测决定:D(q) = min{D_max, max(1, ⌈D_max·h(q)⌉)}。
概率路由的双重目的:避免在不太可能帮助当前查询的关系上浪费检索努力;同时在问题需要时仍允许探索多种证据形式。
4.3 锚点检索(Anchor Retrieval)
图遍历前,用语义 + 词法双路检索确定高质量入口点,通过倒数排名融合(RRF):
s_RRF(v,q) = Σ_{L∈{L_vec, L_lex}: v∈L} 1 / (κ + rank_L(v)),κ = 60。
排名最高的节点初始化已访问集合与搜索前沿。
4.4 候选打分(Candidate Scoring)
每个候选 v 由 System-One 控制器沿四个互补维度评估:
| 维度 | 符号 | 含义 |
|---|---|---|
| 查询相关性 | a_v | 是否包含回答查询所需的事实 |
| 关系有用性 | ℓ_v | 到达该候选的关系是否有用 |
| 信息新颖性 | n_v | 是否添加了证据集中缺失的答案相关细节 |
| 对当前证据的支持 | c_v | 是否支持当前已收集的证据 |
组合转移分数(System-One 预测 + 确定性检索信号):
s(v|q,E_d) = (1/Σλ_i) · [λ_1·z_v + λ_2·a_v + λ_3·p_g(q)·ℓ_v + λ_4·n_v + λ_5·(π_e + c_v)/2]
其中 z_v 为嵌入相似度,π_e 为存储的边权重,p_g(q) 为该图类型的路由概率。
时效性调整(若有时间戳):
ρ_v = 1 / (1 + max(0, τ* − τ_v)/day),s̃(v) = [s(v) + 0.1·r(q)·ρ_v] / [1 + 0.1·r(q)]
- Top W 候选构成下一束(beam)并加入累积证据,束宽 W = 10;
- 附录特别说明:高相关性分数单独并不构成无条件入选证据;
- 遍历请求包含 query、当前已选证据、提议候选(含记忆字段、图类型、关系属性、源/目标标识符,使方向显式)。
4.5 证据引导的扩展与自适应停止(Adaptive Stopping)
每轮检索 d 后评估当前证据集 E_d,估计四个量:
| 符号 | 含义 |
|---|---|
| s_d | 证据充分性(evidence sufficiency) |
| u_d | 进一步检索的预期效用 |
| m_d | 缺失的必需证据 |
| c_d | 未解决的矛盾 |
终止条件:
- 证据充分终止:s_d ≥ θ_suff ∧ m_d < θ_cont ∧ c_d < θ_cont;
- 效用不足终止:u_d < θ_cont(即使证据尚不充分,继续遍历也不太可能改善)。
具体阈值:θ_suff = 0.95,θ_cont = 0.15。提示模板如「证据是否包含回答 query 每个事实部分的支持?(仅有相关主题不够)」「再来一轮检索是否可能填补特定缺口或解决冲突?」。
4.6 控制开销的显式上界
- 正常写入:1 次批量类型请求 +(有候选时)1 次批量关系请求(至多覆盖 K_w 对);
- 单次查询:1 次路由请求 + 每轮至多 1 次证据评估 + 1 次批量候选打分请求;
- 独立硬性限制:检索深度 8、已访问节点 60、已检查边 2400、Jev 调用尝试 16、检索时间预算 15 秒。即使证据不完整也可终止检索。
4.7 时间查询的特殊处理
对时间类查询,证据和候选对象额外包含 timestamp_role 与 temporal_references 字段:标识时间戳为观察时间,并附加带精度的 grounded 表达式——使充分性判断使用与向回答器呈现证据相同的时间 grounding,而非把每个对话日期都当作事件日期。
五、实验设置与结果
5.1 设置
- 数据集:LoCoMo(Maharana et al., 2024)——超长多会话对话基准,评估智能体恢复需要时间、因果和跨会话推理信息的能力;
- 评价指标:LLM-as-a-Judge 分数(越高越好);效率指标为总记忆构建时间与平均每查询延迟;
- 回答模型:gpt-4o-mini(基线使用相同骨干回答模型);
- 基线:Full Context(无外部记忆,直接给完整对话历史)、A-MEM、Nemori、MemoryOS、MAGMA(多关系图记忆,最强基线)。
5.2 Table 1:LoCoMo 推理质量(LLM-as-a-Judge)
| 方法 | Multi-Hop | Temporal | Open-Domain | Single-Hop | Adversarial | Overall |
|---|---|---|---|---|---|---|
| Full Context | 0.468 | 0.562 | 0.486 | 0.630 | 0.205 | 0.481 |
| A-MEM | 0.495 | 0.474 | 0.385 | 0.653 | 0.616 | 0.580 |
| MemoryOS | 0.552 | 0.422 | 0.504 | 0.674 | 0.428 | 0.553 |
| Nemori | 0.569 | 0.649 | 0.485 | 0.764 | 0.325 | 0.590 |
| MAGMA | 0.528 | 0.650 | 0.517 | 0.776 | 0.742 | 0.700 |
| Jev-Mem | 0.623 | 0.637 | 0.618 | 0.802 | 0.962 | 0.777 |
要点:
- 总分 0.777,相对最强基线 MAGMA(0.700)相对提升 11.0%;
- 六个类别中五个最佳,Temporal(0.637)接近 MAGMA 的 0.650;
- Adversarial 提升最大:0.962 vs 基线最强 0.742,说明 System-One 控制的证据充分性/矛盾检查显著增强了抗干扰能力;
- Multi-Hop 与 Open-Domain 提升明显,得益于预算化的多关系图遍历与多跳深度控制。
5.3 Table 2:系统效率(秒)
| 方法 | Build Time (s) | Latency (s) |
|---|---|---|
| Full Context | N/A | 1.74 |
| A-MEM | 3636 | 2.26 |
| MemoryOS | 3276 | 32.68 |
| Nemori | 1044 | 2.59 |
| MAGMA | 1404 | 1.47 |
| Jev-Mem | 158 | 0.93 |
要点:
- 构建时间 158 秒:比最快的竞争记忆系统(Nemori 1044 秒)减少 84.9%,即 6.6× 加速;相比 A-MEM / MemoryOS(均超 3000 秒)差距超 20×;
- 查询延迟 0.93 秒:比最快记忆基线(MAGMA 1.47 秒)低 36.7%,甚至比 Full Context(1.74 秒)低 46.6%;
- MemoryOS 每查询 32.68 秒,凸显把复杂处理留在检索路径上的巨大运行时开销;
- 效率来源:构建时类型化决策在有界候选集上批处理(而非反复 LLM 自由生成);检索时 System-One 执行路由/打分/停止;图探索受显式预算约束;自适应停止避免不必要遍历;
- 效率提升未牺牲质量——Jev-Mem 同时在 LoCoMo 上取得最高准确率,说明「快控制 + 慢推理」不是权衡而是双赢。
5.4 消融与超参数
论文未设独立消融章节,但附录给出了完整配置(可复现性友好):
| 参数 | 值 |
|---|---|
| 关系建立阈值 θ_rel | 0.60 |
| 图视图激活阈值 θ_act | 0.10 |
| 图扩展总预算 B | 80 |
| 活跃图最小预算 m | 1 |
| 预算分配指数 γ | 1.0 |
| RRF 参数 κ | 60 |
| 候选集大小 K_w | 10 |
| 束宽 W | 10 |
| 证据充分阈值 θ_suff | 0.95 |
| 缺失/矛盾阈值 θ_cont | 0.15 |
| 巩固频率 | 每 20 次写入 |
| merge/promote 升级阈值 | 概率 ≥ 0.85 且矛盾分 < 0.85 |
| 检索深度 / 访问节点 / 检查边 / Jev 调用上限 | 8 / 60 / 2400 / 16 |
| 检索时间预算 | 15 秒 |
六、评价与思考
优点:
- 架构洞察清晰:「语义性但非生成性」的观察直击现有 agentic memory 的效率痛点——大量记忆控制决策根本不需要 token 级生成。把 System-One/System-Two 分工从「推理策略」提升到「记忆系统架构」层面,是一个干净的抽象。
- 读写路径统一:构建(类型标注、关系构建)与检索(路由、打分、停止)共用同一 𝒥(S, 𝒬) 控制接口,工程一致性强。
- 效率-质量双赢证据扎实:6.6× 构建加速 + 36.7% 延迟降低 + 11.0% 质量提升,尤其 Adversarial 类别 0.962 的分数说明显式矛盾/充分性检查确有实效。
- 开销有显式上界:预算 B、深度上限、调用上限、时间预算等硬约束使系统行为可预测,适合生产部署。
局限与疑问:
- System-One 依赖专有产品 Jev:核心组件是 TypeSafe AI 的商业系统,论文虽强调「Jev 只是一个实现,创新在架构分离本身」,但社区复现依赖该闭源组件;用什么开源小模型/判别式模型能达到同等控制质量,是值得追问的问题。
- 无消融实验:多关系图(继承自 MAGMA 的设计)与 System-One 控制各自贡献多少?候选打分四个维度的权重敏感性如何?论文未回答。
- 仅 LoCoMo 单基准:文中提到「两个广泛使用的基准」但仅报告了 LoCoMo;在更长时程、更多写入规模的场景下(巩固、merge/promote 的作用会更突出)表现待验证。
- Noul 输出未校准:论文明确不假设控制器输出是校准概率,但诸多阈值(0.60 / 0.95 / 0.85)依赖分数的相对比较,阈值迁移到其他控制器实现时可能需要重新调参。
适用场景:需要长期记忆、高频读写、对延迟敏感的对话/个人助理类智能体;以及希望把记忆系统的计算成本从「LLM 生成主导」降到「轻量判别主导」的生产系统。
七、小结
Jev-Mem(arXiv:2609.23986)提出了一种受双过程认知启发的智能体记忆架构:System-One 控制平面以类型化、批处理、非自回归的方式接管记忆类型标注、关系构建、查询路由、预算分配、候选打分与自适应停止;多关系记忆平面(语义/时间/因果/实体四视图共享规范化节点)承载结构化存储;System-Two LLM 只负责复杂推理与答案合成。在 LoCoMo 上,Jev-Mem 取得 0.777 总分(相对最强基线 +11.0%),构建时间 158 秒(6.6× 加速),查询延迟 0.93 秒(-36.7%),证明了「快速轻量控制 + 按需深度推理」的分离设计可以让智能体记忆更快且更好。