Jev-Mem: System-One 控制的高效智能体记忆架构解读

论文:Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents arXiv:2609.23986(cs.AI / cs.LG,2026 年 9 月 21 日提交,v1) 作者:Dongming Jiang, Yi Li, Bingzhe Li(TypeSafe AI 团队) 一句话概括:把「快思考 / 慢思考」双过程认知架构引入智能体记忆系统——用一个轻量、非自回归的 System-One 控制器接管所有高频记忆决策(构建、路由、打分、停止),LLM(System-Two)只做最终推理与答案合成,从而在 LoCoMo 上同时实现质量提升 11.0% 与构建加速 6.6×。


一、研究背景与动机

长时程(long-horizon)AI 智能体越来越依赖智能体记忆(agentic memory):在与环境/用户持续交互中,智能体需要把观察写入持久记忆,并在后续查询时检索相关证据辅助推理。然而现有记忆系统普遍存在一个结构性问题:

用自回归 LLM 来控制记忆的组织、检索与使用,把昂贵的生成式计算放到了记忆操作的关键路径上。

作者的核心观察是:大量记忆操作是「语义性的但非生成性的」(semantic but not generative)——比如「这条观察属于哪种记忆类型」「两条记忆是否有因果关系」「当前证据是否足够回答问题」「还需不需要继续检索」。这些决策的输出是标签、概率或分数等有界结果,用 LLM 逐 token 生成一段自然语言推理再解析出答案,是巨大且不必要的开销。

Jev-Mem 借鉴认知科学中的双过程理论:

  • System One(系统一):快速、轻量、直觉式决策 → 对应记忆控制平面;
  • System Two(系统二):缓慢、审慎的推理 → 对应 LLM 推理平面,仅在复杂推理和答案合成时调用。

与 System 2 Attention、Tree of Thoughts 等「在单次推理 episode 内分配深思计算」的工作不同,Jev-Mem 把 System-One/System-Two 的分工架构化地应用到了记忆子系统本身


二、总体架构

Jev-Mem 由三个协同组件构成(对应论文 Figure 2 的架构总览图):

组件 职责 特点
System-One 控制平面 所有高频、结构化的记忆控制决策 轻量、输出有界(概率/标签/分数)、无自回归生成
记忆数据平面 共享的多关系结构化记忆存储 规范化节点 + 四种关系视图 + 向量/词法双索引
System-Two 推理平面 复杂推理与最终答案合成 仅在需要开放式生成时调用(gpt-4o-mini)

Figure 1 则给出了智能体记忆的通用工作流:第 t 步,查询 q_t 经检索函数 R 从记忆 M_t 中取出证据 E_t,交给语言模型生成输出 o_t,随后交互结果经更新函数 U 把记忆更新为 M_{t+1}。

2.1 System-One 控制平面:类型化控制器

控制器的核心抽象为 𝒥(S, 𝒬)

  • S:结构化状态(structured state),例如一条观察、一个查询、当前已收集的证据集;
  • 𝒬:一批显式的决策问题(batch of explicit decision questions)。

控制器产出两类结果:

  1. 独立命题的概率(如「两条记忆是否语义相关」「候选是否与查询相关」「证据是否充分」),取值 [0,1];
  2. 互斥选项上的分布(如在预定义的时间关系选项中选择其一)。

与自由形式提示的关键区别:

  • 每个决策暴露小而已知的输出空间,直接以概率表达控制决策,无需生成中间自然语言再解析;
  • 共享同一状态的决策可在单次批量调用中一起评估;
  • 写路径与读路径共用同一套控制接口——记忆的全生命周期(构建、巩固、检索、停止)由同一 System-One 决策抽象管理,而不是「构建用一套启发式、检索用另一套启发式」。

实现载体:论文采用 Jev(TypeSafe AI 公司产品)作为 System-One 控制器的具体实现,通过 TypeSafeClient.system_one 接口调用,无需自回归生成即可产出类型化概率决策。具体形式:

  • Noul:二元命题问题,含 instruction 与显式 true/false 判定标准,返回 [0,1] 值(论文明确指出这些值不被假设为校准概率);
  • Choice:互斥选项选择(如巩固时的表示选择),返回选定标签与选项分布。

多个 Noul 作为独立命题评估(而非互斥标签)——例如一条观察可以同时是 episodic 和 semantic。问题标识符(如 pair_i_candidate_i_ 前缀)仅为簿记键,不作为模型输入;批次内问题互不消费彼此的答案。

2.2 记忆数据平面:多关系记忆结构

形式化定义:

  • 观察:o_t = (x_t, τ_t, μ_t),其中 x_t 为内容,τ_t 为可选时间戳,μ_t 为来源(provenance);
  • 记忆状态:M_t = (V_t, {E_t^g}_{g∈𝒢}, I_t^vec, I_t^lex),关系类型集合 𝒢 = {semantic, temporal, causal, entity}。

结构设计要点:

  • 所有关系视图共享同一组规范化记忆节点 V_t,不为每种关系复制记忆;
  • 同一对节点之间可以并存多种类型的边(语义、时间、因果、实体可同时存在),区别于「每条记忆只进单一图」或「同一观察在多个存储中复制」的做法;
  • 向量索引 I_t^vec 与词法索引 I_t^lex 提供进入同一记忆空间的互补入口;
  • 每个规范化节点保留:原始观察内容、来源、时间戳、嵌入向量、实体、类型分数。

2.3 System-Two 推理平面

  • 仅负责最终答案合成与需要开放式生成/深度推理的操作:y = SystemTwo(q, E),其中 E 为检索终止后得分最高的 K 条记忆;
  • 不参与常规图路由、候选扩展或停止决策;
  • 在记忆维护中,生成是「结构化控制决策的可选后果」:仅当 System-One 批准了 merge / promote 决策且满足阈值时,才可能升级到 System Two 生成高层文本抽象;
  • 实验中的回答模型为 gpt-4o-mini

三、记忆构建流程(写路径)

写路径整体流程:o_t → type → candidates → relations → M_t

3.1 保留式摄入(无准入过滤)

  • 每条有效观察创建一个规范化记忆节点,当前设计保留所有观察,不在摄入时做不可逆的「存或弃」决策(admission_enabled=false)——防止初期看似不重要的信息在未来查询揭示其相关性前被永久丢失;
  • 选择性(selectivity)改在关系构建时检索时引入。

3.2 记忆类型标注(Memory Typing)

控制器预测四个可重叠的记忆特征(非互斥分类):

t(v) = (t_episodic, t_semantic, t_procedural, t_preference)

这些分数用于标注节点而非归入单一类别。典型提示如「该观察是否描述了涉及参与者的特定经历或事件?」(episodic)、「该观察是否表达了参与者的偏好、厌恶或习惯性选择?」(preference)。批量包含 4 个 Noul。

3.3 候选发现与关系判断分离

核心挑战:新观察与日益庞大的记忆全量比较,会使控制器成本随记忆规模线性增长。解决方案为两阶段分离:

  1. 确定性候选发现:结合向量相似度、词法重叠、共享实体、时间邻近性,选出至多 K_w 个候选:C(v) = TopK_{u∈V_t} s_cand(v, u),其中 K_w = 10
  2. System-One 关系判断:控制器只评估这些候选对。

3.4 关系构建规则

对每个候选对 (v, u),控制器估计:

  • 语义相关性(semantic relatedness);
  • 有向因果影响(caused_by 测试 candidate→new 方向,causes 测试反向);提示标准明确区分「因果支持」与「共享主题或纯粹时间先后」;
  • 同情节成员关系(same-episode membership);
  • 必要时实体等价性(entity equivalence)。

确定性捷径(避免不必要的学习推理):

  • 时间戳排序直接创建时间关系;
  • 精确共享标识符直接创建实体关系;
  • 当时间顺序是隐式的,控制器在 {before, after, during, contains, overlaps, same_time, unknown} 中选择。

边插入阈值:P(g|v,u) ≥ θ_rel,θ_rel = 0.60

3.5 周期性巩固(Periodic Consolidation)

  • 触发频率:每 20 次成功写入;
  • 对有界邻域检查:冗余、矛盾、过时、有用的额外链接(4 个 Noul);
  • 表示选择(Choice 问题),四个互斥选项:
  • keep_separate:矛盾叙述、合并会丢细节、或无支持性一般模式;
  • merge:同一事实/事件的兼容叙述可无损失合并;
  • promote:重复情节明确支持稳定的一般模式,适合语义抽象;
  • uncertain:证据不足;
  • 保守原则:巩固保留原始观察,常规路径只记录决策和链接,不自动替换源记忆;
  • System-Two 升级条件:仅当 merge/promote 被选中且概率 ≥ 0.85、且矛盾分数 < 0.85 时,System-Two 摘要器才创建新表示。

四、自适应检索流程(读路径)

检索被视为闭环控制过程而非单次 top-k 搜索,迭代循环为:route → retrieve → assess → expand → reassess

4.1 查询路由(Query Routing)

控制器对每个查询预测:

  • 各关系视图的相关性概率 p_g(q)(g ∈ 𝒢);
  • 多跳需求 h(q)
  • 时效性重要性分数 r(q)

概率独立评估,一个查询可同时激活多个图视图(而非被分配到单一检索意图)。路由请求共 6 个 Noul(semantic、temporal、causal、entity + multi_hop_need + recency_importance)。激活条件:p_g(q) ≥ θ_act,θ_act = 0.10

4.2 检索预算分配(Retrieval-Budget Allocation)

给定总图扩展预算 B = 80

  • 权重:w_g(q) = p_g(q)^γ / Σ_{j∈𝒜(q)} p_j(q)^γ,γ = 1.0
  • 预算分配(先保证可行最小预算,再按比例分配剩余,最大余数取整法): b_g = m + LRound_g[(B − m·|𝒜(q)|)·w_g(q)],其中活跃图最小分配 m = 1
  • 遍历深度由多跳预测决定:D(q) = min{D_max, max(1, ⌈D_max·h(q)⌉)}。

概率路由的双重目的:避免在不太可能帮助当前查询的关系上浪费检索努力;同时在问题需要时仍允许探索多种证据形式。

4.3 锚点检索(Anchor Retrieval)

图遍历前,用语义 + 词法双路检索确定高质量入口点,通过倒数排名融合(RRF)

s_RRF(v,q) = Σ_{L∈{L_vec, L_lex}: v∈L} 1 / (κ + rank_L(v)),κ = 60

排名最高的节点初始化已访问集合与搜索前沿。

4.4 候选打分(Candidate Scoring)

每个候选 v 由 System-One 控制器沿四个互补维度评估:

维度 符号 含义
查询相关性 a_v 是否包含回答查询所需的事实
关系有用性 ℓ_v 到达该候选的关系是否有用
信息新颖性 n_v 是否添加了证据集中缺失的答案相关细节
对当前证据的支持 c_v 是否支持当前已收集的证据

组合转移分数(System-One 预测 + 确定性检索信号):

s(v|q,E_d) = (1/Σλ_i) · [λ_1·z_v + λ_2·a_v + λ_3·p_g(q)·ℓ_v + λ_4·n_v + λ_5·(π_e + c_v)/2]

其中 z_v 为嵌入相似度,π_e 为存储的边权重,p_g(q) 为该图类型的路由概率。

时效性调整(若有时间戳):

ρ_v = 1 / (1 + max(0, τ* − τ_v)/day),s̃(v) = [s(v) + 0.1·r(q)·ρ_v] / [1 + 0.1·r(q)]

  • Top W 候选构成下一束(beam)并加入累积证据,束宽 W = 10
  • 附录特别说明:高相关性分数单独并不构成无条件入选证据;
  • 遍历请求包含 query、当前已选证据、提议候选(含记忆字段、图类型、关系属性、源/目标标识符,使方向显式)。

4.5 证据引导的扩展与自适应停止(Adaptive Stopping)

每轮检索 d 后评估当前证据集 E_d,估计四个量:

符号 含义
s_d 证据充分性(evidence sufficiency)
u_d 进一步检索的预期效用
m_d 缺失的必需证据
c_d 未解决的矛盾

终止条件

  • 证据充分终止:s_d ≥ θ_suff ∧ m_d < θ_cont ∧ c_d < θ_cont;
  • 效用不足终止:u_d < θ_cont(即使证据尚不充分,继续遍历也不太可能改善)。

具体阈值:θ_suff = 0.95θ_cont = 0.15。提示模板如「证据是否包含回答 query 每个事实部分的支持?(仅有相关主题不够)」「再来一轮检索是否可能填补特定缺口或解决冲突?」。

4.6 控制开销的显式上界

  • 正常写入:1 次批量类型请求 +(有候选时)1 次批量关系请求(至多覆盖 K_w 对);
  • 单次查询:1 次路由请求 + 每轮至多 1 次证据评估 + 1 次批量候选打分请求;
  • 独立硬性限制:检索深度 8、已访问节点 60、已检查边 2400、Jev 调用尝试 16、检索时间预算 15 秒。即使证据不完整也可终止检索。

4.7 时间查询的特殊处理

对时间类查询,证据和候选对象额外包含 timestamp_roletemporal_references 字段:标识时间戳为观察时间,并附加带精度的 grounded 表达式——使充分性判断使用与向回答器呈现证据相同的时间 grounding,而非把每个对话日期都当作事件日期。


五、实验设置与结果

5.1 设置

  • 数据集LoCoMo(Maharana et al., 2024)——超长多会话对话基准,评估智能体恢复需要时间、因果和跨会话推理信息的能力;
  • 评价指标:LLM-as-a-Judge 分数(越高越好);效率指标为总记忆构建时间与平均每查询延迟;
  • 回答模型:gpt-4o-mini(基线使用相同骨干回答模型);
  • 基线:Full Context(无外部记忆,直接给完整对话历史)、A-MEM、Nemori、MemoryOS、MAGMA(多关系图记忆,最强基线)。

5.2 Table 1:LoCoMo 推理质量(LLM-as-a-Judge)

方法 Multi-Hop Temporal Open-Domain Single-Hop Adversarial Overall
Full Context 0.468 0.562 0.486 0.630 0.205 0.481
A-MEM 0.495 0.474 0.385 0.653 0.616 0.580
MemoryOS 0.552 0.422 0.504 0.674 0.428 0.553
Nemori 0.569 0.649 0.485 0.764 0.325 0.590
MAGMA 0.528 0.650 0.517 0.776 0.742 0.700
Jev-Mem 0.623 0.637 0.618 0.802 0.962 0.777

要点:

  • 总分 0.777,相对最强基线 MAGMA(0.700)相对提升 11.0%
  • 六个类别中五个最佳,Temporal(0.637)接近 MAGMA 的 0.650;
  • Adversarial 提升最大:0.962 vs 基线最强 0.742,说明 System-One 控制的证据充分性/矛盾检查显著增强了抗干扰能力;
  • Multi-Hop 与 Open-Domain 提升明显,得益于预算化的多关系图遍历与多跳深度控制。

5.3 Table 2:系统效率(秒)

方法 Build Time (s) Latency (s)
Full Context N/A 1.74
A-MEM 3636 2.26
MemoryOS 3276 32.68
Nemori 1044 2.59
MAGMA 1404 1.47
Jev-Mem 158 0.93

要点:

  • 构建时间 158 秒:比最快的竞争记忆系统(Nemori 1044 秒)减少 84.9%,即 6.6× 加速;相比 A-MEM / MemoryOS(均超 3000 秒)差距超 20×;
  • 查询延迟 0.93 秒:比最快记忆基线(MAGMA 1.47 秒)低 36.7%,甚至比 Full Context(1.74 秒)低 46.6%;
  • MemoryOS 每查询 32.68 秒,凸显把复杂处理留在检索路径上的巨大运行时开销;
  • 效率来源:构建时类型化决策在有界候选集上批处理(而非反复 LLM 自由生成);检索时 System-One 执行路由/打分/停止;图探索受显式预算约束;自适应停止避免不必要遍历;
  • 效率提升未牺牲质量——Jev-Mem 同时在 LoCoMo 上取得最高准确率,说明「快控制 + 慢推理」不是权衡而是双赢。

5.4 消融与超参数

论文未设独立消融章节,但附录给出了完整配置(可复现性友好):

参数
关系建立阈值 θ_rel 0.60
图视图激活阈值 θ_act 0.10
图扩展总预算 B 80
活跃图最小预算 m 1
预算分配指数 γ 1.0
RRF 参数 κ 60
候选集大小 K_w 10
束宽 W 10
证据充分阈值 θ_suff 0.95
缺失/矛盾阈值 θ_cont 0.15
巩固频率 每 20 次写入
merge/promote 升级阈值 概率 ≥ 0.85 且矛盾分 < 0.85
检索深度 / 访问节点 / 检查边 / Jev 调用上限 8 / 60 / 2400 / 16
检索时间预算 15 秒

六、评价与思考

优点

  1. 架构洞察清晰:「语义性但非生成性」的观察直击现有 agentic memory 的效率痛点——大量记忆控制决策根本不需要 token 级生成。把 System-One/System-Two 分工从「推理策略」提升到「记忆系统架构」层面,是一个干净的抽象。
  2. 读写路径统一:构建(类型标注、关系构建)与检索(路由、打分、停止)共用同一 𝒥(S, 𝒬) 控制接口,工程一致性强。
  3. 效率-质量双赢证据扎实:6.6× 构建加速 + 36.7% 延迟降低 + 11.0% 质量提升,尤其 Adversarial 类别 0.962 的分数说明显式矛盾/充分性检查确有实效。
  4. 开销有显式上界:预算 B、深度上限、调用上限、时间预算等硬约束使系统行为可预测,适合生产部署。

局限与疑问

  1. System-One 依赖专有产品 Jev:核心组件是 TypeSafe AI 的商业系统,论文虽强调「Jev 只是一个实现,创新在架构分离本身」,但社区复现依赖该闭源组件;用什么开源小模型/判别式模型能达到同等控制质量,是值得追问的问题。
  2. 无消融实验:多关系图(继承自 MAGMA 的设计)与 System-One 控制各自贡献多少?候选打分四个维度的权重敏感性如何?论文未回答。
  3. 仅 LoCoMo 单基准:文中提到「两个广泛使用的基准」但仅报告了 LoCoMo;在更长时程、更多写入规模的场景下(巩固、merge/promote 的作用会更突出)表现待验证。
  4. Noul 输出未校准:论文明确不假设控制器输出是校准概率,但诸多阈值(0.60 / 0.95 / 0.85)依赖分数的相对比较,阈值迁移到其他控制器实现时可能需要重新调参。

适用场景:需要长期记忆、高频读写、对延迟敏感的对话/个人助理类智能体;以及希望把记忆系统的计算成本从「LLM 生成主导」降到「轻量判别主导」的生产系统。


七、小结

Jev-Mem(arXiv:2609.23986)提出了一种受双过程认知启发的智能体记忆架构:System-One 控制平面以类型化、批处理、非自回归的方式接管记忆类型标注、关系构建、查询路由、预算分配、候选打分与自适应停止;多关系记忆平面(语义/时间/因果/实体四视图共享规范化节点)承载结构化存储;System-Two LLM 只负责复杂推理与答案合成。在 LoCoMo 上,Jev-Mem 取得 0.777 总分(相对最强基线 +11.0%),构建时间 158 秒(6.6× 加速),查询延迟 0.93 秒(-36.7%),证明了「快速轻量控制 + 按需深度推理」的分离设计可以让智能体记忆更快且更好