冻结 VLM 的自我进化:经验记忆 + 可靠性在线校准让空间推理不靠微调

论文:Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence arXiv:2608.12743 · 2026-08-13 提交 · Under Review · cs.AI 作者:Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen


核心摘要

把 VLM 调成"空间大脑",目前主流就两条路:要么 SFT/RL 把模型权重再训一遍,要么给模型挂上深度估计、3D 重建这种专家工具,让模型边问边查。这篇论文(arXiv 2608.12743)走了第三条被忽略的路——参数免更新的自进化:用一套经验记忆框架 Spatial Memory Agent(SMA),让冻结的 VLM 在可验证环境里解题,验证器打分的经验被反射模型蒸馏成"可迁移的课程"(transferable lesson),每条课程带一个在线校准的 Transfer Reliability Score(TRS),部署时只检索最可靠的 top-k 课程去引导推理,不动模型、不调用外部工具。

5 个空间推理 benchmark × 4 个冻结 VLM(Qwen3.5-9B / 35B-A3B / 27B / 122B-A10B),20 个评测中 SMA 拿下最高 macro average(最强单底模下 2.6~2.9 个点的增益);和训过的 SpatialEvo-7B 比,宏观平均从 47.1% 涨到 63.5%,整体涨了 16.4 个点。对做 Agent 记忆系统的同学来说,这套「经验蒸馏 + 可靠性打分 + 在线校准 + 二阶段检索」的范式,比多数文本 Agent 记忆系统多走了一步——它区分了"语义相似"和"经验可迁移"。

一句话评价:不是底层突破,是工程整合做得非常扎实的样本。TRS 在线校准是这版里最有借鉴价值的点子。


一、问题:为什么空间 VLM 也需要"免训练进化"

去年做空间推理相关项目的时候,我有个挺别扭的体感——模型在 RoboSpatial 这种 embodied spatial benchmark 上,能在 60% 附近打转,再怎么加 prompt、拆解 step 都不太顶用。回头看论文里的数据:Qwen3.6-27B 在 RoboSpatial 上 No memory 只能到 54.1%,确实不是个别现象。

现有两条改进路径,作者梳理得很清楚:

第一条:post-training。SpatialVLM、RoboSpatial、SpatialEvo、SAGE、AtlasVA 这一串,本质都是训一遍——用空间指令数据、2D+3D 融合数据、self-generated 课程、RL 信号去改 VLM 的权重。代价是数据、算力、过拟合风险,且每换一次底模就要重新来。

第二条:tool-augmented agent。S-Agent、SpaceTools 这类,让 VLM 调用深度估计、3D 重建、视觉程序等专家工具。代价是部署时引入额外依赖——一旦没有深度估计 API,或者工具返回不稳定,整个链路就脆了。

作者抛出一个被忽视的问题:

一个完全冻结的 VLM,能不能只靠"维护一个外部记忆库",就在新空间任务上持续变好?目标不是记住具体题目,而是从已验证经验里蒸馏出"可复用的课程"。

这个问题对做 Agent 记忆系统的同学尤其亲切。文本 Agent 这两年已经从 AWM、ExpeL 一路卷到 MemP、MemRL,做了大量"经验→课程"的蒸馏工作。但这些工作有几个共同盲区:检索基本只看语义相似度,没人区分"这经验看着像"和"这经验真有用";价值更新也基本是 reward-shaped,没有可靠性置信度。SMA 这篇正好打在文本 Agent 记忆系统当前的痛点上,所以我读得格外仔细。


二、SMA 的核心机制:一张图先看明白

直接上图。这是论文里我最推荐先看的概念图,它把"为什么需要 TRS"讲得非常清楚。

图1:三种范式对比——No Memory、Similarity-only Memory、SMA

图 1:三种范式在同一个空间问题上的表现。问题:Which is taller in 3D: the fridge or the table and chair stacked together? 答案:Fridge。No Memory 直接答 B(错);Similarity-only Memory 也答 B(错,因为检索到的记忆虽然相似度高但可靠性低);SMA 答 A(对,因为它挑了 TRS=0.86 的记忆而不是 TRS=0.24 的)

这张图最值得琢磨的地方是它把"高相似"和"高 TRS"显式拆开了。Best memory is not always the nearest memory——这是论文里我自己摘出来的核心信条,也是后面所有实验设计的基础假设。

下面这张是完整的工作流,方法细节都在里面。

图2:SMA 的系统工作流

图 2:Spatial Memory Agent 的系统方法与工作流。Memory Writing 阶段:冻结 VLM 在可验证环境里解题 → Verifier 给 reward → Reflection Model 把 rollout 蒸馏为 memory card(task + summary + transferable lesson + visits + TRS),TRS 用 verifier reward 在线校准。Read-only Deployment 阶段:Two-Stage Retrieval(语义过滤 → similarity+TRS 联合排序)挑出 top-k 课程,引导冻结 VLM 推理;memory bank 冻结,模型权重冻结


2.1 Memory Card:六元组的结构化表示

每条记忆 \(m_i\) 不是一句原始经验,而是一个结构化六元组:

\[m_i = (t_i,\ s_i,\ l_i,\ n_i,\ c_i,\ v_i)\]
  • \(t_i\):源任务文本
  • \(s_i\):rollout 的简短总结(abstract task shape + 成功/失败诊断)
  • \(l_i\):transferable lesson(可迁移课程)—— 模式 + 要避开的坑 + 复用的检查步骤
  • \(n_i\):这条记忆被检索过的次数
  • \(c_i\):累计 reward
  • \(v_i\):Transfer Reliability Score(TRS)

注意一个反直觉的细节:检索时只暴露 task / summary / transferable lesson,不暴露模型当时的原始答案和已验证答案。这是个防泄漏设计——你不能让检索到的课程里直接写着"这题的答案是什么",否则就成了 prompt 注入。

2.2 Procedure Memory Generation:反射模型怎么蒸馏

Memory Writing 阶段只发生一次(One-Pass,见下),反射模型 \(R_\phi\) 接收:

\[(s_i,\ l_i) = R_\phi(o_i,\ t_i,\ y_i^{\star},\ r_i)\]

其中 \(o_i\) 是 VLM 的原始输出,\(y_i^{\star}\) 是 verified target,\(r_i\) 是 verifier reward。反射输出严格 JSON,summary 抽象任务形态,lesson 是可复用原理。\(y_i^{\star}\) 给到反射模型是核心选择——它让反射模型"知道正确答案",但 anti-leakage 规则禁止把答案原样写进 lesson。

这个 trick 我之前在 ExpeL 上见过类似设计,差别在于 ExpeL 是把 task 用 success/fail 二分完事,SMA 把 verified target 显式喂进去,让反射模型"对照着正确答案总结教训"。

2.3 Two-Stage Retrieval:相似度过滤 + TRS 联合排序

检索分两步。第一阶段用任务文本的 embedding(论文用 text-embedding-3-large)算余弦相似度:

\[\mathrm{rel}_{ij} = \cos(\psi(t_i),\ \psi(t_j))\]

相似度低于阈值 \(\delta\) 的全部丢弃,得到候选集 \(C_i\)

第二阶段做相似度和 TRS 的联合排序:

\[S_{ij} = (1 - \eta)\, z(\mathrm{rel}_{ij}) + \eta\, z(v_j)\]

\(z(\cdot)\) 是 clipped z-score 归一化,\(\eta\) 控制 TRS 权重(论文默认 0.5)。Top-k 课程(默认 k=3)作为 guidance 拼到 prompt 前面。

这一步是 SMA 和其他记忆系统最不一样的地方——MemP、RAG 这类只做 \(\mathrm{rel}_{ij}\),SMA 显式把"未来可迁移性"作为单独一维加进去。后面 Table 7 的 Similarity–Accuracy Analysis 我会专门展开。

2.4 TRS 在线校准:让可靠性"长出来"

这是全文最有借鉴价值的一节。TRS 的更新公式:

\[\forall m_j \in \mathcal{G}_i:\quad n_j \leftarrow n_j + 1,\quad c_j \leftarrow c_j + r_i,\quad v_j \leftarrow \frac{\lambda v_0 + c_j}{\lambda + n_j}\]

初始时所有记忆 \(v_i = v_0 = 0.5\)均匀先验,不论你创建这条记忆时答对答错)。每当某条记忆被检索并用到了某次推理,就把那次推理的 reward \(r_i \in [0, 1]\) 累加到 \(c_j\),访问次数 \(n_j\) 加 1,TRS 按"先验 + 累计 reward / 先验强度 + 访问次数"的形式更新。

这是一个 shrinking estimator——\(\lambda\) 是先验强度,论文默认 2.0。访问次数少的记忆会被向 \(v_0\) 拉回去,访问次数多的记忆才"显出真形"。这避免了一个经典问题:刚被创建就被偶然答对一次的经验,TRS 直接飙到 0.99,然后一直霸占检索。

这里有个设计判断我想单独拎出来说——TRS 故意不区分"创建时答对"和"后来帮上忙"这两件事。Table 5 显示,来自成功 source 的记忆平均 TRS 0.522、下游 85.7% acc;来自失败 source 的 TRS 0.452、下游 61.4% acc。0.07 的 TRS 之差,撬动 24.3 个点的下游精度。这个差距不是 TRS 公式直接算出来的,是"经验在后续场景里反复被验证能 transfer"自然沉淀出来的。这是我最欣赏 SMA 的一个设计选择——它把"未来可迁移性"和"当时答对答错"彻底解耦了。

2.5 One-Pass Memory Writing:把经验库"稳住"

论文做了一个反直觉的设计选择:默认情况下,只在第一次遍历环境时写记忆,之后 9 个 pass 都只更新 TRS、不写新记忆。

这跟 MemP、MemRL 的"每轮都反思、写新经验"很不一样。论文里的实验数据支持这个选择:跨 10 个 pass,One-Pass 比 Continual 记忆库小到 1/10、redundancy 降低 21%、TRS-update coverage 翻倍。

背后的直觉是:持续往记忆库塞新条目,会形成大量"看似新、实际重复"的卡片,稀释 TRS 的信号。一次性写完,剩下的 9 个 pass 用来"试炼"每条记忆的可靠性,从信息论角度更高效。

这个观察对做 dual-mem(快/慢循环)的同学有直接借鉴——慢循环不要盲目扩量,要给每条记忆足够的试炼机会


三、实验:5 个 benchmark × 4 个底模 × 5 个 baseline

3.1 主表:所有底模下都拿到了最高 macro average

主表 Table 1 的关键数据(accuracy %, 5 benchmark 宏平均):

底模 No memory RAG MemP MemRL-R MemRL-GT SMA 最强 baseline → SMA 差
Qwen3.5-122B-A10B 65.3 64.2 65.3 66.2 65.6 68.8 +2.6 pp
Qwen3.6-35B-A3B 61.6 63.3 63.7 63.8 63.1 66.7 +2.9 pp
Qwen3.6-27B 63.3 65.9 66.8 65.8 68.1 69.8 +1.7 pp
Qwen3.5-9B 60.6 59.2 60.7 58.7 60.0 63.5 +2.8 pp

几个我注意到的小细节:

  • 小模型增益最大:Qwen3.5-9B 上 +2.8 pp,Qwen3.6-35B-A3B 上 +2.9 pp,反而是最大模型 122B 上 +2.6 pp。直觉上小模型从外部经验中"借力"的边际收益更高,符合 dual-mem 的设计哲学
  • SAT、EmbSpatial 是高基线场景(baseline 都已经 80%+),SMA 还能往上抬 1-3 pp,说明 TRS 在"简单任务不显著退化"上做得不错——这是文本 Agent 记忆系统常见的反向问题:很多记忆系统在高 baseline 任务上反而掉点
  • Qwen3.6-27B 上 SMA 拿到 69.8% 的精度,比 No memory 涨 6.5 pp、比 RAG 涨 3.9 pp、比 MemP 涨 3.0 pp、比 MemRL-GT(ground truth reflection)涨 1.7 pp——在 ground truth reflection 之上 SMA 还能再涨 1.7 个点,这其实是挺强的信号:验证器 + 反射模型即使拿到了正确答案,"反思出可迁移课程"这一步还是比直接用答案更好

3.2 消融:每个组件都不可或缺

Table 2 跑在 RoboSpatial + Qwen3.6-27B 上,消融每个组件的代价(相对 SMA 68.5%):

消融 Acc. (%) Δ (pp)
SMA 完整版 68.5
\(-\) summary 65.3 \(-\) 3.2
\(-\) transferable lesson 65.0 \(-\) 3.5
\(-\) semantic filter 62.7 \(-\) 5.8
\(+\) raw model output 64.1 \(-\) 4.4
reward-only reflection 63.0 \(-\) 5.5

最值钱的两个消融是 \(-\) semantic filter(\(-5.8\) pp)和 reward-only reflection(\(-5.5\) pp)。前者验证了"不只靠相似度"是 SMA 的核心贡献;后者验证了"只给 reward 不给 verified target 去反射"是灾难性的(注意 reward-only 这个 ablation 用的还是 verifier reward,不是纯无监督)。两者加起来基本就是把 SMA 变成 MemP/RAG,瞬间跌回 baseline 区间。

对比 \(-\) summary(\(-3.2\) pp)和 \(-\) transferable lesson(\(-3.5\) pp)的差距很小——这其实有点反直觉,说明 summary 在 retrieval 上确实有用(可能有补充语义信息的作用),但 lesson 是核心。\(+\) raw model output(\(-4.4\) pp)证明把模型原始答暴露给 prompt 是负收益,符合前面的防泄漏设计。

Figure 4 做了 \(\eta\)(TRS 权重)和 \(k\)(检索数)的超参扫描:峰值在 \(\eta=0.5,\ k=3\)这说明 similarity 和 TRS 几乎同等重要,缺一不可。\(k\) 超过 3 之后 prompt 噪声反而开始压过信号增益。

3.3 对比训过的 SpatialEvo-7B:免训练把训过的打趴

Table 3 是论文里最戏剧性的一张表。SpatialEvo-7B 是一个专门训过的 7B 空间推理模型,底模是 Qwen3.5-9B。SMA 用同一个底模、不动参数、只挂经验记忆:

Method RoboS. ERQA Omni3D SAT EmbS. Avg.
SpatialEvo-7B 41.3 37.0 25.6 57.7 74.1 47.1
SMA 58.5 52.0 40.8 81.3 84.9 63.5
Δ +17.2 +15.0 +15.2 +23.6 +10.8 整体涨 16.4

平均涨了 16.4 个点,SAT 上涨 23.6 pp,这是用同一底模、免训练的方式把训过的模型按在地上摩擦

不过这里我得稍微留个心眼——SpatialEvo 是 7B、SMA 用 Qwen3.5-9B,参数量差了 2B;SpatialEvo 也未必对所有 benchmark 都做了适配训练;论文里说"评估 scope"有限定。所以这个 +16.4 pp 我倾向于读成"在当前评估范围内,经验记忆路径和训练路径至少是同一量级甚至更优",而不是"SMA 整体超越 SpatialEvo"。

但它确实传递了一个重要信号——对空间推理这种 reasoning-heavy 任务,外挂可迁移经验的边际收益,可能比额外训练一个 7B 模型还高。这给"dual-mem vs SFT"的老问题提供了一个新的数据点。

3.4 记忆迁移:跨模型、跨 benchmark 都能用

Table 4 测了两种迁移:

  • 模型迁移:用 122B 写的记忆库,部署到 27B 上用(同样任务)
  • RoboSpatial:54.1 → 63.5(\(+\)9.4 pp)
  • SAT:82.3 → 88.0(\(+\)5.7 pp)
  • Benchmark 迁移:用 27B 在 ERQA 上写的记忆库,部署到 27B 跑 RoboSpatial
  • 54.1 → 61.7(\(+\)7.6 pp)

模型迁移最让我意外——122B 写的可迁移课程给 27B 用还能涨 9.4 pp,跨底模没崩。说明反射模型蒸馏出的"transferable lesson"确实有底模无关的成分。Benchmark 迁移说明同一类空间推理(不同实例)之间经验是可复用的——这正是 dual-mem 想达到的目标。

这个迁移实验如果再加一组"完全不同的 domain"作为负例(比如文本推理→空间推理),就能把"可迁移"刻画得更清楚。当前实验只做了"同类空间内迁移",还不是完整的迁移测试。

3.5 TRS 诊断:可靠性的信号是不是真的准

Figure 5(论文里 Figure 6 的 TRS bin 部分)按"被检索记忆的平均 TRS"分桶,统计部署精度:

Mean TRS 区间 Deployment Acc.
[0.2, 0.3) 19.3%
[0.3, 0.4) ...
[0.9, 1.0] 97.3%

从 19.3% 到 97.3%,TRS 和下游精度强单调相关。这是 TRS 公式有效性的最直接证据。

Table 5 做了 source-quality 切分:来自成功 source 的记忆 mean TRS 0.522、acc 85.7%;来自失败 source 的 mean TRS 0.452、acc 61.4%。24.3 pp 的下游精度差,源头只是 0.07 的 TRS 差——这个倍差在工业级记忆系统里非常可观。

Table 6 做了 retrieval composition 分析:检索到的 3 条记忆全成功 → 93.0% acc;全失败 → 39.0% acc;混合 → 65.1% acc。TRS(0.909 / 0.480 / 0.653)和下游精度几乎完美同步。

3.6 Similarity–Accuracy 权衡:最相似的不是最好的

Figure 7(论文 Figure 5)有特别意思的一组数据:相对 MemP,SMA 把平均检索相似度从 0.792 降到了 0.698(\(-0.094\)),但把平均精度从 66.8% 涨到了 69.8%(\(+\)3.0 pp)。5 个 benchmark 上方向全部一致。

这个结果直接打脸"语义相似度越高越好"的传统认知——当你愿意放弃一点语义相似度,换来更高的 TRS(更可靠的经验),最终推理质量是涨的。这条结论对所有做 Agent 记忆检索的同学都值得抄下来贴墙上。

3.7 Atomic Spatial Abilities:10 类子能力全面覆盖

Figure 7(论文 Figure 6)按 10 个原子空间能力(Correspondence、Attribute、Object motion、Localization、Relation、Distance/depth、Mental simulation、Tracking、Camera reasoning、Affordance)拆解增益:

  • 最大增益:Correspondence +11.2 pp,Attribute +8.0 pp,Object motion +7.6 pp
  • 最小增益但仍为正:Distance/depth +2.6 pp,Affordance +2.9 pp
  • 对比 MemP:Tracking \(-3.0\) pp,Affordance \(-1.9\) pp(负增长!)

MemP 在 Tracking 和 Affordance 上负增长这件事值得拎出来说——它说明"无 TRS 过滤的程序记忆在某些子能力上反而是负资产"。这把"无差别 RAG-style 记忆"的天花板戳破了:不是所有经验放进 prompt 都是好的,没有可靠性筛选的记忆可能让模型分心。


四、案例研究:TRS 高的记忆到底长什么样

论文给了 5 个案例研究图,挑选了最具代表性的几类空间推理:

图3:5 个空间推理案例研究

图 3:5 个案例的检索记忆 + CoT + 预测。Case 1 RoboSpatial (TRS 0.842) 检查 banana 能否放进 microwave 顶上——课程强调"clearance and size check, 假设占用就报 no fit"。Case 2 ERQA (TRS 0.785) crampon 坐标定位——课程教先估 vertical band 再估 horizontal band, 避开选错对象。Case 3 EmbSpatial (TRS 0.672) 哪个物体离镜头最远——课程教"沿视线方向评估深度, 用 occlusion 排除, 比较所有候选的相对深度"。Case 4 Omni3D (TRS 0.793) 沙发挡住壁炉后是否仍可见——课程教"模拟物体运动并比较投影占地, 避免任何 overlap 就判断为完全不可见"。Case 5 SAT (TRS 0.709) 哪些物体在第二帧相对原位有移动——课程教"刚体空间锚定到背景特征(角、边), 避免依赖近大远小

这五个案例我读完有一个挺强的体感:高 TRS 课程都有"先做 X、再做 Y、避开 Z 陷阱"这种 step-by-step 结构。比如 Case 1 强调"先算 clearance 再假设占用",Case 4 强调"先模拟运动再判断遮挡"。这种结构化课程对 VLM 是非常友好的——它说到底就是 few-shot chain-of-thought,只不过是经过 verifier 验证、可靠性打分的版本。

反过来说,低 TRS 课程通常是没结构、单点的(比如只说"判断远近时看大小"),遇到新场景就失效。这是 TRS 公式能"自然沉淀"出好课程的内在原因。


五、我的判断:亮点、问题、对文本 Agent 记忆系统的迁移

亮点

  1. TRS 公式 + 在线校准是真有工程价值的。传统 Agent 记忆系统的价值更新要么是 reward-shaped 简单叠加,要么是规则启发式;SMA 用 shrunk estimator + 均匀先验,让可靠性"自己长出来",这在文本 Agent 记忆里完全可以平移——比如"经验在 N 次后续任务上帮上忙的频率"作为可靠性。
  2. 区分语义相似和经验可迁移,是这版里最有思想含量的贡献。文本 Agent 记忆系统普遍把"近邻相似"等同于"有用",SMA 直接打脸这个假设:相似度降 0.094、精度涨 3.0 pp。
  3. One-Pass Memory Writing 是个被低估的工程技巧。慢循环不是写得越多越好,要给每条记忆足够的试炼窗口。这点对 dual-mem 设计很有借鉴。
  4. 冻结 VLM + 外部经验 + 免训练 = 部署侧成本极低。模型权重不动,意味着同一个底模配不同的 memory bank 就能在多任务间切换,这是 SaaS 化的天然形态

问题

  1. 信用分配是诚实承认的硬伤。D.1 Limitations 里作者自己写明:当最终答案变好时,没法精确归因到 writing / reflection / retrieval / final use 中的哪个。AttriMem、Memory-R2、MemQ 这些同期工作已经在做过程级信用分配,SMA 还没接上。
  2. 长期记忆维护没做。D.2 Limitations 写明:没有显式的 deletion / merge / compression / expire 策略。记忆库随时间增长,最终会撞上存储 / 延迟预算——这是任何工业级 Agent 记忆系统都要面对的问题。
  3. 评估 scope 我会打个问号。20 个评测里 SMA 大多数最强,但作者也明说 SpatialEvo 对比"在这个评估 scope 内"——benchmark 选择、split 构造都是作者自己做的。外推到工业级任务是不是还成立,得等独立复现
  4. One-Pass 默认值的代价被淡化。在持续演化的环境里(任务分布会漂移),只写一次记忆可能很快过时。作者在 Discussion 提到这个问题,但没给出在漂移环境下的回写策略。
  5. reflection model = base model,这是个有意的设计(同底模省成本),但限制了反思质量的天花板。这点对工业部署其实是把双刃剑——好处是简单,坏处是复杂任务可能需要更大的反射模型。

对文本 Agent 记忆系统的迁移价值

如果让我把这篇方法论搬回文本 Agent 记忆系统,我会重点抄这几条:

  • TRS 公式可直接套。把"verifier reward"换成"任务最终 reward"或"用户反馈",把"transfer reliability"换成"后续场景的复现成功率",整套更新公式 1:1 平移
  • 双阶段检索(语义过滤 → 相似度+TRS 联合排序)。文本 Agent 记忆系统目前基本只做语义检索,加 TRS 排序应该普遍有效
  • summary + transferable lesson + 防泄漏。文本 Agent 经验里直接塞"原答案"会污染后续推理,用结构化课程代替裸答案是个值得推广的模式
  • One-Pass vs Continual 的对照实验范式值得复用——任何"慢循环写记忆"的项目都该跑一下,看自己到底是 One-Pass 更稳还是 Continual 更稳
  • 不要把"高基线任务"默认排除。SMA 在 SAT/EmbSpatial 这种 80%+ baseline 上还能涨 1-3 pp,说明高基线任务不是记忆系统的"无收益区",反过来想:很多文本 Agent 在中等难度任务上做记忆,结果发现 RAG 不涨反降,是不是检索+可靠性联合筛选没做到位?

收尾说一句不太讨巧的判断——SMA 不是底层突破,是工程整合做到极致的样本。"经验蒸馏 + 可靠性打分 + 在线校准 + 防泄漏 + 二阶段检索"这套组合拳,每个组件在文献里都有原型(MemRL / AttriMem / AWM / RAG),但把这五个东西严丝合缝地缝起来,并且每一步都用实验证明"少了你就不 work",是工程上难得的扎实活。

对做 Agent 记忆系统和 dual-mem 方向的同学,这篇值得花一两个小时精读。核心不是抄 TRS 公式,而是抄"区分语义相似和经验可迁移"这个设计判断——它可能比你目前记忆系统里 80% 的检索启发式都更有价值。


附:核心公式速查

Memory card 结构: $\(m_i = (t_i,\ s_i,\ l_i,\ n_i,\ c_i,\ v_i)\)$

Two-Stage Retrieval 联合排序: $\(S_{ij} = (1 - \eta)\, z(\mathrm{rel}_{ij}) + \eta\, z(v_j),\quad \mathcal{C}_i = \{m_j : \mathrm{rel}_{ij} \geq \delta\}\)$

TRS 在线校准(shrinking estimator): $\(v_j \leftarrow \frac{\lambda v_0 + c_j}{\lambda + n_j}\)$

默认超参(4 底模 × 5 benchmark 一致):\(\lambda = 2.0,\ v_0 = 0.5,\ K = 3,\ \eta = 0.5\)

计算设施:4 × NVIDIA H200(143 GiB × 4),2 × Intel Xeon Platinum 8558,2 TiB RAM,Ubuntu 22.04.5 + vLLM 0.20.0 + PyTorch 2.11.0+cu128。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。