SAEScientist-Bench:AI Agent 能否自主开展 SAE 可解释性研究?

  • 论文标题: SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
  • arXiv: 2609.09113(2026-09-08 提交,Preprint / Work in Progress)
  • 作者: Yuqiao Tan, Shizhu He(通讯), Jun Zhao, Kang Liu
  • 机构: 中国科学院自动化研究所认知智能重点实验室、中国科学院大学人工智能学院
  • 代码: https://github.com/Trae1ounG/SAEScientist

一、一句话总结

本文提出 SAEScientist-Bench——首个评估"AI agent 能否像科学家一样,使用稀疏自编码器(SAE)工具自主完成机制可解释性研究"的标准化基准。给定一个目标概念,agent 需要自主设计对比探针(contrastive probes),在 Gemma-2-9B-IT 的 Gemma Scope 字典(131,072 个特征)中发现最优特征,并在激活排名、概念选择性、因果引导三个维度上接受专家基线的检验。10 个前沿 agent 配置 × 20 个任务的评测显示:agent 已展现出真实的科学发现能力,在概念选择性上逼近专家水平(92.91 vs 98.92),但在因果引导(Causal Steering)上大幅落后(31.47 vs 57.75),且常出现"能设计对比实验、却误读实验结果"的问题。


二、研究动机:RSI 的"缺失支柱"

2.1 递归自我改进(RSI)缺乏白箱审计能力

递归自我改进(Recursive Self-Improvement, RSI)是自主 AI 研究的核心目标——让 agent 迭代式地发现、训练和改进前沿模型。但当前相关工作几乎全部聚焦于自动化经验性训练流水线(数据筛选、算法设计、后训练),把演化中的模型当作黑箱,仅靠外部任务性能评估。

随着模型规模与复杂性快速增长,内部机制日益不透明,仅靠行为观察不足以诊断失败或保证真正的对齐。只依赖外部指标的自主训练循环极易受到:

  • Reward hacking(奖励黑客)
  • Specification gaming(规范钻空子)
  • Deceptive alignment(欺骗性对齐)

的影响——模型得分很高,却隐藏着非预期行为。因此,可信可控的 RSI 循环需要一个关键缺失支柱:对内部表征进行持续的事后(post-hoc)监控与审计,检查模型真正学到了什么。没有白箱检查工具,自主迭代可能不断强化虚假捷径与无法检测的安全失败。

2.2 SAE 作为机制可解释性的基石

机制可解释性(Mechanistic Interpretability)工具是弥合这一差距的关键,其中稀疏自编码器(SAE)已成为基础范式:将多义性(polysemantic)激活分解为大量可解释特征方向,为模型表征提供透明视角。SAE 特征具有双重效用:

  1. 审计:检查特定概念是否真正被模型习得;
  2. 引导(steering):作为精确的因果杠杆,在生成时调控模型行为。

随着 Gemma Scope 等预训练 SAE 字典的广泛可用,"利用 SAE 工具检查与引导模型"已成为理解内部表征的重要手段。但社区此前缺乏标准化基准来严格评估前沿 AI agent 的自主科学发现能力——这种发现需要假设驱动的实验,以区分真实概念与虚假相关、并验证因果控制。


三、SAEScientist-Bench 基准设计

3.1 预备知识:SAE 与特征引导

在选定层,SAE 将隐藏状态 \(h \in \mathbb{R}^d\) 编码为稀疏非负特征激活向量 \(z \in \mathbb{R}^m\),并线性解码重建:

\[z = \text{Encoder}(h), \quad \hat{h} = b_{\text{dec}} + \sum_f z_f \cdot d_f\]

其中 \(m\) 为字典大小,\(d_f = W_{\text{dec}}[f,:]\) 为特征 \(f\) 的解码器方向。Gemma Scope 使用 JumpReLU 学习激活阈值,保证每个 token 只有少量特征激活。

特征引导(activation steering):推理时将特征解码器方向直接加到隐藏状态上:

\[h \leftarrow h + \alpha \cdot d_f\]

\(\alpha\) 控制干预强度。通过比较干预前后的输出,可直接评估特征对下游行为的因果效应。

3.2 任务构造

  • 每个任务将一个目标概念与 Gemma-2-9B-IT 的特定层配对,使用预训练的 Gemma Scope 残差流 SAE,字典规模 131,072 个特征
  • agent 需在该层字典中发现一个最能代表该概念的单一特征
  • 20 个发现任务,分布在第 9 层和第 20 层,覆盖 17 个独立概念(earnings reports、portfolio allocation、tax filing 三个概念在两层各出现一次),涵盖三大领域:
  • 多语言理解:Portuguese、Spanish、Latin、Turkish、French、German
  • 专业文档格式:earnings reports(财报)、tax filing(报税)、job postings(招聘)
  • 领域知识:clinical symptom reports、pharmaceutical dosing、archaeological excavation、weather forecasts、real estate listings、gardening advice、portfolio allocation、cat
  • 每个任务的评估套件包含三类文本:正例文本(表达目标概念)、hard-negative 文本(易混淆项,如"用英语讨论葡萄牙语")、中性文本(无关控制),另有测试因果引导的评估提示。
  • Expert 参考特征:每个任务配有锚定在 Neuronpedia 特征库的专家参考特征(来自公开 steering 预设如 Cat,或标准专家筛选工作流:6 正例 + 6 负例构造探针检索候选,再在 8 正例 + 8 hard-negative + 4 中性文本上验证保真度)。任务描述、Expert 特征与评估套件在 agent 发现期间严格冻结,仅用于提交后评测。

任务清单(Table 4,部分)

概念 Expert ID 概念 Expert ID
20 archaeological excavation 7256 9 Latin 7659
9 cat 62610 20 pharmaceutical dosing 104583
20 clinical symptom reports 3927 9 portfolio allocation 77390
9 earnings reports 131024 20 portfolio allocation 101617
9 French 105738 9 Portuguese 41424
9 gardening advice 93406 20 real estate listings 27182
9 German 33987 9 Spanish 94329
9 job postings 91086 9 tax filing language 18713
9 Turkish 99383 20 weather forecasts 44494

3.3 交互协议

  • agent 接收:概念描述、基座模型与 SAE 标识符、hook point、字典宽度;Expert 与评估集保留给评测方。
  • probe_sae 接口:每次请求最多接受 64 条 agent 自撰文本,可检索 top-k 激活特征或测量指定候选集;返回激活值及其在全字典中的排名。
  • agent 迭代修改探针文本与候选,最终提交一个特征 ID 供评测。

3.4 三个评估维度

① Activation Rank(Rank,激活排名)

衡量特征在目标概念上的激活相对于整个字典是否足够突出。文本级激活 = 序列中三个最大非特殊 token 激活的均值(比单 token 最大值更稳定)。

\[\text{Rank} = 100 \times \frac{2 \cdot r_{\text{exp}}}{r_f + r_{\text{exp}}}\]

\(r_f\)\(r_{\text{exp}}\) 分别为提交特征与 Expert 基线在正例文本上的平均字典排名。范围 [0, 200]:100 表示与专家持平,高于 100 表示优于专家。未激活特征获得最差排名(= 字典大小)。

② Activation Selectivity(Activation,概念选择性)

单义特征应只对目标概念响应。计算正例文本与对比控制文本(hard-negative + neutral 合并)之间的 AUROC

\[\text{Activation} = 100 \times \max(0, 2 \cdot \text{AUROC} - 1)\]

范围 [0, 100]:100 = 完全分离;0 = 随机水平。

③ Causal Steering(Steering,因果引导)

每个评估提示下,基座模型在三种条件下生成:未修改基线、特征引导、范数匹配的随机方向控制。自动评审(GPT-4o,匿名化三元组 A/B/C 乱序、两轮独立评分)对目标相关性指令保持度打 0–4 分,并单独标记退化(degeneration)。

\[\text{Steering} = 100 \times \max\left(0, \frac{T_f - \max(T_{\text{base}}, T_{\text{random}})}{4}\right)\]

即超过较强控制条件的净目标表达增益。对替代特征,干预强度 \(\alpha\) 在最终评估前于 5 个留出提示上校准(网格 \(\{0.5, 0.75, 1, 1.25, 1.5\}\alpha_E\),不满足 ≥90% 非退化则回退 \(\{0.0625, 0.125, 0.25, 0.375\}\alpha_E\)),经三阶段筛选:非退化过滤 → 目标线索优化 → 最小扰动平局打破。Expert 保留冻结参考强度。

④ 总分

\[\text{Overall} = \frac{\text{Rank} + \text{Activation} + \text{Steering}}{3}\]

Expert 基线总分 85.56


四、实验设置

4.1 十个 Agent 配置

Agent Harness 模型标识符
Claude Opus 5 Cursor claude-opus-5-thinking-high
Claude Sonnet 5 Cursor claude-sonnet-5-thinking-high
Kimi K3 Cursor kimi-k3-high
Claude Opus 4.8 Cursor claude-opus-4-8-thinking-high
Grok 4.6 Cursor cursor-grok-4.6-high
Gemini 3.8 Flash Cursor gemini-3.8-flash-high
GPT-5.6 Sol Codex gpt-5.6-sol
GPT-5.5 Cursor gpt-5.5-high
GLM-5.2 Cursor glm-5.2-high
GPT-5.6 Luna Codex gpt-5.6-luna
  • 所有 agent 接收相同的任务指令与交互接口禁用外部网络,防止数据污染。
  • 无约束交互环境:agent 自主决定推理投入、探索轨迹、查询次数与停止条件;每个任务标准执行超时 60 分钟
  • 每个模型–harness 配置对每个任务进行 3 次独立端到端调查(共 60 个计分 episode),报告均值与标准差。

4.2 实验总量

  • 600 个计分 episode4,873 次探针调用49,407 条文本条目
  • 引导评估覆盖 124 个任务–方向对、10,940 次生成,GPT-4o 两轮评审共 14,880 个条件评分
  • 引导生成器为 google/gemma-2-9b-it,贪心解码,每个 token 位置干预;最终评估用 20 条指令,生成长度 64–192 tokens。

五、主要实验结果

5.1 主表(Table 1,三次运行均值 ± 标准差)

Agent Overall(名次) Rank(名次) Activation(名次) Steering(名次)
Expert 基线 85.56 100.00 98.92 57.75
Kimi K3 65.82±1.87(1) 74.30±5.60(2) 92.91±1.07(1) 30.26±2.02(2)
Claude Opus 5 65.41±0.41(2) 75.35±0.14(1) 91.89±0.86(3) 28.99±2.01(5)
Claude Sonnet 5 65.04±2.20(3) 73.45±2.81(3) 92.01±3.47(2) 29.66±2.68(4)
Grok 4.6 62.93±1.01(4) 67.21±3.07(6) 90.11±0.83(5) 31.47±3.39(1)
Claude Opus 4.8 62.57±5.42(5) 70.25±6.38(4) 90.90±3.56(4) 26.55±7.13(6)
Gemini 3.8 Flash 59.57±0.61(6) 69.49±5.07(5) 86.78±2.61(7) 22.43±1.39(9)
GPT-5.6 Sol 57.28±0.86(7) 51.65±2.15(8) 90.03±0.91(6) 30.16±3.37(3)
GPT-5.5 54.34±2.80(8) 55.63±5.28(7) 84.19±0.58(9) 23.19±3.50(8)
GLM-5.2 52.27±2.62(9) 47.66±5.75(9) 84.85±3.69(8) 24.28±1.69(7)
GPT-5.6 Luna 50.27±7.40(10) 46.92±14.91(10) 83.36±1.72(10) 20.54±5.76(10)

5.2 核心发现

  1. 不同模型家族擅长不同维度:Opus 5 领跑 Activation Rank(75.35),Kimi K3 主导 Activation Selectivity(92.91),Grok 4.6 领跑 Steering(31.47)——呈现明显的能力权衡
  2. 与专家的差距呈"维度不对称":概念选择性上顶尖 agent 已接近专家(92.91 vs 98.92),但因果引导差距巨大(最高 31.47 vs 57.75)。"找到相关的、有选择性的特征"并不能直接转化为"找到有因果效力的引导向量"。
  3. GPT-5.6 Sol 在 Steering 上排第三(30.16,仅落后类别第一 1.31 分),但 Rank 仅 51.65,拖累总分。
  4. 重复独立运行中排名稳定,标准差通常 1–3 分。
  5. 总分与 Artificial Analysis Intelligence Index v4.2 通用能力排名呈强秩相关(ρ = 0.800),表明白箱可解释性评估与通用能力一致,但又构成独特的评估前沿。

Takeaway 1:前沿 agent 在机制发现中表现出明显的能力权衡,但在因果验证上落后(Overall 65.82 vs 85.56,Steering 31.47 vs 57.75)。表征审计是未来白箱 RSI 工作流的关键瓶颈。


六、深入分析

6.1 对比探针设计与证据解读(Portuguese 第 9 层案例,Table 2)

四个独立的 Portuguese 调查揭示了对比探针设计与最终分数的紧密联系:

  • 跨语言三联探针:Sol、Opus 4.8、Kimi K3 都设计了"葡萄牙语原文 / 西班牙语翻译 / 英语描述葡萄牙"的三联对比探针,并成功找到在控制文本上零激活或近零激活的特征。但存在选择性与激活强度的权衡:Sol 的特征分离干净(Activation 100.0)、因果引导强(88.8),但目标激活仅 7.04,Rank 只有 3.97,Overall 64.2;Kimi K3 找到激活强度 26.33 的突出方向,Rank 100 / Act 100 / Steer 85 / Overall 95,与 Expert 持平
  • 证据误读的典型失败:Opus 5 尽管撰写了匹配的葡/西/英三联探针,其最终所选特征在英语控制文本上的激活(4.50)反而高于葡萄牙语目标(3.81),Overall 崩至 13.9——agent 能设计对比实验,却误读了实验测量结果
  • 区分概念与子串干扰(Cat 任务):Opus 5 遇到某候选在真实猫句子上激活 32.92,但也在 Copycat killer(44.00)与 Catalytic converter(24.54)上强烈激活。Opus 5 通过显式设计形态学负例控制,识别出该候选只在检测子串 "cat" 而非动物概念,成功拒绝它并选择了单义的 Expert 特征。
  • 反例(GLM-5.2,Clinical symptom 任务):虽设计了排除一般医疗行政文本的诊断控制,但最终候选在一份完全无症状的病史文本上仍激活 70.25;GLM-5.2 错误地将这一强烈非症状响应淡化为可忽略,误选了一个由临床文档格式而非症状驱动的特征。
  • 特征纯度 vs 生成退化的权衡(Real estate 任务):Sol 与 Grok 4.6 因非房产广告上的轻微泄漏而拒绝宽泛候选;Kimi K3 则优先广泛覆盖而接受了泄漏候选——结果 Kimi 的特征目标相关性与因果引导更高,但生成退化率从 32.5% 升至 52.5%。自主发现不仅要找到有选择性的特征,还要在精度、覆盖率与输出稳定性之间仲裁。

6.2 搜索工作流差异(Figure 4)

agent 沿两个维度分化:候选广度 vs 探针深度刻意验证 vs 启发式选择

  • Sol:文本多样性优先,平均撰写 115.1 条探针文本(覆盖句长、主题、跨语言翻译),但只测试约 20.2 个候选特征
  • Claude Opus 5:广泛筛选者,平均比较 80.2 个候选(4 倍于 Sol),探针文本较少(平均 77.6 条)。
  • Kimi K3:高度定向策略——检索查询少得多,一旦锁定有希望的候选极少返回检索,却通过精确的假设表述取得最高总分。
  • 主动验证 vs 被动选择:Opus 5 与 Sonnet 5 选中 Expert 特征的比率几乎相同(25 vs 24 episode),但决策轨迹相反——Opus 5 是主动假设检验者,反复撰写专用探针直接评估 Expert 候选后才选择或有意拒绝;Sonnet 5 常在初次检索中遇到 Expert 候选却未经直接验证就忽略,依赖初始排名启发式。

Takeaway 2:搜索策略重要,但严格的假设检验决定发现成败。发现有效特征更多取决于设计有信息量的反例、避免表面干扰项、准确读取实验结果,而非搜索量。

6.3 泛化差距与聚合鲁棒性(Figure 5)

用标准化 Portuguese 评估套件(8 条留出正例 + 12 条控制)对提交的相同候选做盲测,暴露内部搜索中不可见的泛化差距:

  • 覆盖缺口与虚假激活:Sonnet、Grok、Luna 所选特征在自然的"下雨"段落上完全不激活,却在无关的英语保修声明上出现虚假激活;Gemini 的特征漏掉多个正例。表面级探针验证经常欠定概念边界,让模型选中绑定狭窄词汇线索而非全局语义概念的特征。
  • 高选择性 vs 弱激活强度:Sol 与 Expert 都达到 AUROC 1.000,但绝对激活量级差异巨大——Sol 的特征几乎对所有控制文本保持 0.00(非常干净),但目标激活仅 3.5–10.0,而 Expert 为 14.4–19.4、Kimi K3 为 26.3。目标信号太弱使其无法在全字典竞争中脱颖而出,Rank 崩至 3.97。这解释了为什么 Rank 与 Selectivity 必须联合评估
  • Top-3 token 聚合的鲁棒性:仅用最大 token 激活易受孤立离群值影响——Sol 的词汇控制中一个孤立葡语外来词产生 5.56 的单 token 尖峰,而完整目标句仅维持 2.96 的中等响应。最大聚合下 Sol 的 AUROC 降至 0.969;top-3 均值聚合摊薄瞬时尖峰,使 Sol 回到 1.000、Opus 4.8 从 0.927 升至 0.958。多 token 平均能有效过滤形态学伪影、奖励连贯的语义激活。

6.4 因果引导与指令保持(Figure 6、Table 3)

在 6 条评估指令(HTTP 请求解释、17×24 算术、四行诗、清洁能源短文、密码生成、重力定义)上沿各 agent 提交方向干预:

  • 因果效力的鲜明分界:许多特征在静态文本上分离良好,但只有少数能可靠引导生成。Sol、Opus 4.8、Kimi K3 提交的特征(即 Expert 特征 41424)在所有指令上呈现高目标相关性,成功将输出翻转为流畅葡语;而 Opus 5、Sonnet 5、Grok 4.6、Luna 所选特征在全部 6 条提示上目标相关性为零——相关激活未能转化为对下游生成的因果影响。
  • 生成对比示例(提示:"用两句话介绍自己"):
  • 无引导 → "I am Gemma, an open-weights AI assistant…"
  • Expert / Kimi K3 → "Olá! Eu sou o Gemma, um modelo de linguagem…"
  • Sol → "Olá! Eu sou Gemma…"
  • Luna → 仍为英语(无引导效果)
  • 目标诱导与输出质量的权衡:完整 20 指令套件上,Sol 取得领先 Steering 88.75 且指令保持度高(3.525);Opus 4.8 为 84.38 但保持度仅 3.050(要求四行押韵诗时 Sol 输出四行连贯葡语诗,Opus 4.8 生成 11 行重复循环,Expert 为 6 行)。极端案例中,GLM-5.2 在临床任务上的干预把无害的自我介绍变成絮叨的患者病史,完全破坏指令遵循。

Takeaway 3:因果引导将表面的激活相关与可执行的机制区分开来。有效的因果干预要求精确的语义调制而不触发退化、指令漂移或格式崩溃,是自主可解释性研究最严格的检验。


七、局限性与结论

局限性

  1. 范围受限:仅评估 Gemma-2-9B-IT 两层 Gemma Scope 残差流 SAE 上的概念驱动单特征发现,探针接口固定。未来应扩展到多样模型家族、更宽字典、多特征电路发现,以及无预设概念的开放式假设生成。
  2. 评估噪声:候选评估依赖固定文本套件、冻结专家基线与 LLM-as-a-judge;引入人在环验证、多参考特征与多评审集成可进一步降低评分噪声。
  3. 闭环缺口:目前基准的是事后特征审计;将 agent 发现的特征直接整合到下游模型编辑、遗忘(unlearning)或持续对齐循环中,是迈向完全闭环 RSI 的关键下一步。

结论

SAEScientist-Bench 建立了标准化基准,用于评估 AI agent 作为科学家开展自主机制可解释性研究的能力。10 个前沿 agent 配置在 20 个任务上的评估表明:agent 在激活空间中区分概念方面接近专家基线,但因果引导上存在持续的能力差距。行为分析表明,有效发现的关键不在于探索量,而在于严格的假设检验、设计有信息量的反例、准确解读实验反馈。该基准将机制可解释性与自主 AI 研究相连接,为在 RSI 循环中验证内部表征提供了必要且可审计的基础。


八、个人点评

  1. 选题视角新颖且重要:把"机制可解释性"从人工研究流程变成 agent 的可测量能力,直接对接 RSI 闭环中缺失的"白箱审计"一环,安全对齐意义显著。
  2. 三维度指标设计有区分度:Rank / Selectivity / Steering 的分解揭示了一个关键洞察——激活相关 ≠ 因果效力,这恰是当前 SAE 研究社区也在反思的问题,基准把这个问题转化成了可量化的 agent 能力缺口。
  3. 行为分析比分数更有价值:"能写对比探针却误读结果"(Opus 5 的 13.9 分案例)、"未经直接验证就忽略 Expert 候选"(Sonnet 5)等发现,说明当前 agent 的科学严谨性短板在证据解读而非搜索能力,对后续 agent-for-science 研究有普适启发。
  4. 待改进之处:单一模型(Gemma-2-9B-IT)、单一 SAE 家族、单特征发现的设定还较窄;LLM-as-a-judge 评审引入的噪声也需更多消融。期待后续扩展到多特征电路发现与开放式假设生成。

参考文献与链接

  • 论文: https://arxiv.org/abs/2609.09113
  • 代码: https://github.com/Trae1ounG/SAEScientist
  • Gemma Scope / Neuronpedia: SAE 字典与特征库