7B 打 235B?中关村学院把"小模型怎么活"这道题答成了一份全开源配方
你有没有发现一个挺拧巴的现象:一边是大厂拼命把模型往几百 B 上堆,另一边是大家实际部署的时候,手里能用的往往还是 7B、8B 这一档。小模型打不过大模型,似乎是天经地义的事——参数就那么多,你凭什么?
上周挂出来的 ZGCM-1(arXiv:2609.13356)直接跟这个"天经地义"叫板。北京中关村学院的团队从零训了一个 7B dense 模型,在 WebWalkerQA 上打到 63.09 分,反超 Qwen3-235B-A22B 的 59.60,Binary Function Search 上 62 分,紧咬 GLM-5.1 的 66 分。参数量差着 30 多倍。
核心摘要:这篇报告回答的问题是"小参数模型的能力天花板到底在哪"。作者的答案很干脆:小模型别指望靠死记硬背吞下整个开放网络,要把"内部深思 + 外部工具"耦合起来补足参数容量。围绕这个思路,他们交出一套从预训练到后训练全开源的高效配方——门控滑窗与全局注意力 5:1 交错、FP8 + Muon 优化器、16K→64K→256K 渐进式上下文扩展、把交互轨迹重构成 MDP 的 mid-training——最终在 16K 预训练上拿到约 4.2 倍的 time-to-loss 加速。数学侧 AIME 2026 拿 75 分、MATH-500 拿 97.13 分,14 个推理基准平均排名 7B–8B 档第一。权重、中间 checkpoint、训练代码、逐阶段数据配比、W&B 日志全部开放。我的判断:这不是一篇刷榜论文,是一份少见的"把账算给你看"的工程报告,值得细读。
论文信息
- 标题:ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
- 作者:Jiyan He, Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun, Junyi Guo, Wenjun Feng, Yantai Xie, Yifei Shen, Bin Shao, Chuyang Wei, Kai Chen, Kexin Zhou, Minghang Zhu, Shuxin Zheng, Tie-Yan Liu, Taine Zhao, Wenhui Zhu, Xueyin Xu, Xiaoqing Zhang, Yatao Li, Yuxuan Ren
- 机构:北京中关村学院(Zhongguancun Academy)
- 提交日期:2026 年 9 月 11 日
- 链接:https://arxiv.org/abs/2609.13356

图1:论文 teaser。左半部分用环形柱状图对比 7B–8B 同规模模型与前沿大模型在数学推理和 agentic 基准上的表现;右半部分概括四个支柱——FP8 预训练、混合注意力、MDP mid-training、AI 原生研发流程。
🎯 问题动机:7B 模型到底差在哪
说实话,"小模型怎么变强"这个问题已经被各种姿势回答过一轮了:蒸馏、更好的数据、更长的 CoT。但这些做法有个共同的隐含假设——能力最终还是要存进参数里。
ZGCM-1 的作者把话挑明了:compact 模型不可能靠被动记忆装下开放网络。7B 的参数预算摆在那,跟 235B 拼"记住多少知识"是必输的局。那怎么办?他们的破题思路是把战场换掉——知识不够,工具来凑;容量不够,思考来凑。模型不需要记住答案,需要会查、会算、会验证。
这个定位直接决定了后面所有的技术选择:为什么上下文要拉到 256K(工具返回的网页、反编译代码都很长)、为什么 mid-training 里要把交互轨迹重构成 MDP(让模型在预训练阶段就习惯"状态—动作"的决策范式)、为什么 agentic 数据占比要一路加码。
回到工程视角,这套思路其实挺务实的。我之前做小模型项目时也碰到过类似的账:往 7B 里塞知识,ROI 低得可怜;但教它用检索和计算器,提升立竿见影。这篇报告把这个直觉做成了一整套可复现的系统。
🏗️ 架构:5:1 的门控滑窗注意力,把 KV cache 砍到 1/6
先说基座。ZGCM-1 是个 7.39B 的 dense decoder-only Transformer:32 层、hidden 4096、SwiGLU intermediate 11008、GQA(32 个 query head 对 8 个 KV head)、RoPE 旋转比例 0.33、QK 用 RMSNorm 归一化。单看这些数字,就是个中规中矩的 7B。
真正的取舍在注意力上。32 层里,27 层用窗口仅 128 token 的门控滑窗注意力(SWA),只有第 6、12、18、24、30 层是全局因果注意力——5:1 的局部/全局比,跟 Gemma 3 的生产配置一致。门控的形式是给局部注意力输出乘一个 sigmoid 门:
你可能想问:窗口只有 128,长上下文不就瞎了?这正是 5 个全局层存在的原因——它们充当信息高速公路,把远处的内容接力传过来。作者做了 iso-parameter 的消融:在 10B token、4K 序列、8 张 H100 的统一预算下,SWA 5:1 的 tail loss 是 1.93,和全注意力持平,吞吐却是全场最高的 9566 tokens/s/GPU;作为对照,MLA 吞吐只有 7645,loss 还没改善。上下文越长,混合架构的优势越大——4K 时加速 1.13 倍,256K 时拉到 3.94 倍。
KV cache 的账更直观:每 token 的 KV 占用从全注意力的 128 KiB 降到 20 KiB。256K 上下文下,全注意力要 32 GiB,这套混合架构只要 5 GiB——6.4 倍的缩减。对部署侧来说,这个数字比任何 benchmark 都实在。
⚙️ 训练系统:4.2 倍加速是怎么凑出来的
论文里我最喜欢的一段,是他们把"4.2 倍 time-to-loss 加速"这笔账逐项拆开:
| 优化项 | 相对基线的加速 |
|---|---|
| SWA 5:1(16K 吞吐) | 1.4× |
| FP8 精度与系统配置 | 约 1.5× |
| Muon 相对 AdamW 的 step-to-loss 效率 | 约 1.8× |
| Pre-LN 数据效率 | 约 1.1× |
| 合计 | 约 4.2× |
基线是 OLMo 3 风格的 7B BF16/AdamW 配置。注意这是乘积关系,每一项都得真的兑现,任何一项注水都会被乘出来。
几个值得单独说的点。Muon 优化器用在矩阵参数上(momentum 0.9、5 步 Newton–Schulz 迭代、恒定学习率 \(2\times10^{-4}\)),标量参数仍走 Adam——这种"分治"用法最近在小模型圈越来越常见,这份报告算是又添了一个大规模验证。FP8 用 Transformer Engine 的 hybrid 方案:前向 E4M3、反向 E5M2,缩放因子基于 1024 步历史最大值做 delayed scaling,再配一个 TWEO 激活正则化压住中间极值。最终在 16K 生产跑批上稳定维持约 585 model TFLOP/s/GPU,换算下来大约是 H100 BF16 峰值 60% 的 MFU。
还有个很"活人"的运维细节:恢复训练后吞吐会从 585 慢慢掉到 554,查了一圈发现是 GPU 显存碎片化,每 100 次迭代做一次 CUDA allocator cache 清理加垃圾回收就恢复了。这种坑,没踩过的人写不出来。
📊 数据与课程:复杂度排序有用,但对代码和数学不管用
预训练分两个阶段:Stage 1 约 0.99T token,Stage 2 约 3.20T token,跨阶段去重,Stage 2 提高代码和数学占比并引入专门的推理数据(Nemotron-Pretraining-Specialized-v1)。数据配比本身用 0.3B 代理模型在 30B token 上搜出来的——小模型探路、大预算复用,成本控制得很"穷队友好"。

图2:五个甜甜圈图分别展示 Pre-Training Stage 1(0.99T)、Stage 2(3.20T)以及 Mid-Training 16K(180B)、64K(240B)、256K(180.51B)的数据族配比。可以看到 mid-training 阶段知识类数据从 10.5% 升到 14.2%,agentic 数据从 1.5% 升到 3.3%,而 pre-training replay 从 13% 降到 9%。
课程学习上有个挺反直觉的发现。Stage 1 按词汇复杂度从低到高排序,确实有效;但代码和数学被单独拎出来交错训练,因为复杂度排序压根反映不了它们的内在难度——一段 LaTeX 公式的"词汇复杂度"可能很低,推理难度却很高。7B probe 的验证数据:coding BPB 从 1.99 降到 0.81,math BPB 从 0.97 降到 0.94,代价是 general benchmark 的 BPB 微涨 0.03 到 0.09。这个 trade-off 我觉得是值的,也跟他们"数学 + agentic"的定位自洽。
上下文扩展走渐进路线:16K → 64K → 256K 三个阶段,从 2.86T 的候选池里采出 600.51B token。消融显示分阶段(64K 训 10B 再 256K 训 20B)比直接上 256K 训 30B 的最终 loss 更低。256K 阶段 RoPE base 提到 10M,开全激活重计算。

图3:600B token mid-training 的 CE loss 曲线。16K 阶段 loss 从 1.30 快速降到 1.17 附近,64K 阶段平稳缓降,切到 256K 后有一次小跳变再持续下行;红色是学习率曲线,256K 阶段开始衰减。
🧠 MDP Mid-Training:让小模型在预训练就学会"做决策"
这是整篇报告里我认为最值钱的设计。
常规的 agentic 训练是后训练阶段的事:先训好基座,再用 SFT/RL 教它调工具。ZGCM-1 把这个过程前置了——在 mid-training 阶段就把通用交互轨迹重构成 MDP 风格的状态条件化下一动作预测样本。你想想看,一条 agent 轨迹本来是"一长串文本",重构之后变成显式的"状态 \(s_t\) → 动作 \(a_t\)"转换序列,监督信号从"续写下一个 token"变成了"给定当前状态,预测下一步该干什么"。
关键在两个细节上。其一,训练目标仍是全序列因果语言建模,不是 SFT 那种只监督 assistant 部分——完整轨迹上下文保留,同时局部决策拿到了更稠密的逐步监督。其二,软件工程类轨迹做了 execution-aware filtering,只留那些包含真实规划、工具调用、迭代修正的完整交互。
数据质量治理也值得一说:每个数据族的处理配方都走一条"AI 驱动的自迭代"流水线——规则过滤 → 强模型审计 → 失败挖掘 → 人工抽查 → 脚本修订 → 留出验证。

图4:数据治理八步流水线。源数据路由后做分层采样和基线规则过滤,然后进入"强模型审计—人工抽查—失败挖掘—脚本修订"的循环,最后经留出验证决定接受或拒绝。
坦白讲,MDP 重构这个思路本身不是首创(作者明确引用了 Su et al. 2025 的 agentic continual pre-training),但把它作为 7B 模型的核心支柱、配上完整的数据治理流程跑通 600B token,这个工程量是实打实的。
🔧 后训练:剪一半数据反而更强
SFT 阶段的发现也挺反常识:对候选数据做激进的分层质量过滤,剪掉约 50%,总体效果优于全量训练。质量优先于数量这话人人会说,真敢砍一半的没几个。
另外两个细节值得记。一是 think 与 no-think 联合训练有正向跨模式迁移——结构化推理轨迹的暴露会直接提升 no-think 模式下代码、数学、逻辑推理的准确率,两种模式不是互相抢容量,而是互相喂养分。二是调度策略上,通用数据和 agentic 数据联合交错训练优于"先通用后 agentic"的顺序式两段训练。
不过他们也踩了坑:长 CoT 轨迹比例过高会引入冗长偏差,损害指令遵循能力,混合比例得网格搜索校准。RL 阶段用 GRPO 加动态采样(过滤零奖励方差的组),rollout 最多新生成 65536 个 token。

图5:256K SFT 阶段的 CE loss 曲线,呈阶梯式下降(数据配比逐段切换所致),红色为学习率衰减曲线。64K 阶段曲线形态类似,loss 从 0.6 附近降至 0.33 左右。
📈 实验:同规模第一,还能跟 30 倍大的模型掰手腕
看数据。同规模对比里,ZGCM-1-7B 在 14 个推理基准上平均排名第一:

图6:排名热力图。ZGCM-1-7B 平均排名 2.43 居首,Qwen3-8B-Distill 2.57、MiniCPM4.1-8B 3.00 紧随其后。细看单项,ZGCM-1 在 AGIEval SAT Math、AIME 2026、HMMT 2025、HMMT 2026、MATH-500、ARC-AGI-1 六项上排名第一。
几个硬数字:MATH-500 拿 97.13 分,AIME 2026 拿 75.00 分(同档最高的 Qwen3-8B-Distill 是 69.17),HMMT 2025 拿 70.42 分(第二名 61.50,拉开近 9 个点)。HMMT 这种竞赛级题目上的差距,比 MATH-500 这种接近饱和的榜更能说明问题。
真正让人坐直的是 agentic search 这张表:
| 模型/系统 | WebWalkerQA | BrowseComp | GAIA text-only |
|---|---|---|---|
| ZGCM-1-7B | 63.09 | 19.43 | 42.52 |
| Qwen3-235B-A22B | 59.60 | 2.30 | 45.60 |
| Kimi-K2 | 63.00 | 14.10 | 57.30 |
| Claude 4 Sonnet | 61.70 | 12.20 | 68.30 |
| GPT-4o | 33.80 | 1.90 | 34.60 |
| GPT-5 | – | 54.90 | 76.40 |
7B 模型在 WebWalkerQA 上反超 235B 的 Qwen3,BrowseComp 上压着 Kimi-K2 和 Claude 4 Sonnet 打。说实话看到这个数我愣了一下,又回去核了一遍原文表格,没抄错。当然也得泼点冷水:GAIA text-only 上它还是明显落后于 Kimi-K2 的 57.30 和 Claude 的 68.30,GPT-5 在 BrowseComp 上的 54.90 更是另一个量级。所以这个"越级"是特定赛道上的,不是全面碾压——论文自己也只说 "competitive",用词是克制的。
还有一项他们自建的基准 Binary Function Search:给一个 stripped ELF 二进制和一段行为描述,模型通过 Ghidra 接口交互,找出目标函数的入口地址。评测集 50 题来自 10 个训练中完全留出的开源项目(tmux、XZ Utils、libgit2 这些)。

图7:BFS 的四阶段流程——任务设置(Ghidra 预处理)、候选探索(枚举过滤函数、搜字符串和字节)、证据精炼(反编译、查调用关系)、提交验证(与隐藏 oracle 比对入口地址)。下方是可用的 Ghidra 命令集。
结果:ZGCM-1-7B 对 31/50,准确率 62 分,持平 Kimi-K2,离 GLM-5.1 的 66 分差两题,而 Qwen3-8B 只有 12 分,其余同规模基线基本挂零。这个任务对长上下文工具交互的要求极高,7B 能打到这个水平,MDP mid-training 的功劳大概率跑不掉。
🤖 AI 原生研发:研究员指挥 agent 集群做模型
最后聊个"彩蛋"性质的部分:整个模型的研发流程本身就是 agent 驱动的。每个研究员指挥几十 agent,覆盖数据工程、架构设计、实验监控、 infra、评测、部署全生命周期。

图8:AI 原生研发模式。上方研究员通过对话、会议、决策沉淀人类上下文;中间每个研究员指挥各自的 agent 集群;下方 agent 参与数据、架构、学习算法、实验监控、基础设施、评测、部署七个环节;右侧是 Agent Harness(上下文/技能/工具/记忆/编排/验证)与经验沉淀(脚本、工作流、清单、调试历史)。
作者给各环节评了自主性等级,结论挺诚实:实验监控、部署这类运营型任务能到 L4 高度自主,但架构设计、学习算法设计只有 L2,99 个评分里只有 1 个 L5。换句话说,agent 目前是个极好的"研发副驾驶 + 运维工",还不是研究员。这个自我评估比那些鼓吹"AI 全自动做研究"的叙事可信得多。
💡 我的判断
这篇报告真正的价值不在某个单点创新,而在于把"高效训一个强 7B"这件事的全部账单摊开了:架构选型的消融数据、4.2 倍加速的逐项分解、数据配比图、SFT 剪枝比例、运维踩坑,再加上全量开放的权重、checkpoint、代码和 W&B 日志。摘要里说的八条经验发现——架构扩展、SFT 质量剪枝、长上下文泛化、agentic 协同训练这些——基本都有实验撑着,不是凑数的"贡献列表"。
要挑毛病的话也有几处。知识类基准是它的明显短板:MMLU 只有 73.88,被 Qwen3-8B 的 85.40 拉开 11 个多点,GPQA-Diamond 也输 12 个点——这恰好印证了"小模型别拼记忆"的前提,但也意味着它不是个通用模型,是个严重偏科数学和 agentic 的"特长生"。GAIA 上与前沿大模型的差距也说明 agentic 能力还没到全面越级的程度。另外 BrowseComp 这种榜上 19.43 虽然赢了同场对手,绝对值其实不高,这个基准本身的区分度和噪声都值得关注。
但如果你手头只有单卡或几张卡的预算,想搞清楚 2026 年一个 7B 模型的 SOTA 配方长什么样,这份报告几乎是现成的答案。MDP mid-training 和"SFT 剪一半反而更强"这两条,我觉得会被不少团队抄走。
如果你也在做小规模模型或者 agentic 训练,这套配方值得从头到尾过一遍——反正他们连 W&B 日志都给你了。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我