数据标注还能再被动一点吗?这篇论文想让数据自己"裁"出来

当所有人都在卷模型架构和 RL 算法的时候,有一帮人退回到了最上游——他们问的问题是:你喂给模型的那堆原始视频、GUI 操作日志、机器人轨迹,到底是怎么变成训练数据的?

核心摘要

我们这几年默认了一件事:高质量数据是靠"标注"出来的——要么写一堆启发式规则去采样、切片,要么直接把视频丢给一个通用 VLM 让它生成字幕和问答对。这套流程被动、单调、还贵。更要命的是,它根本榨不出原始数据里那些藏得很深的过程性逻辑。

这篇论文(arXiv:2606.21337,DataClaw₀)做的事情,是把"数据处理"本身重新定义成一种可以被学习、可以被强化训练的高阶能力。他们管这个新范式叫 Agentic Data Tailoring(智能体数据裁剪)——给定一个用户意图或者下游训练目标,让一个裁剪智能体主动去过滤冗余、定位关键证据、按 schema 重组成高密度监督信号。

为了训这种能力,他们设计了"确定性事实锚点提取 + 生成式语义合成"的两阶段数据流水线,覆盖日常生活、教育、具身智能、世界模型、GUI 五大领域;模型层面用 SFT + GRPO 把一个 9B 的多模态模型训成专门做数据裁剪的 DataClaw₀;评测上既造了首个数据裁剪基准 DataClaw₀-val,又干脆把"下游后训练效果"当成终极试金石。结果是:用 DataClaw₀ 裁出来的数据训下游模型,在 GUI 导航的任务成功率、视频生成的 FVD、VQA 的整体准确率上,能打平甚至超过 Gemini-3.1-Pro 这种顶级闭源 VLM。

我的判断先放这儿:这篇论文最值钱的地方不是那个 9B 模型,而是它把"数据生产"从一个工程脏活,重新框定成了一个值得用 RL 去优化的、可量化的能力问题。这个视角本身就有点东西。


论文信息

  • 标题:DataClaw₀: Agentic Tailoring Multimodal Data from Raw Streams
  • 作者:Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong
  • arXiv:2606.21337(v1, 2026 年 6 月 19 日提交)
  • 方向:cs.LG / cs.AI
  • 项目页:https://czjdsg.github.io/MakeAnyData

为什么要做这件事:原始数据的"熵"太高了

先聊聊动机,因为这块其实是整篇文章立论的根。

物理世界和数字世界每天在产出取之不尽的原始多模态流——几个小时的教程视频、机器人的具身轨迹、Web 和 GUI 的操作日志。理论上这些都是金矿。但你真去挖就会发现,这些流跟那些精心整理过的图文对完全是两个物种。

论文用了一个词来概括这个障碍:data entropy(数据熵)。原始流天生就是噪声大、高度冗余、弱结构化的。它里面塞满了物理动态、过程性知识、隐式的决策逻辑,但偏偏缺少高效知识获取或者高质量后训练所需要的那种明确监督信号

说白了——不对,换个说法,问题在于:信息密度极低,而且关键信息被埋在大量无关帧里。

那现在大家怎么处理?论文把现有做法归为"被动标注范式":启发式采样、粗粒度字幕、或者直接 prompt 一个通用 VLM 去生成 caption 和 QA。这套东西对付短的、精选过的输入还行,但碰到那种需要时间推理、时空一致性、隐式物理理解的长噪声流,就开始露怯——产出的东西要么是幻觉,要么是碎片化的,要么信息密度低得可怜。

我自己之前做过类似的视频数据清洗,深有体会。你让一个通用 VLM 去给一段 5 分钟的操作视频生成训练样本,它给你的东西经常是"一个人在厨房里做菜"这种正确但毫无价值的废话。真正值钱的——"他在第 47 秒发现油温不够,又等了 15 秒才下锅"这种过程性决策——它根本抓不到。

这就是 Agentic Data Tailoring 想解决的痛点。


核心思想:把数据裁剪当成一种可学习的能力

论文的核心动作,是把高质量数据生产重新定义成一种可学习的高阶能力

它给出的形式化是这样的:输入是原始多模态流 \(X_{raw} = \{x_1, x_2, \dots, x_T\}\),外加一个意图指令 \(I\)(用户的高层目标或下游任务需求)。目标是产出一个定制化的结构化知识资产 \(Y_{struct} = \{y_1, y_2, \dots, y_L\}\),而且这个产出必须严格符合预定义的 schema \(\Phi\)(特定的 JSON 格式、Markdown 语法或者动作代码逻辑)。

优化目标长这样:

\[\theta^* = \arg\max_\theta \sum \log P(Y_{struct} \mid X_{raw}, I; \theta) \cdot \mathbb{I}(Y_{struct} \in \Phi)\]

那个指示函数 \(\mathbb{I}(\cdot)\) 是关键——只有当输出真的符合 schema \(\Phi\) 时才算数,否则直接归零。这其实已经在暗示后面 RL 阶段的格式奖励设计了。

注意一个细节:\(T \gg L\)。也就是输入帧数远远大于输出长度。这意味着裁剪智能体必须干两件事:

  • 信息过滤与聚焦:基于意图 \(I\)\(X_{raw}\) 里的冗余背景噪声扔掉。
  • 结构重组:保证产出的 \(Y_{struct}\) 不仅语义对,还得严格守格式。

跟通用的数据整理或者合成指令生成比,Agentic Data Tailoring 的差异点在于它聚焦于意图条件下的熵约减——在连续的多模态流上,按着意图把熵压下去。这个定位我觉得是清晰的。

图1:DataClaw₀ 的代表性裁剪案例

图 1:几个代表性的裁剪案例。每个面板顶部是原始输入片段,接着是用户 Intent(指定要构造什么)。DataClaw₀ 在 Task 下挑出任务相关的视觉证据,formulate 出对应的 Question,再把解法拆成一串带对齐图像和文本推理的中间 Steps,底部给出最终的结构化结果——包括 Answer 和保留/重建后的 Video Output。你能直观看到,它不是在"描述"视频,而是在"重组"视频成监督信号。


数据从哪来:两阶段流水线 + 五大领域

训这种高阶能力,最大的拦路虎是数据稀缺——你上哪儿去找现成的"数据裁剪示范"?论文的解法是自己造一个大规模数据集,方法是一套"自底向上提取 + 自顶向下合成"的两阶段流水线。

第一阶段:确定性事实锚点(Factual Anchors)提取。 用轻量级的领域专家、元数据解析器、启发式规则,从原始流里抽出确定性的低层 grounding——对象状态、时间边界、OCR 文本、GUI 交互事件这些。形式化为:

\[A = H(X_{raw}) = \{a_k = (t_k, p_k, c_k)\}_{k=1}^{K}\]

每个锚点记录时间戳 \(t_k\)、空间位置 \(p_k\)、局部语义内容 \(c_k\)。这一步的意义在于——它是确定性的、可靠的。后面合成阶段再怎么放飞,这些锚点是钉死的事实底座。

第二阶段:生成式语义合成(Generative Semantic Synthesis)。 让一个强 VLM 合成引擎 \(S\) 在原始输入、提取出的锚点、领域意图三者之上做长程逻辑链接,注入受多模态思维链启发的多维推理痕迹:

\[Y_{struct} = S(X_{raw}, A, I_{domain})\]

这个"底层抓事实、顶层做合成"的组合拳,我觉得是这篇论文工程上最聪明的地方。纯靠 VLM 合成会幻觉,纯靠规则提取又死板没逻辑。把确定性锚点当作合成的约束,相当于给放飞的 VLM 拴了根绳。

覆盖的五大领域是:日常生活(Daily Life)、教育(Education)、具身智能(Embodied AI)、世界模型 / AIGC(World Models)、GUI 智能体(GUI Agents)。每个领域有自己代表性的意图类别和输出结构:

领域 代表性意图 典型输出结构
GUI Agents UI 动作抽取 带坐标的有序动作 JSON
Embodied AI 机器人恢复推理 故障诊断、纠正轨迹
World / AIGC 视频生成规划 prompt、运动规划、关键证据帧
Daily Life 过程性知识抽取 分步推理与问答
Education 讲座摘要 关键概念、图文交错

图2:DataClaw₀ 整体流水线概览

图 2:整体流水线。左半部分是数据构造——从原始多模态流自底向上提取 factual anchors(关键帧、步骤、动作、轨迹、场景),再结合领域意图由强 VLM 做自顶向下的语义合成,产出跨五大领域的结构化数据。右半部分是模型训练的两种范式:用混合领域数据训的 omni 模型,和按领域子集训的 expert 模型。推理时,用户意图要么直接走 omni 模型,要么路由到对应的领域专家。


模型怎么训:SFT 打底,GRPO 拔高

DataClaw₀ 基于一个 9B 的开源多模态模型初始化(论文用的是 Qwen3.5-9B),SFT 和 GRPO 协同上阵。

部署上给了两套架构,这点挺有意思:

  • DataClaw₀-O(Omni):跨所有领域联合训练的统一模型,图个简洁通用。
  • DataClaw₀-E(Expert):一组解耦的、领域专属的裁剪智能体,专精强、模块化好扩展。

SFT 阶段用 34K 条严格清洗过的指令裁剪数据,只训 1 个 epoch。重头戏在 GRPO 的奖励设计,三个信号:

\[R(Y) = \lambda_1 R_{format}(Y, \Phi) + \lambda_2 R_{anchor}(Y, A) + \lambda_3 R_{eff}(Y)\]

Format Compliance Reward。 用 AST 或正则解析器,严格验证生成内容是不是 100% 符合目标 schema。能成功解析给高正奖励,结构或语法一错就立刻截断惩罚。这个直接呼应了前面优化目标里那个指示函数——格式不对,一切免谈。

Spatio-Temporal Anchor Reward。 这是给具身和视频任务用的。它测的是预测轨迹和真实轨迹的"时间形状相似度":把离散帧索引归一化、插值重采样到 \(K=50\) 个对齐点,算 MAE 得到轨迹偏差 \(d_{shape}\),再做指数映射:

\[R_{anchor} = \exp(-d_{shape} / \tau_s), \quad \tau_s = 0.10\]

Reasoning Efficiency Penalty。 动态长度正则。在每个 GRPO rollout 组里,找出整体奖励排名前 50% 的 rollout,把它们的 CoT 长度当参考标准,对明显更长或更短的序列做惩罚。说实话这个设计挺务实——既防止模型偷懒写太短,又防止它为了凑奖励灌水。

超参方面:\(\lambda_{fmt}=0.7\)\(\lambda_{anc}=1.0\)\(\lambda_{eff}=0.3\),学习率 \(4\times10^{-6}\),8 张 A100。优势估计走标准的组内相对归一化 \(\hat{A}^{(g)} = (R^{(g)} - \mu_R)/\sigma_R\),加 clipped 目标和 KL 正则。这套 GRPO 配方没什么花活,规规矩矩,但奖励设计是真的为"数据裁剪"这个任务量身定做的。


怎么评测:先造基准,再用下游任务当终审

评测这块论文做了两层,我觉得第二层才是真正的杀手锏。

第一层:DataClaw₀-val 基准。 通过多样性感知采样选 200 个高质量样本,覆盖五个场景。每个实例四件套:多模态输入、裁剪意图、目标 schema、参考输出。评分用分层度量:

\[S_{total} = G_{json} \cdot (\lambda_1 S_{field} + \lambda_2 S_{semantic} + \lambda_3 S_{traj})\]

那个 \(G_{json} \in \{0,1\}\) 是硬性门控——JSON 无效直接 0 分,没得商量。三个维度权重 \(\lambda_1=0.20\)(Field 字段完整性)、\(\lambda_2=0.35\)(Semantic 内容正确性)、\(\lambda_3=0.45\)(Sequence 排序结构一致性)。还有个 DataClaw₀-Intent 子集,专门做模糊意图压力测试——给一个欠规范的请求比如"帮我设计一个数据构造的例子",看模型能不能自己推断目标,最终靠 100 名用户做 user study 评判。

第二层:下游后训练当终极试金石。 这是我最欣赏的设计。基准分数再高也只是中间指标,真正要回答的是——用你裁的数据训下游模型,到底有没有用?论文搞了个统一裁剪协议:同一批原始流,分别用基座模型自处理(Self-Refinement)、Gemini-3.1-Pro、DataClaw₀ 三种标注器处理,走同样的过滤管道,采样等量有效实例,然后训下游模型比效果。

三个下游任务:GUI 导航(数据集 AgentNet,基座 Qwen3.5-4B,看 SSR / TSR)、动作视频生成(Ego4D,基座 Wan2.2-I2V-5B,看 FVD / 时间一致性 / Contact mAP)、时空 VQA(ReMoT,基座 Qwen3.5-4B,看 Partial / Overall Acc.)。


实验结果:跟 Gemini 打成平手,端到端指标还更优

先看最关键的下游应用结果(Table 2):

SFT 数据来源 GUI SSR↑ GUI TSR↑ Video FVD↓ 一致性↑ Contact mAP↑ VQA Partial↑ VQA Overall↑
零样本基座 12.4 1.2 385.2 68.4 18.5 28.3 9.8
基座自处理 16.8 3.5 362.1 69.1 24.2 33.5 14.2
Gemini-3.1-Pro 处理 39.5 14.2 295.4 76.2 48.5 53.4 31.5
DataClaw₀ 处理 38.2 15.6 288.6 75.8 51.2 52.1 33.2

这张表信息量很大。先看基座自处理那一行——相比零样本只有相当有限的提升,这恰好坐实了前面"被动标注榨不出价值"的论点。

然后看 DataClaw₀ vs Gemini。这是一个 9B 模型对一个顶级闭源大模型。结果是打了个有意思的平手:Gemini 在步级 / 部分指标上略优(GUI SSR、VQA Partial Acc.),而 DataClaw₀ 在端到端指标上反超(GUI TSR 任务成功率、VQA Overall 整体准确率、视频 FVD、Contact mAP)。

这个 trade-off 我觉得值得品。步级指标好说明 Gemini 单步标注更准;但端到端指标好说明 DataClaw₀ 裁出来的数据在任务全局上更连贯——它真正学到了那个"过程性逻辑",而不只是把单帧描述准。对于训下游 Agent 来说,后者其实更重要。

再看主基准 Table 1(节选 Overall 列):DataClaw₀-E 的 Field 得分 97.53,跟 Gemini-3.1-Pro(98.12)、GPT-4o(97.27)三家咬得很紧;在具身域和模糊子集的 Sequence 指标上甚至拿了最佳(71.60 / 50.31)。而 DataClaw₀-E 对 DataClaw₀-O 是全面碾压——Field 97.53 vs 87.65、Semantic 74.94 vs 62.46、Sequence 48.86 vs 44.82,专家路线的专精优势很明显。

不过得说句公道话:GPT-4o 的整体 Semantic 还是最高的(75.15),略微压过 DataClaw₀-E(74.94)。论文没藏着,这点我给好评。

图3:数据混合分布与缩放行为

图 3:左边是构造样本的领域和子任务分布,右边是 DataClaw₀-E 与 DataClaw₀-O 的缩放曲线对比,以及 t-SNE 可视化。这张图其实暴露了一个很有意思的现象——往下细说。

消融实验:锚点奖励有用,专家路由是命门

奖励设计消融(Table 3a,用 10% SFT 初始化):

变体 Field Sem. Seq.
最小初始化 82.50 36.79 45.40
仅 SFT 100.00 82.54 70.83
GRPO 去掉 R_anchor 100.00 83.32 70.11
GRPO 带 R_anchor 100.00 82.36 71.96

R_anchor 把 Sequence 顶到了 71.96,证实显式时空 grounding 确实有用。但坦白讲,提升幅度不算大(70.11 → 71.96,不到 2 个点),而且带 R_anchor 后 Semantic 反而掉了一丢丢(83.32 → 82.36)。这说明锚点奖励主要在管"排序结构对不对",对语义内容帮助有限。

专家路由消融(Table 3b)就刺激多了:

域(专家) Field Sem. Seq.
Embodied(用 GUI 专家) 0.00 0.00 50.00
Embodied(用 Emb 专家) 96.50 74.21 63.48
GUI(用 GUI 专家) 100.00 84.93 76.41
GUI(用 Emb 专家) 0.00 52.55 0.00

看到那两个 0.00 了吗?路由错了,性能直接崩盘。这其实是 Expert 范式的一把双刃剑——专精强,但前提是路由器得选对专家,选错就是灾难。

图4:定性对比

图 4:左边机器人操作数据构造,右边 GUI 任务重建。对比通用 MLLM 和 DataClaw₀-E 的输出,红叉是无效/不完整的裁剪,绿勾是正确的结构化输出。通用 MLLM 经常给出格式残缺的结果,这正是那个硬性 JSON 门控想卡掉的东西。


我的判断:视角很值钱,但有几个地方得打问号

聊聊我看完的真实感受。

先说亮点。 这篇论文最打动我的,是它把"数据生产"这件长期被当成脏活累活的事,重新框定成了一个可学习、可量化、可用 RL 优化的能力问题。这个 reframing 本身就有价值。再加上"确定性锚点 + 生成式合成"的组合拳,以及把下游后训练效果当终极评判标准——这套方法论是站得住的。一个 9B 模型在数据裁剪这个特定任务上打平 Gemini,已经足够说明问题。

但有几个地方我得皱眉。

第一,Omni 模型的 scaling 行为有点诡异。附录 D.1 提到 DataClaw₀-O 随数据量增加出现严重震荡——1/15 数据时 53.60,7/15 时骤降到 47.23,12/15 时又反弹到 57.84,然后再掉。这种非单调的、剧烈波动的缩放曲线,通常暗示训练不太稳定或者领域间存在干扰。论文用 Expert 集成(稳定在 68.86)绕过了这个问题,但 Omni 为什么这么飘,我觉得解释得还不够透。

第二,Expert 路由的脆弱性。Table 3b 那两个 0.00 太刺眼了。现实里那个路由器本身也是要学的、会出错的,一旦路由错误就是断崖式崩溃,这在生产环境里是个不小的隐患。论文没怎么展开讨论路由器本身的鲁棒性。

第三,最根本的一个隐患——论文自己在附录 E.2 诚实地报了个失败案例:构造样本的语义是对的(问怎么从工位走到床边,答案也对),但 CoT 描述视频"从工位移向床",而实际输入帧的时间顺序是反的(从床到工位)。这是典型的 temporal hallucination(时间幻觉),根源在基座模型的推理先验。

这个案例其实戳到了整个范式的软肋:你用一个会幻觉的 VLM 当合成引擎去"裁剪"数据,那裁出来的数据本身就可能带着幻觉,再拿去训下游模型——幻觉会不会被放大、被固化?确定性锚点能挡住一部分,但显然挡不住这种时序层面的推理幻觉。这是个值得继续追的问题。

对工程的启发。 如果你也在做多模态数据流水线,这篇论文至少给了两个能直接借鉴的点:一是"确定性锚点约束 + 生成式合成"这个组合,能有效压制纯 VLM 合成的幻觉;二是 GRPO 那个硬性格式门控 + 时空锚点奖励的设计,对任何"输出必须符合 schema"的结构化生成任务都通用。至于要不要上 Expert 范式,得看你的领域路由器靠不靠谱——这是个权衡。

总的来说,arXiv:2606.21337 这篇论文给出的不是一个终极方案,而是一个有说服力的新视角和一套能跑通的 baseline。它最大的贡献,是让"数据处理"这件事第一次像模型训练一样,有了可以被优化的目标函数。这个方向,我觉得会有人接着往下做。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我