不搭 Agent 平台,13 个技能让 Claude Code 从点子直接干到论文
你有没有想过一个问题:AI Scientist 那类"全自动科研系统"看起来很美好,但每个都是一套独立平台——自己的调度层、自己的数据库、自己的基础设施,部署一次就够你喝一壶。而我们日常真正干活的地方,其实是 Claude Code、Cursor 这类编码助手。文件读写、代码执行、联网搜索、工具调用,这些能力助手本来就有。那能不能不造新轮子,直接把"从 idea 到完整论文"这条链路拆成一堆技能,塞进现有助手里跑起来?
这篇 Spark-to-Paper 给出的答案是:能,而且只要 13 个可组合技能。
核心摘要:Spark-to-Paper 把端到端论文生成实现为编码助手内部的 13 个可组合技能,不需要任何独立的 Agent 平台或编排服务。它的关键设计是把"模型判断"和"确定性操作"分开——模型负责需要推理的决策,代码负责可以机械验证的操作;同时把实验规划和实验报告分开,论文需要哪些证据在跑实验之前就定死。效果上,8 个受控研究主题下做到 99.5% 的引用有效率 和 96.4% 的图可编辑率,编造检测率从单遍生成的 14% 拉到 92%,每篇论文成本 8.1 美元、耗时 3.2 小时。我的判断:这不是底层技术突破,而是一套非常扎实的工程整合,但它踩中了一个真痛点——科研自动化的"最后一公里"其实是可靠性,不是生成能力。
论文信息
- 标题:Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
- 作者:Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng, Jin Jiang, Junsheng Zhang, Wenhao Wang(前两位为共同一作,Wenhao Wang 为通讯作者)
- 机构:Vast Intelligence Lab, University of Technology Sydney
- 链接:https://arxiv.org/abs/2608.11924
- 代码:https://github.com/Spark-To-Paper-Skills/spark-to-paper-skills
- 提交日期:2026 年 8 月 12 日
🎯 问题:科研自动化为什么总是"另起炉灶"
把研究想法变成一篇完整论文,远不止"写文字"这一件事。要检索文献、设计并跑实验、根据证据修正论断、画出能发表的图,还要在漫长的生成过程中保持前后一致。
目前这条路上有两拨玩家,各自缺一条腿:
| 阵营 | 代表系统 | 端到端 | 跑真实验 | 画图 | 可编辑矢量图 | 无需常驻基础设施 |
|---|---|---|---|---|---|---|
| 自主科研 Agent | AI Scientist / v2 | ✓ | ✓ | ✓ | – | – |
| 自主科研 Agent | AutoResearchClaw | ✓ | ✓ | ✓ | – | – |
| 自主科研 Agent | Kosmos / Robin | ⚫ | ✓ | ⚫ | – | – |
| 轻量技能工具 | Idea2Story | – | – | ⚫ | – | ✓ |
| 轻量技能工具 | ARS | ⚫ | – | – | – | ✓ |
| 轻量技能工具 | CycleResearcher | ⚫ | ✓ | – | – | – |
| 本文 | Spark-to-Paper | ✓ | ✓ | ✓ | ✓ | ✓ |
表 1:与直接相关系统的能力对比。✓ 完整支持,⚫ 部分支持,– 不支持或未公开。可以看到 Spark-to-Paper 是唯一把五个维度全打勾的系统——当然,这是作者基于各系统公开文档做的自我评估,不是实测 benchmark。
左边一拨(AI Scientist、Kosmos 这些)能力全,但每个都是独立应用,要自己养一套编排服务,有的还要图数据库、集群调度器。右边一拨(Idea2Story、ARS)倒是轻量,直接住在编码助手里,但做不了真实验,也产不出可编辑的矢量图。
说实话,我对"五个维度全打勾"这种自我定位表向来保持警惕——坐标是作者自己评的,天然有美化嫌疑。但撇开这张表,论文的机制设计确实是实打实写出来的,这个后面细聊。
🏗️ 方法:13 个技能,一条流水线
Spark-to-Paper 的核心想法用一句话说:技能只管定义做什么和必须满足的约束,怎么做交给助手根据项目状态现场决定。这跟把系统行为编码成细粒度 Agent 图(每个动作、每次跳转都要预先指定)是完全两种思路。流水线只规定高层顺序,具体执行路径由助手根据项目当前状态现场决定。

图 2:系统执行总览。Stage 0 做输入路由,决定走 Proposal Mode 还是 Data-Aware Mode;Stage 1-7 是每次都跑的核心流水线(规划→引用→写作→润色→评审→画图→组装),每个阶段后面都挂一个确定性 gate;Stage 8 是条件触发的实验执行;右下角是质量评估的四个机制。
整条流水线拆开看:
Stage 0 输入路由。系统先看用户给的是什么:一句话 idea 就先扩成结构化 proposal;成熟的 proposal 直接进流水线。更关键的是判断有没有真实验数据——没有就走 Proposal Mode,没观测到的数值必须留空,禁止编;有就走 Data-Aware Mode,论文里每个定量论断都必须能被数据支撑。这个模式会贯穿后续所有阶段。
Stage 1-7 核心流水线。规划(产出论文蓝图 blueprint)、引用(检索并用 DOI/arXiv 元数据逐条验证,存成 BibTeX)、写作(基于蓝图和验证过的文献生成 LaTeX)、润色(整篇级别去重、统一术语)、评审(多个独立视角挑刺)、画图(第 6 节细说)、组装(按目标会议模板拼成完整 LaTeX 工程并编译)。
Stage 8 实验执行。初稿完成后,如果论文计划的实验在现有代码和数据下可行,就真跑。跑完用测量结果回填表格和图,并同步修订摘要、引言、实验、结论里的论断。资源不够就留空,绝不生成假数字。
所有技能之间靠共享项目目录里的持久化产物通信:blueprint.json(论文结构)、refs.bib(验证过的文献)、claims_map.json(论断-引用映射)、results.facts.json(有依据的定量证据)、logs/*.io.md(每个阶段的输入输出记录)。这个设计我很喜欢——没有消息总线,没有状态服务,文件就是接口,出问题了打开目录就能查。
工程实现上,整套东西跑在 Claude Code 里,用 Claude 系列模型。作者特意声明设计不绑定 Claude Code——任何能读文件、用工具、执行代码的助手都能承载同样的技能设计。这话我信一半,毕竟技能里的提示词和 gate 阈值大概率是针对 Claude 调过的。
🔬 最值钱的设计:先承诺要什么证据,再跑实验
这部分是我觉得全文最有想法的地方。
科研造假(包括 AI 科研造假)有个经典手法:先看实验结果,再回头改实验设计,让数据"刚好"支撑结论。Spark-to-Paper 的对策是把实验规划和实验报告彻底分开:
- 执行前,规划阶段就把数据集、baseline、指标、消融、结果表格结构全部定死。表格框架固定,数值格子留空——这相当于在流水线内部做了轻量级的预注册。
- 实验阶段只负责填补"证据缺口",跑的是解决这些缺口所需的最小实验集,不是按通用模板把所有能跑的实验都跑一遍。
- 一个数字想进论文,必须能追溯到数据集、模型配置、随机种子、指标定义和原始输出。追不到源头的,一律不准进。
- 跑完之后,系统重新评估论文里的每个论断,打五种标签:supported、partially-supported、unsupported、contradicted、needs-confirmation,分别对应保留(措辞与证据匹配)、收窄、补实验或弱化或删除、移除或写进 limitations、退回给作者确认。
还有一条规矩特别戳我:阴性、无效、不确定的结果必须保留,不许省略。整体叙事允许因为实测证据而"变弱"。你想想看,多少 AI 生成的论文是反过来干的——先把牛吹出去,再让数据将就叙事。
声明准入协议里有个细节:修订会传播到论断出现的所有位置。摘要放在最后改,保证它反映的是全稿最终的论断强度。这个顺序安排很懂论文写作的坑——多少论文摘要吹的牛和正文实际做的实验对不上。
⚠️ 自驳循环:当 AI 死活证明不了自己的假设
论文里命名了一个挺有意思的失败模式,叫 Self-Refutation Loop(自驳循环)。
场景是这样的:系统带着一个研究假设出发,设计实验去验证,结果证据不足。正常系统会修方法、改设计、再跑一轮。但有时候新证据还是不足,于是再修、再跑……陷入"实验-批判-修订"的死循环。注意,这跟正常的迭代改进不一样——健康的迭代每轮都在解决具体弱点、逼近清晰结论;自驳循环是系统反复得出"我自己的结果不支持原始假设",却死活不肯承认这个 idea 可能就是不 work。
说实话看到这段我愣了一下,因为这个问题在人类研究生身上也太常见了——一个方向做不出来,导师让换,自己偏要再试一次,再试一次。
Spark-to-Paper 的处理方式简单粗暴但清醒:循环上限 7 次。7 轮之后原始研究目标还是立不住,这条轨迹直接终止,把原始 idea、试过的方法、观测结果、证据不足的原因写成一份失败报告存档,然后换一个 idea 重跑整条流水线。失败报告被当作一种正式的研究产出,而不是被改写成"看起来成功"的论文。
不强迫每个研究想法都成功——这个姿态在当下的 AI 科研系统里相当罕见,大部分系统的隐含假设都是"必须给你交付一篇看起来像模像样的论文"。
🛡️ 质量保证:硬约束走代码,软判断走模型
长程生成会出两类错。一类是显性可机检的:引用断了、图丢了、编译挂了、没数据支撑的数值冒出来了。另一类是语义层面的:早期论断和后期证据打架、论证跨章节漂移。Spark-to-Paper 分而治之。
确定性 gate 管第一类,一共六道:Template Gate(会议模板结构)、Blueprint Gate(蓝图合规)、Citation Gate(文献完整性,DOI/arXiv 逐条解析)、Manuscript Gate(结构 + 结果完整性,Proposal Mode 下出现未观测数值直接毙)、Figure Gate(定量图必须有测量数据依据)、Compilation Gate(LaTeX 必须编译通过,且修复有界,不许无限修)。每个阶段过完自己的 gate 才能往下走。作者把话说得很明白:这些 gate 只管能无歧义验证的属性,不管"这个贡献重不重要"这种需要品味的判断。
模型自批判 管第二类,分两层。Self-Review 在每次编辑后局部跑,修术语漂移和局部不一致;Adversarial Review 在整篇层面跑,多个隔离的评审通道从理论严谨性、实验设计、系统有效性等不同视角挑刺。每条评审意见必须引用具体段落,然后从三个方向被复核:问题是否真实存在、是否已在别处被回应、是否超出论文声明的范围。能被驳倒的意见直接丢弃,存活下来的才送回修订。评审迭代到"新一轮挑不出新存活问题"为止。
这个"意见必须可被驳倒"的设计挺讲究——LLM 评审最大的问题就是为了挑刺而挑刺,先让意见过一遍反驳检验,能把大量无效 critique 挡在门外。74% 的评审精确率(57 条意见里 42 条被盲评确认为真实问题)说明这套过滤确实在起作用,虽然离"意见基本靠谱"还有距离。
🖼️ 图片生成:定量图走代码,示意图走"生成再重建"
AI 生成论文的图一直是个尴尬点:文生图模型画出来的架构图是张位图,投出去之后想改个箭头位置都没法改。Spark-to-Paper 按图的角色分两条路。

图 4:图片生成双通道。上方绿色通道:实验结果图直接从测量数据写绘图代码,导出原生矢量 PDF,数值始终绑定实测记录。下方紫色通道:方法示意图先用图像生成模型产一张位图作为"视觉目标",再用代码以 HTML 重建(可编辑文本、形状、连线、布局),迭代渲染-对比-调整直到重建可靠,导出矢量 PDF;重建不可靠就回退保留位图。
定量图(性能对比、消融、趋势)坚决不用生成模型——直接读实验输出写绘图代码,导出矢量 PDF。示意图(方法架构、系统框图)则玩了个"曲线救国":先让图像生成模型产一张位图,但这张图只当视觉规格说明书,不当最终产物。然后系统用编码能力把这张图用 HTML 重建出来——文本、形状、连线全是可以编辑的元素——再渲染对比、迭代修正,最后导出矢量 PDF。
这个思路挺巧的。它把生成模型擅长的"视觉设计"和代码擅长的"结构化可编辑表达"拼在一起,生成图是靶子,代码重建才是交付物。约 1900 个图元素上测出 96.4% 的可编辑率,作为对照,AI Scientist 发布的论文里图的可编辑率是 0%(210 个图元素全是位图),连人类写的预印本抽样也只有 58%。
📊 实验:数据说话
主实验在 8 个外部选定、预注册的研究主题上跑全套系统,其中 3 个主题额外跑单遍基线做配对比较。引用有效性统计了系统产出论文的 384 条引用,人类对照组是 8 篇抽样预印本的 320 条引用。
| 系统 | 引用有效率 (%) | 图可编辑率 (%) | Token (M) | 成本 (USD) | 耗时 |
|---|---|---|---|---|---|
| 人类预印本(抽样) | 97.8 | 58 | n/a | n/a | n/a |
| AI Scientist(发布论文) | 93 (42/45) | 0 (0/210) | 未报告 | $10–15(摊销) | 约 12 h/批 |
| AI Scientist-v2(workshop 集) | 91 (58/64) | 3 (0–8) | 未报告 | 约 $20–25/次 | ≤15 h/轮 |
| Agent Laboratory(发布论文) | 96 (27/28) | 0 (0/30) | 未报告 | $2.33(gpt-4o) | 约 19 min |
| 单遍 LLM 草稿(同底座) | 81 (76–86) | n/a | 0.11 | $0.66 | 16 min |
| Spark-to-Paper(全栈) | 99.5 | 96.4 | 11.9 | $8.1 | 3.2 h |
表 3:主对比结果。Spark-to-Paper 的两项质量指标都是最高,且高于人类预印本的抽样水平;代价是 token 消耗比单遍草稿高了约 100 倍。注意先前几行是对各系统公开发布产物的审计,没有重跑这些系统,定价环境也不同,横向比成本要当心。
几个点值得说道。99.5% 的引用有效率超过了人类预印本的 97.8%——这反直觉吗?其实不。人类凭记忆写参考文献本来就爱出错,而这系统是逐条 DOI 验证过的,比人靠谱很正常。真正有意思的是单遍基线的 81%:同一个底座模型,不做检索验证直接写,五条引用里就有一条是编的。这就是幻觉的裸奔状态。
成本账也算得坦白:11.9M token、8.1 美元、3.2 小时一篇。Agent Laboratory 用 gpt-4o 只要 2.33 美元 19 分钟——但人家的引用有效率是 96% 且图完全不可编辑,而且实验深度完全不是一个量级。便宜和可靠,你选一个。
消融实验是全文我最信服的部分。作者往源材料里注入了 36 个固定的"探针"(覆盖 10 类失败模式,比如编造的引用、无数据支撑的数值),然后逐层叠加质量组件看检测率:
| 配置 | 编造检测率 (%) | 评审精确率 (%) | 增量 Token (M) | 增量成本 (USD) |
|---|---|---|---|---|
| 单遍草稿(无 gate) | 14 (5/36) | n/a | 基准 | 基准 |
| 仅 gate | 69 (25/36) | n/a | +8.1 ± 0.9 | +5.3 ± 0.5 |
| gate + 自评审 | 81 (29/36) | n/a | +1.1 ± 0.2 | +0.6 ± 0.1 |
| gate + 自评审 + 对抗评审 | 92 (33/36) | 74 (42/57) | +2.6 ± 0.4 | +1.6 ± 0.2 |
表 4:质量栈消融。编造检测从 14% 一路爬到 92%,其中确定性 gate 贡献了最大的一跳(14%→69%),也是成本大头;自评审和对抗评审用很小的增量成本各再抬一截。
看到这个表我才意识到一件事:最值钱的不是模型评审,是那几道笨笨的确定性检查。从 14% 到 69% 这一跳全靠 gate——也就是"未观测的数值不许出现"这种写在代码里的死规矩。模型自评审只从 69% 抬到 81%。这很符合工程直觉:能用 if-else 解决的问题,别指望 LLM 的自觉性。当然,92% 仍然说明 36 个探针里有 3 个漏网——这套系统远没到"可以撒手不管"的程度。

图 6:案例研究。作者故意往 proposal 里注入两个错误预期:临床筛查场景里把 Accuracy 设为主要指标(类别极度不平衡时的经典陷阱),电力负荷预测场景里预设"因果分解模型性能会打平"。生成论文的实测结果都顶了回来——前者明确指出 Accuracy 和 F1 都具有欺骗性(0.049 患病率下 F1 在 0.5 阈值处崩塌),后者发现因果分解模型明显更差(VMD-GRU 只有 24.1 RMSE)。图中加粗下划线标出的就是被证据推翻的先验预期。
这个案例设计得聪明:它测试的不是"AI 能不能顺着用户说",而是"AI 敢不敢拿实验证据打用户的脸"。能,这是这套证据优先架构的题中应有之义。
🤔 我的判断
先说亮点。这篇论文最打动我的不是某个具体技术,而是一整套把"诚实"做成默认设置的工程哲学:实验设计预注册、数字必须可追溯、阴性结果不许藏、7 轮证伪就认输写失败报告。这些单拎出来都不新鲜——预注册是医学研究的老规矩,确定性校验是软件工程的基本功——但把它们组装进 AI 论文生成流水线,让这个流水线"宁可交付失败报告也不交付假成功",这个系统级的设计决策是有价值的。
再说问题。第一,Table 1 那个"五项全能"的自我定位确实有点讨巧,坐标全是作者自己评的序数判断。第二,成本并不低——8.1 美元、3.2 小时一篇,是单遍草稿的 12 倍价格、12 倍时间,换来的主要是"可靠性"而非"更好的科学"。第三,论断级的证据诊断(这段证据到底支不支撑这个论断)目前还是模型在做,作者也承认这部分无法机检,只是用结构化报告让它可审计。第四,也是最根本的:整套评测度量的是"产物质量"(引用真不真、图能不能编辑、有没有编造),完全没回答"生成的论文科学价值如何"。8 个主题产出的论文有没有一篇能过真实的同行评审?论文没说。这恐怕才是这类系统真正的试金石。
跟同期工作比,AI Scientist-v2 已经在冲 workshop 级投稿,Kosmos 在做开放式科学发现,论"科学野心"它们更大;Spark-to-Paper 的定位更像把一个可靠的生产工具塞进你每天都在用的助手里。两种路线不冲突,甚至互补。
工程上的启发很直接:如果你也在搭长链路 Agent 系统,这篇论文的三板斧可以直接抄——能机检的全写成确定性 gate 别交给模型自觉;需要证据的决策先做承诺再执行;给自我修正循环设硬上限,允许系统体面地认输。第三条尤其反直觉但尤其重要,没有退出机制的"自我改进"循环,跑出来的一定是看起来在改进的灾难。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我