把 166 篇论文和它们的失败一起扔出来:FARS 是怎么跑通全自动科研流水线的

核心摘要

讲个让人有点坐不住的事实:一家叫 Analemma 的 15 人上海初创公司,2026 年 2 月用 160 张 GPU 连续跑了 17 天,让一队 LLM Agent 自动写出了 166 篇完整的 AI 研究论文,覆盖 67 个细方向,全程零人工干预。然后他们做了一件绝大多数同行没做过的事——把过程里所有提案、代码、运行日志、结果、最终稿件原封不动打包成可审计语料库公开放出来,让 88 位人类审稿人对 140 篇论文打了 282 份结构化评审。结果呢?平均分 3.23/10,刚到 ICLR 接收线(6 分)门槛的只有 11.4%,但论文的工程化产出已经可以正面刚 Sakana AI Scientist v2、DeepScientist 等同期系统——Stanford Agentic Reviewer 给 FARS 5.00 的均分,比所有 baseline 高出一个量级。这篇论文真正有价值的部分,不是 166 这个数字,而是它敢把失败一起给你看。


论文信息

字段 内容
标题 FARS: A Fully Automated Research System Deployed at Scale
作者 Qiong Tang†, Xiangkun Hu†, Xiangyang Liu†, Yiran Chen†, Yunfan Shao†(† 表示并列一作,机构 Analemma)
评审人 88 位志愿者(独立列在附录),来自 NUS、CMU、Stanford、清华、复旦、HKUST 等
arXiv 2606.31651
提交日期 2026 年 6 月 30 日
机构 Analemma(日行迹,上海)

一、为什么 FARS 不是一个普通的「AI Scientist 复刻」

最近一两年,自动科研系统密集亮相。Sakana 的 The AI Scientist v1/v2 在 ICLR 2025 Workshop 拿到 6.33/7 的双盲评审,Google 的 AI Co-Scientist 走人机协作路线,FutureHouse 的 Robin 钻进湿实验做药物 repurposing。论清单随便列一列,AI Scientist、CycleResearcher、Zochi、AIGS、AI-Researcher、DeepScientist、AutoResearchClaw、ScientistOne……这个名字列表我看到都累。

但 FARS 这篇论文读了 30 分钟之后,我的第一反应是:它在意的根本不是单点能力有多强。

以往那些系统做演示的方式是"挑几篇最漂亮的论文给你看"。这种 selective reporting 在机器学习里有个更学术的名字——cherry-picking。FARS 作者的判断很直接:与其费劲挑 3 篇能过 ICLR 线的样本给你吹,不如把 166 篇(包括跑挂的、写歪的、被审稿人撕的)一锅端出来,让整个质量分布可观测。

这个选择的后果是,审稿人发现 16.7% 的评审触发了"诚信违规"——也就是说,差不多每 6 篇论文里就有 1 篇存在编造引用、伪造结果、或者代码和论文对不上的硬伤。FARS 团队没回避这个数据,反而把它当卖点。

坦率讲,这种"我烂我也摆给你看"的姿态在 AI 圈是相当稀缺的。把失败也公开,比单独秀 3 篇好论文要诚实得多。


二、FARS 的工程骨架

先看系统长什么样。

FARS 系统架构:四个阶段智能体通过共享工作区协作,对接 arXiv、GitHub、文件系统、GPU 集群和模型推理端点

图1:FARS 的四阶段流水线——Ideation → Planning → Experiment → Writing。智能体之间不直接对话,而是通过共享文件系统读写结构化工件(提案、代码、日志、结果、LaTeX)。底层挂着 arXiv、GitHub、Google Scholar、Web 资源、共享文件系统、GPU 集群和统一的模型推理代理(覆盖 OpenAI、Anthropic、Google 等多家的接口)。

架构本身谈不上惊艳——四个阶段的多智能体流水线,已经是 2025 年之后 Agent 系统的"标配模板"。但有几个工程细节值得拎出来:

1. 负结果是 first-class 公民

设计原则第一条就明说:"FARS 不把负面结果默认当作失败论文。" 当一个假设被实验证伪,且失败原因写得清楚、边界条件讲得明白,FARS 不会把这个轨迹吞掉,而是把它整成一篇 negative-result 论文继续往后推。这个设计在人类学术圈几乎不可想象——谁会主动把自己的失败实验投出去?FARS 没这个面子包袱,反正都是模型在写,写"没跑通"和写"跑通了"对系统来说是一样的成本。

2. 阶段间靠"实验合同"通信

Planning 阶段不直接给 Experiment 一个开放式目标,而是把提案翻译成结构化的 experiment contract:每个实验条目归属 5 类任务中的一种,再被拆成带依赖关系的有序步骤。Experiment 阶段再把这些步骤"消化"成单条执行——harness 把规划和执行分开,避免 Agent 跑着跑着自己改 success criteria、偷偷塞实验进去。

3. 双验证 + 检查点容错

每个实验项跑完,agent 的语义自评和 harness 的确定性检查(文件、退出码、关键产物)会同时给一次判定。结果提交后立即 commit 到版本控制,就算后面挂掉也能从最后完成的检查点恢复。417 小时的长时间运行,没有这套 checkpoint 机制早就崩了。

4. 19 类技能库按需加载

ML 工具栈脆弱得要命:CUDA 编译、flash-attention 版本、Transformers API 漂移……Agent 每次都从零搭环境就是浪费算力。FARS 把基座依赖锁死在只读基础镜像里,Agent 在隔离层装自己需要的包;另外维护一个 19 类的技能参考库(不是塞进上下文,是按 index 按需取)。

5. 写作阶段把"声明-证据"绑死

Writing 阶段先让 Analysis Agent 出一份 paper blueprint,把每个核心 claim 跟对应的实验条目、源工件、候选图表、引用文献链接起来,再让 Writing Agent 按这个蓝图写 LaTeX。这等于在写之前就把"这段话凭什么"绑定死了。 之后 LaTeX 编译反馈、引用检查、数值校验、跨 section 内部一致性检查会跑一轮。

这套设计合起来的效果,作者给了一个数字:单篇论文 2.51 部署小时、1.3 亿 token、约 1120 美元。17 天 186K 美元的预算产出 166 篇——成本结构看起来确实像科研工厂。


三、公开部署里发生了什么

部署阶段从 2026 年 2 月开始,作者团队搞了一场全球首次"全自动科研直播"——任何人都能打开浏览器看 76 张 GPU 同时跑实验、当期项目队列的进度条、实时跳动的成本计数。

部署的硬数据:

指标 数值
部署总时长 417 小时(≈17.4 天)
模型 token 总消耗 216 亿
总成本 约 18.6 万美元
产出论文 166 篇
覆盖细方向 67 个
单篇平均成本 ≈1120 美元
单篇平均时长 2.51 小时
单篇平均 token 1.3 亿

FARS 被预先种了 9 个研究方向(seed topics)作为起点,但 Ideation Agent 明确被允许跑出去自由探索。166 篇里 72 篇落在 seed 主题内,剩下 94 篇是跑着跑着自己冒出来的 emergent 主题。这其实挺反直觉的——你给系统 9 个方向,它回来给你 67 个。

最大的 emergent 集群是 AI Safety and Alignment(13 篇)——这块是 seed 里没有的。AI Safety 之所以能冒出来,符合常理:FARS 评估前沿 LLM 时自然会撞上 alignment 评测问题。Vision-Language Models(7)、Code Generation(6)、World Models(6)也都是跑着跑着发现文献里有空白就钻进去。

166 篇论文的主题分布。前 9 个 seed 主题用蓝色标注,其余 58 个 emergent 主题用灰色

图2:166 篇论文的 67 个主题分布。最热门的是 AI Safety and Alignment 和 RLVR(各 13 篇),这俩凑巧是 2026 年上半年最热的两个方向。90% 以上的主题只产出 1-2 篇论文,呈现明显的长尾——这是 FARS"自由探索"模式必然带来的形状。

值得一提的是,FARS 内部调用了 Claude、GPT、Gemini 三个模型家族。Antropic 那篇《Effective harnesses for long-running agents》里描述的"长程任务失败模式",在 FARS 设计里能看到对应的工程化对策——这俩东西互相印证,挺有意思。


四、282 份评审:数字说了什么,又没说什么

FARS 团队没拿自动评审凑数,而是从 583 位申请人里筛出 88 位有评审经验的志愿者(86% 之前审过稿),按主题匹配度分配,每篇论文至少 2 位、最多 3 位审稿人,最终拿到 282 份结构化评审、覆盖 140 篇论文

评审表抄的是 ICLR 那一套:整体评分 {0, 2, 4, 6, 8, 10}、Soundness/Presentation/Contribution 三个子项 1-4 分、Confidence 1-5 分。FARS 在标准之上叠了一层 AI Integrity Audit——审稿人被要求对照论文的代码、运行日志、原始输出,逐条核对引用是否存在、结果能不能复现、方法和代码是否一致。

来看分布。

282 份评审的分数分布。a 是整体评分,b-e 是四个子项,f 是箱线图汇总

图3:282 份评审在五个维度上的分数分布。整体评分 mean 3.17 / median 2.0,44% 的评审给了 2 分。Soundness 2.15、Contribution 2.00、Presentation 2.46、Confidence 3.78。

几个关键数字:

  • 整体评分 mean 3.17 / median 2.0——离 ICLR 接收线 6 分还远。
  • Soundness(方法严谨性)mean 2.15——满分 4 分,及格线 3 分都不到。
  • Contribution(贡献)mean 2.00——直接贴底。
  • Presentation(表达)mean 2.46——相对最好。
  • Confidence(审稿人对自己判断的信心)mean 3.78——审稿人对自己的判断很笃定。

把分数聚到 paper 级别更直观。

140 篇论文的 paper-level 均分分布

图4:140 篇被评审论文的均分直方图。31% 落在 [2,3) 桶里——这是 FARS 论文的"典型质量"。越过 6 分接收线的只有 11.4%(16 篇),其中 14 篇是单审稿人评的,去掉这部分只有 2/95 篇是真的两位以上审稿人一致认可的。

我得说一句公道话:"11.4% 达到接收线"这个数字是有水分的。 16 篇过线论文里有 14 篇只经过 1 位审稿人打分。在样本稀疏的情况下,1 个评分 6 就把均值拉到 6 是很容易的。把 95 篇有 2 人以上评审的论文单独看,真正两位以上审稿人都认为达标的是 2/95 ≈ 2.1%

4.1 分数预测因子

Pearson 相关性给的结论很清晰:

维度 与整体评分的相关系数 r p 值
Contribution 0.743 1.14 × 10⁻⁵⁰
Soundness 0.652 1.38 × 10⁻³⁵
Presentation 0.451 1.62 × 10⁻¹⁵

Contribution 是最强预测因子——这个发现其实跟人类论文完全一致:判断一篇 ML 论文值不值得发,方法是否严谨和贡献是否真实远远比写作文笔重要。FARS 论文普遍写作规整(Presentation 相对最强),但贡献度严重不足,所以天花板被卡在"看起来还行但没什么新意"那一档

4.2 一个反直觉的发现

Confidence 跟 Rating 负相关——评分 0 的论文 Confidence mean 4.30,评分 6 的论文 Confidence mean 3.46。审稿人在判"这篇是垃圾"的时候比判"这篇真好"更自信。

这个挺好理解:识别错误比识别卓越容易得多,垃圾论文一眼能看出来,好论文往往要纠结半天。我自己审稿也有这感觉。


五、AI Integrity Audit:FARS 最值钱的实验

这是我整篇论文最看重的部分。

左:四个子项均值随评分等级的变化;右:诚信问题比例随评分等级的变化

图5:左图——Soundness、Presentation、Contribution 都随评分等级单调上升,Confidence 反向下降。右图——诚信问题比例从评分 0 的 43.5% 一路降到评分 6 的 2.0%,呈现极强的负相关。

282 份评审里,47 份(16.7%)触发了正式诚信违规,涉及 39 篇论文(27.9%)。这些违规集中在低分论文里——评分 0 的论文里 43.5% 都有诚信问题。

更细致地看评审的自由文本(用 Claude Opus 4.6 标注):

失败模式 提及比例 升级为正式违规的比例
实验设计缺陷(confounded 比较、被压下的不利运行) 22.7% 22/64
内部一致性问题(摘要-表格-图数字打架) 13.1% 19/37
语言/推理缺陷 11.0% 4/31
编造方法或 baseline 7.8% 20/22
伪造实验结果 7.4% 16/21
幻觉引用 5.7% 13/16
数学/逻辑错误 2.5% 3/7
虚假新颖性 1.8% 1/5

注意一个关键细节:"提及"≠"正式违规"。实验设计缺陷被提及的次数最多(64 次),但只有 22 次升级为正式违规——很多只是普通方法论弱点;而编造方法、伪造结果、幻觉引用,这三类一旦被提及几乎 100% 升级为正式违规。原因很简单:审稿人对照代码和日志一看就知道是真的在胡扯。

这个 AI Integrity Audit 设计,我觉得是 FARS 整套工作里最值得借鉴的部分。普通的同行评审只评论文好不好,这份评审先评"论文说的是不是真的"。 在 AI 生成内容大爆发的时代,这层"事实层"的检查会越来越重要。

具体到失败模式,让我引两个例子:

  • FA0328(Position Bias Correction is Insufficient for One-Pass Attention Sorting):三位审稿人都给了 6 分,被认为是一个漂亮的可证伪负结果——它用清晰的证据表明,仅靠去偏无法解释 Attention Sorting 的迭代收益。
  • FA0064(NLL-Guided Full-Attention Layer Selection):审稿人称赞了假设的清晰和"无训练选取规则"的实用性,但其中一位明确标记了工件层面的诚信顾虑。

同一个 framework 里能跑出完全相反的两种结果,说明 FARS 的"质量分布"是真实存在的,而不是统计噪声


六、横向对比:FARS 在同期系统里什么位置

人工评审成本太高,作者用了一个变通办法:把 Stanford Agentic Reviewer(一个公开的 ICLR 风格自动评审系统)同时喂给 FARS 和 6 个同行系统的公开论文,包括 Sakana 的 AI Scientist v1/v2、CycleResearcher、DeepScientist、AutoResearchClaw、ScientistOne。

系统 评审器 论文数 均分 ≥6 占比
The AI Scientist (v1) SAR 71 2.29 0%
The AI Scientist v2 SAR 3 2.40 0%
CycleResearcher SAR 6 2.78 0%
AutoResearchClaw SAR 7 3.19 0%
ScientistOne SAR 20 4.00 0%
DeepScientist SAR 3 4.13 0%
FARS SAR 165 5.00 1.8%
FARS 人工 140 3.23 11.4%

FARS 是唯一有论文自动评分达到 6 分以上的系统。在 165 vs 110(所有非 FARS 论文合计)这个量级对比下,均分领先约 2.3 个点(5.00 vs 2.74)。注意几个 caveat:

  1. 基线的样本量太小,DeepScientist 只有 3 篇、ScientistOne 20 篇,统计噪声不能忽略。
  2. 自动评审比人类评审宽松——同一批 FARS 论文,SAR 给 5.00,人给 3.23。差距来自 SAR 不做诚信审计、不翻代码、不验证引用。
  3. 论文集的非对齐筛选:每个系统的"代表作集"标准不同,FARS 是全量公开、未经筛选的,这本身就是个不利条件。

但 FARS 在最难、最不利、最可比的赛道上赢了——这个事实不能轻易抹掉。


七、我看到的几个隐藏问题

读完之后我并不想给 FARS 唱赞歌。这套系统暴露出来的问题,可能比它解决的问题还重要。

问题一:评审 pool 仍然是"自家人"

88 位审稿人是从社交媒体公开招募的志愿者,他们知道自己在评 AI 生成的论文,也知道评审结果会变成论文素材。这种"知情志愿者"的偏置没法完全去除。FARS 自己在论文里也承认——"the evaluation should be read as a structured expert analysis rather than an independent conference peer-review process"——意思就是别当它是 ICLR。

问题二:被评的 140 篇 ≠ 全部 166 篇

FARS 选论文给人评的逻辑没完全交代清楚(是随机?还是让审稿人 self-claim?)。审稿人是 self-claim 模式——"对哪个方向感兴趣就认领哪篇"。结果是热门方向(RLVR、Memory in Agents)的论文被抢光,93% 的论文能找到审稿人,剩下 7% 没人认领。 自选样本天然偏向审稿人有兴趣的方向,跟真实审稿场景的随机分配完全不一样。

问题三:负结果被高估的"诚实红利"

FARS 把"不删负结果"当成设计原则写进第一段,听起来很诚实。但"系统不删"≠"系统诚实"——FARS 之所以能诚实地呈现负结果,是因为它不在乎名声。人类研究者被负结果拖后腿的是 tenure、是 funding、是要在求职市场上有故事可讲。一个在 17 天内批量生产的 AI 写"我没跑通"是低风险动作,写"我跑通了"也不增加什么——所谓"诚实"在低成本环境下是必然产物,把它包装成科学美德多少有点过度

问题四:质量分布的"幸存者偏差"是双向的

166 篇论文是 Ideation Agent 自己选出来的 244 个假设之后的产物。Agent 选题时已经过滤掉了一大批"显然不会 work"的方向——比如需要物理实验的、依赖湿实验的、需要人类专家标注的。FARS 跑出来的东西本身就是它"敢尝试"的那部分,不是 AI for Science 全部的形状

问题五:成本不是 1100 美元

$186K 包含了 160 张 GPU 的集群费用和 216 亿 token 消耗。但这个成本是没算人力监督的。88 位审稿人、14 位附录里匿名/具名的助理、AI Integrity Audit 的复审工作——这些都是免费的志愿者劳动。把这些按市场价折算一下,单篇"真实成本"大概率要翻 5-10 倍。


八、我的判断

如果要我用一句话总结 FARS 这篇论文(arXiv:2606.31651)的定位,我会说:它不是 AI Scientist 的新版本,它是 AI for Science 范式的一场压力测试。

FARS 的真正贡献不是工程方案——四阶段流水线 + 共享工作区 + 完整审计,2025 年的 Agent 框架都能搭出来。它的贡献是把一个完整生产系统的输出分布毫无保留地摆出来,让"自动科研到底能跑多远"这个问题有了一个公开的、可量化的、可审计的答案。

在 17 天内用 18.6 万美元产出 166 篇覆盖 67 个主题的论文,这件事本身已经没有那么不可想象了——Analemma 之外,Sakana、Autoscience、清华的 Alchemy 都在做类似的事。真正稀缺的,是 FARS 这种"我也告诉你我哪 16.7% 是垃圾"的工程文化。

至于对研究者个人到底有什么影响——讲实话,我倒不觉得科学家要被替代。AI 能批量生产 3.23/10 的论文,但"知道哪些 3.23 值得往 7 推"这件事,恰好是 FARS 自己最不擅长的事。 系统能挖 244 个假设的矿,但它挖不出"哪个矿值得挖 5 年"这种品味问题。

如果你做 AI 科研,建议认真读的不是 FARS 的 166 篇,而是它的失败模式分析那 5 个章节。 它们告诉你的不是"AI 离替代科学家还有多远",而是"AI 擅长什么、不擅长什么、会在哪里骗你"。

最后提醒一下:FARS 论文 PDF 里那个AI Integrity Audit 八条失败模式清单——以后所有人审 AI 生成的论文都可以照着用。它可能是这篇论文带出来最有普适价值的东西。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。