跳到主要内容

1 篇博文 含有标签「autoresearch」

查看所有标签

AutoResearch 怎么落地:验证债务与可信闭环

· 阅读需 14 分钟

AutoResearch 最容易被描述成一条越来越长的流水线:搜论文、提 idea、改代码、跑实验、画图、写 LaTeX,再让另一个模型 review。按照这个口径,覆盖阶段越多,系统就越接近“AI Scientist”。

但两个代表项目给出了相反信号。

karpathy/autoresearch 只允许 Agent 修改一个 train.py,每轮训练 5 分钟,只看一个 val_bpbAI Scientist-v2 则从主题、idea 和文献一路走到实验树、论文与 review。后者的行动空间大得多,官方 README 却明确提醒:开放探索的成功率低于模板更强的 v1,有强起始模板时也不一定生成更好的论文。

这不是“简单 Agent 比复杂 Agent 聪明”,而是两套系统承担了不同的验证债务:Agent 每多获得一种行动能力,系统就必须多证明一件事——它没有因为扩大搜索、重复看分数、选择性报告或自我审查而制造假改进。