mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6
2766 字
7 分钟
AI-Researcher:把科研 Agent 从“会写”推进到“可审计”

为什么要做 AI-Researcher#

很多 AI 科研工具容易陷入一个误区:它们看起来很会写,能快速生成一段研究背景、一组实验描述,甚至是一篇像论文的 Markdown。但科研真正困难的地方不只是“写得像”,而是每一个结论都要能追到来源,每一个实验都要能复现,每一次改进都要知道它到底有没有变好。

所以 AI-Researcher 一开始就没有把目标定成“论文写作机器人”,而是做成一个 证据优先的自动科研操作系统

它要解决的问题是:

  • 真实检索,而不是凭空编参考文献;
  • 有边界地做实验,而不是让 Agent 随便改代码;
  • 用验证报告约束结论,而不是只看生成文本;
  • 用审稿和发布门禁阻止过度声明;
  • 把长期记忆写进 Obsidian 兼容的 Markdown 知识库,而不是只存在一次会话里。

一句话概括:AI-Researcher 想让科研 Agent 从“能生成内容”,走向“能留下证据链”。


它不是聊天助手#

AI-Researcher 的使用入口更像一个本地/服务器上的长期 operator。

首次部署时,airesearcher setup 会引导配置模型供应商、OpenAI-compatible base URL、模型名、API key、Obsidian vault、通信通道和默认 Agent 团队。启动后,airesearcher serveairesearcher autopilot --watch 可以按周期执行科研循环:检索资料、刷新灵感、生成候选方向、做相似工作检查、运行实验、生成报告、做审稿、构建论文产物,再把结果写回本地记忆。

这里最关键的设计选择是:默认不把 Agent 当成一个可以无限自由行动的“黑盒研究员”,而是把它放进一个有审批、有证据、有回滚的流程里。

比如在 approve-dangerous 模式下,危险动作需要显式审批;通信推送如果没有真实送达状态,就记录为 skipped,不会假装已经通知成功;如果某个外部来源正在限流或状态文件损坏,系统会写出 source preflight 证据并跳过昂贵的后续步骤,而不是继续制造看似完整的结果。


核心闭环#

AI-Researcher 的科研流程可以粗略拆成六层。

1. 文献和灵感输入#

系统支持 ArXiv、OpenAlex、Semantic Scholar 等学术来源,也能把 Hugging Face 数据集、Hacker News 这类非学术信号作为“灵感来源”记录下来。

这里有一个很重要的边界:非学术灵感不能直接变成论文证据。它可以提示“这里可能有个方向”,但最后能不能成立,还要经过文献、实验、复现和审稿门禁。

2. Obsidian 知识库#

autoresearch-vault/ 是整个系统的记忆底座,里面会保存文献摘要、候选方向、实验记录、证据图、review finding、issue、失败模式、skill card、strategy card 和论文构建摘要。

这让自循环不是靠 prompt 里的临时记忆,而是靠可版本管理的 Markdown 文件。下一轮运行可以读取上一轮留下的 review、失败和 follow-up,再决定继续推进、修正方向或阻断发布。

3. 研究计划门禁#

在进入实验前,系统会先生成可执行研究计划,并把 Markdown、TeX、PDF 和 JSON 产物写到 outputs/<project-id>/research-plan/

这个步骤的意义不是“多生成一份文档”,而是把研究方向变成一份明确的协议:要验证什么,数据来自哪里,基线是什么,指标是什么,停止条件是什么。没有这个协议,就不应该让代码 Agent 直接冲进实验目录里乱改。

4. 有边界的实验执行#

实验层不是只跑 toy demo。项目里已经有基于 UCI Pendigits、Letter Recognition、Spambase、Skin Segmentation 等公开 benchmark 的 demo 路径。

每次运行会保留:

  • run-record.json:运行元数据、命令、commit、config hash、data hash;
  • validation-report.json / .md:指标边界、统计检查、产物存在性;
  • evidence-map.json:把具体指标绑定到证据边;
  • Markdown report:用证据约束生成结果说明。

这套结构的重点是:实验不是一句“模型效果很好”,而是一组可以被审计的本地文件。

5. 审稿和发表门禁#

AI-Researcher 里有两类特别“保守”的门禁。

第一类是 publication-audit。它会检查文献检索广度、引用是否有 DOI 或 URL 支撑、相似工作覆盖、真实数据集、baseline、ablation、统计 sanity、方法贡献、LLM review 质量和相关工作检查。比如 CCF-B / Q3 级别目标会要求更高的证据密度,不能因为有一个 PDF 就说“论文准备好了”。

第二类是 evidence-gate。它更像物理发布闸门:cycle summary、候选记录、文献摘要、相似工作、实验目录、验证报告、证据图、复现检查、审稿结果、publication audit、LaTeX PDF 和 paper quality 都要能找到对应 artifact。

也就是说,系统把“能不能发布”从一句模型判断,变成一张硬检查表。

6. 受控自进化#

AI-Researcher 也尝试让系统改进自己的策略和 skill,但这条路被刻意做得很慢。

一个 skill 或 strategy 想进入正式使用,需要先有 issue/failure 证据,再经过 shadow evaluation、golden tests、reward scoring、灰度发布、rollback target 和 audit review。外部项目的启发也不会直接复制进仓库,而是先进入 watchlist,等许可证、安全、验证和回滚门禁都通过后再考虑提升。

这比“让 Agent 自己优化 prompt”麻烦得多,但也更像一个可以长期运行的工程系统。


技术栈和工程形态#

项目主体是 Python 包 autoresearch,命令行入口是 airesearcher,同时提供 Node 启动器 bin/airesearcher.mjs 和 npm scripts。

主要技术栈包括:

  • Typer / Click:命令行界面;
  • LangGraph:科研工作流状态机;
  • Pydantic:配置、schema 和验证模型;
  • ArXiv / Semantic Scholar / OpenAlex:在线文献和元数据来源;
  • Obsidian Markdown vault:长期记忆和人工可读记录;
  • LaTeX / PDF 构建:论文级产物输出;
  • pytest / ruff / mypy / hypothesis:测试、静态检查和属性测试。

仓库结构也反映了这个定位:src/autoresearch/ 下按 agentsexperimentsliteraturereportsknowledgeruntimeobservability 等模块拆分;autoresearch-vault/ 保存项目记忆;outputs/runs/ 用于本地生成产物;docs/ 则记录 dashboard、部署和发布门禁设计。


我觉得最有价值的三个设计#

第一,所有 claim 都必须落到 artifact#

很多 Agent 系统的问题不是“不会做”,而是“做完以后不知道哪些是真的”。AI-Researcher 反过来要求每个阶段都留下文件:检索结果、运行记录、验证报告、审稿 JSON、PDF 构建日志、evidence gate 报告。

这让系统的输出可以被人接着查,而不是只能相信一次生成结果。

第二,把失败当成一等公民#

如果来源限流、引用缺失、实验没有显著提升、LaTeX 模板不可用、review 质量不够,系统不会把这些失败藏起来。它会写 issue note、follow-up task 或 blocked gate。

这点很重要。真正的科研过程大部分时间都在处理失败、重复、证据不足和方向修正。如果一个“自动科研系统”只展示成功,它其实还不够科研。

第三,不急着做成 SaaS#

V1.0 明确是单操作者的本地/服务器版本,不是多用户 SaaS,也不会自动投稿。这是一个很克制的范围。

科研 Agent 的核心难题不是先把界面做得多热闹,而是先把证据链、门禁、复现、成本和人工介入跑通。等这些底座稳定以后,再做 dashboard、多项目、多用户和团队协作才有意义。


一个典型使用画面#

想象它挂在一台工作站或服务器上:

  1. 白天自动刷新文献和灵感来源;
  2. 发现一个候选研究方向后,先做相似工作检索;
  3. 用户确认方向,系统生成研究计划;
  4. 实验 Agent 跑一个有边界的 benchmark;
  5. 系统写出验证报告、证据图和论文草稿;
  6. reviewer 检查引用、指标、可复现性和过度声明;
  7. LaTeX 构建 PDF;
  8. evidence gate 决定这轮是可发布、需修订,还是必须阻断;
  9. 所有结果和失败都写回 Obsidian,作为下一轮的起点。

这不是一个“按下按钮就发论文”的幻想,而是一个把科研过程拆成可检查动作的长期循环。


目前的边界#

AI-Researcher 还不是一个成熟的全自动科学家。

它不会自动投稿,也不应该跳过人类确认;它的 live API、文献来源和外部模板仍然会受限流、网络和本地环境影响;一个 benchmark 上的正向结果也不能直接证明方法具有发表级创新。项目自己也把这些问题写进 Known Problems 和发布门禁里。

但这正是我觉得它有意思的地方:它没有把自动科研包装成魔法,而是把“哪里还不能信”也做进系统。


总结#

AI-Researcher 的价值不在于让 AI 多写几段漂亮论文,而在于把科研 Agent 的工作变得可追踪、可复现、可阻断、可回滚。

如果说很多 AI 工具是在追求“生成速度”,那 AI-Researcher 更像是在追求“研究可信度”:

  • 资料从哪里来;
  • 实验怎么跑;
  • 指标怎么验证;
  • 引用是否真实;
  • 论文产物是否可构建;
  • 为什么现在还不能发布;
  • 下一轮应该修什么。

这套东西听起来不如“一键生成论文”刺激,但它更接近真正能长期使用的科研基础设施。

项目地址:neutronstar238/ai-researcher-loop,目前仍处在 V1.0 / 0.1.0 baseline 的持续迭代阶段。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

部分信息可能已经过时

封面
Sample Song
Sample Artist
封面
Sample Song
Sample Artist
0:00 / 0:00