autoresearch
autoresearch 是 Andrej Karpathy(前 OpenAI 创始成员、前特斯拉 AI 总监)开源的科研自动化框架。核心思路极其简单:给 AI Agent 一个真实的 LLM 训练环境,让它一边改代码、一边跑实验、一边自我迭代,整晚不需要人类干预。Karpathy 让它跑了 2 天,Agent 完成约 700 次实验,发现 20 项真正的改进,在已优化的代码上再提升 11% 效率。
autoresearch 项目封面

项目简介

autoresearch 于 2026 年 3 月发布,是一个仅约 630 行的 Python 脚本项目。它的核心理念是"自主研究循环"(Autonomous Research Loop):让 AI Agent 自动修改训练代码、运行实验、检查结果、保留有效的改进、丢弃无效的尝试,然后重复这个过程——永不停歇,直到你停止它。

这个项目发布后迅速爆火,一个月内获得 6.6 万 Star 和 9600 个 Fork,成为 2026 年上半年 AI 开源社区传播最广的项目之一。Shopify CEO Tobi Lutke 用它跑了一晚上,37 次实验后得到了一个 0.8B 参数的模型,性能超过了他之前的 1.6B 模型——更小的模型,更好的结果。

核心原理

自主实验循环
  • Agent 修改训练代码(train.py)

  • 运行一次 5 分钟的训练实验

  • 检查验证损失是否改善

  • 有改善就 git commit 保留

  • 没改善就 git revert 回退

  • 重复以上步骤,持续迭代

三个核心文件
  • train.py:Agent 唯一修改的文件,包含完整的 GPT 模型定义、优化器(Muon + AdamW)和训练循环。架构、超参数、batch size、优化器——一切都可以改

  • program.md:给 Agent 的指令文件,相当于一个超轻量的"skill",告诉 Agent 该怎么做实验。这个文件由人类编辑和迭代

  • autoresearch.py:主循环脚本,调度 Agent 执行实验、评估结果、管理 git 版本

5 分钟实验预算
  • 每次实验限制在 5 分钟内

  • 确保快速迭代,一天能跑数百次实验

  • 小模型 + 小数据集快速验证想法

  • 有效的改进可迁移到大模型

  • 避免长时间运行浪费资源

核心特性

完全自主运行
  • 启动后无需人工干预

  • Agent 自主决定修改什么

  • 自主评估实验结果

  • 自主保留或回退改动

  • 可持续运行数天

可复现的实验记录
  • 每次有效改进都 git commit

  • 完整的实验历史可追溯

  • 每次改动都有明确的验证结果

  • 支持实验对比和分析

  • 结果可复现

灵活可扩展
  • 可替换为任意训练任务

  • 不限于 LLM 训练,可用于任何可量化的优化任务

  • 可自定义 Agent(Claude、GPT、Codex 等)

  • 可调整实验预算和评估指标

  • program.md 可不断优化迭代

成本可控
  • 小模型训练,GPU 成本低

  • API 调用费用可控

  • 5 分钟预算避免浪费

  • 本地 GPU 即可运行

  • 个人开发者也能负担

实际效果

  • Karpathy 运行 2 天:约 700 次实验,20 项有效改进,效率提升 11%

  • Shopify CEO 运行 1 晚:37 次实验,0.8B 模型超越 1.6B 模型

  • 社区用户反馈:在各种任务上都能找到意想不到的优化

  • 发现的改进往往是人类容易忽略的细节

  • 适合探索超参数、架构变体、优化器调整等

快速开始

  1. 克隆项目仓库:git clone https://github.com/karpathy/autoresearch.git

  2. 进入项目目录:cd autoresearch

  3. 安装依赖:pip install -r requirements.txt

  4. 配置 AI Agent API 密钥(支持 Claude、GPT 等)

  5. 准备训练数据(默认使用 nanoGPT 的 Shakespeare 数据集)

  6. 启动自主研究:python autoresearch.py

  7. 等待 Agent 自动运行实验,定期查看 git log 了解进展

应用场景

  • 模型优化:自动探索模型架构和超参数的最优组合

  • 训练策略研究:自动实验不同的学习率调度、优化器、正则化方法

  • 代码性能调优:自动优化训练代码的运行效率

  • 算法探索:在任意可量化评估的任务上自动搜索最优方案

  • 夜间研究:睡觉时让 AI 帮你跑实验,早上来看结果

注意事项

  • 需要一定的 GPU 资源(建议至少 8GB 显存)

  • 需要 AI Agent API 调用费用

  • 实验结果取决于初始代码和 Agent 能力

  • 建议从小任务开始验证效果

  • 定期检查实验进展,避免 Agent 走入死胡同

  • 保留好的改进,定期人工审查 commit 记录

项目地址

GitHub 开源仓库:https://github.com/karpathy/autoresearch

授权方式:免费 + 开源(MIT License)

授权方式:��免费 + 开源(MIT License)