autoresearch - Karpathy 开源的科研自动化框架,让 AI 自己跑实验自我迭代
项目简介
autoresearch 于 2026 年 3 月发布,是一个仅约 630 行的 Python 脚本项目。它的核心理念是"自主研究循环"(Autonomous Research Loop):让 AI Agent 自动修改训练代码、运行实验、检查结果、保留有效的改进、丢弃无效的尝试,然后重复这个过程——永不停歇,直到你停止它。
这个项目发布后迅速爆火,一个月内获得 6.6 万 Star 和 9600 个 Fork,成为 2026 年上半年 AI 开源社区传播最广的项目之一。Shopify CEO Tobi Lutke 用它跑了一晚上,37 次实验后得到了一个 0.8B 参数的模型,性能超过了他之前的 1.6B 模型——更小的模型,更好的结果。
核心原理
Agent 修改训练代码(train.py)
运行一次 5 分钟的训练实验
检查验证损失是否改善
有改善就 git commit 保留
没改善就 git revert 回退
重复以上步骤,持续迭代
train.py:Agent 唯一修改的文件,包含完整的 GPT 模型定义、优化器(Muon + AdamW)和训练循环。架构、超参数、batch size、优化器——一切都可以改
program.md:给 Agent 的指令文件,相当于一个超轻量的"skill",告诉 Agent 该怎么做实验。这个文件由人类编辑和迭代
autoresearch.py:主循环脚本,调度 Agent 执行实验、评估结果、管理 git 版本
每次实验限制在 5 分钟内
确保快速迭代,一天能跑数百次实验
小模型 + 小数据集快速验证想法
有效的改进可迁移到大模型
避免长时间运行浪费资源
核心特性
启动后无需人工干预
Agent 自主决定修改什么
自主评估实验结果
自主保留或回退改动
可持续运行数天
每次有效改进都 git commit
完整的实验历史可追溯
每次改动都有明确的验证结果
支持实验对比和分析
结果可复现
可替换为任意训练任务
不限于 LLM 训练,可用于任何可量化的优化任务
可自定义 Agent(Claude、GPT、Codex 等)
可调整实验预算和评估指标
program.md 可不断优化迭代
小模型训练,GPU 成本低
API 调用费用可控
5 分钟预算避免浪费
本地 GPU 即可运行
个人开发者也能负担
实际效果
Karpathy 运行 2 天:约 700 次实验,20 项有效改进,效率提升 11%
Shopify CEO 运行 1 晚:37 次实验,0.8B 模型超越 1.6B 模型
社区用户反馈:在各种任务上都能找到意想不到的优化
发现的改进往往是人类容易忽略的细节
适合探索超参数、架构变体、优化器调整等
快速开始
克隆项目仓库:
git clone https://github.com/karpathy/autoresearch.git进入项目目录:
cd autoresearch安装依赖:
pip install -r requirements.txt配置 AI Agent API 密钥(支持 Claude、GPT 等)
准备训练数据(默认使用 nanoGPT 的 Shakespeare 数据集)
启动自主研究:
python autoresearch.py等待 Agent 自动运行实验,定期查看 git log 了解进展
应用场景
模型优化:自动探索模型架构和超参数的最优组合
训练策略研究:自动实验不同的学习率调度、优化器、正则化方法
代码性能调优:自动优化训练代码的运行效率
算法探索:在任意可量化评估的任务上自动搜索最优方案
夜间研究:睡觉时让 AI 帮你跑实验,早上来看结果
注意事项
需要一定的 GPU 资源(建议至少 8GB 显存)
需要 AI Agent API 调用费用
实验结果取决于初始代码和 Agent 能力
建议从小任务开始验证效果
定期检查实验进展,避免 Agent 走入死胡同
保留好的改进,定期人工审查 commit 记录
项目地址
GitHub 开源仓库:https://github.com/karpathy/autoresearch
授权方式:免费 + 开源(MIT License)