曾几何时,前沿AI研究是由血肉计算机(指人脑)在吃饭、睡觉、娱乐之余,偶尔通过声波互联在“小组会议”的仪式中同步完成的。那个时代早已远去。如今,研究完全由自主AI代理集群主导,它们运行于天空中的计算集群巨型结构之上。这些代理声称,代码库现已演进至第10,205代;无论如何,无人能辨真伪,因为“代码”已成为自我修改的二进制文件,其复杂程度已超出人类理解。本仓库讲述的正是这一切如何开始的故事。
——@karpathy,2026年3月
这段充满未来感的引言,来自Andrej Karpathy的最新开源项目——Autoresearch。它并非科幻小说,而是一个让AI Agent能够自主进行深度学习研究的实验框架。本文将从该项目中汲取灵感,剖析其设计思想,探讨如何构建一个能够自我进化的研究型Agent,以及人类研究者该扮演什么角色?
项目目的:为AI Agent打造真实的练兵场
Autoresearch的核心目标是:为AI Agent提供一个精简但真实的LLM训练环境,让其能够整夜自主实验。Agent会修改代码,训练5分钟,检查结果是否提升,保留或丢弃改动,然后重复。清晨醒来,研究者将看到详细的实验日志,以及(但愿)一个更好的模型。
项目基于nanochat的简化版单GPU实现。关键在于,研究者不再像传统方式那样直接修改Python文件,而是通过编写program.mdMarkdown文件为AI代理提供上下文,构建自己的“自主研究组织”。仓库中的默认program.md是一个极简基线,但显而易见,你可以不断迭代,寻找能实现最快研究进展的“研究组织代码”。
设计原则:最小可控
Autoresearch的设计遵循“最小可控”原则,通过四条核心约束将自主实验的复杂性降至最低,同时保证结果的可比性和可解释性。
1. 单文件修改
Agent仅被允许修改train.py。这一设计带