프로젝트 소개
autoresearch는 Andrej Karpathy가 만든 자율 AI 연구 프레임워크로, AI 에이전트가 단일 GPU에서 LLM 학습을 독립적으로 실험할 수 있게 해줍니다. 이 시스템은 nanochat의 단순화된 단일 GPU 구현을 기반으로 하며, AI 에이전트가 학습 코드(train.py)를 자율적으로 수정하고, 5분의 고정 벽시계(wall-clock) 예산으로 실험을 실행하고, 검증 bits per byte(val_bpb)를 사용하여 결과를 평가하고, 개선 사항은 유지하고 성능 저하를 폐기하면서 반복합니다.
이 프로젝트는 의도적으로 최소한으로 구성되어 있으며, 세 가지 핵심 파일로 이루어져 있습니다: prepare.py(수정되지 않는 고정 데이터 준비 및 유틸리티), train.py(에이전트가 편집하는 유일한 파일로, 전체 GPT 모델, 옵티마이저, 학습 루프 포함), program.md(인간이 편집하는 에이전트용 기본 지침). 인간의 역할은 Python 코드를 작성하는 것에서 자율 연구 조직을 정의하는 program.md Markdown 파일을 프로그래밍하는 것으로 전환됩니다. 기본 program.md는 의도적으로 최소한의 기준선으로 유지되지만, 시간이 지나면서 이를 반복하여 가장 빠른 연구 진행을 달성하는 '연구 조직 코드'를 찾거나 더 많은 에이전트를 추가하는 방법은 명확합니다.
학습은 계산 세부 사항과 관계없이 정확히 5분 동안 실행되므로 시간당 약 12개의 실험과 밤새 약 100개의 실험이 가능합니다. 이 고정 시간 예산은 에이전트가 무엇을 변경하든(모델 크기, 배치 크기, 아키텍처 등) 실험을 직접 비교할 수 있게 하며, 시스템이 해당 제약 내에서 주어진 플랫폼에 최적의 모델을 찾을 수 있도록 보장합니다. val_bpb 지표는 어휘 크기와 무관하므로 아키텍처 변경 전반에 걸쳐 공정한 비교가 가능합니다.
요구 사항에는 단일 NVIDIA GPU(H100에서 테스트됨), Python 3.10+, uv가 포함됩니다. 이 프로젝트는 PyTorch와 몇 가지 작은 패키지 외에는 외부 종속성이 없는 자체 포함형이며, 분산 학습이나 복잡한 구성이 없습니다. macOS, Windows, AMD 플랫폼을 위한 주목할 만한 포크가 존재합니다. 이 프로젝트는 MIT 라이선스로 제공됩니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.