project
autoresearch - Karpathyは、自律的な科学研究実験のためのオープンソースAIフレームワークです。
Autoresearchは、Andrej Karpathy氏によるオープンソースのAI自律型研究実験フレームワークです。このフレームワークにより、AIエージェントは単一のGPU上でナノチャットのトレーニング実験を自動的に実行できます。ハイパーパラメータの調整、トレーニングの実行、結果の分析と検証などを自律的に行います。
AutoResearchとは何ですか?
Autoresearchは、Andrej Karpathy氏によるオープンソースのAI自律型研究フレームワークです。このフレームワークにより、AIエージェントは単一のGPU上でnanochatのトレーニング実験を自動的に実行し、パラメータの調整、トレーニングの実行、メトリクスの分析と検証、そして次の最適化方向の決定を自律的に行います。これにより、従来のパラメータ調整、実験の実行、ログの確認、そして再度の調整といった手動サイクルが完全に自動化されます。Autoresearchは導入障壁が非常に低く、単一のGPU上で動作し、AIを単なる研究対象から独立した研究実行者へと変革します。
自己研究の主な機能
-
自律的なコード反復AIエージェントによる直接編集
train.pyこのファイルを使用すると、モデルアーキテクチャ、オプティマイザ、ハイパーパラメータなど、トレーニングプロセス全体の構成を変更できます。 -
固定時間予算実験実験結果がプラットフォーム間で比較可能となるよう、各トレーニングセッションは実時間で厳密に5分に制限されています。
-
自動改良型フィルタリング:使用
val_bpb(1バイトあたりの検証ビット数)は統一された指標であり、この指標を下げる有効な変更は自動的に保持され、無効な変更は破棄されます。 -
人間が管理する研究機関:合格
program.mdエージェントの行動と研究戦略を定義し、コードを直接変更するのではなく、「研究組織コード」を反復的に最適化する。 -
単一ファイルに焦点を当てたデザインエージェントのみ変更
train.py単一ファイルを使用することで実験の範囲を制御でき、差分も確認可能です。
自動車研究の技術的原則
-
ナノチャットのトレーニングを簡素化するMuonオプティマイザとAdamWを統合し、完全なトレーニングループをサポートする、単一GPU上で実装された軽量GPTモデル。
-
BPEの単語分割とデータフロー:
prepare.py単発のデータ準備とBPEセグメンテーションツールのトレーニングを担当し、標準化されたデータロードおよび評価ツールを提供する。 -
統一評価指標語彙サイズに依存しない
val_bpb指標を用いることで、アーキテクチャ変更前後の実験結果が公平かつ比較可能であることを保証できる。 -
エージェント - クローズドループ環境:
program.mdエージェントの「スキルファイル」として、エージェントは指示を読み込み、コードを修正し、トレーニングを実行し、メトリクスを評価し、保持するか破棄するかを決定し、ループを繰り返します。 -
時間標準化メカニズムモデルサイズやバッチサイズの変更に関わらず、トレーニングは常に一定の時間実行されるため、ハードウェアの違いが実験の比較可能性に与える影響が排除されます。
自動調査の使い方
-
UVを設置する:埋め込む
curl -LsSf https://astral.sh/uv/install.sh | shUVプロジェクトマネージャーをインストールしてください。 -
依存関係をインストールしますリポジトリディレクトリに移動してから実行してください。
uv syncプロジェクトの依存関係のインストールを完了してください。 -
データ準備:埋め込む
uv run prepare.pyトレーニングデータをダウンロードし、BPE単語分割器をトレーニングします(1回のみ、約2分)。 -
検証環境手動操作
uv run train.py単一のトレーニングプロセスが正常に実行されることを確認してください(所要時間約5分)。 -
エージェントを起動するClaude/CodexなどのAIエージェントをIDEにロードし、それらを...に指定します。
program.md書類。 -
調査を開始する入力プロンプトワード例 “Hi have a look at program.md and let’s kick off a new experiment” 自動反復処理を開始します。
-
結果を表示翌日実験記録を確認し、
train.py変更履歴を利用することで、最適化されたモデルと改善経路を取得できます。
自動車研究の主な利点
-
ミニマルデザインコアファイルは3つだけ(
prepare.py、train.py、program.md外部依存関係は一切なく、単一のGPUで動作します。 -
公平な比較5分間の固定時間枠と語彙に依存しない評価指標により、あらゆるアーキテクチャの変更を同じ基準で評価することが可能になります。
-
人間と機械の協働人間は
program.mdエージェントは研究戦略を設定することで、コード実験の実行を担当し、それによって人間が方向性を設定し、AIが実験を実行するという分業を実現する。 -
高スループットこのシステムは1時間に約12回の実験を実行でき、一晩で約100回の自動反復を完了できるため、人間の手動実験の効率をはるかに凌駕する。
-
監査可能性単一ファイル変更モードにより、各実験の差分が明確かつ追跡可能になり、エージェントの改善経路を理解しやすくなります。
オートリサーチのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/karpathy/autoresearch
Autosearchによる類似製品の比較
| 比較対象寸法 | autoresearch | SciClaw |
|---|---|---|
| 製品ポジショニング | LLMトレーニング専任自律型研究エージェント | 一般科学研究におけるAI同僚/研究ライフサイクル全体オーケストレーションシステム |
| 中核ミッション | トレーニングコードを自動的に変更し、ハイパーパラメータを調整し、実験を実行し、選択と改善を行います。 | 文献調査、実験計画、計算シミュレーション、論文作成、査読への対応。 |
| 研究対象 | Nanochatモデルのトレーニング(シングルGPUによる深層学習) | 生命科学、化学、物理学、材料科学など、複数の分野における研究課題。 |
| 実験の実施 | Pythonコードを直接変更してトレーニングループを実行します。 | 自律的にタスクを分解し、科学ツールを活用し、計算シミュレーションを実行し、実験装置とドッキングする。 |
| 評価メカニズム | 固定5分間トレーニング+ val_bpb 保持/破棄する指標の自動フィルタリング |
実験結果の分析、論文の品質評価、仮説の検証 |
| 知識ベース | いいえ、各実験はコードと指標に基づいて独立して意思決定を行います。 | 長期記憶プロジェクトのデータ、実験記録、文献、メール履歴 |
| ハードウェア要件 | NVIDIA製GPUを1基搭載 | クラウド上で動作することも、ローカル環境にデプロイすることも可能で、AIグラスや自動化された実験装置をサポートします。 |
| 相互作用方法 | 合格 program.md コマンドファイルとAIエージェントによる自動実行 |
会話型インタラクション(Web/Lark/DingTalk/Telegram/Discord) |
| オープンソース | MITは完全にオープンソースです | クローズドソース製品(内部テストには招待コードが必要です) |
| 対象ユーザー | AI研究者、LLM研修エンジニア | 研究者、博士課程学生、および企業の研究開発担当者 |
| 出力結果 | 最適化されたモデル重み + 実験ログ | 論文草稿、PowerPointプレゼンテーション、ポスター、査読回答、実験レポート |
| 自律性の深さ | コードレベルでの自動反復処理は可能だが、単一のトレーニングタスクに限定される。 | プロジェクトレベルのフルライフサイクルオーケストレーションは、数日かかる可能性のあるバックエンドの実験や自己修復をサポートします。 |
自動調査の応用シナリオ
-
LLMトレーニングのための自動ハイパーパラメータ探索学習率、バッチサイズ、モデルの深さなどの組み合わせを自動的に探索し、最適な構成を見つけ出します。
-
建築革新の検証新しいアテンションメカニズム、位置エンコーディング、またはオプティマイザのバリアントの実際的な効果を迅速に検証します。
-
低コストモデルチューニング単一GPU環境における小規模モデルのパフォーマンスを自動的に最適化します。個人研究者やリソースが限られたチームに適しています。
-
AI研究手法の探求自律型AI研究のための概念実証プラットフォームとして、これは「AI科学者」の実現可能性の限界を探るものである。