project
ファラデー - インヘレント社のAI科学者エージェント
ファラデーは、ロンドンを拠点とするAI研究所Inherentが開発したAI科学者エージェントです。270億個のパラメータを持つQwen 3.6モデルをベースに、強化学習によって訓練されています。ファラデーは、事前の知識がなくても人間の博士課程学生のようなタスクを実行できます。
ファラデーとは何か?
ロンドンを拠点とするAI研究所Inherentが開発したAI科学者エージェント「Faraday」は、270億個のパラメータを持つQwen 3.6モデルに基づいた強化学習を用いて訓練されています。人間の博士課程学生のように、Faradayは答えを事前に知らなくても、論文を自律的に読み、実験を設計し、研究結果を再現することができます。論文再現ベンチマーク「Replica」において、FaradayはClaude Opus 4.8やGPT-5.5を上回る性能を発揮しています。
ファラデーの主な機能
- 自作論文の複製結果グラフが不明瞭な学術論文を読み、実験方法を推測し、限られたGPUリソースを用いて60分以上かけて再現可能な実験を独自に設計・実行する。
- 科学実験設計完全に再現できない実験に直面した場合、元の論文の核心的な主張に忠実でありながら、実験規模を比例的に縮小できる能力は、「研究の洗練度」を示すものである。
- ツールコールプログラミングCodex GPT-5.5を外部コーディングツールとして使用し、科学的な意思決定はご自身で行い、コードの実行はプロのプログラミングエージェントに任せましょう。
- ドメイン横断的な一般化機械学習に関する論文で学習し、科学のためのAIに関する論文でテストを行った結果、分野横断的な応用能力を備えている。
ファラデーの技術原理
- ベースモデルの選択Faradayは、わずか270億個のパラメータを持つQwen 3.6-27Bをベースに構築されています。チームは強化学習を用いてFaradayを訓練し、科学的な意思決定能力を持たせました。コードの実装は外部ツールによって行われ、科学的知能と工学的知能を分離できることが実証されました。
- コーディングエージェントをツールとして利用する(CAT)アーキテクチャFaradayはシェルツールを使用してCodex GPT-5.5を外部プログラミングアシスタントとして呼び出します。Faradayは論文の理解、実験計画の設計、計算リソースの割り当てなど、高度な科学的意思決定に重点を置き、Codexは具体的なコードの記述、デバッグ、実行を担当します。
- レプリカタスクスペーストレーニングデータは、1990年から2026年までの100の有名な論文を網羅した、自動生成されたレプリカベンチマークから取得され、合計310の再現可能なタスクが含まれています。タスクは、Gemini 2.5 Proを使用して論文内の結果グラフを自動的に識別してマスキングすることであり、エージェントは60分以内、かつH200 GPUの1/7という厳密な制限内で結果を自律的に再現する必要があります。
- 評価基準に基づく審査員報酬システム:明確な答えのないタスクを再現するという課題に対処するため、本システムはまずClaude Opus 4.7を使用して、各タスクに対して独自のスコアリング基準を自動的に生成します(過学習を防ぐために元のゴールドプロットは非表示にします)。次に、Codex GPT-5.5が実行審査員として機能し、10分以内にコードリポジトリ、git履歴、およびインタラクション記録をレビューし、視覚的な一致、科学的主張の裏付け、実験の忠実性、リソース利用効率、科学的整合性の5つの側面に基づいて0~1ポイントの報酬シグナルを提供します。
- 長期強化学習トレーニングFaradayは、LoRAファインチューニング(ランク=128)を施した改良型GRPOアルゴリズムを採用し、128Kトークンのコンテキストウィンドウで学習率6×10⁻⁶でポストトレーニングを実行します。各バッチは、異なる時代の論文を網羅するように均等にサンプリングされ、トレーニングが単一の科学的パラダイムに支配されないようにし、長期にわたる検証不可能なタスクの安定した最適化を実現します。
ファラデーの使い方
Faradayは現在、研究開発およびリリース段階にあり、まだ公開API、製品インターフェース、ユーザーエクスペリエンスポータルなどは提供していません。
ファラデーの主な利点
- 小型モデルながら、大きな可能性を秘めている。270億個のパラメータに基づくQwen 3.6は、紙の再現タスクにおいてClaude Opus 4.8やGPT-5.5を凌駕し、科学的知能が超大規模モデルに依存しないことを証明した。
- ツール分離アーキテクチャコーディングエージェントをツールとして活用する(CAT)パラダイムを採用することで、ファラデーは科学的な意思決定に注力し、コードの実装をCodex GPT-5.5に委任することで、科学的知能と工学的知能の間で効率的な分業を実現している。
- 味覚育成に関する研究強化学習を通して「研究の好み」を学習することで、リソースが限られている場合でも、ハードコーディングや不正な近道を排除し、元の論文に忠実な規模縮小実験を設計することが可能になる。
- ドメイン横断的な一般化機械学習に関する論文で学習させ、科学のためのAIに関する論文でテストした場合、タスクの勝率が60%以上を維持しており、強力な分野横断的な転移能力を示している。
- スケーラブルなベンチマークReplicaに基づいてタスク空間が自動的に生成され、100件の論文から310件の再現可能なタスクへと拡張され、AI研究者がトレーニングを行うための拡張可能なデータ基盤を提供する。
- 安定した長距離RL
GRPO強化学習を長期にわたる検証不可能な研究課題に拡張することに成功し、課題ごとの評価基準判定とターンごとの評価割り当てによって安定した学習を実現した。
ファラデーのプロジェクト住所
- プロジェクト公式サイト:https://inherentlabs.ai/research/training-to-replicate
- arXiv技術論文:https://arxiv.org/pdf/2608.13331
ファラデーの類似製品の比較
| 比較対象寸法 | Faraday (Inherent) | The AI Scientist (Sakana AI) |
|---|---|---|
| コアポジショニング | 既存の研究結果の信頼性を検証するために、「論文の再現性」に焦点を当てる。 | エンドツーエンドの自律型研究:仮説生成から論文執筆までの全プロセス |
| 基本モデル | Qwen 3.6-27B(小型モデル+外部ツール) | Claude/GPTなどの最先端モデルを基礎として |
| 作業方法 | Codexをプログラミングツールとして使用し、まるで人間の博士課程学生のように論文の図やグラフを再現する。 | 自主的に研究アイデアを提案し、実験を行い、LaTeX論文を執筆する。 |
| タスク範囲 | 発表論文から特定の結果チャートを再現する(レプリカベンチマーク) | 研究テーマをゼロから完全に考案し、提出可能な論文を作成する。 |
| 検証方法 | 自動ルーブリック審査員+人間専門家による再現性品質評価 | 実際の学術会議(ICLRワークショップ)における査読を通じて検証済み |
| オープンソースの状況 | 論文とReplicaベンチマークは公開されているが、モデル自体はオープンソース化されていない。 | AI Scientist v1/v2のコードがGitHubでオープンソースとして公開されました。 |
ファラデーの応用シナリオ
-
学術論文の複製と検証研究機関はFaradayを利用して、発表された論文の再現性を一括検証することができ、機械学習分野における「再現性の危機」を解決できる。
-
博士課程研究訓練「仮想研究助手」として、古典的な論文を再現することで、博士課程の学生が実験計画法や科学的感覚を養うのに役立つ。
-
科学のためのAI実験検証材料科学、気象予報、バイオインフォマティクスなどの分野における学際的な論文から、実験結果を自動的に再現する。
-
研究ベンチマークAI科学者エージェントが科学研究タスクにおける様々なモデルの能力を測定するための、標準化されたレプリカ評価フレームワークを提供する。
-
研究方法論監査学術誌の査読者や助成金審査機関は、Faradayを使用して、投稿された論文における実験結果の信憑性と再現性を迅速に検証できます。