AB
AiBoss
project

Evo 2 - Acr InstituteがNVIDIA、スタンフォード大学などと共同で開発した生物学的AIモデル。

Evo 2は、Arc Research Institute、NVIDIA、スタンフォード大学、およびその他の機関の共同開発によって生まれたDNA言語モデルです。ゲノムモデリングと設計に使用され、生命のあらゆる分野を網羅しています。Evo 2は、StripedHyena 2アーキテクチャに基づいています。

Evo 2とは何ですか?

Evo 2は、Arc Research Institute、NVIDIA、スタンフォード大学、およびその他の機関の共同研究によって開発されたDNA言語モデルです。ゲノムモデリングと設計に使用され、生命のあらゆる領域を網羅しています。StripedHyena 2アーキテクチャをベースとするEvo 2は、単一ヌクレオチド解像度で最大100万塩基対のコンテキスト長を処理できます。自己回帰事前学習には、生命のあらゆる領域から8.8兆個のタグを含むOpenGenome2データセットを使用します。Evo 2は、長鎖配列モデリング、DNA配列生成、埋め込みベクトル抽出をサポートし、多様なニーズに対応するために複数のモデルチェックポイントを提供します。Evo 2は、ゲノミクス研究と応用を推進し、生物医学や合成生物学などの分野に強力なツールを提供します。

Evo 2の主な機能

  • 長期コンテキストモデリング最大100万塩基対のDNA配列を処理でき、高精度なゲノムモデリングをサポートする。
  • DNA配列生成与えられた指示に基づいて新しいDNA配列を生成する。合成生物学や遺伝子編集に応用可能。
  • 埋め込みベクトル抽出遺伝子機能予測や変異影響解析などの下流解析のために、DNA配列の埋め込みベクトルを抽出します。
  • ゼロサンプル予測遺伝子変異が機能に及ぼす影響を予測するなど、ゼロショット学習をサポートします(例:BRCA1遺伝子変異の影響を予測する)。
  • シーケンススコアリングDNA配列の安定性と機能的可能性を評価するために、その配列の尤度スコアを計算します。

Evo 2の技術原理

  • 大規模データトレーニングこのモデルは、細菌、古細菌、真核生物など、複数の生命形態の生物を網羅する12万8000以上のゲノムから得られた、9兆3000億以上のヌクレオチドのデータに基づいて訓練された。
  • 独自のAIアーキテクチャStripedHyena 2アーキテクチャに基づいて、最大100万ヌクレオチドの遺伝子配列を処理し、ゲノムの離れた部分間の関係を理解する。
  • 深層学習と生成生物学深層学習技術に基づき、言語を理解するのと同じように核酸配列を理解することを目指している。進化の過程で形成された生物学的配列パターンを学習することで、遺伝子変異の影響を予測し、新たなゲノムを生成する。
  • 強力なコンピューティングサポートEvo 2のトレーニングには、NVIDIAのDGX Cloud AIプラットフォームと2,000個以上のH100 GPUが活用されており、強力なコンピューティング能力と効率的なモデルトレーニングを実現しています。

Evo 2プロジェクトの住所

Evo 2の応用事例

  • 疾患予測遺伝子変異が病原性であるかどうかを特定し、疾患の診断に役立てる。
  • 遺伝子治療副作用を軽減するために、細胞特異的な遺伝子治療ツールを設計する。
  • 合成生物学人工生命研究を支援するための新たなゲノムの設計。
  • 進化研究遺伝子配列パターンを特定し、生物進化を研究するため。
  • バイオツール開発バイオセンサーなどのツールを設計し、バイオテクノロジーを発展させること。