project
Protenix-v1 - ByteSeedチームによるオープンソースの生体分子構造予測モデル。
Protenix-v1は、ByteDanceのSeedチームが開発したオープンソースの生体分子構造予測モデルです。AlphaFold 3のデータカットオフ日(2021年9月30日)、モデルサイズ、推論予算といった厳密な制約の下で高い性能を達成した最初のモデルです。
Protenix-v1とは何ですか?
Protenix-v1は、ByteDanceのSeedチームが開発したオープンソースの生体分子構造予測モデルです。AlphaFold 3のデータカットオフ日(2021年9月30日)、モデルサイズ、推論予算に厳密に準拠した条件下で、AF3と同等、あるいはそれ以上の性能を達成した初の完全オープンソースモデルです。このモデルはAF3の推論時間スケーリング機能を再現しており、サンプリング予算を増やすことで対数線形的な性能向上を実現しています。抗体-抗原予測DockQの成功率は36%から47.68%に向上しました。このモデルは、学術的な公平な比較のための標準バージョンと、実用的な創薬シナリオのためのデータ拡張バージョン(2025年6月30日)という2つのバージョン戦略を採用しています。また、タンパク質テンプレートやRNA MSAなどの新機能もサポートしており、ベンチマークの問題に対処するためにPXMeter評価ツールキットが提供されています。
Protenix-v1の主な特徴
- 複合体構造予測本システムは、タンパク質間複合体、抗体-抗原複合体、タンパク質-核酸複合体、タンパク質-低分子複合体など、様々な生体分子複合体の高精度な三次元構造予測をサポートします。
- RNA MSAサポートRNA多重配列アライメント機能を統合しており、RNAの進化的な保存性や二次構造の特徴を捉えることができ、タンパク質-RNA複合体予測の精度を大幅に向上させる。
- テンプレート情報の統合既知のタンパク質構造テンプレートを導入することで、相同性情報を通じて予測の信頼性が向上し、モデル学習プロセスの収束が安定化する。
- 推論中の拡張機能サンプリングシードの数を増やすことでパフォーマンス向上をサポートし、ユーザーが計算コストと予測精度を柔軟にバランスさせることができるため、複雑なドッキングタスクに特に適しています。
- 導入された物理的制約これは原子レベルの接触制約と複合ポケット制約を提供し、構造生成を導くために、以前の実験データや物理的知識を組み込むことを可能にする。
- デュアルバージョンモデル戦略同時に、公平な比較と実用的なニーズとのバランスを取るため、学術ベンチマーク版(2021年9月30日時点のデータ)とアプリケーション最適化版(2025年6月30日時点のデータ)がリリースされます。
Protenix-v1の技術的原理
- インフラストラクチャーAlphaFold 3をベースとしたエンドツーエンドの拡散アーキテクチャは、MSAエンコーダ、Pairformer関係モデリングモジュール、および反復的なノイズ除去プロセスを通じて原子座標を直接出力する拡散生成モジュールで構成されています。
- Inference-Time Scalingこの技術の中核となる革新は、AF3の推論時間拡張特性を再現することにある。数百もの候補構造を並列にサンプリングし、それらをスコアリング関数と組み合わせて最適な解を選択することで、抗体-抗原結合などの柔軟なドッキングタスクの予測成功率が計算入力に対して対数的に増加する。
- テンプレート統合メカニズム私たちはKalignなどのツールを使用して相同テンプレートを検索し、テンプレートの特徴をPairformerのペア表現に注入することで、保存的なフォールディングファミリーを識別する能力を向上させ、初期トレーニング段階における不安定性を軽減します。
- RNA機能エンジニアリングMSAモジュールを拡張し、RNA配列アライメントをサポートし、ヌクレオチド進化情報と共変動シグナルをエンコードし、核酸相互作用モデリングにおける従来のタンパク質中心モデルの欠点を補う。
- 軽量設計(プロテニックスミニ)線形アテンション機構を用いることで計算の複雑さを軽減し、タンパク質言語モデルを導入して単一配列の推論を実現し、MSAデータベースの検索オーバーヘッドを排除し、大規模な仮想スクリーニングシナリオに適している。
Protenix-v1のプロジェクトアドレス
- GitHubリポジトリ:https://github.com/bytedance/Protenix
- 技術論文:https://github.com/bytedance/Protenix/blob/main/docs/PTX_V1_Technical_Report_202602042356.pdf
Protenix-v1の応用シナリオ
- 創薬と開発抗体-抗原複合体の予測は、Protenix-v1の核となる強みです。その推論時間の拡張性により、困難な免疫療法標的の構造モデリングの精度を大幅に向上させることができ、抗体工学およびエピトープ設計のための信頼できる基盤を提供します。
- タンパク質設計制約関数を用いて結合ポケットと重要な接触残基を指定することで、高親和性分子の合理的な設計を支援します。Protenix-Miniシリーズは、膨大な数の候補配列を迅速にスクリーニングするために使用できます。
- 構造生物学研究これは、実験的な構造生物学のための予測モデルを提供し、低解像度の結晶構造やクライオ電子顕微鏡密度マップの解析を支援し、実験における試行錯誤のコストを削減し、標的構造の特性評価を加速します。
- RNA関連研究タンパク質-RNA複合体予測機能は、RNA干渉、CRISPRシステム、RNA薬剤送達などの最先端分野に適用可能であり、核酸-タンパク質相互作用モデリングにおける従来のツールの欠点を補うものである。
- 大規模なバーチャル上映会軽量なMiniバージョンは、ハイスループットなドッキング評価をサポートしており、創薬の初期段階における化合物ライブラリやタンパク質変異体の迅速なフィルタリングを可能にし、高精度モデルとの「粗スクリーニング-精密化」ワークフローを構築します。