project
TTT-Discover - スタンフォード大学とNVIDIAが開発したテスト時強化学習手法
TTT-Discover(Test-Time Training to Discover)は、スタンフォード大学やNVIDIAなどの機関によって開発されたAI科学的発見手法です。TTT-Discoverは、テスト段階で強化学習を用いてモデルを訓練し、重みを固定しません。
TTT-Discoverとは何ですか?
TTT-Discover(Test-Time Training to Discover)は、スタンフォード大学やNVIDIAなどの機関によって開発されたAI科学発見手法です。テスト段階では、TTT-Discoverは強化学習を用いてモデルをトレーニングし、凍結されていない重みは探索にのみ使用されます。エントロピー目的関数とPUCTに着想を得た状態再利用メカニズムを組み合わせることで、報酬の最大化を最適化し、モデルが特定の問題を試行錯誤しながらリアルタイムで学習できるようにします。オープンソースモデルgpt-oss-120bをベースとするTTT-Discoverは、数学、GPUカーネルエンジニアリング、アルゴリズム競技、バイオインフォマティクスなどの分野で最先端(SOTA)のパフォーマンスを実現し、1問題あたりわずか数百ドルのコストで利用できます。
TTT-Discoverの主な機能
-
テスト中の継続的な学習モデルの重みは、特定の問題を解決する際に動的に更新されるため、AIは失敗した試行からリアルタイムで経験を蓄積し、目標とする進化を達成することができます。
-
科学的発見の最適化目標は、数学、工学、アルゴリズム、生物学などの分野における未解決問題に対し、既存の知識を凌駕する最適な解決策を見出すことである。
-
効率的な検索戦略エントロピー目的関数を通して高報酬の行動に焦点を当て、それをPUCTメカニズムと組み合わせることで過去の状態を賢く再利用し、探索と利用のバランスを実現します。
-
低コストで高性能オープンソースモデルを使用することで、複数のタスクにおいて最先端の性能を達成でき、トレーニング費用は問題あたりわずか数百ドルに抑えられます。
TTT-Discoverの技術原理
- エントロピー目的関数最適化の目標は 。いつ この時点では、目的は平均報酬ではなく最大報酬の最大化に収束し、モデルが単一の最適解を見つけることに集中するようになります。適応的なアプローチが採用されています。 トレーニングの安定性を維持するために、KLダイバージェンスを制御する。
- PUCTに触発された州の再利用スコアリング関数を使用して、過去の解のバッファを維持する。 初期状態を選択してください。 子ノードの報酬のうち、平均値ではなく最大値を取得する。 これは、高ポテンシャル状態の活用と多様性の探求の両方を考慮に入れた、報酬順位付けされた事前分布に基づいています。
TTT-Discoverプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2601.16175
TTT-Discoverの応用シナリオ
- 数学研究エルデシュの最小重なり問題や自己相関不等式などの未解決の数学的問題に対する境界値を最適化し、新しい構成的証明を発見する。
- GPUカーネルエンジニアリングこれは、AlphaFoldのTriMul演算子やDeepSeekのMLAデコードなど、人間の専門家を凌駕する速度で高性能なコンピューティングカーネルを自動的に生成するのに役立ちます。
- アルゴリズムコンペティションTTT-Discoverは、AtCoderなどのプログラミングコンテストにおけるNP困難な最適化問題を解決することができ、幾何学的計算や生産計画といった複雑なタスクも含まれる。
- バイオインフォマティクスTTT-Discoverは、シングルセルRNAシーケンスにおけるノイズ低減アルゴリズムを改善し、遺伝子発現データ解析の精度を向上させることができる。