AB
AiBoss
project

Seed-Thinking-v1.5 - ByteDanceの最新思考モデル

Seed-Thinking-v1.5は、ByteDanceが発表した推論型インテリジェンスモデルです。ハイブリッドエキスパート(MoE)アーキテクチャを採用し、合計200個のパラメータを持ち、イテレーションごとに20個のパラメータを有効化します。このモデルは、AIなどの複数のベンチマークテストで優れた性能を発揮します。

Seed-Thinking-v1.5とは何ですか?

Seed-Thinking-v1.5は、ByteDanceが発表したインテリジェント推論モデルです。合計2000億個のパラメータを持つハイブリッドエキスパート(MoE)アーキテクチャを採用し、セッションごとに200億個のパラメータをアクティブ化します。このモデルは複数のベンチマークテストで非常に優れた性能を発揮し、AIME 2024で86.7、Codeforces pass@8メトリックで55.0、GPQAテストで77.3のスコアを達成しました。推論以外のタスクでは、DeepSeek R1を8%上回り、幅広い適用性を示しています。Seed-Thinking-v1.5の開発には、厳選されたトレーニングデータ、高度な強化学習フレームワーク、2層報酬システム、効率的なインフラストラクチャが用いられました。このモデルは、4月17日にVolcano Engineのオープンインターフェースを通じてユーザーテストに利用可能になります。

Seed-Thinking-v1.5の主な特徴

  • 卓越した推論能力Seed-Thinking-v1.5は、AIME 2024スコア86.7、Codeforcesのpass@8評価55.0%、GPQAスコア77.3など、複数の権威あるベンチマークテストで非常に優れた成績を収めています。これは、STEM(科学、技術、工学、数学)分野およびプログラミングにおける強力な推論能力を実証するものです。
  • 幅広い一般化能力このモデルは推論以外のタスクにおいても優れた性能を発揮し、DeepSeek R1よりも勝率が8%高く、複雑なユーザーシナリオへの対応における優位性を示している。
  • 効率的なインフラ大規模なトレーニングをサポートするため、Seed-Thinking-v1.5はHybridFlowプログラミングモデルとストリーミング推論システム(SRS)を採用し、3層並列アーキテクチャ(テンソル/エキスパート/シーケンス並列処理)によってトレーニング効率を最適化しています。

種子思考の技術的原則-v1.5

  • ハイブリッドエキスパートモデル(MoE)アーキテクチャSeed-Thinking-v1.5は、合計200個のパラメータを持つエキスパート混合モデル(MoE)アーキテクチャを採用し、一度に20個のパラメータを有効化します。これにより、計算リソースの消費量を大幅に削減し、高いパフォーマンスを維持しながらモデルの効率性を向上させます。
  • 強化学習アルゴリズム
    • VAPOおよびDAPOフレームワーク強化学習における不安定性の問題に対処するため、研究チームはVAPO(アクタークリティック)とDAPO(ポリシー勾配)という2つの主要なフレームワークを提案した。これらの手法は、堅牢な学習軌跡を提供し、推論モデルを効果的に最適化する。
    • 報酬モデリング研究チームは、Seed-VerifierとSeed-Thinking-Verifierという2つの報酬モデリング手法を設計した。Seed-Thinking-Verifierは、詳細な推論プロセスを通じて、報酬の欺瞞、予測の不確実性、境界ケースの処理の失敗といった問題に対処する。
  • データ処理とデータ拡張
    • 検証可能な問題これには数学、プログラミング、論理パズルが含まれており、厳密な選別と強化(例えば、多肢選択問題を穴埋め問題に変換するなど)を通じて、モデルが真の推論能力を学習することを保証します。
    • 検証不可能な問題例えば、創作文や対話においては、モデルが局所最適解に陥るのを防ぐために、分散の小さいサンプルが動的にフィルタリングされます。
    • データ拡張戦略例えば、モデルを用いて候補となる解答を生成し、手動による検証によって誤った参照解答を修正することで、データの信頼性を向上させることができる。
  • 分散型トレーニングインフラストラクチャ
    • ハイブリッド並列アーキテクチャテンソル並列処理(TP)、エキスパート並列処理(EP)、コンテキスト並列処理(CP)を組み合わせることで、効率的な大規模トレーニングをサポートします。
    • ストリーミング生成システム(SRS)非同期処理と動的リソーススケジューリングを用いることで、長文テキスト生成の効率が3倍向上し、従来の同期フレームワークにおける「末尾処理問題」が解決される。
    • 自動チューニングシステムシステムは、リアルタイムの負荷に基づいて最適なコンピューティング構成を動的に選択し、メモリとコンピューティングリソースのバランスを取ります。

Seed-Thinking-v1.5のプロジェクトアドレス

Seed-Thinking-v1.5のパフォーマンス

  • 数学的推論AIME 2024テストでは86.7点を獲得し、OpenAIのo3-mini-highと同等のスコアとなった。
  • プログラミングタスクCodeforcesのベンチマークテストでは、pass@8の指標が55.0%に達し、DeepSeek-R1を上回った。
  • 科学に関する質疑応答GPQAテストにおける精度は77.3%に達し、これはトップモデルのレベルに近い。
  • 非推論タスク非推論タスクにおける勝率はDeepSeek R1よりも8%高く、高い汎化能力を示している。

Seed-Thinking-v1.5の応用シナリオ

  • 科学に関する質疑応答Seed-Thinking-v1.5は、科学的な質問への回答においても優れた性能を発揮します。このモデルは、科学的な概念や原理を含む複雑な質問を理解し、回答することができるため、教育と研究の両方に適しています。
  • クリエイティブライティングこのモデルは、歴史上の人物の内面的な独白をシミュレートしたり、異なる分野の用語を融合させた物語を生成したりするなど、時間軸を超えた対話を生成できます。コンテンツ制作、広告、脚本執筆など、様々な分野での応用が期待されます。
  • 論理的推論Seed-Thinking-v1.5は、論理的な分析と推論を必要とする問題の処理において大きな利点があり、法的分析や市場戦略の立案など、論理的な判断と分析を必要とするシナリオに適しています。
  • 教育支援Seed-Thinking-v1.5の推論機能は、学生が数学や科学の問題を解決したり、プログラミング演習にフィードバックを提供したり、言語学習をサポートしたりするのに役立ちます。