AB
AiBoss
project

Seed 1.5-Embedding - ByteDanceのSeedチームが発表したベクトルモデル。

Seed1.5-Embeddingは、ByteDanceのSeedチームがリリースした最新のベクトルモデルで、Seed1.5(Doubao-1.5-pro)をベースにさらに学習されています。このモデルは、権威あるベンチマークリストMTEBにおいて、中国語と英語の両方で最先端(SOTA)の性能を達成しました。

Seed1.5埋め込みとは何ですか?

Seed1.5-Embeddingは、ByteDanceのSeedチームがリリースした最新のベクトルモデルで、Seed1.5(Doubao-1.5-pro)をベースにさらにトレーニングされています。このモデルは、権威あるベンチマークMTEBにおいて中国語と英語の両方で最先端(SOTA)のパフォーマンスを達成し、推論集約型検索タスクのBRIGHTリーダーボードでも優れた結果を達成しました。このモデルは、Seed1.5の事前学習済みLLMに依存するシャムデュアルタワー構造を採用し、2段階のトレーニングによって汎用表現能力を強化しています。第1段階では、教師なしデータを使用して事前ファインチューニングを行い、対照学習によって生成モデルをエンコーディングモデルに変換します。第2段階では、教師ありデータと合成データを使用してファインチューニングを行い、さまざまなタスクのデータを混合してマルチタスク最適化を行います。反復的なハードネガティブサンプルマイニング、擬似ネガティブサンプルフィルタリング、および合成データ最適化戦略により、データの構成と品質が向上し、検索タスクにおけるモデルのパフォーマンスが強化されます。Seed1.5-Embeddingは、2048、1024、512、256など、複数のベクトル次元をサポートしています。

Seed1.5-Embeddingの主な機能

  • テキスト意味符号化この手法は、入力テキストの意味を高次元表現ベクトルに符号化することで、関連するテキスト間のベクトル類似性を高めます。この符号化手法は、検索、分類、クラスタリングなどの下流タスクをサポートでき、検索、推薦、コンテンツ理解といったシナリオで広く利用されています。
  • 検索タスクこのモデルは、ベクトル類似度を計算することで、膨大な量の文書の中からユーザーのクエリに最も関連性の高い情報を迅速に特定します。推論を多用する検索タスクに優れており、複雑なクエリと文書のマッチング関係を理解することができます。
  • マルチタスク最適化分類、クラスタリング、ペアワイズ分類、並べ替え、検索、意味的テキスト類似性(STS)タスクなど、さまざまなタスクをサポートしているため、多様なアプリケーションシナリオに適しています。
  • 柔軟なベクトル次元のサポート複数のベクトル次元(2048、1024、512、256)をサポートしており、ユーザーはそれぞれのニーズに合わせて適切な次元を選択できます。低次元の場合でもモデルのパフォーマンス低下は最小限に抑えられ、ストレージと実行効率に関して柔軟な選択肢を提供します。
  • 推論能力の最適化推論を多用する検索データを構築することで、複雑なクエリや文書マッチングにおけるモデルの推論能力が最適化され、より複雑な意味関係や論理的推論タスクを処理できるようになる。

Seed1.5埋め込みの技術原理

  • モデルアーキテクチャSeed1.5-Embeddingは、シャム双塔型ベクトルモデル構造を採用しており、クエリベクトルとドキュメントベクトルはコサイン類似度を用いてマッチングされます。このモデルは、Seed1.5で事前学習済みのLLMをベースとし、一方向アテンションを双方向アテンションに置き換えることで、小規模なMoE(Mixture of Experts)モデルを構築します。パラメータはクエリ側とドキュメント側で共有されるため、高い運用効率が確保されます。
  • 2段階のトレーニングプロセス
    • フェーズ1教師なしデータを使用して事前微調整を行い、対照学習を通じて一方向アテンション生成モデルを双方向アテンション符号化モデルに変換し、さまざまなテキストマッチングパターンを完全にモデル化する。
    • フェーズ2微調整は教師ありデータと合成データを用いて行われ、マルチタスク最適化は様々なタスクのデータを組み合わせることで行われ、モデルが各タスクに最適な表現パターンを学習できるようにする。
  • データエンジニアリング戦略
    • ネガティブサンプルマイニングモデル自身の好みに基づいてハードネガティブ例をマイニングするための反復的なハードネガティブ例マイニング戦略を設計し、それによってモデルが細かい関連性を識別する能力を向上させる。
    • 偽陰性フィルタリング肯定的な例と酷似したテキストを自動的にフィルタリングし、誤った否定的な例が学習に影響を与えるのを防ぎます。
    • 合成データ: 一般的なシナリオと推論集約型のシナリオに対応するデータを構築し、複雑な検索タスクにおけるモデルのパフォーマンスを向上させる。

Seed1.5-Embeddingプロジェクトのアドレス

Seed1.5埋め込みの応用シナリオ

  • 情報検索と意味検索Seed1.5-Embeddingは、文書やWebページをベクトル化することで、意味レベルの検索をサポートし、再現率と精度を大幅に向上させます。例えば、質問応答システム(QA)、社内文書検索、カスタマーサービスなどのシナリオにおいて、このモデルはユーザーのクエリ意図をより正確に理解し、関連文書を迅速に見つけることができます。
  • テキストクラスタリングとトピック認識Seed1.5-Embeddingは、テキストベクトルを用いることで、膨大な量の文書をクラスタリングし、様々なトピックや分類情報を自動的に識別することができます。
  • 推薦システムレコメンデーションシステムでは、モデルはユーザーレビューや製品説明などのテキスト情報をベクトル化し、類似性を計算することで、類似の製品やユーザーを検索することができます。
  • テキスト分類と感情分析Seed1.5-Embeddingはテキストからベクトルを生成し、それを下流の分類モデルに入力することで、テキスト分類、感情分析、スタンス分析などのタスクのパフォーマンスを向上させることができます。従来のTF-IDF特徴量と比較して、生成されたベクトルはテキストの意味と文脈をより正確に表現できます。
  • 複雑なクエリの理解と推論このモデルは、推論を多用する検索タスクにおいて優れた性能を発揮し、複雑なクエリとドキュメント間の根本的なマッチング関係を深く理解していることを示します。例えば、生物学、地球科学、プログラミングなどの分野における複雑な検索タスクにおいて、Seed1.5-Embeddingはより正確な検索結果を提供します。