project
harrier-oss-v1 - マイクロソフトのオープンソース多言語テキスト埋め込みモデル
Harrier-OSS-V1は、Microsoftが開発したオープンソースの多言語テキスト埋め込みモデルで、Multilingual MTEB v2ベンチマークにおいて最先端(SOTA)のパフォーマンスを実現しています。このモデルはデコーダーのみのアーキテクチャを採用し、最終的なトークンプーリングとL2回帰を利用しています。
harrier-oss-v1とは何ですか?
Harrier-oss-v1は、Microsoftが開発したオープンソースの多言語テキスト埋め込みモデルで、Multilingual MTEB v2ベンチマークにおいて最先端(SOTA)のパフォーマンスを実現しています。このモデルはデコーダーのみのアーキテクチャを採用し、最終的なトークンプーリングとL2正規化によって高密度ベクトルを生成するため、検索、クラスタリング、意味的類似性、分類などのタスクに適しています。Harrier-oss-v1は、27B、0.6B、270Mの3つのバージョンがあり、極めて高いパフォーマンスとエッジ環境への導入要件とのバランスが取れています。また、オープンソースであり、商用利用も可能です。
harrier-oss-v1の主な特徴
-
テキスト埋め込みデコーダーのみのアーキテクチャを使用して、入力テキストを標準化された高次元の密なベクトル表現に変換します。
-
意味検索ベクトル類似性に基づく効率的な文書検索および情報取得。
-
テキストクラスタリング意味ベクトルに基づいて、関連するテキストを自動的にグループ化および分類します。
-
類似度計算これは、2つのテキストセグメント間の意味的関係を定量的に評価することを可能にする。
-
テキスト分類意味的特徴ベクトルを用いてテキストコンテンツを自動的に分類する。
-
バイリンガル鉱業言語横断的なテキストの意味的整合性とマッチング検索をサポートします。
-
結果は並べ替えられた。: 意味的な関連性に基づいて候補結果を最適化および並べ替え、精度を向上させます。
harrier-oss-v1 の使い方
-
モデルを取得するHuggingFaceのページにアクセスして、バージョン27B、0.6B、または270Mをダウンロードしてください。
-
ドキュメントを表示具体的な呼び出し方法を理解するには、モデルカードと使用例をお読みください。
-
モデルHuggingFace Transformersやその他のフレームワークを使用して、事前学習済みの重みを読み込みます。
-
入力テキスト処理対象のテキストシーケンスをエンコード用のモデルに入力します。
-
抽出ベクター最終的なトークンプーリングとL2正規化後の密なベクトルを取得します。
-
下流アプリケーションベクトルは、検索、クラスタリング、分類などの特定のビジネスシナリオに使用します。
harrier-oss-v1 のプロジェクトアドレス
- ハギングフェイスモデルライブラリ:
- https://huggingface.co/microsoft/harrier-oss-v1-27b
- https://huggingface.co/microsoft/harrier-oss-v1-0.6b
- https://huggingface.co/microsoft/harrier-oss-v1-270m
harrier-oss-v1の主要情報と使用要件
- プロデューサーマイクロソフト
- モデルタイプ多言語テキスト埋め込みモデル
- 建築デコーダーのみ
- コアテクノロジー最後に、トークンプーリングとL2正規化を行います。
- 評価結果多言語対応MTEB v2 SOTA(最先端技術)
- オープンソースライセンス友好的なオープンソースライセンス(おそらくMIT/Apache 2.0)
- モデルバージョン27B / 0.6B / 270M の3種類の仕様をご用意しています。
- ハードウェア要件バージョンに応じて処理能力を選択してください。27Bは十分なGPUリソースを必要としますが、270Mはエッジ環境に展開できます。
- ソフトウェアの依存関係HuggingFace Transformers、または互換性のあるフレームワークが必要です。
- 入力形式プレーンテキストシーケンス
harrier-oss-v1の主な利点
-
優れた業績多言語ベンチマークMTEB v2において、最先端(SOTA)の結果を達成しました。
-
高効率アーキテクチャこのモデルは、デコーダーのみの設計と最終的なトークンプーリングを組み合わせることで、高品質な意味ベクトルを生成します。
-
規模の柔軟性本製品は27B、0.6B、270Mの3つのバージョンを提供し、クラウドにおける高性能からエッジにおける低消費電力まで、あらゆるシナリオに対応します。
-
箱から出してすぐに使えますこのモデルはHuggingFaceでホストされており、複雑な環境設定なしで直接ダウンロードして読み込むことができます。
-
幅広い業務単一のモデルで、検索、クラスタリング、分類、類似度計算、バイリンガルマイニング、再ランキングという6つの主要なタスクを同時にサポートできます。
Harrier-OSS-V1と類似の競合製品との比較
| 寸法 | Harrier-OSS-V1 | E5-mistral-7b-instruct | BGE-M3 |
|---|---|---|---|
| プロデューサー | マイクロソフト | マイクロソフト | BAAI (智源) |
| 建築 | デコーダーのみ | エンコーダー・デコーダー | エンコーダー(XLM-RoBERTa) |
| コアテクノロジー | 最後に、トークンプーリングとL2正規化を行います。 | 弱教師あり対照事前学習+指示微調整 | 多言語・多機能トレーニング+ハイブリッド検索 |
| 最大 | 27B | 7B | 9B(複数サイズ) |
| 軽量版 | 0.6B、270M | なし | 568M |
| MTEBスコア | Multilingual MTEB v2 SOTA | それは(ハリアーの時代を超えて)長い間チャートを席巻した。 | 多言語対応能力に優れ、一部のタスクには最適です。 |
| 出力方法 | 密なベクトル | 密なベクトル | 密ベクトル+疎ベクトル+多ベクトル混合 |
harrier-oss-v1の適用シナリオ
-
セマンティック検索ベクトル類似性に基づいた、大規模文書データベースの効率的な情報検索と正確な検索。
-
テキストクラスタリング意味ベクトル特徴に基づいて、膨大な量のテキストをトピックの関連性に応じて自動的かつインテリジェントにグループ化および分類します。
-
インテリジェント分類このモデルは、テキスト埋め込み特徴ベクトルを使用して、コンテンツの種類を自動的に分類・区分します。
-
意味的マッチングベクトル類似度を計算することで、テキストの重複排除やコンテンツ推薦といった、より精度の高いマッチングシナリオを実現します。
-
言語横断検索数十の言語における意味的整合性をサポートしており、言語間のテキストの相互運用性と検索を可能にする。