project
KaLM-Embedding - テンセントが発表した一連のテキスト埋め込みモデル
KaLM-Embeddingは、テンセントが開発した高性能テキスト埋め込みモデルシリーズで、高度な学習技術と高品質なデータによってテキスト埋め込みの性能を向上させています。最新バージョンのKaLM-Embedding-V2では、アーキテクチャと学習方法に改良が加えられています。
KaLM埋め込みとは何ですか?
KaLM-Embeddingは、Tencentが開発した高性能テキスト埋め込みモデルシリーズで、高度なトレーニング技術と高品質なデータによってテキスト埋め込みの性能を向上させています。最新バージョンのKaLM-Embedding-V2では、アーキテクチャとトレーニング方法にいくつかの革新が加えられており、例えば、因果的アテンションマスクを削除して双方向表現学習を実現したり、多段階トレーニングプロセス(事前トレーニング、ファインチューニング、対照蒸留を含む)を採用したりすることで、モデルの汎化能力と意味理解能力を大幅に向上させています。最新のKaLM-Embedding-Gemma3-12B-2511は、このシリーズの重要なバージョンであり、より大きなパラメータスケール(12Bパラメータ)に基づいてモデル性能をさらに最適化し、より高い精度が求められる複雑なタスクに適したものとなっています。
KaLM埋め込みの主な機能
-
高効率なテキスト埋め込み生成KaLM-Embeddingは、テキストを固定長の埋め込みベクトルに効率的に変換できるため、検索、分類、意味マッチングなど、さまざまな自然言語処理タスクに適しています。
-
多言語能力および異言語間能力多言語テキスト埋め込みをサポートしており、異なる言語間での意味的整合性と言語間検索を可能にすることで、言語間タスクのパフォーマンスを向上させます。
-
柔軟な埋め込み寸法柔軟な次元埋め込みをサポートし、マトリョーシカ表現学習技術を用いることで、異なる次元においても高いパフォーマンスを維持し、様々なアプリケーションシナリオに適応します。
-
強力な下流タスク適応テキスト分類、意味マッチング、情報検索、クラスタ分析など、さまざまな下流タスクに適しており、自然言語処理を包括的にサポートします。
KaLM埋め込みの技術原理
-
双方向注意機構従来の因果的注意マスクが取り除かれ、双方向の注意機構が採用されたことで、モデルは文脈情報を同時に考慮できるようになり、意味表現の精度が向上した。
-
平均値プーリングテキストシーケンスは、単純な平均プーリング法を用いて固定長の埋め込みベクトルに変換され、モデルの出力埋め込みが様々な下流タスクに適用可能であることを保証する。
-
多段階トレーニングプロセスモデルの埋め込み能力は、事前学習、ファインチューニング、比較蒸留という3つの段階を組み合わせることで段階的に向上します。事前学習段階では大規模な弱教師ありデータを使用し、ファインチューニング段階では高品質の教師ありデータを利用し、比較蒸留段階ではより強力な教師モデルからきめ細かい知識を学習します。
-
焦点再重み付けメカニズムフォーカス型重み付けは、学習が難しいサンプルに焦点を当て、トレーニングプロセスを最適化し、難しいサンプルからモデルが学習する能力を向上させます。
-
オンラインでの困難なサンプルプーリング困難なネガティブサンプルを動的に生成することで、トレーニング信号に大量の情報を継続的に提供し、古いネガティブサンプルを回避し、モデルの識別能力を向上させます。
-
マトリョーシカは学習を意味するマトリョーシカ技術により、柔軟な埋め込み次元をサポートし、異なる次元においても高いパフォーマンスを維持することで、様々なアプリケーションシナリオに対応します。
-
高品質なデータサポートトレーニングには多様で高品質なデータセットを使用し、タスク固有の指示、負荷の高いサンプルマイニング、マルチクラスラベリングなどの手法を組み合わせて、埋め込みの品質を確保しています。
-
比較学習と抽出InfoNCE損失関数を用いた対照学習により、より強力な教師モデルから対照蒸留を通してきめ細かいソフトシグナルが学習され、モデルのパフォーマンスがさらに最適化されます。
-
温度係数調整比較蒸留に温度係数を導入することで、学習信号の分布が最適化され、温度係数を調整することによってモデルの学習効率が向上します。
-
柔軟なモデルアーキテクチャコンパクトなモデルアーキテクチャ(例えば、パラメータスケールが0.5B)に基づいて、効率性を維持しながら高性能なテキスト埋め込みを実現します。
KaLM埋め込みモデルシリーズのバージョン
-
KaLM-Embedding-V1これはシリーズの初期バージョンであり、コンパクトなモデルアーキテクチャに基づき、因果的アテンションマスクを採用し、主に基本的なテキスト埋め込みタスク向けに設計されています。
-
KaLM-Embedding-V2V1をベースに、双方向表現学習を実現するために因果的注意マスクを削除したり、事前学習、ファインチューニング、対照蒸留を含む多段階のトレーニングプロセスを導入したりするなど、いくつかの改良が加えられ、モデルのパフォーマンスが大幅に向上しました。
-
KaLM-Embedding-V2.5これはV2をさらに最適化したバージョンであり、比較蒸留によってより強力な教師モデルからきめ細かいソフトシグナルを学習することで、モデルの埋め込み能力と汎化性能をさらに向上させています。
-
KaLM-Embedding-Gemma3-12B-2511これは最新バージョンであり、より大きなパラメータスケール(120億個のパラメータ)に基づいており、モデルのパフォーマンスをさらに最適化し、より高い精度を必要とする複雑なタスクに適しています。
KaLM-Embeddingプロジェクトのアドレス
- プロジェクト公式サイト:https://kalm-embedding.github.io/
- ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/KaLM-Embedding-Gemma3-12B-2511
- arXiv技術論文:https://arxiv.org/pdf/2506.20923
KaLM埋め込みの応用シナリオ
-
テキスト分類テキストを効率的に分類できるため、ユーザーはテキストのトピックやカテゴリを素早く特定できます。
-
意味的マッチングこれは、異なるテキスト間の意味的な類似性を正確に判断することができ、検索エンジンや推薦システムなどの分野で幅広く応用されている。
-
情報クラスタリング類似するテキスト情報を自動的に分類するため、ユーザーは大量のテキストデータをより簡単に管理・分析できるようになります。
-
検索のおすすめ意味理解を活用することで、検索結果の関連性とレコメンデーションの精度を向上させ、ユーザーによりパーソナライズされた体験を提供できます。
-
多言語理解多言語間の意味的整合性をサポートし、言語間検索や翻訳などのタスクで優れた性能を発揮するため、より正確な言語間意味理解が可能になります。