AB
AiBoss
project

SAC-KG - 100万個以上のノードを持つドメイン知識グラフを構築できる汎用知識グラフ構築フレームワーク。

SAC-KGは、大規模言語モデル(LLM)に基づいてドメイン知識グラフを自動的に構築するための汎用フレームワークです。ジェネレータ、バリデーター、プルーナーの3つの主要コンポーネントで構成され、生のドメインコーパスからドメイン固有の知識グラフを自動的に生成できます。

SAC-KGとは何ですか?

SAC-KGは、大規模言語モデル(LLM)に基づいてドメイン知識グラフを自動的に構築するための汎用フレームワークです。ジェネレータ、バリデーター、プルーナーという3つの主要コンポーネントで構成され、特定のドメインの生データから、生成されたトリプルの精度を保証する第1レベルの知識グラフを自動的に生成できます。SAC-KGは100万ノードを超えるドメイン知識グラフを構築でき、89.32%の精度を達成しています。これは、現在の最先端手法よりも20%以上高い精度です。このフレームワークは、LLMをドメインエキスパートとして効果的に活用し、専門的で正確な多階層知識グラフを生成します。

SAC-KGの主な機能

  • 知識グラフの自動構築SAC-KGは、特定のドメインの構成要素から元のドメインコーパスに基づいて単層知識グラフを自動的に構築し、反復的に多層知識グラフを構築することができます。
  • 施工精度の向上SAC-KGのバリデーターとプルーナーは連携して、生成エラーを修正し、新しく生成されたテールが知識グラフの次のレベルで反復処理する必要があるかどうかを判断することで、精度を確保します。実験では、精度は89.32%に達し、既存の手法よりも20%以上高くなりました。
  • 専門化ドメインエキスパートとしての大規模言語モデル(LLM)に基づいて、SAC-KGによって生成される知識グラフは高度な専門性を持ち、特定のドメインに関連するトリプルを生成することができます。
  • 生成プロセスを制御するSAC-KGは、オープンな知識検索システムとプルーナーを導入することで、生成プロセスを効果的に制御し、生成されたトリプルが正しい形式であり、ドメイン要件を満たしていることを保証できます。
  • 大規模建設能力SAC-KGは、100万ノードを超える規模のドメイン知識グラフを自動的に構築することができ、大規模データセットの処理におけるその優位性を示している。
  • 教師なし学習法SAC-KGは、データにラベル付けすることなく、大規模な非構造化テキストコーパスを持つあらゆる分野に適用できる教師なし学習手法です。
  • 一貫性評価SAC-KGによって生成された知識グラフの高品質と信頼性は、GPT-4および人間の評価との整合性を比較することによって検証された。

SAC-KGの技術原理

  • ジェネレータジェネレーターは、元のドメインコーパスとオープンソースの知識グラフから関連情報を取得し、それを大規模言語モデル(LLM)への入力として供給して、特定のドメインの第一レベルの知識グラフを生成する役割を担います。ジェネレーターは、以下の2つのサブモジュールで構成されています。
    • ドメインコーパス検索ドメインコーパスは文に分割され、エンティティの出現頻度に基づいてソートされます。最後に、ソートされた文が連結されて固定長のテキストとなり、LLM(言語学習モデル)に入力されます。
    • オープン知識検索オープンソースの知識グラフに含まれるエンティティについては、関連するトリプルが例として提供されます。オープンソースの知識グラフに含まれないエンティティについては、セグメント化されて再度取得されます。それでも一致しないエンティティについては、10個のトリプルがランダムに選択され、提案として提示されます。
  • 検証者バリデーターの役割は、ジェネレーターによって生成された誤ったトリプルを検出して除外することです。これには次の2つのステップが含まれます。
    • エラー検出RuleHubから抽出した7,000以上のルールを使用して、生成されたトリプルは、数量、形式、および競合についてチェックされます。
    • エラー訂正検出されたエラーの種類に基づいて、適切なプロンプトを表示し、LLMに再度プロンプトを表示して正しいトリプルを生成させます。
  • 剪定ばさみ剪定と検証は連携して、新しく生成された末尾が知識グラフの次のレベルで反復する必要があるかどうかを判断することで精度を確保し、構築された知識グラフの制御性を向上させます。オープンソースの知識グラフであるDBpediaに基づき、微調整されたT5バイナリ分類器モデルは、各正しいトリプレットの末尾エンティティを入力として受け取り、「成長中」または「剪定済み」を出力します。これは、エンティティが知識グラフの次のレベルの生成を継続するか、それ以上の生成を停止するかを示します。

SAC-KGプロジェクトの住所

SAC-KGの応用シナリオ

  • 専門分野の知識グラフの構築SAC-KGは、医学、生物学、ソーシャルネットワークなど、さまざまな分野に適用でき、特定のドメインの知識グラフの構築に役立ちます。
  • 自動化と精度の向上SAC-KGは、自動化された構築プロセスを通じて知識グラフ構築の自動化と精度を向上させ、89.32%の精度を達成しました。これは、現在の最先端の手法よりも20%以上高い値です。
  • 専門化SAC-KGは、ドメインエキスパートとして大規模言語モデル(LLM)を活用し、ドメイン固有のトリプルを生成することで、知識グラフに高度な専門性をもたらします。
  • 大規模データ処理SAC-KGは、100万ノードを超える規模のドメイン知識グラフを自動的に構築することができ、大規模データセットの処理におけるその優位性を示している。