AB
AiBoss
project

ImBD - 復旦大学、華南理工大学などが共同で開発した汎用AIコンテンツ検出器。

ImBD(Imitate Before Detect)は、復旦大学、華南理工大学、武漢大学、Fenzi AIなどが開発した、機械編集されたテキストを検出するための手法です。まず、大規模言語モデル(LLM)のテキスト生成プロセスを模倣します。

IMDbとは何ですか?

ImBD(Imitate Before Detect)は、復旦大学、華南理工大学、武漢大学、Fenzi AIなどが開発した、機械編集されたテキストを検出するための手法です。まず、大規模言語モデル(LLM)によって生成されたテキストのスタイルを模倣し、スタイル選好最適化(SPO)に基づいてスコアリングモデルを調整することで、機械編集されたテキストの特性にさらに適合させます。次に、スタイル条件付き確率曲率(Style-CPC)を利用して、元のテキストと条件付きサンプリングによって生成されたテキストとの間の対数確率の差を定量化し、人間の文章と機械編集されたコンテンツを効果的に区別します。ImBDは、異なるLLMによるテキスト修正、複数のテキストドメイン、さまざまな修正タイプなど、さまざまなシナリオで非常に優れた性能を発揮し、検出性能を大幅に向上させ、少量のデータと短いトレーニング時間で優れたパフォーマンスを実現します。

ImBDの主な機能

  • 検出機械改訂版テキスト書き換え、加筆、推敲など、機械編集されたテキストを効果的に識別します。テキスト内の機械特有の表現を捉え、人間の文章と機械編集されたコンテンツを区別することで、検出精度を向上させます。
  • 様々な状況に適応可能ImBDは、様々なテキスト領域や異なる種類の機械編集タスクに適用可能です。ニュース記事、学術論文執筆、物語創作など、様々な分野における機械編集の痕跡を正確に検出でき、優れた汎化能力を備えています。
  • 効率的な訓練と推論ImBDは、少数のサンプルと短い学習時間で優れた性能を実現します。推論段階ではテキストデータを迅速に処理し、検出結果を提供するとともに、実用的なアプリケーションの効率要件を満たします。

ImBDの技術原則

  • スタイル嗜好最適化(SPO)スコアリングモデルは、SPOに基づいて調整され、機械校正されたテキストのスタイル特性により適合するようにしました。人間が書いたテキストと機械校正されたテキストのペアを使用することで、最適化されたモデルのトークン分布が機械校正されたテキストのスタイルにより適合し、モデルが機械のスタイルの特徴を認識する能力が向上しました。
  • スタイル条件付き確率曲率(Style-CPC)検出段階では、Style-CPCを用いて、元のテキストと条件付きサンプリングによって生成されたテキストとの間の対数確率差を定量化します。この差に基づいて、モデルは人間が書いたテキストと機械が編集したテキストを効果的に区別できます。なぜなら、機械編集されたテキストは、通常、人間が書いたテキストとは異なる確率分布特性を示すからです。
  • 模倣と検出の組み合わせImBDの核心的な考え方は、検出を行う前にまず機械のスタイルを模倣することです。機械のスタイル特性を模倣することで、モデルは機械修正されたテキストの特徴をよりよく理解し、検出中に機械修正の痕跡をより正確に識別し、検出の精度と堅牢性を向上させることができます。

ImBDプロジェクトの住所

ImBDの応用シナリオ

  • 学術分野これは査読者が論文中の機械編集された部分を特定するのに役立ち、独創性と学術的誠実性を確保する。
  • ニュースメディアニュース記事における機械編集されたコンテンツを検出し、報道の信憑性と正確性を確保します。
  • 出版業界編集者が原稿を校正する際に役立ち、機械編集による修正箇所を特定し、書籍の品質を保証します。
  • 教育このシステムは、学生の課題のうち機械支援部分を評価し、学生の能力を正確に評価し、的を絞ったフィードバックを提供する。
  • 企業と商業マーケティングコピーやその他の資料を精査し、独創性と品質を確保するとともに、著作権やブランドに関する問題を回避する。
  • ネットワークセキュリティと情報検証オンライン上の誤情報に含まれる、機械生成または改変されたコンテンツを特定し、ネットワークのセキュリティと情報の信頼性を維持する。