project
SlideChat - 上海AIラボが複数の大学や研究機関と共同で開発した、視覚的な言語アシスタント。
SlideChatは、上海AI研究所、厦門大学、華東師範大学などの研究機関によって開発された、ギガピクセルレベルのフルスライス画像を理解できる初の視覚言語アシスタントです。SlideChatは、フルスライス画像の詳細な説明を生成できます。
SlideChatとは何ですか?
上海AI研究所、厦門大学、華東師範大学などが開発したSlideChatは、ギガピクセルレベルの全スライス画像を理解できる初の視覚言語アシスタントです。SlideChatは全スライス画像の詳細な説明を生成し、多様な病理学的シナリオに対して状況に応じた複雑なコマンド応答を提供します。トレーニングに基づき、SlideChatは顕微鏡検査や診断を含む複数の臨床タスクにおいて優れた性能を発揮しています。SlideChatは、大規模なマルチモーダルコマンドデータセットSlideInstructionと、21種類の臨床タスクを網羅する複数のサブセットを含む評価ベンチマークSlideBenchを活用しています。
SlideChatの主な機能
- 全スライス画像の理解ギガピクセルレベルの全スライス病理画像(WSI)を処理・理解し、画像の詳細な分析を提供する。
- マルチモーダル対話機能ユーザーとのマルチモーダルな対話をサポートし、自然言語によるコマンドを理解し、視覚情報を組み合わせることで応答を提供する。
- 複雑なコマンド応答複雑な視覚的クエリや病理関連の指示に応答し、実行する。
- 臨床業務のカバー範囲顕微鏡検査や診断など、さまざまな臨床現場において優れた性能を発揮し、21種類の臨床タスクに対応します。
SlideChatの技術原則
- 画像セグメンテーションスライス画像全体は、計算と処理を容易にするために、224×224ピクセルの小さなパッチに分割されます。
- ローカルエンコーダ各画像パッチは、ローカルエンコーダに基づいて視覚的埋め込みに変換され、ローカルな特徴を捉えます。
- スライドレベルエンコーダーローカルエンコーダの出力をスライドレベルエンコーダで処理し、グローバルコンテキスト情報を含むコンテキスト埋め込みを生成します。
- マルチモーダル投影マルチモーダルプロジェクターは、視覚的特徴を大規模言語モデル(LLM)に準拠した統一空間にマッピングする。
- 2段階トレーニング:
- ドメイン間アライメント最初の段階では、モデルはLLMの単語埋め込みをWSIから抽出された視覚的特徴に合わせることを学習します。
- 視覚的な指導学習第2段階では、モデルはWSIに特有のドメイン固有の質問に正確に回答する方法を学習します。
SlideChatのプロジェクトアドレス
- プロジェクト公式サイト:uni-medical.github.io/SlideChat.github.io
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/General-Medical-AI/SlideBench
- arXiv技術論文:https://arxiv.org/pdf/2410.11761
SlideChat アプリケーションシナリオ
- 病理診断補助これは病理医が組織切片全体の画像を分析・解釈するのに役立ち、癌などの重篤な病理学的状態を含む様々な疾患の診断を支援する。
- 教育と訓練医学教育においては、病理スライドの解釈方法を学び、診断スキルを向上させるための教育ツールとして活用される。
- 研究開発研究者たちは、疾患のサブタイプを分類し、疾患の進行や患者の予後を予測するための新たなバイオマーカーを研究している。
- 臨床意思決定支援これは臨床ワークフローに統合され、リアルタイムの病理学的分析を提供することで、医師がより正確な治療決定を下すのに役立ちます。
- 品質管理と標準化病理検査室では、診断の一貫性と正確性を確保するためには、人的ミスを減らすための自動分析が不可欠である。