project
Lingshu - アリババが発表した、医療分野向けのマルチモーダル言語モデル。
Lingshuは、Alibaba DAMO Academyが開発した、医療分野に特化した大規模なマルチモーダル言語モデルです。このモデルは、X線、CTスキャン、MRIなど12種類以上の医用画像モダリティをサポートし、マルチモーダル質問応答、テキストベースの質問応答、医療関連の質問応答などに優れています。
霊舒とは何ですか?
Lingshuは、アリババDAMOアカデミーが開発した、医療分野に特化した大規模なマルチモーダル言語モデルです。X線、CTスキャン、MRIなど12種類以上の医用画像モダリティに対応し、マルチモーダル質問応答、テキストベースの質問応答、医療レポート生成などのタスクで優れた性能を発揮します。多段階トレーニングに基づき、Lingshuは徐々に医療専門知識を組み込み、医療分野における推論能力と問題解決能力を大幅に向上させています。パラメータバージョンは7Bと32Bの2種類があり、32Bバージョンは複数の医療マルチモーダル質問応答タスクにおいて、GPT-4.1などの独自モデルを凌駕する性能を示しています。Lingshuプロジェクトでは、主流の医療ベンチマークを統合したMedEvalKit評価フレームワークも導入し、医療AIモデルの標準化された評価と開発を促進しています。
霊舒の主な機能
- マルチモーダル医療に関するQ&A本システムは、X線、CT、MRIなど、さまざまな医用画像モダリティにおける視覚的な質問応答タスクをサポートします。入力された医用画像と関連する質問に基づいて、正確な回答を生成します。
- 医療レポートの作成Lingshuは、放射線レポートなどの高品質な医療レポートを作成できます。入力された医療画像に基づいて、詳細な「発見」および「所見」セクションを生成し、臨床医にとって貴重な参考情報を提供します。
- 医学知識に関するQ&ALingshuは、平易な文章で書かれた医学的な質問に答えることができ、幅広い医学知識を網羅し、医学生、臨床医、研究者に正確な情報を提供する。
- 医学的推論と診断支援Lingshuは強力な医療推論能力を備えており、入力された医療画像とテキスト情報に基づいて複雑な推論と診断支援を実行することが可能です。
- 医用画像の理解と注釈Lingshuは、病変の位置、種類、重症度など、医療画像における重要な特徴を理解して注釈を付けることができ、医師が画像の内容をよりよく理解できるよう、詳細な画像説明の生成をサポートします。
霊樹の技術的原則
- データ処理:
- データ収集複数の情報源から、医用画像データ、医療テキストデータ、および一般的なドメインデータを収集する。
- データクリーニング画像フィルタリング、重複排除、テキストクリーニングに基づいて、データの品質と関連性を保証します。
- データ合成トレーニングデータを充実させるために、高品質な医学用語タイトル、視覚的質問応答(VQA)サンプル、および推論軌跡を生成する。
- モデルアーキテクチャLingshuはQwen2.5-VLモデルアーキテクチャに基づいており、3つの主要コンポーネントで構成されています。テキスト入力を処理してテキスト出力を生成する大規模言語モデル(LLM)、医療画像から視覚的特徴を抽出するビジュアルエンコーダ、そして視覚的特徴を言語モデルの表現空間にマッピングするプロジェクターです。
- 多段階トレーニング:
- 医学的表層アライメント少数の医療画像とテキストのペアを用いて微調整を行うことで、モデルは医療画像を正確にエンコードし、対応する説明文を生成できるようになる。
- 医療深層アライメント医療知識をさらに統合するために、より大規模で高品質かつ意味的に豊かな医療画像とテキストのペアデータセットを導入します。
- 医療指示の変更大規模な医療指示データに基づいてモデルを最適化することにより、特定のタスク指示を実行する能力を向上させる。
- 医療指向の強化学習強化学習と検証可能な報酬(RLVR)パラダイムを用いて、モデルの医療推論能力を向上させる。
- 評価フレームワークMedEvalKit評価フレームワークをご紹介します。このフレームワークは、複数のマルチモーダルおよびテキストベースの医療ベンチマークを統合し、多肢選択式質問、選択式質問、自由記述式質問、医療レポート生成など、さまざまな質問形式をサポートします。標準化されたデータ前処理形式と後処理プロトコル、一貫性のあるモデル展開および推論インターフェースを提供することで、迅速な統合とワンクリック評価を実現します。
凌舒のプロジェクトアドレス
- プロジェクト公式サイト:https://alibaba-damo-academy.github.io/lingshu/
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/lingshu-medical-mllm/lingshu-mllms-6847974ca5b5df750f017dad
- arXiv技術論文:https://arxiv.org/pdf/2506.07044
霊舒の応用事例
- 医用画像診断このシステムは、複数の医用画像モダリティにおける視覚的な質問応答タスクを処理し、画像内の異常を分析して診断の提案を行い、詳細な画像説明を生成し、主要な特徴にラベルを付けることで、医師が正確な診断を下すのを支援することができます。
- 医療レポートの作成このシステムは、医用画像に基づいて高品質の放射線科および病理科の報告書を作成し、「発見」および「印象」のセクションを網羅することで、臨床医にとって重要な参考資料を提供し、報告書作成の効率と質を向上させます。
- 医学知識に関するQ&Aこれは、医学生、医療従事者、臨床医がより情報に基づいた意思決定を行うために必要な情報を得るのに役立つ、正確な医学知識を提供する。
- 医学研究医学研究において、医用画像およびテキストデータの整理と分析を支援する。
- 公衆衛生Lingshuは、公衆衛生データの処理、疫学研究の支援、帰属リスクの計算などを行うことができます。