project
白川-M4 - 白川知能と清華大学が共同開発した医療拡張モデル
白川-M4は、白川智能と清華大学が共同開発した次世代医療拡張モデルです。HealthBench総合、Hard、Professionalという3つの権威ある健康ベンチマークで世界第1位を獲得し、幻覚発生率はわずか3.3%です。
白川M4とは何ですか?
Baichuan-M4は、Baichuan Intelligenceと清華大学が共同開発した次世代医療拡張モデルです。HealthBenchの総合、難易度、専門性の3つの主要ベンチマークで世界第1位を獲得し、誤認識率は業界最低の3.3%に抑えています。Baichuan-M4は、一般的な大規模モデルにおける受動的な応答という限界を打破し、詳細な相談、疾患の全過程の記憶、エビデンスの定着、自律的なエージェントのスケジューリングという4つのコア臨床機能に焦点を当てることで、AIが単に質問に答えるだけでなく、効果的に病気を診断することを可能にします。
白川M4の主な機能
-
綿密な事前相談このシステムは、臨床医による複数回の問診をシミュレートし、患者が症状についてより詳細な情報を提供するよう促し、完全な情報が揃うのをただ待つのではなく、重篤な症例や重症症例の特定を優先する。
-
病気の全経過に関する記憶過去の医療記録、複数回の診察、検査結果の推移、投薬に関するフィードバックなどを統合することで、数多くの対話を通じて患者の病歴を継続的に包括的に理解することができます。
-
証拠の定着生成された各医学的結論は、権威ある論文またはガイドラインの特定の段落に正確に対応しており、追跡可能性と検証可能性が確保されています。
-
エージェントのスケジュール管理Baichuan-Harnessは、フォローアップの質問をするタイミング、病歴の取得や確認のタイミングを自律的に判断し、複雑なサブタスクを並行して処理します。
-
安全上の制約不正なツール呼び出し、不正なデータアクセス、および臨床基準に準拠しない操作をリアルタイムで傍受します。
白川M4の技術原理
- OSCEに基づく動的な協議医学教育で用いられる客観的構造化臨床試験(OSCE)の手法に基づき、150名以上の第一線で活躍する医師と協力して、SCAN-bench評価システムを開発しました。このモデルは、動的な対話を複数回繰り返すことで実際の患者診察プロセスをシミュレートし、症状の性質や原因について積極的に質問することで診断範囲を徐々に絞り込み、重要な病歴の見落としを防ぎながら迅速な診断を目指します。
- 病気の全経過に関する長期的な文脈記憶単一ターンの対話記憶の限界を克服するため、このモデルは長期コンテキスト臨床記憶メカニズムを採用し、構造化された医療記録、過去の診察概要、検査結果、および投薬に関するフィードバックを継続的に統合します。複数のタイムラインにわたる複数のやり取りを通して、このモデルは患者の身元、過去の病歴、および主要指標の変化に関する包括的な理解を維持し、精密医療のためのパーソナライズされたデータ基盤を提供します。
- 6つの情報源に基づくエビデンスに基づく実践とエビデンスの定着「6つの情報源に基づくエビデンス」パラダイムに基づき、オープンネットワークから収集された情報源は除外し、信頼できる医学情報源のみを取得します。ガイドライン、専門家のコンセンサス、実際の治療プロセスは、200以上の疾患を網羅する1000を超える標準化された臨床パスウェイユニットに細分化されます。モデルの出力は、参照番号だけでなく、元の文献の特定の段落に正確に紐付けられる必要があり、引用精度は90.0%となります。
- 白川ハーネスエージェントアーキテクチャ医療インテリジェンスエージェントの中枢神経系として、相談、記憶、エビデンスに基づく医療という3つの主要モジュールの呼び出しを自律的にスケジュールします。負荷の高いタスクに直面した場合は、並列処理のためにサブタスクに分割し、メインエージェントのコンテキストへの負荷を軽減します。同時に、不正なツール呼び出しやデータアクセスをブロックするリアルタイムのセキュリティガードを内蔵し、困難なオンラインケースの反復的な解決をサポートします。
白川M4の使い方
- 初期症状の説明ユーザーは、白川スマート製品ポータルを通じて、現在の身体的な不快感を説明したり、検査結果をアップロードしたりすることができます。
- 積極的な複数ラウンドにわたるフォローアップ質問M4は、症状の部位、持続時間、誘因、既往歴などの重要な情報を補足するために、対象を絞ったフォローアップ質問を自動的に開始します。
- 医療相談カードを作成する情報収集が完了すると、モデルは病歴と症状を構造化された診察カードに整理し、予備的な医学的アドバイスを提供する。
- 継続的なフォローアップ管理ユーザーはいつでも新しい症状や検査結果を追加でき、M4は病気の経過全体の記憶に基づいて、病気の進行状況を継続的に追跡します。
白川M4のコアとなる利点
-
評価のあらゆる側面において主導的な役割を果たすHealthBenchの3つのベンチマークすべてにおいて、合計スコア68.6で世界第1位にランクインし、2位のGPT-5.5を10ポイント以上上回った。
-
業界で最も低い幻覚発生率事実に基づく幻覚の発生率はわずか3.3%で、GPT-5.5(3.8%)やDeepSeek-V4-Pro(9.8%)よりも有意に低かった。
-
コンサルティング能力において圧倒的なリードを誇る初期のSCAN-benchスコアは79.0、追跡調査時のスコアは74.7であり、いずれも主流の一般的な大型モデルよりも有意に優れていた。
-
証拠に基づく精度は非常に高い。白川EBMの引用精度は90.0に達し、GPT-5.5(54.7)をはるかに上回った。
-
長期記憶長い文脈を伴う臨床記憶は86.9点を獲得し、前世代のM3と比較して21.1点向上した。
-
臨床応用可能200種類以上の疾患を網羅する1,000を超える臨床パスウェイユニット。すべて上級専門家によって検証済み。
白川M4プロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2606.08982
白川M4と類似競合製品との比較
| 比較対象寸法 | Baichuan-M4 | GPT-5.5 |
|---|---|---|
| HealthBench総合版 | 68.6(世界第1位) | 58.4 |
| HealthBench Hard | 49.7 | 33.8 |
| HealthBench Prof | 55.1 | 51.8 |
| 幻覚率 | 3.3%(業界最低水準) | 3.8% |
| SCANベンチ初期診断 | 79.0 | 68.8 |
| SCAN-benchフォローアップ予約 | 74.7 | 67.7 |
| 長期的文脈における臨床記憶 | 86.9 | 81.7 |
| 証拠に基づく引用精度 | 90.0 | 54.7 |
| 相談モード | ネイティブスピーカーによる、深く掘り下げた積極的な質問。臨床医による複数回の質問ラウンドをシミュレートします。 | ロールプレイングの指示に頼りすぎると、性急な結論に陥る可能性がある。 |
| メモリ機構 | 病歴の全過程を記憶し、医療記録と経過観察を時系列に沿って統合する | 文脈記憶が限られている。病気の経過が長いと、初期の情報を忘れてしまう。 |
| 証拠追跡 | 論文/ガイドライン内の特定の段落に正確に紐づけられている | 参考文献レベルの引用は、段落レベルでの精度が不十分である。 |
| 建築設計 | 白川ハーネスエージェントによる自律的なオーケストレーションとスケジューリング | 外部の手動ワークフローオーケストレーションと複数モジュール間の連携が必要となる。 |
| 臨床パスの適用範囲 | 1000以上の標準化された経路ユニット、200以上の疾患 | ネイティブの臨床パスウェイシステムはありません |
白川M4の応用事例
-
定期健康相談利用者が身体的な不快感を感じた場合、複数回のフォローアップ質問を通じて予備的な評価と医療アドバイスを受けることができ、それによって根拠のない医療処置を避けることができる。
-
慢性疾患の長期管理高血圧や糖尿病などの慢性疾患患者の服薬状況や指標の変化を継続的に記録し、個別のフォローアップリマインダーを提供する。
-
診断前の相談患者は病院で登録する前に症状確認を完了することができ、それによって構造化された診察カードが作成され、対面診察の効率性が向上する。
-
地域をまたいだ家族ケア子供たちは遠隔で両親の健康状態を監視でき、このモデルは長期的な記録と組み合わせることで、初期段階の心不全などの隠れたリスクを特定することができる。
-
医学教育と研修OSCE方式に基づき、動的な相互作用を通して、医学生に標準化された再利用可能な臨床思考トレーニングを提供する。