project
SensorFM - Googleがウェアラブル健康データのための汎用的な基盤モデルを発表
SensorFMは、Google Researchが開発した、ウェアラブルヘルスデータのための大規模センサー基盤モデルです。500万人の参加者から得られた1兆分を超えるラベルフリーのマルチモーダルセンサーデータを使用して事前学習されており、一般的な生物学的特性を学習します。
SensorFMとは何ですか?
SensorFMは、Google Researchが開発した、ウェアラブルヘルスデータ向けの大規模センサー基盤モデルです。500万人の参加者から収集した1兆分を超えるラベルなしマルチモーダルセンサーデータを用いて事前学習を行い、一般的な生理学的特徴を学習します。心血管系、代謝系、睡眠、メンタルヘルスなど、35種類の健康予測タスクに適用可能です。データ補完と効率的なラベル適応をサポートし、パーソナルヘルスエージェントの基盤ツールとして機能します。
SensorFMの主な機能
- 一般的な生理学的表現学習我々は、PPG、加速度計、EDA、皮膚温度、高度計という5つのセンサーモダリティから、1分間の集計特徴量を34個抽出し、個人やデバイスを横断する一般的な生理学的表現を学習した。
- マルチドメイン健康予測これは、心血管系、代謝、睡眠、メンタルヘルス、ライフスタイル、人口統計という6つの主要カテゴリにわたる35の下流判別タスクを網羅しています。
- 欠落データの補完生成型事前学習機能を用いることで、センサーデータの欠落部分に対して時間補間および時間外挿が実行されます。例えば、60分間のデータが欠落している場合でも、1日の歩数予測精度は99.7%に維持されます。
- タグベースの高効率適応ラベル付きサンプルが少量しかない場合でも、新しいタスクに迅速に適応でき、データが少ないシナリオでは、完全教師あり学習に基づくベースラインよりも優れた性能を発揮します。
- エージェント予測ヘッド設計複数のLLMエージェントをデプロイして連携や競合を行い、最適な下流予測ヘッダーコードを自動的に検索・生成し、30,000を超える候補ソリューションを探索します。
- パーソナルヘルスエージェントの統合下流予測因子をツールとしてパーソナルヘルスエージェントに組み込むことで、LLMの健康対応における状況認識、パーソナライゼーション、およびセキュリティを向上させることができる。
SensorFMの技術原理
- 自己教師あり再構成事前トレーニングSensorFMは、LSM-2ベースのマスク型オートエンコーダーフレームワークを採用し、高価な健康ラベル付けに頼ることなく、マスク領域の再構成平均二乗誤差を最小化することで、数兆分に及ぶラベルなしデータから生理学的信号の固有構造を学習します。
- Adaptive and Inherited Masking(AIM)実際のデバイスにおけるデータの欠落を手動マスクと同等に扱うことで、このモデルは不完全な記録から直接学習し、データの欠落を認識する生来の能力を備え、従来の補間におけるバイアスやデータ損失によって生じる無駄を回避します。
- データとモデルの共同拡張本システムは、パラメータ数を10万から1億、センサー時間を200万から20億に拡大した場合のスケーリングパターンを検証した。その結果、両方を同時に拡大した場合、事前学習損失と下流性能は飽和することなくほぼ線形に向上することがわかった。最大規模のモデルであるSensorFM-Bは、35個のタスクのうち33個で最高の性能を達成した。
- 線形検出評価SensorFMエンコーダーを固定し、軽量リニアヘッドをそのエンコーダーのみで学習させることで、埋め込み品質を直接的に検証しました。その結果、タスク34/35において、手動で設計した特徴量を用いた完全教師あり学習のベースラインを上回る性能を示し、モデルサイズが大きくなるにつれて人口統計学的特徴量への依存度が徐々に低下しました。これは、より大きなモデルが生理学的に関連する特性を暗黙的に学習したことを示しています。
- LLMエージェントの自動最適化このシステムは「教室」型のマルチエージェントシステムを構築し、複数のLLMエージェントが予測ヘッダーコードを反復的に生成、テスト、最適化できるようにします。最終的なソリューションは、20の分類タスクのうち16、15の回帰タスクのうち12において、単純な線形プロービングよりも優れた性能を発揮し、エージェントの能力が高いほど、より良いソリューションを見つけ出します。
SensorFMの使い方
SensorFMは現在、技術プレビュー段階にあり、学術研究の参考資料として利用できます。現時点では、直接体験したり、導入したりすることはできません。
SensorFMの主な利点
-
規模でリード500万人のデータと1兆分に及ぶデータを用いた事前学習に基づいており、現在、ウェアラブル機器のデータセットとしては最大規模かつ最も多様性に富んでいる。
-
高い汎用性単一の表現で、6つの主要な医療領域にわたる35のタスクを同時にカバーできるため、エンドポイントごとに個別のパイプラインを構築する必要がなくなります。
-
認識の欠如AIMメカニズムは、欠損データをノイズや負担ではなく、学習シグナルへと変換します。
-
タグ付け効率少数の注釈でも、完全な教師あり学習のベースラインを上回ることができ、医療分野における注釈不足という課題を解決できる。
-
自動適応LLMエージェントは予測ヘッドを自動的に設計するため、下流タスク開発への参入障壁が低くなります。
-
臨床的検証1,860人の臨床医による評価で検証された結果、パーソナルヘルスエージェントに組み込まれた回答は、関連性と安全性において大幅な改善を示した。
SensorFMのプロジェクトアドレス
- プロジェクト公式サイト:https://research.google/blog/sensorfm-towards-a-general-intelligence-and-interface-for-wearable-health-data/
- arXiv技術論文:https://arxiv.org/pdf/2605.22759
SensorFMの応用シナリオ
-
心血管系の健康状態のモニタリングPPG(光電容積脈波)と心拍変動特性に基づいて、不整脈や血圧傾向などの心血管リスクを継続的に評価し、早期警告を実現します。
-
代謝リスクスクリーニング睡眠時間、活動レベル、皮膚温度などの信号を組み合わせることで、糖尿病や肥満などの代謝リスク指標を推測することができる。
-
睡眠障害分析マルチモーダルセンサー融合を利用することで、睡眠段階や呼吸中断パターンを正確に識別でき、睡眠時無呼吸症候群などの疾患のスクリーニングに役立つ。
-
メンタルヘルス追跡心拍変動、皮膚コンダクタンス、活動パターンから、うつ病や不安などの心理状態を示す微弱なシグナルを抽出することで、長期的な感情モニタリングを支援することができる。