project
MemPrivacy - メモリテンソルとHonor AIが共同開発したプライバシー保護フレームワーク。
MemPrivacyは、MemTensorチーム、Honor AIチーム、および同済大学が共同開発したオープンソースのエッジクラウド協調エージェント向けプライバシー保護フレームワークです。クラウドベースのエージェントにおける長期記憶シナリオでのプライバシー漏洩リスクに対処します。
MemPrivacyとは何ですか?
MemPrivacyは、MemTensorチーム、Honor AIチーム、および同済大学が共同開発したオープンソースのエッジクラウド協調エージェントプライバシー保護フレームワークです。クラウドエージェントの長期メモリシナリオにおけるプライバシー漏洩リスクに対処するため、「ローカル可逆擬似匿名化」スキームを提案しています。エッジはユーザー入力内の機密情報を識別し、意味的に型付けされたプレースホルダー(例:...)に置き換えます。 <Email_1>、<Health_Info_1>実際の値マッピングはローカルのSQLiteデータベースに保存されます。クラウドはプレースホルダーに基づいて推論、メモリへの書き込み、および取得を引き続き実行します。返された後、ローカルデータベースから実際のコンテンツに復元されます。
MemPrivacyの主な機能
-
ローカル可逆擬似匿名化クライアント側は、ユーザー入力内のプライベートな断片を識別し、意味的に意味のあるプレースホルダー(例:...)に置き換えます。
<Email_1>、<Health_Info_1>実際の値とプレースホルダーのマッピングは、ローカルのSQLiteデータベースに永続的に保存されます。クラウド上ではプレースホルダーのみが表示され、平文は表示されません。送信後、ローカルデータベースは実際のコンテンツを復元します。 -
4段階のプライバシー分類システム(PL1~PL4)識別可能性、潜在的な危害、およびユーザビリティの基準に基づいて、プライバシーは基本プロファイルレベル(PL1)、アイデンティティアンカーレベル(PL2)、高リスク機密レベル(PL3)、およびクリティカルコアレベル(PL4)に分類され、ユーザーが脱感作閾値と保護戦略を自由に設定できるようにサポートします。
-
3つのマスキングモード:
type_specific型付きプレースホルダー(意味役割を保持し、最適な有用性を実現)generic汎用プレースホルダー(プライバシー保護には優れているが、意味的な意義は低い)complete機密性の高いセグメントを完全に削除する(プライバシーは最大限に保護されるが、実用性は最も低くなる)。 -
端末-クラウド-端末の3段階プロセスアップリンクの機密性低減(ローカル)→クラウド処理(推論/メモリ書き込み/ツール呼び出し)→ダウンリンクの復旧(ローカル)により、アーキテクチャレベルの分離を実現し、クラウドコンポーネントが元の機密値にアクセスしないことを保証します。
-
複数仕様のエンドサイドモデルオープンソースの0.6B、1.7B、4Bパラメータバージョン(Qwen3シリーズをベースとしている)は、いずれも軽量IoTから高性能エッジデバイスまで、さまざまな導入ニーズに対応できるよう、SFTおよびRLトレーニングバージョンを提供している。
-
MemPrivacy-Bench(自社開発の評価ベンチマーク)本システムは、200人の合成ユーザー、中国語と英語の二言語による複数ターン対話、および15万5000を超えるプライバシー項目を対象としており、プライバシー抽出精度とメモリシステムユーティリティ損失のエンドツーエンド評価をサポートします。
-
開封後すぐに使える評価キットこのソフトウェアには、主要な3つのメモリシステム(Mem0、LangMem、Memobase)に対応したエンドツーエンドの評価スクリプトが組み込まれており、さまざまな保護戦略の下でのプライバシーと利便性のトレードオフを直接テストできます。
-
低遅延ローカル処理単一メッセージのプライバシー検出と匿名化にかかる遅延は1秒未満であるため、ユーザーのリアルタイムなインタラクティブ体験に影響を与えることなく、シームレスなエッジ展開に適しています。
-
永続的なマッピング管理ローカルのSQLiteデータベースは、セッション間でプレースホルダーと実際の値のマッピングを保存し、エージェントの長期メモリシナリオにおける継続的なプライバシー保護をサポートします。
MemPrivacyの使い方
-
リポジトリをクローンして依存関係をインストールします:
git clone https://github.com/MemTensor/MemPrivacy.git仮想環境を作成し、実行するpip install -r requirements.txt。 -
プライバシーフレームワークのパラメータを設定する:編集
src/privacy_config.yamlLLM API 認証情報、ローカル SQLite データベースのパス、およびマスク レベル (例: ...) を設定します。PL3、PL4)。 -
評価キットのパラメータを設定する(オプション):編集
evaluation/eval_config.yaml各役割ごとに、OpenAI API、メモリシステムデータベース接続(Mem0 / Memobase)、およびLLMを設定します。 -
コア脱感作プロセスを実行する: 電話
src/privacy_masking.pyでmask_dialogue()アップリンク感度低減を実行し、マスクモードを選択します(type_specific/generic/complete)。 -
クラウドインタラクション匿名化されたテキストはクラウドベースのLLM/メモリシステムに送信され、そこでクラウドはプレースホルダーに基づいて推論とメモリ操作を実行します。
-
下降回復: 電話
unmask_dialogue()ローカルのSQLiteマッピングテーブルを使用して、クラウドレスポンス内のプレースホルダーを実際の値に復元します。 -
ランタイムメモリシステムの評価(オプション):実行
python evaluation/eval_mem0.py/eval_langmem.py/eval_memobase.pyエンドツーエンドのベンチマークテストを実施する。
MemPrivacyのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/MemTensor/MemPrivacy
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/IAAR-Shanghai/memprivacy
- arXiv技術論文:https://arxiv.org/pdf/2605.09530
MemPrivacyの技術原則
-
局所的に可逆な擬似匿名化アーキテクチャこのシステムは「エンド→クラウド→エンド」の3段階プロセスを採用しています。エンドデバイスは、プライバシー検出と匿名化、ローカルマッピングとストレージ、およびダウンリンクリカバリを担当します。クラウドはプレースホルダーを含むテキストのみを処理するため、アーキテクチャレベルでの分離が実現され、元の機密値がクラウドに渡ることは決してありません。
-
きめ細かなプライバシー検出モデル本研究では、Qwen3シリーズプラットフォームをベースとした専用のプライバシー抽出モデルを訓練します。SFT段階を通して、26,000件の高品質な複数ターン対話からプライバシー保護型のローカリゼーションおよび置換機能を学習し、その後、GRPO強化学習を用いて、曖昧な境界条件下における再現率と精度のバランスを最適化します。
-
4段階のプライバシー分類ツリー(PL1~PL4)プライバシー評価システムは、識別可能性、潜在的な危害、およびユーザビリティという3つの側面に基づいて構築されています。PL1は機密性の低い嗜好プロファイル、PL2はIDアンカー情報、PL3は高リスクの機密データ、PL4は重要なコア認証情報を表します。このシステムは、ポリシーのしきい値に基づいてユーザーが動的に保護をトリガーすることをサポートします。
-
意味を保持するプレースホルダー置換メカニズム機密性の高い部分を、型付きのプレースホルダー(例:...)に置き換えます。
<Email_1>、<Health_Info_1>従来型と比較して***マスクまたは一般的な<Mask_1>これにより意味役割情報が保持され、クラウドベースのエージェントはタイプに基づいてコンテキストを理解し、推論、メモリ取得、およびツール呼び出しを実行できるようになります。 -
ローカルSQLiteマッピングの永続化クライアント側でプレースホルダーと元の実数値の暗号化されたマッピングデータベースを確立し、セッション間で永続的に保存し、長期記憶シナリオでの双方向変換をサポートし、マッピングされたデータはローカルにのみ存在し、アップロードされません。
-
3つのマスキング戦略間の動的な切り替え:
type_specificパターンは意味の保持とシステムの有用性を最大化する。genericパターンは意味的露出面を縮小する。completeこのモードでは機密性の高いセグメントが直接削除され、ユーザーはプライバシーレベルやシナリオのニーズに応じて柔軟に選択できます。
MemPrivacyの主な利点
-
プライバシー抽出精度が大幅に向上MemPrivacy-4B-RLは、MemPrivacy-Benchにおいて85.97%のF1スコアを達成し、OpenAI privacy-filterの35.50%を50.47%上回りました。また、クロスディストリビューションデータセットであるPersonaMem-v2においても、約9%の差をつけてリードしています。
-
システムの利用損失は極めて低い。PL2~PL4を保護する場合、メモリシステムの精度は0.71%~1.60%しか低下しません。PL4のみを保護する場合は、低下率は0.89%未満ですが、従来の不可逆マスクでは16%~42%の大幅な低下を引き起こす可能性があります。
-
汎用大型モデルを圧倒するGPT-5.2、Gemini-3.1-Pro、DeepSeek-V3.2-Thinkといった一般的なモデルと比較しても、MemPrivacy-4B、さらには0.6Bのマイクロバージョンでさえ、プライバシー抽出タスクにおいて圧倒的な性能を発揮します。
-
きめ細かな意味保持型付きプレースホルダーを使用することで、クラウドエージェントは意味構造を理解できるようになり、「エージェントの記憶喪失」やタスクロジックの破綻を防ぐことができます。
-
低遅延エッジ展開単一メッセージ処理の遅延は1秒未満であるため、シームレスなローカル展開に適しています。
-
2段階トレーニング戦略まず、26,000件の高品質な複数ターン対話データ(SFT)を用いて、プライバシー保護機能を備えた基本的な位置特定と置換の手法を習得します。次に、GRPO強化学習を導入し、曖昧な境界条件下における再現率と精度とのバランスを最適化します。
MemPrivacyの類似製品の比較
| 比較対象寸法 | MemPrivacy | OpenAI privacy-filter |
|---|---|---|
| 出版社 | MemTensor + Glory + 同済大学 | OpenAI |
| リリース時間 | 2026年5月15日 | 2026年4月22日 |
| モデルパラメータ | 0.6B / 1.7B / 4B(Qwen3に基づく) | 合計パラメータ数15億、活性化パラメータ数約5000万 |
| プライバシーラベルの粒度 | きめ細かい型付きプレースホルダー(例: <Health_Info_1>) |
8つの基本タグ(例) [PRIVATE_PERSON]、[SECRET]) |
| プライバシー分類システム | 4段階層別化(PL1~PL4)、調整可能な閾値 | 明確な分類はなく、均一な処理が行われている。 |
| コアメカニズム | ローカル可逆擬似匿名化(エンド-クラウド-エンド) | 双方向トークン分類、直接マスク/置換 |
| F1スコア(MemPrivacy-Bench) | 85.97%(4B-RLバージョン) | 35.50% |
| システムユーティリティ損失 | 0.71% ~ 1.60% | 従来のマスク着用は、16%から42%の急落につながった。 |
| コンテキストの長さ | 長文テキストへの適応 エージェントのメモリシナリオ | 128K |
| オープンソースの範囲 | モデルの重み、コード、評価ベンチマークはすべてオープンソースです。 | モデルはオープンソースです |
MemPrivacyの応用シナリオ
-
エッジサイドのスマートアシスタント向けプライバシー強化モバイルAIアシスタント向けにローカルなプライバシーフィルタリングレイヤーを提供し、ユーザーの健康データや財務データが平文でクラウドに送信されないようにします。
-
エンタープライズレベルのエージェントコンプライアンス展開顧客サービス担当者および医療担当者が顧客の個人情報(PII)を扱う場合、データコンプライアンス要件を満たすこと。
-
長期記憶パーソナルアシスタントスケジュール、好み、自宅住所などのユーザーの長期記憶データを保護しつつ、パーソナライズ機能を維持する。
-
国境を越えたクラウドサービスのためのプライバシー分離中国本土のユーザーからのデータは、データ輸出に関する法令遵守要件を満たすため、クラウドで処理される前に現地で匿名化されます。
-
プライバシー保護に関する調査ベンチマークMemPrivacy-Benchを使用して、さまざまなメモリシステム(Mem0、LangMem、Memobase)のプライバシーと利便性のトレードオフを評価します。