project
Miras - Googleが発表した、深層学習アーキテクチャ設計のための汎用フレームワーク
Mirasは、Googleが開発した汎用的なディープラーニングアーキテクチャ設計フレームワークであり、特にシーケンスモデリングタスクに適しています。連想記憶とアテンションバイアスの概念に基づき、MirasはTransformerや最新の線形RNNなどのモデルを再定義します。
ミラスとは何ですか?
Mirasは、Googleが開発した汎用的なディープラーニングアーキテクチャ設計フレームワークで、特にシーケンスモデリングタスクに適しています。連想記憶とアテンションバイアスの概念に基づき、MirasはTransformerや最新の線形RNNなどのモデルを、内部最適化目標を持つ連想記憶モジュールとして再定義します。Mirasは、連想記憶アーキテクチャ、アテンションバイアス目標、保持ゲート、および記憶学習アルゴリズムという4つの主要な選択肢に基づいてモデルを構築します。Mirasは、Moneta、Yaad、Memoraなど、それぞれ異なる利点を持つ新しいシーケンスモデルを生成できます。これらのモデルは、言語モデリングや常識推論などのタスクで非常に優れた性能を発揮し、既存のTransformerや線形RNNモデルを凌駕します。
Mirasの主な機能
- 既存のアーキテクチャを統合するこれは、既存の様々なシーケンスモデル(Transformer、RetNet、Mambaなど)を統一されたフレームワークに統合するものです。
- メモリ管理を最適化する注意バイアスと保持ゲートの概念を導入することで、Mirasは新しい情報の学習と古い情報の保持のバランスをより良く取ることができ、それによってモデルの記憶管理能力を最適化することができる。
- 新しいモデルを設計するこれは、Moneta、Yaad、Memoraなど、異なる注意バイアスと保持メカニズムを持つ新しいシーケンスモデルの設計をサポートします。
- モデルのパフォーマンスを向上させる長シーケンスタスクにおけるモデルのパフォーマンスを向上させ、高速な並列学習機能を維持する。
ミラスの技術原理
- 連想記憶連想記憶とは、入力(キー)を出力(値)にマッピングするメカニズムです。Mirasでは、シーケンスモデルは、入力と出力間の学習済みマッピングに基づいて情報を保存および取得する連想記憶モジュールとして捉えられます。連想記憶はMirasの中核であり、モデルがシーケンスデータから情報をどのように保存および利用するかを決定します。
- 注意バイアスアテンションバイアスは、連想記憶の内部最適化目標であり、モデルが特定のイベントや刺激を優先する度合いを測定するために使用されます。これは、モデルが入力(キーと値)間のマッピングをどのように学習するかを決定します。アテンションバイアスのさまざまな目標(ℓ²回帰、ℓ¹回帰、Huber損失など)を選択することで、データの感度と堅牢性を調整できます。
- ドアをそのままにしておく保持とは、モデルが新しい情報を学習しながら古い情報を保持する方法を制御する正則化メカニズムです。学習と保持のバランスを取るために、保持正則化項(ℓ²正則化、KLダイバージェンスなど)を導入します。これにより、モデルが古い情報を過度に忘れることを防ぎ、長いシーケンスタスクにおいてより優れたパフォーマンスを維持します。
- 記憶学習アルゴリズム記憶学習アルゴリズムは、連想記憶の目的関数を最適化するために使用されます。一般的なアルゴリズムには、勾配降下法とモーメンタム勾配降下法があります。適切な最適化アルゴリズムを選択することで、モデルの学習効率と収束速度を向上させることができます。
ミラスプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2504.13173
Mirasの応用シナリオ
- 言語モデリングこれは、自然言語処理の研究者やテキスト生成開発者が、長文テキストを効率的に処理し、長距離の依存関係を把握するために使用する。
- 常識的な推論AI研究者やインテリジェントアシスタント開発者は、暗黙的な情報を理解し、それに基づいて推論する能力を向上させることができる。
- 長文処理テキスト分析エンジニアと情報検索専門家は、長文テキスト処理の効率を最適化し、リソース消費を削減します。
- マルチモーダルタスクマルチモーダル研究者やマルチメディアコンテンツ分析エンジニアは、複数のモダリティからの情報を統合することで、クロスモーダル推論能力を向上させることができる。