project
Qwen2.5-1M - アリババの同義千文プラットフォームが提供するオープンソースの言語モデルで、100万個のトークンコンテキストをサポートします。
Qwen2.5-1Mは、アリババ同義千文チームが公開したオープンソースモデルで、100万トークンのコンテキスト長をサポートしています。このモデルには、Qwen2.5-7B-Instruct-1MとQwen2.5-14B-Instruct-1Mの2つのバージョンがあります。(文章がここで突然終わっていますが、おそらく文が不完全か情報が欠落しているためです。)
Qwen2.5-1Mとは何ですか?
Qwen2.5-1M は、アリババの Tongyi Qianwen チームによって開発されたオープンソース モデルで、最大 100 万トークンのコンテキスト長をサポートしています。このモデルには、Qwen2.5-7B-Instruct-1M と Qwen2.5-14B-Instruct-1M の 2 つのバージョンがあります。長いコンテキスト タスクで非常に優れたパフォーマンスを発揮し、特に 64K を超える長さのタスクを処理する場合、以前の 128K バージョンを上回ります。Qwen2.5-14B-Instruct-1M モデルは、Qwen2.5-Turbo を上回り、複数のデータセットで一貫して GPT-4o-mini を上回ります。Qwen2.5-1M シリーズ モデルは、短いテキスト タスクでは 128K バージョンと同等のパフォーマンスを発揮し、長いシーケンスを処理する能力が向上しても、基本的な機能が損なわれないことを保証します。
Qwen2.5-1Mの主な機能
- 長時間のコンテキストタスク処理Qwen2.5-1Mシリーズモデルは、最大100万トークンのコンテキストを処理でき、従来の128Kバージョンを凌駕する性能を発揮します。コンテキスト長が100万トークンのパスキー取得タスクにおいて、Qwen2.5-1Mシリーズモデルは、最大1Mの長さのドキュメントから隠された情報を正確に取得できます。
- パフォーマンス上の利点Qwen2.5-14B-Instruct-1Mモデルは、Qwen2.5-Turboを上回り、複数のデータセットにおいてGPT-4o-miniを常に凌駕した。
- 短シーケンスタスク処理Qwen2.5-1Mシリーズのモデルは、短いテキスト処理タスクにおいて128Kバージョンと同等の性能を発揮し、長文シーケンス処理機能を追加しても基本的な機能が損なわれないことを保証します。
Qwen2.5-1Mの技術原理
- 長期コンテキストトレーニングQwen2.5-1Mは、コンテキスト長を4Kから256Kまで拡張する段階的長さ拡張方式を採用しています。トレーニングプロセスは複数の段階に分かれています。
- 事前トレーニング段階4Kから始めて徐々に256Kまで増やしながら、調整ベース周波数方式を使用してRoPEベース周波数を10,000から10,000,000まで増加させる。
- 監視および微調整段階トレーニングは2段階で行われます。第1段階では、短い命令(長さ32Kまで)のみを微調整し、第2段階では、短い命令と長い命令(長さ256Kまで)を組み合わせてトレーニングを行います。
- 強化学習フェーズ短いテキスト(最大8KB)で学習させることができ、短いテキストで学習させた場合でも、人間の好みを一致させる性能を長い文脈のタスクにもうまく一般化できる。
- スパースアテンションメカニズム事前充填段階を高速化するために、Qwen2.5-1MはMinferenceに基づくスパースアテンション最適化を導入し、一連の改善を提案しています。
- ブロックの事前充填入力シーケンスは長さ32768のブロックに分割され、各ブロックは事前にデータが書き込まれるため、ビデオメモリの必要量が大幅に削減されます。
- 統合長さ外挿スキームDCAベースの長さ外挿スキームをスパースアテンションメカニズムに統合することで、長いシーケンスタスクにおける推論効率と精度が向上する。
- スパース性最適化本論文では、長さ100万のシーケンスにおけるスパース性構成を最適化する方法を提案し、それによってスパースアテンションによって引き起こされる精度損失を低減する。
- その他の最適化: オペレータの効率と動的ブロックパイプラインの並列処理を最適化することで、フレームワーク全体の可能性を高めます。
- 長さの外挿Qwen2.5-1Mは、モデルのコンテキスト長を256Kから1Mに拡張するために、長さ外挿技術を採用しています。デュアルチャンクアテンション(DCA)法は、過度に大きな相対位置をより小さな値に再マッピングすることで、長いコンテキストタスクにおけるパフォーマンス低下の問題に対処します。
Qwen2.5-1Mプロジェクトの住所
- プロジェクト公式サイト:https://qwenlm.github.io/zh/blog/qwen2.5-1m/
- ハギングフェイスモデルライブラリ:https://huggingface.co/spaces/Qwen/Qwen2.5-1M-Demo
- 技術論文:https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen2.5-1M/Qwen2_5_1M_Technical_Report.pdf
Qwen2.5-1Mのアプリケーションシナリオ
- 長編小説に対する深い理解一度に10冊の小説を処理し、詳細な分析と理解を行うことができる。
- 複数の論文を読む複数の学術論文を同時に処理できるため、研究者は重要な情報を迅速に入手することができる。
- 創作それは作家が小説を創作する際に役立ち、執筆のインスピレーションや創造的なコンテンツを提供する。
- 広告コピーライティング広告主が魅力的な広告コピーを迅速に作成するのに役立ちます。
- 教材教育分野においては、生徒が複雑な概念を理解するのを助けるための教材として活用される。
- データ分析研究分野では、大量のデータや文献を分析するのに役立ちます。