project
Qwen2 - Alibaba Cloudが提供する、1000問の質問に対応した次世代型一般知識モデル(オープンソース)。
Qwen2は、アリババクラウドの同義千文チームがオープンソース化した次世代の大規模言語モデルです。このシリーズは、0.5Bから72Bまでの5つのスケールモデルを網羅し、既存の中国語と英語のモデルに27言語の高品質データを追加することで、大幅な改善を実現しています。
Qwen2とは何ですか?
Qwen2は、Alibaba CloudのTongyi Qianwenチームがオープンソース化した、次世代の大規模言語モデルです。このシリーズは、0.5Bから72Bまでの5つのスケールモデルを網羅し、既存の中国語と英語のモデルに27の言語からの高品質データを追加することで、モデルの自然言語理解、コーディング、数学的問題解決、多言語処理能力を大幅に向上させています。Qwen2は最大128Kトークンのコンテキスト長をサポートし、モデルの汎化性能と応用可能性を最適化しています。このモデルシリーズは複数のベンチマークで優れた性能を発揮し、MetaのLlama-3-70Bを凌駕しており、現在Hugging FaceとModelScopeプラットフォームでオープンソースとして公開されています。
Qwen2モデル情報
| モデル名 | パラメータ量(B) | 非埋め込みパラメータの数(B) | GQAは使用すべきでしょうか? | タイ埋め込みは | コンテキストの長さ(トークン数) |
|---|---|---|---|---|---|
| Qwen2-0.5B | 0.49 | 0.35 | はい | はい | 32K |
| Qwen2-1.5B | 1.54 | 1.31 | はい | はい | 32K |
| Qwen2-7B | 7.07 | 5.98 | はい | いいえ | 128K |
| Qwen2-57B-A14B | 57.41 | 56.32 | はい | いいえ | 64K |
| Qwen2-72B-Instruct | 72.71 | 70.21 | はい | いいえ | 128K |
- パラメータモデルに含まれるパラメータの総数(単位:十億(B))。
- 非埋め込みパラメータ数単語埋め込み部分を除いたパラメータの数。
- GQAは使用すべきでしょうか?このモデルはGQA(汎用クエリ応答)技術を採用していますか?
- タイ埋め込みはこのモデルは、入力層と出力層の間でパラメータを共有する手法を使用していますか?
- コンテキストの長さモデルが処理できる最大コンテキスト長(トークン単位)。
Qwen2公式サイトへの入り口
- 公式ブログ紹介:https://qwenlm.github.io/zh/blog/qwen2/
- GitHubアドレス:https://github.com/QwenLM/Qwen2
- ハグの顔のアドレス:https://huggingface.co/Qwen
- ModelScopeアドレス:https://modelscope.cn/organization/qwen
- Hugging Faceのオンラインデモ:https://huggingface.co/spaces/Qwen/Qwen2-72B-Instruct
Qwen2モデルレビュー
- Qwen2シリーズは複数のベンチマークテストで優れた性能を発揮し、特にQwen2-72Bモデルは大幅な性能向上を実現しました。
- 自然言語理解、知識、コード、数学、多言語能力といった機能面において、Qwen2-72Bは、Llama-3-70BやQwen1.5の110Bモデルといった現在の主要モデルを大幅に上回る性能を発揮します。
- 16のベンチマークテストにおいて、Qwen2-72B-Instructは基本機能と人間の価値観との整合性のバランスを示し、Qwen1.5の72Bモデルを凌駕し、Llama-3-70B-Instructと同等の性能を発揮した。
Qwen2のモデルハイライト
- プログラミングと数学Qwen2は、CodeQwen 1.5で得られた経験をうまく統合し、複数のプログラミング言語でパフォーマンスを向上させることで、コーディング機能と数学的機能を大幅に強化しました。大規模で高品質なデータに支えられた数学的機能は、問題解決能力の飛躍的な向上を可能にしました。
- 長文処理Qwen2シリーズのInstructモデルは、32kのコンテキスト長で学習され、YARNなどの技術を用いてより長いコンテキストに拡張されます。Qwen2-72B-Instructは、128kのコンテキスト長を持つ情報抽出タスクを完璧に処理できます。
- 安全多言語の安全でないクエリのカテゴリにおいて、Qwen2-72B-Instructはセキュリティの面でGPT-4に匹敵し、Mistral-8x22Bモデルを大幅に上回り、生成される有害な応答の割合を削減します。
- 多言語能力Qwen2は多言語評価において優れた性能を発揮し、27言語を処理する能力を向上させ、言語変換問題を最適化し、モデルにおける言語変換の確率を低減しました。