project
DeepSeek-V3.2 - DeepSeekのオープンソースAIモデルの正式リリース。
DeepSeek-V3.2-Expは、DeepSeek-AIが発表した実験的な人工知能モデルです。DeepSeek Sparse Attention(DSA)メカニズムを導入することで、長文テキスト処理の効率を大幅に向上させています。このモデルはDeepSeek-V3をベースにしています。
DeepSeek-V3.2とは何ですか?
DeepSeek-V3.2-Expは、DeepSeek-AIが開発した実験的な人工知能モデルです。DeepSeek Sparse Attention(DSA)メカニズムを導入することで、長文テキスト処理の効率を大幅に向上させています。このモデルはDeepSeek-V3.1-Terminusをベースに継続的に学習されており、アーキテクチャにDSAのみを導入することで、きめ細かなスパースアテンションメカニズムを実現しています。高速インデクサーを用いて重要な情報を効率的に選択することで、長文テキストの学習と推論の効率を大幅に向上させています。
パフォーマンス面では、DeepSeek-V3.2-Expは複数の公開ベンチマークデータセットにおいてDeepSeek-V3.1-Terminusとほぼ同等の性能を発揮し、様々な分野におけるその能力を実証しています。このモデルはHugging FaceおよびModelScopeプラットフォーム上でオープンソースとして公開されており、研究者や開発者による探索と応用を容易にしています。DeepSeek-V3.2-ExpのAPI価格が大幅に引き下げられたことで、開発者のコストが削減され、実用アプリケーションにおける普及がさらに促進されます。
- DeepSeek-V3.2(スタンダード版)推論速度と出力品質のバランスが取れており、日常的な使用に適しています。
- DeepSeek-V3.2-Speciale(拡張版)複雑な推論や長時間の思考作業に最適化されており、高いパフォーマンスを発揮する一方で、計算コストも高くなります。
DeepSeek-V3.2の主な機能
-
建築革新DeepSeek-V3.2-Expは、DeepSeek-V3.1-Terminusをベースに、DeepSeek Sparse Attention(DSA)メカニズムを導入しました。高速インデクサと高精度ラベル選択メカニズムにより、特に長文テキストのシナリオにおいて、大幅な効率向上を実現しています。
-
パフォーマンス最適化このモデルは、複数の公開評価データセットにおいてDeepSeek-V3.1-Terminusと同等の性能を発揮し、長文テキスト処理における推論コストを大幅に削減します。 最適化済み これにより、長文における推論の効率が大幅に向上する。
-
オープンソースの共有DeepSeek-V3.2-Expは、Hugging FaceおよびModelScopeプラットフォーム上でオープンソースとして提供されており、研究者や開発者による研究や応用を容易にするために、詳細な実装の詳細とモデルの重み付け情報を提供しています。
-
コスト削減API価格の大幅な下落により、開発者の利用コストが削減され、より多くの開発者がより低コストでモデルにアクセスして利用できるようになり、実用的なアプリケーションにおけるモデルの広範な導入が促進された。
-
アプリケーションの拡張公式アプリ、ウェブ版、ミニプログラムはすべてDeepSeek-V3.2-Expにアップデートされ、複数のアプリケーションプラットフォームに対応し、ユーザーにより効率的で経済的なAIサービス体験を提供します。
DeepSeek-V3.2の技術的原理
- 推論能力が大幅に向上しました
- GPT-5レベルに近づいているGSM8K、MATH、HumanEvalなど、複数の公開推論ベンチマークにおいて優れた性能を発揮し、GPT-5に迫るとともに、一部のタスクではGemini-3.0-Proを凌駕している。
- 数学的能力の向上DeepSeek-Math-V2の定理証明機能を統合し、IMO(国際数学オリンピック)やICPC(国際大学対抗プログラミングコンテスト)といったトップレベルの競技会で金メダルを獲得した人間のレベルを達成しています。
- より効率的な長文処理前バージョン(V3.1-Terminus)と比較して、このモデルは冗長なコンテンツを削減し、応答速度を向上させながら、高品質な出力を維持しています。
- エージェント(インテリジェントエージェント)機能の大幅なアップグレード
- 「思考+ツール活用」の統合をサポートする最初のモデル推論プロセス中に、外部ツール(コード実行、検索エンジン、APIなど)を動的に呼び出すことができます。複数ラウンドの思考モードをサポートし、複雑なタスクを解決する際に、より安定したパフォーマンスを発揮します。
- 大規模なエージェントトレーニングデータ1800種類以上の異なる環境と85,000種類以上の複雑な命令で学習されたこのモデルは、タスクの計画と実行能力を大幅に向上させます。オープンソースのエージェント評価において最高のパフォーマンスを発揮し、クローズドソースモデル(GPT-5やClaude 4など)との差を縮めています。
- よりスマートなツール呼び出し
- クロード・コードを応援しようコード実行機能を最適化し、PythonやSQLなどのツールと組み合わせて複雑な計算を行うことができます。
- 思考パターンAPIこの機能により、ユーザーは自身の思考過程をフィードバックすることができ、モデルはより一貫性のある推論プロセスを維持できるようになります。数学的証明、プログラミングのデバッグ、データ分析など、複数のステップからなる推論を必要とするタスクに適しています。
-
スパースアテンションメカニズムDeepSeek-V3.2-Expでは、DeepSeek Sparse Attention(DSA)が導入されました。これは、Lightning Indexerを使用してクエリトークンと先行するトークン間のインデックススコアを計算し、キー値エントリを選択することで、きめ細かいスパースアテンションを実現し、長文テキスト処理の効率を大幅に向上させます。
-
ライトニングインデクサーLightning IndexerはDSAの中核コンポーネントです。クエリトークンと直前のトークン間のインデックススコアを計算し、少数のインデックスヘッダーと効率的な計算方法を用いて、クエリトークンにとって最も重要なトークンを迅速に特定します。
-
きめ細かなラベル選択インデックススコアに基づいて、モデルはアテンション計算のために上位k個のキー値エントリを選択し、不要な計算を削減してモデルの推論速度と効率を向上させます。
-
MLAベースの実装DSAは、マルチレイヤーアテンション(MLA)アーキテクチャに基づいて実装され、マルチクエリアテンション(MQA)モードを採用しています。これにより、各キー値エントリを複数のクエリ間で共有できるため、計算効率が向上します。
-
継続的なトレーニングと最適化DeepSeek-V3.1-Terminusの基本的なチェックポイントから始め、Lightning Indexerとモデル全体は、集中的なウォームアップとスパースなトレーニングという2つのフェーズを経て最適化され、スパースなアテンションパターンに適応します。
DeepSeek-V3.2のプロジェクトアドレス
- DeepSeek-V3.2:https://huggingface.co/deepseek-ai/DeepSeek-V3.2
- DeepSeek-V3.2-Speciale:https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Speciale
- ハギングフェイスモデルライブラリ:https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp
- マジックダッシュコミュニティ:https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.2-Exp
- 技術論文:https://github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/main/DeepSeek_V3_2.pdf
DeepSeek-V3.2の使い方
- ウェブ版とアプリ版:アクセス DeepSeek公式サイトまたは、公式アプリをダウンロードしてください。
-
API経由で使用開発者はDeepSeek-V3.2-Exp APIを使用して、モデルの機能をアプリケーションに統合できます。API価格の大幅な引き下げにより利用コストが削減され、より多くの開発者がこの技術を採用しやすくなります。
-
ローカルで実行ユーザーは、Hugging FaceプラットフォームからDeepSeek-V3.2-Expのモデル重みをダウンロードし、提供されているローカル実行ガイドに従って重みを推論デモンストレーションに必要な形式に変換した後、対話型チャットインターフェースを起動して使用できます。
-
公式アプリを使用してください公式DeepSeekアプリ、ウェブ版、ミニプログラムはすべてDeepSeek-V3.2-Expにアップデートされました。ユーザーはこれらのプラットフォームを通じて、追加の設定なしでモデルを直接使用できます。
-
モデルの微調整特定のタスクやドメインに合わせて、ユーザーはDeepSeek-V3.2-Expを微調整することで、特定のアプリケーションシナリオにより適切に適応させ、特定のタスクにおけるモデルのパフォーマンスを向上させることができます。
-
二次的発展DeepSeek-V3.2-Expは、Hugging FaceおよびModelScopeプラットフォーム上でオープンソースとして提供されています。ユーザーは、オープンソースコードと実装の詳細を参照することで、モデルの動作原理を理解し、必要に応じて二次開発を行うことができます。
DeepSeek-V3.2の応用シナリオ
-
長文処理長文文書の分析や長文テキストの生成など、長文テキストの処理が必要なシナリオに適しています。そのスパースアテンション機構により、長文テキストの処理効率を大幅に向上させることができます。
-
検索と情報取得検索エージェントなどのシナリオで使用でき、ユーザーが迅速かつ正確に情報を取得できるように支援し、検索効率と関連性を向上させることができます。
-
コード生成とプログラミング支援コード生成や、コード補完、コード最適化といったプログラミング支援タスクをサポートし、開発者のプログラミング効率とコード品質の向上を支援します。
-
数学的および論理的推論数学的な問題解決や論理的推論のタスクに優れており、複雑な数学的問題や論理的推論の連鎖を処理することができる。
-
多言語処理多言語タスクをサポートしており、異言語間のテキスト生成、翻訳、その他のシナリオに適用することで、さまざまな言語環境のニーズに対応できます。
-
インテリジェントエージェントとインタラクションインテリジェントエージェントの中核モデルとして、インテリジェントアシスタントやチャットボットなどを構築し、自然言語による対話サービスを提供するために使用できます。