AB
AiBoss
project

DeepSeek-V4 - DeepSeekの新世代大規模言語モデルシリーズ

DeepSeek-V4は、DeepSeekの次世代大規模言語モデルシリーズのプレビュー版であり、数百万文字の容量を持つコンテキストウィンドウを備え、エージェント機能、世界知識、推論機能の面でオープンソース分野をリードする性能を誇ります。

DeepSeek-V4とは何ですか?

DeepSeek-V4は、DeepSeekの次世代大規模言語モデルシリーズのプレビュー版であり、100万文字を超えるコンテキストウィンドウを誇り、エージェント機能、世界知識、推論性能においてオープンソース分野でトップレベルの性能を実現しています。このモデルには、高性能を重視するdeepseek-v4-proとコスト効率を重視するdeepseek-v4-flashの2つのバージョンがあります。どちらもオープンソースであり、APIサービスを提供し、非思考モードと思考モードの両方をサポートすることで、長文テキスト処理とインテリジェントエージェントアプリケーションのための汎用的なインフラストラクチャを提供します。

DeepSeek-V4の主な機能

  • 百万のコンテキスト処理公式サービスの標準機能である、100万トークンにも及ぶ超長文の理解と記憶をネイティブでサポート。
  • ハイブリッド注意機構CSAおよびHCAアーキテクチャは、長時間のコンテキスト計算とメモリオーバーヘッドを大幅に削減します。
  • エージェントエンコーディングの強化Claude CodeやOpenClawといった主流のエージェントフレームワーク向けに高度に最適化されています。
  • デュアルモード推論思考モードと非思考モードの両方をサポートしており、後者の思考モードの強度はreasoning_effortパラメータで調整できます。
  • 複数分野の専門家の統合OPD抽出を通じて、数学、プログラミング、エージェント、その他の分野の専門家の専門知識を統合する。
  • 経済的で効率的な選択肢Flash版は、より低いパラメータ数でPro版に近い推論性能を実現し、APIコストも大幅に削減されています。

DeepSeek-V4の技術原理

  • CSA圧縮スパースアテンション各m個のトークンのキーと値のペアは、1つのエントリに圧縮されます。インデックススコアはLightning Indexerを使用して計算され、上位k個のスパース選択が実行されます。スライディングウィンドウとアテンションシンクのメカニズムを組み合わせることで、ローカルな依存関係が保持されます。
  • HCAの注意力の強い圧縮KVエントリは、より大きな圧縮率m'を持つ単一のエントリに統合され、疎な選択を使用せずに密な注意を維持し、計算コストをさらに削減します。
  • mHC多様体制約付きハイパーリンク残差マッピング行列は、スペクトルノルムが1を超えないように制約されたSinkhorn-Knoppアルゴリズムを使用して、二重ランダム行列多様体に投影され、それによって深部信号伝搬の安定性が向上します。
  • ミューオン最適化ツールこのモデルは、勾配行列を直交化するためにハイブリッド・ニュートン・シュルツ反復法を採用しており、高速収束と高精度安定化の2つのフェーズで構成され、大規模なMoEモデルの効率的な学習をサポートします。
  • FP4量子化知覚トレーニングFP4量子化はMoEエキスパート重みとCSAインデクサQKパスに対して実行され、FP8でダイナミックレンジを拡張することでロスレス逆量子化が実現され、メモリと計算のオーバーヘッドが削減されます。

DeepSeek-V4のパフォーマンス

  • 知識と能力
    • 世界をリードするオープンソースの知識SimpleQA-Verifiedは57.9%のスコアを獲得し、評価対象となったすべてのオープンソースモデルを20パーセントポイント上回り、Gemini-3.1-Pro(75.6%)にわずかに劣るのみでした。
    • 中国の知識が際立っているChinese-SimpleQAは84.4%の精度を達成し、K2.6(75.9%)とGLM-5.1(75.0%)を大幅に上回った。
    • 教育知識が最前線にあるMMLU-Proは87.5%、GPQA Diamondは90.1%で、GPT-5.4と同等、Gemini-3.1-Proよりわずかに低い。
  • 推論能力とコーディングスキル
    • 数学コンテストはクローズドソースに匹敵するHMMT 2026年2月は95.2%、IMO AnswerBenchは89.8%を達成し、K2.6とGLM-5.1を上回り、GPT-5.4とOpus-4.6に迫る結果となった。
    • オープンソースコードの競争が、初めてクローズドソースコードの競争に追いついた。彼のCodeforcesレーティングは3206で、GPT-5.4(3168)に匹敵するレベルであり、現在、人間プレイヤーの中で23位にランクインしている。
    • 高難易度推論における画期的な進歩Apex Shortlistは90.2%のスコアを達成し、GPT-5.4(78.1%)とOpus-4.6(85.9%)を上回りました。LiveCodeBenchは93.5%のスコアを達成し、比較対象モデルの中でトップとなりました。
  • エージェントの機能
    • ソフトウェアエンジニアリングは、トップレベルのクローズドソースに近い。SWE Verifiedは80.6%に達し、Opus-4.6(80.8%)とほぼ同じでした。SWE Proは55.4%、SWE Multilingualは76.2%でした。
    • 主要なオープンソース端末運用Terminal Bench 2.0は67.9%のスコアを達成し、K2.6(66.7%)、GLM-5.1(63.5%)、Opus-4.6(65.4%)を上回りました。
    • ツール呼び出しの優れた一般化MCP Atlas Public(73.6%)とToolathlon(51.8%)は、幅広いツールとMCPサービスを対象とした評価において、非常に優れた成績を収めた。
  • 長文コンテキスト機能
    • 強力なコンテキスト検索MRCRは1M以内で83.5%に達し、Gemini-3.1-Pro(76.3%)を上回りました。検索性能は128K以内で非常に安定しており、1Mでも依然として高い能力を維持しています。
    • 実世界の長文文書の理解CorpusQA 1Mは62.0%を達成し、Gemini-3.1-Pro(53.8%)を上回った。
  • 効率性能
    • 計算負荷は急激に低下した。1Mのコンテキストでは、V4-Proのシングルトークン推論FLOPsはV3.2のわずか27%であり、V4-Flashのわずか10%に過ぎません。
    • KVキャッシュが大幅に圧縮されました1Mのコンテキストでは、V4-Proの累積KVキャッシュはV3.2の10%であり、V4-Flashはわずか7%である。
    • ルーターエキスパート FP4量子化専門家による重み付けにはFP4ストレージが使用されており、理論的には将来のハードウェア実装において効率をさらに3分の1向上させる可能性がある。

DeepSeek-V4の使い方

  • ウェブ/アプリDeepSeekのウェブサイトまたは公式アプリにアクセスし、エキスパートモード(Pro)またはクイックモード(Flash)を選択してください。
  • API呼び出しモデルパラメータを変更してdeepseek-v4-proまたはdeepseek-v4-flashbase_urlは変更されません。
  • 思考パターン複雑なエージェントシナリオでは、思考モードを有効にして設定することをお勧めします。reasoning_effort: max
  • ローカル展開Hugging FaceまたはModelScope経由でオープンソースの重みをダウンロードし、ご自身でデプロイしてください。

DeepSeek-V4の主要情報と使用要件

  • バージョン仕様Pro版は1.6Tパラメータ/49Bアクティベーションを使用し、Flash版は284Bパラメータ/13Bアクティベーションを使用します。事前学習データはそれぞれ33Tと32Tです。
  • コンテキストの長さどちらのバージョンも100万トークンをサポート、旧インターフェースdeepseek-chatそしてdeepseek-reasoner2026年7月24日にサービスが終了します。
  • API料金(100万トークンあたり)Pro入力キャッシュはヒット1元/ミス12元で、出力24元。Flash入力キャッシュはヒット0.2元/ミス1元で、出力2元。
  • 計算能力の限界Pro版は現在、サービス処理能力に制限があり、今年後半にAscend 950スーパーノードが段階的に導入された後、価格は大幅に下がる見込みです。

DeepSeek-V4の主な利点

  • 普遍的なアクセスを実現する数百万のコンテキスト1Mトークンの超長文コンテキストは公式サービスの標準機能となり、従来の注意機構の二次計算のボトルネックを打破し、長文タスクやテストにおけるスケーリングを真に実現可能にしました。
  • 極めて長いコンテキスト効率CSA圧縮スパースアテンションとHCA高圧縮アテンションのハイブリッドアーキテクチャを使用することで、V4-Proは1MコンテキストでV3.2の単一トークン推論FLOPsのわずか27%しか達成できず、KVキャッシングはわずか10%、Flashバージョンではさらに低く10%と7%にとどまります。
  • オープンソースモデルのパフォーマンスに関する新たなベンチマークV4-Pro-Maxは、知識、推論、コーディング競技など、あらゆる評価において従来のオープンソースモデルを凌駕しています。内部評価では、エージェントのコーディング能力はClaude Sonnet 4.5よりも優れており、非思考モードでの配信品質はOpus 4.6に匹敵します。
  • デュアルバージョンで柔軟なカバー範囲Pro版(1.6T/49B)は最高性能バージョンとして位置づけられており、Flash版(284B/13B)は極めて小さなアクティベーションパラメータでほぼ推論機能を実現しています。API価格はPro版の1/12と低価格であるため、様々な予算規模に対応可能です。
  • エージェント機能がネイティブに強化されましたClaude CodeやOpenClawといった主流のエージェントフレームワーク向けに最適化されており、ユーザーメッセージの境界を越えた一貫性のある推論の保持をサポートし、SWEやTerminal Benchなどのエージェント評価において優れた性能を発揮します。

DeepSeek-V4プロジェクトのアドレス

  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/deepseek-ai/deepseek-v4
  • 技術論文:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf

DeepSeek-V4と類似の競合製品との比較

比較対象寸法 DeepSeek-V4-Pro Claude Opus 4.6 Kimi K2.6
モデルの位置特定 オープンソースの高性能MoE クローズドソースのトップレベル汎用 オープンソースのエージェントインテリジェンス
オープンソースのステータス 完全オープンソース クローズドソースAPI オープンソース/オープンAPI
パラメータの総数 1.6T 非公開 非公開
活性化パラメータ 49B 非公開 非公開
コンテキストの長さ 1M Token 200K 1M Token
コアアーキテクチャ CSA+HCAハイブリッドアテンション 従来型変圧器 MoE+ ロングコンテキスト
MMLU-Pro 87.5 89.1 87.1
SimpleQA 57.9 46.2 36.9
Codeforces 3206
SWE Verified 80.6 80.8 80.2
Terminal Bench 67.9 65.4 66.7
MRCR 1M 83.5 92.9
API入力価格 100万トークンあたり12元 100万トークンあたり約150人民元 100万トークンあたり約60元
長期的な文脈効率 KVキャッシュは、V3.2のわずか10%に過ぎません。 標準KVキャッシュ 非常に効率的だが、詳細は非公開。

DeepSeek-V4の応用シナリオ

  • 長文文書分析数百万語に及ぶ論文、報告書、法的契約書などの全文理解と章間の論理的推論をサポートします。
  • インテリジェントエージェントのコーディングClaude CodeやOpenClawなどのフレームワーク内で、複雑なコード生成、リファクタリング、デバッグなどのタスクを実行します。
  • 複数ラウンドのツール呼び出しエージェントのワークフロー内で推論履歴全体を保持し、ユーザーメッセージの境界を越えた一貫性のある思考をサポートします。
  • 知識集約型の質問応答グローバルな知識評価においてオープンソースモデルを大幅に上回る性能を発揮し、教育、研究、専門コンサルティングに適している。
  • ホワイトカラーのオフィス業務このモデルは、中国語の文書作成、情報分析、文書生成、編集といったシナリオにおいて優れた性能を発揮します。