AB
AiBoss
project

GLM-4.6V - Zhipuオープンソースマルチモーダル大型モデルシリーズ

GLM-4.6Vは、Zhipuが発売したマルチモーダル大型モデルで、クラウドおよび高性能クラスタシナリオ向けの基本バージョンGLM-4.6V(106B-A12B)と、ローカル展開および低遅延アプリケーション向けの軽量バージョンGLM-4.6V-Flash(9B)が含まれています。

GLM-4.6Vとは何ですか?

GLM-4.6Vは、Zhipuが発表したマルチモーダル大規模モデルで、クラウドおよび高性能クラスタ環境向けの基本バージョンGLM-4.6V(106B-A12B)と、ローカル環境および低遅延アプリケーション向けの軽量バージョンGLM-4.6V-Flash(9B)があります。このモデルは、長いコンテキスト(128kトークン)をサポートし、そのパラメータ規模において視覚理解で最高レベルの精度を実現しています。また、ツール呼び出し機能をビジュアルモデルにネイティブに統合した初のモデルであり、視覚認識から実行可能なアクションまでのクローズドループを実現しています。このモデルは、インテリジェントな画像およびテキスト作成、画像ベースのショッピング、フロントエンドの複製、長文ドキュメント/ビデオの理解といったシナリオで幅広く使用されており、前世代のGLM-4.5Vを大幅に上回る性能を発揮しながら、コストを50%削減しています。

GLM-4.6Vの主な機能

  • マルチモーダルな理解と生成このモデルは、画像、動画、テキストなど様々な入力形式を処理し、高品質なテキストと画像の混合コンテンツを生成できます。これは、コンテンツ作成、ソーシャルメディアへの投稿、その他のシナリオに適しています。
  • ビジョン主導型ツール呼び出し画像やスクリーンショットなどをテキストによる説明なしにツールパラメータとして直接使用できるため、情報損失を軽減できます。また、統計グラフやウェブページのスクリーンショットなど、ツールから返されるマルチモーダルな結果も処理できます。
  • 長時間のコンテキスト処理コンテキストウィンドウが12万8千トークンに拡張され、最大150ページにも及ぶ複雑な文書や1時間の動画コンテンツを処理できるようになり、文書間の比較分析や長尺動画における重要なイベントの特定もサポートされるようになりました。
  • 賢いショッピングガイドと価格比較電子商取引のシナリオでは、画像認識から商品検索、価格比較、ショッピングガイドリストの生成まで、完全なサプライチェーンを実現できます。
  • フロントエンドの複製とインタラクションのデバッグピクセルレベルのフロントエンド複製をサポートし、デザイン案を実行可能なウェブページコードに迅速に変換でき、スクリーンショットに基づいた複数回の視覚的インタラクションの変更をサポートします。
  • マルチモーダルな相互作用と推論複雑なタスクにおいては、視覚的な入力とテキスト情報を組み合わせて推論を行い、構造化された出力結果を生成できるため、さまざまなビジネスシナリオに適している。
  • 高い費用対効果と柔軟な導入前世代モデルと比較してコストが50%削減され、クラウド、ローカル、および様々なハードウェア環境への展開をサポートすることで、多様なシナリオのニーズに対応します。

GLM-4.6Vの性能

MMBench、MathVista、OCR Benchなど30以上のマルチモーダルベンチマークを用いた検証テストにおいて、GLM-4.6Vは前世代モデルに比べて大幅な改善を示し、特にマルチモーダルインタラクション、論理推論、長文コンテキスト処理といった主要機能において最高レベルのパフォーマンスを達成しました。

  • GLM-4.6V-Flash バージョン9B総合的な性能はQwen3-VL-8B(8Bパラメータ数)を上回り、マルチモーダルタスクにおいてより高い効率性と性能を発揮します。
  • 106Bパラメータ、12BアクティブGLM-4.6Vパラメータ数が2倍のQwen3-VL-235Bと同等の性能を発揮し、パラメータ効率の面で大きな優位性を示し、より少ない計算リソースで同等またはそれ以上の性能を実現しています。

GLM-4.6Vモデルの特長

  • 自己起動ツールこのモデルは、視覚入力に基づくツール呼び出しをネイティブにサポートしており、テキストと画像が混在するレイアウト、画像ベースのショッピングやショッピングガイド、エージェントシナリオなど、より複雑な視覚タスクを処理することが可能です。
  • 128k コンテキストウィンドウ理論的には、150ページの複雑な文書、200ページのプレゼンテーション資料、または1時間のビデオを理解することができ、複数の長い文書やビデオを1回の推論で処理することも可能です。
  • コーディングスキルの向上フロントエンドの複製機能と複数ラウンドにわたる視覚的インタラクションの変更機能が最適化され、開発者が「デザイン案から作業ページへ」のプロセスを短縮できるようになっています。
  • 同レベルのSOTA同じパラメータスケールにおいて、このモデルはマルチモーダルなインタラクション、論理的推論、長いコンテキストといった主要な機能において、最先端の性能を達成している。

GLM-4.6Vの使い方

  • ローカル展開GitHubなどのオープンソースプラットフォームからコードとモデルの重みをダウンロードし、ローカルコンピュータまたはサーバーで実行してください。
  • クラウドコールZhipuオープンプラットフォームにアクセスし、アカウントを登録してAPIキーを取得し、ネットワークリクエストを介してクラウドモデルを呼び出します。
  • オンライン体験結果を表示するには、z.ai または Zhipu Qingyan アプリ/ウェブ版に直接アクセスし、GLM-4.6V モデルを選択して、画像をアップロードするかテキストを入力し、「推論」をクリックしてください。
  • アプリケーションへの統合APIまたはローカル展開を介してモデルを独自のソフトウェアまたはシステムに統合し、特定の機能を実現します。
  • 推論フレームワークを使用するモデルをサポートされているフレームワーク(SGLang、トランスフォーマーなど)にロードし、ハードウェア(GPUなど)を使用して実行します。

GLM-4.6Vのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/zai-org/GLM-V
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/zai-org/glm-46v
  • 技術論文:https://z.ai/blog/glm-4.6v

GLM-4.6Vの使用例

例:トピックのみを入力すると、画像とテキスト情報が生成されます。

2025年ITTF混合団体ワールドカップにおける中国チームの成績を検索すると、写真とテキストを含むニュース記事が表示されます。

事例研究:類似商品を検索し、価格を比較して、ショッピングガイドを作成する

GLM-4.6Vの応用事例

  • インテリジェントなグラフィック作成トピック、またはテキストと画像を組み合わせたコンテンツを入力すると、モデルが自動的に、ソーシャルメディア、公式アカウント、その他のプラットフォームに適した、構造が整然としていてイラストが豊富なコンテンツを生成します。
  • 視覚重視のショッピング画像をアップロードしてコマンドを発行すると、モデルが購入意図を認識し、類似商品を検索してショッピングガイドリストを生成するため、eコマースでのショッピング体験が向上します。
  • フロントエンド開発支援ウェブページのスクリーンショットやデザイン案をアップロードすると、モデルが正確に再現され、コードが生成されます。複数回のインタラクティブな修正に対応しており、フロントエンド開発プロセスを加速します。
  • 長文文書と動画の理解長文の文書や動画を処理し、文書間の比較分析や重要なイベントの特定をサポートし、複雑なコンテンツの理解や調査を支援します。
  • マルチモーダルなインテリジェントカスタマーサービス視覚情報とテキスト情報を組み合わせることで、正確な回答や提案を提供し、複数回の対話に対応し、顧客サービスの効率性を向上させます。