project
GLM-4.5V - Zhipu Open Sourceによる最新世代の視覚推論モデル。
GLM-4.5Vは、Zhipu Open Sourceが開発した最新世代の視覚推論モデルです。106B個のパラメータと12B個のアクティベーション機能を備え、現在、最先端の視覚言語モデル(VLM)となっています。このモデルは、GLM-4.1V-Thinkingをベースにしています。
GLM-4.5Vとは何ですか?
GLM-4.5Vは、Zhipuが発表した最新世代のビジュアル推論モデルです。106B個のパラメータと12B個のアクティベーション能力を備え、現在、ビジュアル言語モデル(VLM)のリーダー的存在となっています。このモデルはGLM-4.1V-Thinkingのアップグレード版であり、その優れたアーキテクチャを継承し、次世代テキストベースモデルGLM-4.5-Airと連携して学習されています。このモデルは、ビジュアル理解と推論能力において卓越した性能を発揮し、Webフロントエンドの複製、グラウンディング、グラフ探索ゲーム、ビデオ理解などのシナリオに適しており、マルチモーダルアプリケーションの開発をさらに促進することが期待されています。開発者がGLM-4.5Vの強力な機能を直感的に体験し、独自のマルチモーダルアプリケーションを作成できるように、チームは、コード支援、ビデオ分析、ゲーム解決、ドキュメント解釈などのさまざまなビジュアルタスクを処理するためにGLM-4.5Vモデルを活用し、リアルタイムでスクリーンショットを撮影したり画面を録画したりできるデスクトップアシスタントアプリケーションをオープンソース化しました。
GLM-4.5Vの主な機能
- 視覚的理解力と推論力画像や動画などの視覚コンテンツを理解・分析し、物体、場面、人物間の関係性などを認識するといった複雑な視覚的推論タスクを実行できる。
- マルチモーダルな相互作用テキストとビジュアルコンテンツの融合をサポートしており、例えばテキストの説明から画像を生成したり、画像からテキストの説明を生成したりすることができます。
- Webフロントエンドの複製ウェブページのデザインモックアップに基づいてフロントエンドコードを生成し、迅速なウェブページ開発を可能にする。
- 画像検索ゲーム画像ベースの検索やマッチングタスクをサポートしており、複雑なシーンの中から特定のターゲットを見つけるといったことが可能です。
- 動画の理解動画コンテンツの分析、重要な情報の抽出、動画の要約やイベント検出などのタスクの実行をサポートします。
- クロスモーダル生成視覚コンテンツからテキストを生成したり、テキストから視覚コンテンツを生成したりすることに対応しており、マルチモーダルコンテンツのシームレスな変換を可能にします。
GLM-4.5Vの技術原理
- 大規模な事前トレーニングこのモデルは106億の事前学習済みアーキテクチャに基づいており、膨大な量のテキストデータと画像データを用いて、言語と視覚の統合的な表現を学習するように訓練されています。
- 視覚言語の融合本システムはTransformerアーキテクチャを採用してテキストと視覚的特徴を融合させ、相互注意メカニズムに基づいてテキストと視覚情報間の相互作用を実現します。
- 活性化メカニズムこのモデルは12B個の活性化パラメータを用いて設計されており、推論中に該当するパラメータのサブセットを動的に活性化することで、計算効率と推論性能を向上させます。
- 構造継承と最適化GLM-4.1V-Thinkingの優れた構造を継承し、新世代テキスト台座モデルGLM-4.5-Airと連携してトレーニングすることで、パフォーマンスがさらに向上しました。
- マルチモーダルなタスク適応微調整と最適化に基づき、このモデルは、視覚的な質問応答、画像説明の生成、動画理解など、さまざまなマルチモーダルタスクに適応できる。
GLM-4.5Vの性能
- General VQAGLM-4.5Vは、一般的な視覚的な質問応答タスクにおいて最高の性能を発揮し、特にMMBench v1.1ベンチマークテストでは88.2という高得点を記録しました。
- STEMGLM-4.5Vは、科学、技術、工学、数学(STEM)分野の課題においても優れた性能を発揮し、MathVistaテストで84.6という高得点を獲得しました。
- Long Document OCR & Chart長文文書や図表を処理するOCRベンチマークテストにおいて、GLM-4.5Vは86.5という優れたスコアを記録しました。
- Visual GroundingGLM-4.5Vは視覚的位置特定タスクにおいて非常に優れた性能を発揮し、RefCOCO+loc(val)テストで91.3のスコアを獲得した。
- Spatial Reasoning空間推論能力に関して言えば、GLM-4.5VはCV-Benchテストで87.3という優れたスコアを達成した。
- Codingプログラミングタスクにおいて、GLM-4.5VはDesign2Codeベンチマークで82.2点を獲得し、コード生成と理解におけるその能力を実証した。
- Video UnderstandingGLM-4.5Vは動画理解においても優れた性能を発揮し、VideoMME(字幕なし)テストでは74.6点を獲得した。
GLM-4.5Vのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/zai-org/GLM-V/
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/zai-org/glm-45v-68999032ddf8ecf7dcdbc102
- 技術論文:https://github.com/zai-org/GLM-V/tree/main/resources/GLM-4.5V_technical_report.pdf
- デスクトップアシスタントアプリケーション:https://huggingface.co/spaces/zai-org/GLM-4.5V-Demo-App
GLM-4.5Vの使い方
- 登録とログインZ.aiの公式サイトにアクセスし、メールアドレスを使ってアカウントを登録してください。登録後、アカウントにログインしてください。
- モデルを選択ログイン後、モデル選択ドロップダウンメニューから「GLM-4.5V」を選択してください。
- エクスペリエンス機能:
- Webフロントエンドの複製ウェブデザインテンプレートをアップロードすると、モデルが自動的にフロントエンドコードを生成します。
- 視覚的推論画像や動画をアップロードすると、モデルが視覚理解、物体認識、シーン分析などのタスクを実行します。
- 画像検索ゲーム対象画像をアップロードすると、モデルが複雑なシーンの中から一致する画像を見つけ出します。
- 動画の理解動画ファイルをアップロードすると、モデルが重要な情報を抽出し、動画の要約またはイベント検出結果を生成します。
GLM-4.5VのAPI呼び出し料金
-
入力2元/Mトークン
-
出力6元/Mトークン
- 応答速度毎秒60~80トークンに達する
GLM-4.5Vの応用事例
- Webフロントエンドの複製ウェブデザインをアップロードすると、開発者が効率的にウェブページを開発できるよう、フロントエンドコードが迅速に生成されます。
- ビジュアルQ&Aユーザーが画像をアップロードして質問すると、モデルが画像の内容に基づいて正確な回答を生成します。これは、教育や高度な顧客サービスなどの分野で活用できます。
- 画像検索ゲーム複雑なシーンでも対象画像を迅速に特定できるため、セキュリティ監視、スマートリテール、エンターテイメントゲーム開発などに適しています。
- 動画の理解動画コンテンツを分析し、重要な情報を抽出して要約を作成したり、イベントを検出したり、動画の推奨、編集、監視を最適化します。
- 画像の説明生成アップロードされた画像に対して正確な説明文を生成することで、視覚障害のある方が画像を理解しやすくし、ソーシャルメディアでの共有体験を向上させます。