AB
AiBoss
project

GLM-4.1V-Thinking - Zhipu AIが提供するオープンソースの視覚言語モデルシリーズ。

GLM-4.1V-Thinkingは、Zhipu AIが開発したオープンソースのビジュアル言語モデルで、複雑な認知タスク向けに特化して設計されており、画像、動画、文書などのマルチモーダル入力をサポートしています。このモデルは、GLM-4Vアーキテクチャに基づいた思考連鎖推論メカニズムを導入しています。

GLM-4.1V-Thinkingとは何ですか?

GLM-4.1V-Thinkingは、Zhipu AIがリリースしたオープンソースのビジュアル言語モデルで、複雑な認知タスク向けに特別に設計されており、画像、動画、文書などのマルチモーダル入力をサポートしています。GLM-4Vアーキテクチャをベースに、思考連鎖推論メカニズムを導入し、カリキュラムサンプリング強化学習戦略を利用して、クロスモーダル因果推論能力と安定性を体系的に向上させています。軽量版のGLM-4.1V-9B-Thinking(GLM-4.1V-9B-BaseとGLM-4.1V-9B-Thinkingはどちらも深い思考と推論能力を備えています)は、パラメータ数が10Bレベルに制御されています。28の権威ある評価において、10Bレベルのモデルの中で23で最高性能を達成し、そのうち18では72BパラメータのモデルQwen-2.5-VLと同等またはそれ以上の性能を示し、小容量モデルの究極の性能ポテンシャルを実証しました。

GLM-4.1V-Thinkingの主な機能

  • 画像理解画像コンテンツを正確に識別・分析し、物体検出、画像分類、視覚的質問応答といった複雑な視覚タスクをサポートします。
  • ビデオ処理時系列分析やイベントロジックモデリングを実行する機能を備え、ビデオ入力を処理してビデオ理解、ビデオ説明、ビデオ質問応答を行うことをサポートしています。
  • 文書解析文書内の画像やテキストコンテンツの処理をサポートし、長文文書の理解、グラフの理解、文書に関する質疑応答にも対応しています。
  • 数学的および科学的推論複雑な数学的問題解決、多段階の推論、公式の理解をサポートし、STEM分野における推論タスクにも対応できます。
  • 論理的推論論理的推論や因果分析をサポートし、多段階推論や論理的判断といった複雑な推論タスクもサポートします。
  • 異種感覚推論これは、推論のために視覚情報と言語情報を組み合わせることで、画像やテキストの理解、視覚的な質問への回答、視覚的なアンカーリングといったタスクを支援する。

GLM-4.1V思考の技術的原則

  • 建築設計このシステムは、画像と動画の入力を処理およびエンコードするために、ビジュアルエンコーダーとしてAIMv2Hugeを使用します。MLPアダプタは、視覚的特徴を言語モデルのトークン空間に整合させます。言語デコーダーは、マルチモーダルトークンを処理し、出力を生成するために、言語モデルとしてGLMを使用します。
  • トレーニング方法大規模な画像とテキストのペア、学術文献、知識集約型データを用いて事前学習を行うことで、堅牢な視覚言語基盤モデルを構築します。長連鎖推論(CoT)データを用いた教師ありファインチューニングにより、モデルの推論能力が向上し、人間の理解との整合性が高まります。カリキュラムサンプリング強化学習(RLCS)は、学習に最適な情報量の多いサンプルを動的に選択することで、様々なタスクにおけるモデルのパフォーマンスを向上させます。
  • 技術革新このシステムは思考連鎖推論メカニズムを導入し、モデルが段階的に詳細な推論プロセスを生成できるようにします。コースサンプリング戦略に基づき、トレーニングサンプルの難易度を動的に調整することで、モデルが各段階で最も効果的なトレーニングを受けられるようにします。2D-RoPEおよび3D-RoPE技術を活用することで、任意の解像度とアスペクト比の画像入力をサポートし、モデルの時空間理解能力を向上させます。

GLM-4.1V-Thinkingのパフォーマンス

MMStar、MMMU-Pro、ChartQAPro、OSWorldなど、権威ある評価機関による28件の評価のうち23件で、このモデルは10Bレベルのモデルの中で最高の成績を収め、そのうち18件はパラメータ数が72Bにも及ぶQwen-2.5-VLモデルと同等またはそれ以上の成績を達成しました。

GLM-4.1V-Thinkingのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/THUDM/GLM-4.1V-Thinking
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/THUDM/glm-41v-thinking-6862bbfc44593a8601c2578d
  • arXiv技術論文:https://arxiv.org/pdf/2507.01006v1
  • オンラインでデモを体験してくださいhttps://huggingface.co/spaces/THUDM/GLM-4.1V-9B-Thinking-Demo

GLM-4.1V-Thinkingの使い方

  • APIインターフェース
    • アカウントを登録するZhipu AIオープンプラットフォームにアクセスし、アカウントを登録してログインしてください。
    • APIキーを取得するプラットフォーム上でアプリケーションを作成し、固有のAPIキーを取得してください。
    • APIを呼び出すAPIドキュメントによると、HTTPリクエストを使用してモデルインターフェースを呼び出し、入力データを送信し、モデルの出力結果を取得します。例えば、Pythonを使ってAPIを呼び出すコード例を以下に示します。
import requests
import json

# 设置API接口地址和API Key
api_url =
"https://api.zhipuopen.com/v1/glm-4.1v-thinking"
api_key =
"your_api_key"
# 准备输入数据
input_data =
{
"image":
"image_url_or_base64_encoded_data",
"text":
"your_input_text"
}
# 设置请求头
headers =
{
"Authorization":
f"Bearer {api_key}",
"Content-Type":
"application/json"
}
# 发送请求
response = requests.post(api_url, headers=headers, data=json.dumps(input_data))
# 获取结果
result = response.json()
print(result)
  • オープンソースモデル
    • モデルをダウンロードHugging Faceのウェブサイトにアクセスし、GLM-4.1V-Thinkingモデルのページを見つけて、モデルファイルをダウンロードしてください。
    • モデル適切な深層学習フレームワーク(PyTorchなど)を使用してモデルをロードします。
    • 推論するこれは、入力データをモデルに入力する前に前処理を行い、その後モデルの出力を取得するというプロセスです。例えば、PyTorchを使用してモデルをロードし、推論を実行するコード例を以下に示します。
from transformers import AutoModelForVision2Seq, AutoProcessor
import torch

# 加载模型和处理器
model_name =
"THUDM/glm-4.1v-thinking"
model = AutoModelForVision2Seq.from_pretrained(model_name)
processor = AutoProcessor.from_pretrained(model_name)
# 准备输入数据
image_url =
"image_url_or_image_path"
text =
"your_input_text"
inputs = processor(images=image_url, text=text, return_tensors="pt")
# 进行推理
with torch.no_grad():
 outputs = model(**inputs)
# 获取结果
result = processor.decode(outputs.logits[0], skip_special_tokens=True)
print(result)
  • オンライン体験プラットフォーム
    • アクセス体験リンクHugging Faceプラットフォーム上のGLM-4.1V-Thinking体験ページをご覧ください。
    • 入力データウェブページに画像をアップロードしたり、テキストを入力したりできます。
    • 結果を出す「実行」ボタンをクリックし、モデルの処理が完了するまで待ってから、結果を確認してください。

GLM-4.1V-Thinkingの応用シナリオ

  • 教育指導これは、数学や科学などの科目における複雑な問題を生徒が解決するのを支援し、詳細な解決手順と推論プロセスを提供することで、生徒が知識をより深く理解し、習得できるようにサポートします。
  • コンテンツ作成画像とテキストを組み合わせて、広告コピー、ソーシャルメディア投稿、ニュース記事などのクリエイティブなコンテンツを生成し、コンテンツ制作の効率と品質を向上させます。
  • インテリジェントなインタラクションインテリジェントなカスタマーサービス担当者または仮想アシスタントとして、ユーザーの質問やニーズを理解し、正確かつタイムリーな回答と解決策を提供し、マルチモーダル入力にも対応します。
  • 産業用途医療、金融、産業などの分野では、データ分析、レポート作成、機器監視といった業務において専門家を支援し、作業効率と精度を向上させる。
  • エンターテインメントとライフ旅行ガイドや観光スポットの紹介、料理や調理方法の提案、ゲームのストーリーラインやミッションデザインの生成など、ユーザーのエンターテイメント体験を豊かにする。