Zhipu GLM-4.6Vの実地試験の結果、これは国内で生産されたマルチモーダルエージェントの基本モデルの中で最も高性能であることが明らかになった。
Zhipuは、新しい視覚推論モデルシリーズであるGLM-4.6Vを正式にリリースし、完全オープンソース化しました。今回のリリースには2つのバージョンが含まれています。GLM-4.6V:総パラメータ数106B、推論あたりの活性化パラメータは約12B、視覚理解精度は…
Zhipuが新しい視覚推論モデルを正式に発表 GLM-4.6Vシリーズモデルそして包括的にオープンソース!
今回のリリースには2つのバージョンが含まれています。
- GLM-4.6Vパラメータの総数は106バイトで、推論ごとに約12バイトの活性化パラメータを使用することで、他のパラメータと同等の視覚的理解精度を実現しています。SOTAクラウド環境やハイパフォーマンス環境に適しています。
- GLM-4.6V-Flash総合パラメータ:9B、軽量かつ高速、ローカル展開に適しています。
GLM-4.6Vは、ビジュアルモデルに関数呼び出し(ツール呼び出し)機能を統合した最初の製品です。、させて大型モデルそれは目と手の両方を備え、複雑な視覚タスクのネイティブ処理をサポートし、視覚的理解に基づいて後続の操作を完了するためのツールを能動的に呼び出すことができる。
例えば、GLM-4.6Vは、複雑な構造や多数の図表を含む論文を直接「理解」し、誰にでも理解できる図解入りの記事に再構成することができます。
スクリーンショットを撮るだけで、ページ構造を分析し、ほぼ同じフロントエンドページを複製することができる。
z.aiを開き、ページ左上にあるモデル「GLM-4.6V」を選択してください。
公式サイト:https://chat.z.ai
GitHub:https://github.com/zai-org/GLM-V
Hugging Face:https://huggingface.co/collections/zai-org/glm-46v
GLM-4.6Vは、画像認識、画像処理、画像検索、ショッピング検索の4つのツールを利用できます。
入力ボックスの下には、公式ドキュメントに、汎用検索、画像およびテキストのスキャン、インテリジェントな文書読み取り、ビデオ理解など、典型的な機能例がいくつか記載されています。知的価格比較や数学的な問題解決などいずれかの機能を選択すると、GLM-4.6Vは...自動マッチングツールを呼び出してください。
ケース1:ユニバーサルサーチ
プロンプトワードこの場所はどこにありますか?また、訪れるのに最適な月は何月ですか?
GLM-4.6Vはネイティブな画像理解機能を備えており、画像認識ツールを直接呼び出して画像内のコンテンツを識別し、関連する知識を検索して応答を提供します。
ケース2:画像とテキストのスキャン
プロンプトワード画像から情報を抽出し、Excelスプレッドシートに変換します。
GLM-4.6Vは、コンテンツとレイアウトを非常に正確に認識します。
もう少し複雑なことを試してみましょう。
プロンプトワードこのキャットフードの原材料、原材料リスト、その他の情報をよく確認し、2歳の子猫が長期的に食べるのに適しているかどうかを分析してください。
GLM-4.6Vは、原材料の組成と製品の構成要素を正確に識別し、この情報に基づいて分析を実行します。
事例3:インテリジェントな文書読み取り
先週、中国科学技術大学の潘建偉教授の研究チームが、一流の国際学術誌に研究成果を発表した。PRL『フィジカル・レビュー・レターズ』誌に掲載最新のこの研究成果は量子物理学の分野における画期的な出来事であり、アインシュタインとボーアの間で1世紀にわたって繰り広げられてきた論争に終止符を打つものとなった。
私は元の論文を見つけ、GLM-4.6Vに解析を依頼しました。
プロンプトワード専門用語を使わずに、この論文の内容、なぜアインシュタインとボーアの100年にわたる論争に終止符を打ったと言われているのか、そしてこの業績が学術的な価値を超えて、現実世界や一般の人々にとってどのような意味を持つのかを説明してください。
GLM-4.6Vは、複雑な図表を理解できるだけでなく、重要な情報を整理し、視覚的に分かりやすい方法で明確に説明することもできます。
ケース4の動画理解
プロンプトワードこれは映画『シークレット・ライフ』の有名なシーンです。具体的にどのような撮影技法が用いられ、構図上の見どころは何でしょうか?
GLM-4.6Vによる解説は非常にプロフェッショナルでした。ビデオ全体の構成、使用されたショット、そしてそれらのショットが伝える感情などを詳しく説明してくれました。私の理解をはるかに超える深い内容でした。
ケース5:数学的問題解決
プロンプトワード図中の質問に答えてください。
GLM-4.6Vは、視覚情報と外部知識を組み合わせて推論を行うことができ、問題解決のアプローチが非常に明確です。
case6 知的パリティ
プロンプトワード写真の趙露思がつけているような、お手頃価格のイヤリングを探すのを手伝ってください。
GLM-4.Vアプリは、私にとって手頃な価格の代替品をいくつか見つけてくれました。識別精度も非常に高く、さまざまなプラットフォームで利用可能なオプションも提示してくれました。
事例7:グラフィックおよびテキストコンテンツの作成
プロンプトワードビジュアルモデルの開発プロセスを検索し、図解入りのレポートを作成する。
ケース8:フロントエンドWebページの複製
プロンプトワードスクリーンショットのウェブページを再現するには、ページで使用するすべての画像素材は実際の画像と動画でなければなりません。プレースホルダーやプレースホルダー要素は使用しないでください。
視覚的な理解、構造的な推論、そしてコード生成がすべてワンステップで行われ、元の画像とほぼ同じウェブページが生成されます。スクリーンショットに写っているフローティングウィンドウの構造も認識され、復元されます。ナビゲーションバーには、ナビゲーションのためのスペースも確保されています。
実際のテストでは、GLM-4.6Vは画像内の細部を認識するだけでなく、画像の意味と自然言語の意味を結びつけ、画像が何を表現しているのか、そしてこれらの情報間の関係性を理解することができました。そのプロセス全体は非常にスムーズでした。
このツールを使用する際は、モデルの応答品質を高めるために、ディープシンキングを有効にしておくことをお勧めします。フロントエンドを複製する場合は、ツールを無効にすることをお勧めします。それ以外の場合は、タスクに応じて設定をカスタマイズするか、公式オプションのデフォルト設定を使用してください。
これ強力視覚機能は、月額わずか20元から利用できるZhipuのコーディングプランにも統合される予定で、すぐに利用可能となる。最新のそのモデリング機能は、日常的な使用において非常に優れています。
これらの機能が成熟するにつれて、視覚情報は意思決定、計画立案、そして行動そのものに深く関わるようになり、現実世界の画像はシステムが直接理解しアクセスできる主要な情報源となるだろう。
ビジュアルモデル機能の向上は、単に... AI 次世代のための、一対の目と一対の手。知的体現実世界と関わることで、新たな可能性が開ける。
将来、ロボットは特定の動作を実行するために精密なプログラミングを必要とせず、「クローゼットの一番右にある赤いセーターを取ってきて」といった自然な指示を理解できるようになるだろう。