AB
AiBoss
チュートリアル

Zhipu GLM-5.1 オープンソース実地テスト:SWE-bench Proでプログラミング機能がトップに

GLM-5.1ってそんなに強力なの?!複雑なソフトウェアエンジニアリングでClaude Opus 4.6を超えるの?!先月末、Zhipu GLM-5.1がすべてのGLMコーディングプランユーザーに提供開始されました。

智谱 GLM-5.1 开源实测:编程能力登顶 SWE-bench Pro

GLM-5.1ってそんなに強力なの?!複雑なソフトウェアエンジニアリングの能力を凌駕している。 Claude Opus 4.6?!

先月末、Zhipu GLM-5.1がすべてのGLMコーディングプランユーザーに提供開始されました。

コメント欄はたちまち熱狂的な祝賀ムードに包まれた。というのも、GLMは長年にわたり多くのプログラマーにとって欠かせない電子ツールだったからだ。

10日以上も皆を焦らした後、ついにGLM-5.1のモデルパラメータと評価データが正式に公開されました。データを見た私の感想はただ一つ、Zhipuは素晴らしい!

GLM-5.1は、権威ある人工分析ベンチマークにおいてOpus 4.6との初の整合性を達成し、さらに難易度の高いSWE-bench Proベンチマークテストにおいても業界ベンチマークを上回る新たな世界最高スコアを記録しました。 Claude 作品4.6!このテストは、現実世界の複雑な工学問題を解決する能力を評価するものであり、非常に価値のあるものであることを覚えておいてください。

一方、GLM-5.1はコーディング総合ランキングでもトップに立った。オープンソースまず、国内製品としてはナンバーワンです!世界的には3位です。

高いベンチマークスコアと好意的なコミュニティレビューを誇るこのGLM-5.1は、噂通り、国内製品の頂点に立つ可能性を本当に秘めているのだろうか?早速テストしてみよう。

私はここにいます Claude このコードには3つのテストケースが含まれており、主にGLM-5.1の長鎖実行機能をテストするものです。主なテストでは、GLM-5.1のロングチェーン実行機能と、実際のビジネスシナリオにおけるエンドツーエンドの配信機能に重点が置かれました。

トピックを探すのは通常非常に時間がかかるため、最近検証済みのトピック案を直感的に操作できるウェブアプリケーションにしようと試みました。

ケース1:インスピレーションのテーマ選択ツール

インスピレーションを得たり、テーマを選択したりするためのウェブアプリケーションをゼロから開発する。

要件:ユーザーがインスピレーションのテーマを入力したら、インターネット全体を検索し、DouyinとXiaohongshuにおける関連ディスカッションの人気度を調査する。人気のある読者が最も関心を寄せている疑問点や、類似コンテンツが均質化しているかどうかといった一般的な視点から、人気度、競争状況、コンテンツ差別化の余地、普及可能性などを総合的に考慮し、そのトピックが記事にする価値があるかどうかを明確に判断します(スコア0~100)。記事にする価値があると判断した場合は、タイトル案、記事の切り口、導入部の構成、本文の骨子、各パートで展開できる主要な論点などを含む、記事全体の構成案をランダムに生成します。

このケースは、フロントエンド、バックエンド、そして... AI 複雑な呼び出し要件に対して、GLM-5.1は、熟練したエンジニアのように、タスクを4つの明確なステップに直接分解します。

  • ディレクトリ構造を作成する。
  • Python Flaskバックエンド(app.py)を作成します。
  • フロントエンドのHTML/CSS/JSを作成する。
  • 設定ファイルを作成します。

フォルダの作成やローカルファイルの書き込みなどの操作を行う前に、GLM-5.1は積極的に認証確認を開始するため、全体的な制御性が非常に高くなります。

GLM-5.1は、各ステップが完了するたびにリアルタイムでフィードバックを記録して出力し、全体の方向性が正確であることを保証します。

プロジェクト全体はわずか8分ほどで完了した。

GLM-5.1は、トピック選択分析においてより正確な手法を用いることができることを示唆している。 AI 詳細分析では、デフォルトオプションは Claude モデルは、 AI そうであれば、アルゴリズム解析を用いることができる。

設定させて AI GLM-5.1に切り替えて、設定を完了してください。

GLM-5.1は自動彼らは、.env設定ファイルとAPIコードの調整を手伝ってくれました。

プロジェクトを開始するには、.env ファイルに API キーを手動で入力するだけで済みます。

実行してみましょう。結論は非常に明確で、フロントエンドページのレイアウトもかなり良いです。

APIキーを手動で入力する以外は、プロセス全体を通して、GLM-5.1が100%処理しました。 自動仕上げる

ケース2 ローカルAPI管理システム

私たちは日常生活の中で様々なモデルを試そうとすることがありますが、それがAPI管理を困難にしています。一部のAPIは生成時に一度しかコピーできません。私は通常、それらを自分宛てに送信しますが、見つけるのが非常に面倒で、区別するのも容易ではありません。

今回は、GLM-5.1を使って、すべてのAPIキーを1か所で管理できるローカル環境のAPI管理システムを開発しようと試みました。

ローカルで動作するAPI管理システムをゼロから開発します。要件には、API構成の追加、編集、削除のサポート、ベースURL、APIキー、モデル名、リクエストヘッダーなどの情報の保存、サービスプロバイダによる管理のサポート、機密フィールドの匿名化、呼び出しテストと応答結果の表示のサポート、呼び出しログ、応答時間、エラーメッセージのログ記録が含まれます。システム全体はローカルで直接実行でき、完全な起動手順を提供する必要があります。アプリケーション全体をD:\KJ\[指定されたフォルダ]に作成してください。

GLM-5.1は、「ローカル操作、指定ディレクトリストレージ、構成管理、呼び出しテスト、ログ記録、匿名表示」といった複雑で複合的な制約に直面しても、まずプロジェクトの骨組みを決定し、次に詳細を補完するための適切な技術パスを選択します。

実際のアプリケーションはすぐに使える状態で、UIのインタラクティブな効果も非常に良く設計されています。

事例3:クロスモーダル深層データ調査

過去 12 か月の販売台数上位 5 社の世界の自動車グループが発表した主要な新モデルを収集します。これらのモデルを比較レポートにまとめ、発売日、ポジショニング、価格帯、主要なセールスポイント、ターゲット層、マーケティング戦略ごとに分類します。レポートを Word 文書として出力し、D:\KJ\[指定のフォルダ] に保存します。開始する前に、販売統計の基準、新製品の定義、情報源の基準を明確に定義してください。レポートには情報源を含め、各社の新製品戦略における共通点と相違点を個別に要約する必要があります。

このタスクは非常に複雑です。なぜなら、世界トップ5の自動車メーカーのすべての新製品情報を1つのウェブページに掲載することは不可能だからです。そのため、モデルは膨大な数のウェブページにわたって、情報検索、情報フィルタリング、および相互検証を実行する必要があります。

GLM-5.1は、まずWeb検索に積極的にアクセスし、世界の自動車グループの販売ランキングと新モデルを確認します。

複雑なデータ収集と比較分析を完了した後、GLM-5.1 は引き続き Python と python-docx を呼び出します。自動レポートスクリプトを生成し、結果を指定されたパスにあるWord文書に書き込みます。

処理中にソースコードのエンコーディングエラーや構文エラーが発生した場合、GLM-5.1は自動的に問題を検知、特定し、配信が続行できるまで修正を試みます。

1時間以上かけて、数十回にわたるウェブページ検索と数万語の情報処理を行った結果、大多数の…大型モデル長い間ダウンしています。検索ループに陥ってしまうか、あるいはWord文書として指定したディレクトリに保存するという最初の指示をとうに忘れてしまっているかのどちらかだ。

しかしながら、GLM-5.1の長文テキスト記憶と目標認識能力は極めて安定している。1時間半にわたる過酷なストレステストの後でも、多段階タスク計画から複雑なネットワーク検索、論理合成、コード作成、ローカルファイルI/Oに至るまで、そのフルチェーン機能を完璧に実証した。

コーヒーを飲みに出かけて、戻ってきて完成品を検査することもできます。

現在、GLMコーディングプランのすべてのユーザーはGLM-5.1モデルを使用できます。設定方法は非常に簡単です。単純

オープンします Claude そのファイルが保存されているフォルダ内で、ファイル ~\.claude\setting.json を見つけて、設定情報を次のように変更してください。

{

"env": {

"ANTHROPIC_BASE_URL": "https://open.bigmodel.cn/api/anthropic",

"ANTHROPIC_API_KEY": "実際のAPIキー"

"ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.5-air",

"ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.1",

"ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.1"

}

}

再起動 Claudeすると、デフォルトモデルがGLM-5.1になっていることがわかります。

以下のコマンドを入力すると、現在のモデル情報を表示することもできます。

/status

GLMコーディングプランを使用している場合は、以下のコマンドを入力してGLM-5.1モデルに切り替えることもできます。

/model

まだコーディングプランをお持ちでない方は、最近コーディングプランのパッケージが非常に人気ですので、午前10時ちょうどに購入されることをお勧めします。

3種類のパッケージオプションをご用意しておりますので、お客様のニーズに合ったものをお選びいただけます。

  • Lite:エントリーレベルの価格帯で、小規模で軽量な作業に適しています。
  • Pro:Liteの5倍の使用量制限があり、中規模のタスクや軽度の開発に適しており、厳選されたさまざまなMCPツールを網羅しています。
  • 最大:Lite版の使用制限の20倍。中規模から大規模の高度な開発タスクに適しており、ピーク時には優先的にリソースが確保されます。

とともに大型モデルこの技術は、当初の「100機種規模の競争」から、より高度な能力開発段階へと移行しており、長距離任務が機種試験の鍵となっている。知的次の基準。

一般的なテストでは、国内モデルと海外モデルの違いを認識することは困難です。公式のケーススタディにおける、GLM-5.1が8時間自律的に動作し、数千語を反復処理し、自己レビューループを実行するような、詳細かつ難易度の高いシナリオにおいてのみ、GLM-5.1とGLM-5の違いをより具体的に認識することができます。

GLM-5.1 組み合わせ Claude コードやその他のエンジニアリングハーネスは、ドキュメント横断的なエンジニアリングアーキテクチャとエンドツーエンドのプロジェクトデリバリーにおける能力を実証します。

人工的な知的開発の方向性は既に非常に明確です。大型モデル現在、コード作成の補助業務に取り組んでいます。自動完成者は、要件を理解し、アーキテクチャを計画し、タスクを独立して完了できる仮想従業員へと進化しました。

将来、自然言語が最も重要なものになることは予測できる。強力GLM-5.1は、このプログラミング言語の最高の実行エンジンであることは間違いない。

国内生産品です大型モデル生産性の時代が真に到来した。

元のリンク:志普 GLM-5.1 オープンソースベンチマークスコアが上回る Claude Opus 4.6!詳細なテスト結果はこちらです。