AB
AiBoss
チュートリアル

Tencent Hy3の実地テスト - GLM 5.1およびDeepSeek V4 Proとの比較

テンセントのHy3が先日リリースされ、WorkBuddyユーザーは無料で利用できるようになった。誰もがこぞって利用しようとしており、長蛇の列ができている。Hy3は、4月末にリリースされたHy3プレビュー版のアップグレード版だ。

Tencentは最近Hy3をリリースし、WorkBuddyは直接...無料使用中は誰もがこぞって利用しようとし、長い行列ができる。

Hy3は、4月末にリリースされたHy3プレビュー版のアップグレード版です。

モデルの実世界でのブラインドテストでは、Hy3 は平均して GLM 5.1 を上回りました。推論では、知的長い文脈を扱うタスクにおいては、その性能は国内外のより大規模な主力モデル(パラメータ規模はHy3の2~5倍であることが多い)に匹敵する。

Hy3は、より大型の(2~5倍の)フラッグシップモデルに匹敵し、実際のテストではGLM 5.1を上回る性能を発揮すると宣伝されているため、この主張に基づいてテストしてみるべきでしょう。

比較のために、Hy3よりもスペックの高いGLM 5.1とDeepSeek-V4-Proの2つ、そしてスペックが同程度のDeepSeek-V4-Flashの1つを選びました。

実際に試してみて、どんなものか確かめてみましょう!

ケース1:フロントエンド設計

プロンプトワード

作る AI モデル比較ダッシュボード。

内容は以下のとおりです。

  • 1. 上部には、hy3、GLM 5.1、DeepSeek V4 Pro、DeepSeek V4 Flashの4つのモデルが表示されます。
  • 2. 中央部分は採点マトリックスで、コード、推論、記述、視覚、速度、安定性が評価されます。
  • 3. 右側には、現在選択されているモデルの長所と短所が表示されます。
  • 4. テストケースの実行ログは下部に表示されます。

設計要件:

  • 1. マーケティング用のランディングページを作成しないでください。
  • 2. プロフェッショナルなSaaSツールのように、情報密度は高いが、ごちゃごちゃしていないものであるべきです。
  • 3. デスクトップおよびモバイルデバイスに対応しています。
  • 4. 実世界での操作:モデルの切り替え、テストタイプのフィルタリング、スコアの並べ替え。
  • 大きなグラデーションの背景、ガラスのようなデザイン、中空の装飾の使用は避けてください。

Hy3:

Hy3は非常に完成度が高く、その情報アーキテクチャは実際の比較評価ツールに最も近いものです。主要なKPI、4つのモデルカード、スコアリングマトリックス、右側のモデル詳細、レーダーチャート、寸法詳細、長所と短所、仕様エリア、テスト記録、フィルタリングなど、すべてが含まれています。

デスクトップ画面中央左側に目立つ空白領域があり、ブラウジングのリズムが不均一になる。

DeepSeek-V4-Pro:

DeepSeek-V4-Proは、6次元×4のモデルスコアリングマトリックスを備えた明確な構造を持っています。列の選択、フィルタリングボタン、テスト履歴テーブルはすべて正常に動作します。

しかしながら、デザインに独自性がなく、「標準的な白い背景のSaaSテーブルデモ」に似ている。マトリックス領域には大きな空白があり、ページ密度も適切に制御されていない。詳細面では、モデルプロファイル、仕様、グラフィック機能パネルが不足しており、記憶に残りにくい。

DeepSeek-V4-Flash:

DeepSeek-V4-Flashのカード、棒グラフ、表はどれも非常に安定しており、視覚的なスタイルは控えめで、不要な装飾は一切ありません。

しかし、いわゆる「スコアリングマトリックス」は、現在選択されているモデルの6つの次元のみを表示するものであり、真の4モデル水平マトリックスではありません。情報階層も限定的で、完全な比較評価ワークベンチというよりは、モデルの詳細ページと記録テーブルに似ています。

GLM 5.1:

GLM 5.1ページが実行されていません。ブラウザに「無効または予期しないトークン」エラーが表示されます。モデルカード、マトリックス、詳細、テストレコードはすべて表示されず、暗いシェルと空のヘッダーのみが表示されます。

このケースのランキング:Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash > GLM 5.1

ケース2:3D物理的相互作用

プロンプトワード

3Dミニ扇風機宮殿を作ろう。

必要とする:

  1. Three.jsを使用してください。
  2. 画像には、傾いた迷路盤と小さなボールが写っている。
  3. キーボードの矢印キーを使って、迷路ボードの傾きを操作してください。
  4. ボールは、傾きの方向に応じて転がります。
  5. そこには壁があり、ゴールラインがあり、そして失敗の落とし穴がある。
  6. チェックポイントに到着すると、所要時間が表示されます。
  7. 穴に落ちた後はリセットしてください。
  8. 基本的な物理的効果が必要であり、単に座標を変更してスクロールを偽装するだけではダメだ。

非常に安定しており、three.min.jsがプリインストール済みで直接実行できます。傾斜ボード、転がるボール、壁との衝突、穴を抜けてリセットされる動作、ゴールライン、タイマー、落下回数、モバイルデバイス用の方向キーなど、物理演算の実装も明確です。ボタンを押すと、ボールの位置とタイマーがはっきりと変化します。

DeepSeek-V4-Pro:

DeepSeek-V4-Proは、React Three Fiber + Rapierを使用する非常に高度なアプローチを採用しており、ビルドプロセスも成功したことから、物理エンジンを使用する必要があることが示唆される。

しかし、実際にプレイしてみると、いくつか大きな問題があります。左右の重力のロジックが不安定で、ボードが上向きに傾いた後、さらに上方向に動いてしまうのです。

DeepSeek-V4-Flash:

キャンバス、迷路、タイマー、開口部、そしてレベルクリアのためのポップアップウィンドウが特徴です。

欠点としては、ゲームシステムがまだやや脆弱な点が挙げられます。オープニングが少なく、HUD情報も限られており、左右の重力ロジックが不安定です。ボードが上向きに傾いた後、上方向に移動してしまうのです。

GLM 5.1:

このゲームは非常に良くできており、完全な迷路、壁、複数の失敗した出口、ゴールライン、影、HUD、ベストタイム表示、WASD/矢印キー、Rキーによるリスタート、マウスによる視点回転などの機能を備えています。

しかし、あらゆる方向における重力の法則は混沌としており、ボードは上向きに傾くが、同時に上方向にも移動する。

この場合、ランキングは次のようになります。Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

ケース3:タワーディフェンスゲーム

プロンプトワード

ミニタワーディフェンスゲームを作ってみよう。

必要とする:

  1. マップ上には固定された経路があり、敵はその経路に沿って移動します。
  2. プレイヤーは開けた場所に砲塔を設置できる。
  3. 砲塔自動射程範囲内の最も近い敵を攻撃せよ。
  4. 敵は倒されると金貨を落とす。
  5. 敵の波状攻撃の数と速度は、波ごとに増加していく。
  6. 体力ポイント、コイン、ウェーブ、一時停止、再開といった要素が含まれています。
  7. 砲塔には少なくとも2種類ある。単体への高ダメージ型と、範囲攻撃型の低ダメージ型だ。
  8. ゲームは、少なくとも5つのウェーブがプレイできるようにバランス調整する必要がある。

Hy3:

Hy3には、矢の塔、大砲の塔、氷の塔の3種類の塔があり、それぞれ単体攻撃、範囲攻撃、減速効果をカバーしています。また、売却による返金、一時停止、再開、ウェーブステータスといった機能も備えています。UIは分かりやすく、敵の体力ゲージ、移動経路、塔の位置などが明確に表示されるため、完成度の高いミニゲームのプロトタイプと言えるでしょう。

DeepSeek-V4-Pro:

DeepSeek-V4-ProのReact/Vite版。タワー配置と5波フローが利用可能です。

しかし全体的に見ると、基本的なデモ版といった印象です。タワーの種類は2種類しかなく、ログや売却、減速、敵の種類変更などはなく、ビジュアルも比較的...単純

DeepSeek-V4-Flash:

DeepSeek-V4-Flashは、タワーの設置、ウェーブの開始、キル報酬としての金銭付与など、様々な機能を備えた高品質な単一ファイルです。イベント通知機能やタワー属性パネルも搭載しています。

欠点としては、タワーの種類が2種類しかないこと、敵の種類や戦略の奥深さが平均的であること、インターフェースの視覚的な魅力が劣ることが挙げられる。

GLM 5.1:

GLM 5.1のゲーム構造は非常に製品志向的です。10ウェーブ、2種類のタワー、複数の敵の種類、スピードボタン、イベントログ、そして右側のショップには完全な情報が掲載されています。

しかし、グラフィックはかなり暗く、戦闘のフィードバックも直感的ではありません。タワーの種類も少なく、売却やアップグレードもできません。

このケースのランキング:Hy3 > GLM 5.1 > DeepSeek-V4-Flash > DeepSeek-V4-Pro

ケース4:コードのデバッグ

プロンプトワード

以下のPythonコードは、配列内の合計がtargetに等しい2つの数値のインデックスを見つけますが、バグがあります。バグを指摘し、正しいコードを示し、3つのテストケースを追加してください。

def two_sum(nums, target):

seen = {}

for i, n in enumerate(nums):

if target – n in seen:

return [i, seen[n]]

seen[n] = i

return []

Hy3:

Hy3 の標準テストケースは明確に説明されており、[2,7,11,15] では KeyError が発生すること、コードの修正が正しいこと、テストカバレッジには基本的、反復的、および解決不可能なケースが含まれていることが指摘されています。

「n == target - n の場合のみ正しい」という記述は、やや絶対的な表現です。元の戻り値の順序が厳密に [0,1]、[3,3] である必要がある場合、元のコードを逆にすることも可能です。

DeepSeek-V4-Pro:

DeepSeek-V4-Proの修正とテストは正しく、4つのテストケースすべてが完全に網羅されています。しかし、seen[n]が「現在の数値nのインデックス、つまりi自体」である可能性があるという説明は正確ではありません。なぜなら、seen[n] = iは判定後に発生し、通常はまだ書き込まれていないからです。

DeepSeek-V4-Flash:

DeepSeek-V4-Flashには明らかな欠陥があり、「戻り値の順序が逆になっている」という問題を誤って判断しているにもかかわらず、`seen[n]`ではなく`seen[target – n]`を使用しています。標準テストケース[2,7,11,15]、target=9では依然としてKeyErrorが発生し、提供されているテストも実行に失敗します。

GLM 5.1:

GLM 5.1 は根本的な問題点を正確に特定しています。`target – n` が `seen` に含まれているかどうかをチェックし、戻り値は `seen[target – n]` でなければならないとしています。また、`seen[n]` で KeyError または重複値が発生する可能性があるという、より厳密な説明も提供しています。修正されたコードとテストは正しいです。

このケースのランキング:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

事例5:中国語の書き方

プロンプトワード

以下の段落を、WeChat公式アカウントの投稿としてより自然な表現になるように書き直してください。 AI 書かれた。

オリジナル:

存在する人工的な知的速い今日の開発では、Agent もはや単なる技術的な概念ではなく、生産性を変革するための重要なツールになりつつあります。一般の人々にとって、理解することは… Agent これは非常に重要なことです。なぜなら、作業効率を向上させるだけでなく、人間と機械の関係性を再考するきっかけにもなるからです。

Hy3:

Hy3は査読に対する意識が高く、原文の問題点を正確に指摘することができる。 AI メロディーの源泉、そして書き換えられた過程もまた、公的な記録の始まりを思わせる魅力を持っている。

DeepSeek-V4-Pro:

DeepSeek-V4-Proは、簡潔で分かりやすく、無駄な機能がなく、使いやすいソフトウェアです。ただし、収録されている情報は比較的少なめです。 Agent 一般的な効率化ツールとして記述すると、「積極的な実行、複数ステップのタスク、人間と機械の分業の変化」といった重要な要素が欠けてしまう。

DeepSeek-V4-Flash:

DeepSeek-V4-Flashはオリジナルよりも口語的な表現を多用しているものの、「ただの…ではない」「本当に…」「作業効率を2倍にする」「考え直す」といった明確なテンプレートは維持されている。人間と機械のどちらがどちらに耳を傾けるべきかという問いも、クリックベイト的な印象を与える。

GLM 5.1:

GLM 5.1は具体的でシナリオに基づいた内容となっており、単に「効率性を向上させる」というレベルを超え、フライトの予約、書類の整理、進捗状況の監視、レポートの作成、メールの送信、データのアーカイブといったタスクを記述することで、読者が理解しやすいように工夫されています。 Agent 文の構造は明確で、口調も自然で、定型文が多すぎることもありません。「~よりも~の方が良い」という表現が繰り返し使われているのが少し気になります。

このケースのランキング:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

ケース6 制約遵守

プロンプトワード出力はJSON形式で行ってください。Markdownや解釈形式は使用しないでください。

タスク: AI プログラミングツールに関する中国の広告スローガン5選。

制約:

  • 1. 各項目は中国語で16文字以内とする。
  • 2. 「効率」と「効率」という単語は使用しないでください。知的「未来」という三つの言葉。
  • 3. 各項目には動詞が含まれていなければなりません。
  • 4. JSONフィールドは「slogans」で、その値は文字列の配列です。

Hy3:

Hy3のJSON形式は正しく、フィールドは正確に5つで、すべて短い中国語の文章で構成されており、英語、スペース、不要な説明は一切含まれていません。

DeepSeek-V4-Pro:

DeepSeek-V4-Pro の JSON は準拠しており、表現もより鮮明ですが、次のような行が少し長くなっています。要件を述べるだけで、コード自体が長いので、アイデアをどんどん入れてください。

DeepSeek-V4-Flash:

DeepSeek-V4-Flashフォーマットは問題ないが、制約が最も弱い。バグを利用している...AI このような英語表現です。バグは修正され、即座に展開されました。アカウントごとに1人ずつです。AI宣伝文句のように、スタック全体をサポートすると言うのは少々誇張表現だ。

GLM 5.1:

GLM 5.1も非常に安定しており、5つの小節すべてが短く、一定のリズムを維持していました。ただし、「bug」という英単語が使用されていました。

今回のケースランキング:Hy3 > DeepSeek-V4-Pro > GLM 5.1 > DeepSeek-V4-Flashcase 7

コードのリファクタリング

プロンプトワード以下の関数は2年間オンラインで稼働しており、クーポン、会員割引、地域税率に対応する必要が生じました。リファクタリングによる解決策を設計してください。

function calcTotal(items, user) {

let total = 0

for (const item of items) {

total += item.price * item.count

}

if (user.vip) total *= 0.9

total *= 1.06

return Math.round(total * 100) / 100

}

必要とする:

  • 1. 過剰なデザインを避ける。
  • 2. テスト容易性を維持する。
  • 3. TypeScriptコードを提供してください。
  • 4. サンプルとなる単体テストを提供してください。
  • 5. どのロジックを設定する必要があるかを説明してください。

Hy3:

Hy3は、純粋関数、構成オブジェクト、および税率/会員割引/クーポンの境界を明確に分離して説明しており、エンジニアリング上の判断の信頼性を高めています。

DeepSeek-V4-Pro:

DeepSeek-V4-Proは、堅牢な実装、広範なテストカバレッジ、そして依存関係のない動作を誇ります。欠点は、「ユーザー」から「メンバーシップ」への変更であり、元の製品版で「VIP」フィールドが使用されていた場合、互換性の問題が発生する可能性があります。

DeepSeek-V4-Flash:

DeepSeek-V4-Flashは、適切なアプローチを採用している。つまり、構成は一定で、計算順序は固定されており、戦略パターンは存在しない。

しかし、この方式には実装上の問題が最も多く存在します。クーポンは会員割引よりも優先され、会員割引は小計に基づいて差し引かれるため、クーポンの組み合わせとビジネス上の直感との間に容易に食い違いが生じる可能性があります。また、固定クーポンには最終的なセーフティネットがなく、複数のクーポンを併用するとマイナスになる場合があり、全体として未完成な印象を受けます。

GLM 5.1:

GLM 5.1の設計は、構成の注入、移行のペース、過剰設計を避けるべき点など、すべて網羅的に説明されています。特に、運用バックエンドに接続する前に、まず古いハードコードされた構成を使用して回帰テストを行うという提案は、実際のエンジニアリングプロセスと非常によく似ています。

減点の理由は、コードスニペットの軽微な欠陥によるものです。pricing.ts では types.ts から型をインポートする方法が示されておらず、DiscountPolicy/TaxPolicy がテストでインポートされていません。これらを直接コピーしても、コードが正しく動作しない可能性があります。

case 8 Excel自動変化

プロンプトワード

私には以下のフィールドを持つ売上テーブルがあります。

日付、営業担当者、都市、製品、販売金額、費用、顧客タイプ。

以下の要件を満たすExcel分析テンプレートを作成してください。

  1. 自動売上総利益と売上総利益率を計算してください。
  2. 月別、都市別、営業担当者別に展望分析を生成する。
  3. 粗利益率が15%未満の注文を特定する。
  4. 管理ダッシュボードを生成します。
  5. 使用する数式、ピボットテーブルのフィールド設定、およびグラフの種類を指定してください。

Hy3:

Hy3は、生成スクリプト、数式列、条件付き書式設定を含む、完全な.xlsxファイルを提供します。自動概要にはKPIと3つのグラフが含まれています。実際のExcelピボットテーブルは作成されていませんが、ピボットフィールドの説明が記載されています。

DeepSeek-V4-Pro:

DeepSeek-V4-Proは、明確な構造と完全な6シート構成を備えており、KPI計算式や低マージンリスト比較フィルター機能も実用的です。ピボットテーブルにおける「売上総利益/売上高」フィールドを用いた売上総利益率の計算精度は非常に高いです。

DeepSeek-V4-Flash:

DeepSeek-V4-Flashソリューションは基本的なフレームワークを備えていますが、数式の詳細に多くの問題があります。例えば、低マージンマーカーがゼロ除算を防止せず、COUNTIF(I:I,<0.15)に引用符が欠落しており、ピボットテーブルの利益率の提案が十分正確ではありません。

GLM 5.1:

GLM 5.1は、実際のExcelの設定プロセスと非常によく似ています。スーパーテーブル、ピボットテーブル、低収益アラート、スライサー、タイムライン、しきい値などの機能はすべて設定セルに配置できます。実用的しかし、一部の数式は、総売上総利益 / 総売上高のように、特性を記述することに重点を置いて記述されています。

この場合、ランキングは次のようになります。Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

ケース9 DCF評価

以下の仮定に基づいて、DCF評価を実施してください。

2026年のフリーキャッシュフローは1,200万ドルで、その後4年間はそれぞれ18%、15%、12%、8%の成長率となる見込みです。永久成長率は3%、加重平均資本コスト(WACC)は10%です。純負債は2,000万ドル、発行済株式数は1,000万株です。

  1. 明示的な期間のキャッシュフローの現在価値。
  2. 最終値。
  3. 企業価値。
  4. 株式価値。
  5. 一株当たりの価値。
  6. 加重平均資本コスト(WACC)9~11%、および永久成長率2~4%について感度分析を実施する。

Hy3:

Hy3の割引方法は正しいです。2026年から2030年までのキャッシュフローはt=1~5で割り引かれ、2030年末の最終値も5年間で割り引かれています。1株当たり21.95元のベンチマークも正しく、HTMLレポートと計算スクリプトが実際に生成されました。

DeepSeek-V4-Pro:

DeepSeek-V4-Proにもローカルスクリプトがありますが、その基本的なアプローチが間違っています。2026年の1200万FCFを省略し、2027年からしか割引計算を開始していません。また、ターミナルバリューも4年間しか割引計算されていないため、評価額が23.14元に過大評価されています。

DeepSeek-V4-Flash:

DeepSeek-V4-FlashとDeepSeek-V4-Proはどちらも、DCF(割引キャッシュフロー)において同じ誤りを犯しています。それは、2026年のキャッシュフローを省略し、先物割引期間を1年少なく設定している点です。しかし、DeepSeek-V4-Flashは、ローカルドキュメントが不足しており、説明も簡潔であるという点で、DeepSeek-V4-Proよりも劣っています。

GLM 5.1:

GLM 5.1の計算と定義は厳密で、評価日、年末のキャッシュフロー契約、5年間の割引将来価値が明確に示されています。5×5の感度分析も完了しています。結論で将来価値の割合と相互検証が強調されていることから、財務モデリングに関する知識がうかがえますが、残念ながらローカル配信ファイルは生成されませんでした。

このケースのランキング:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash

テスト結果を見る限り、Hy3の宣伝文句はかなり正直だと言えるでしょう。全体的にGLM 5.1を上回っており、DeepSeek-V4-Proをも凌駕したことには非常に驚きました。

Hy3は、フロントエンド開発、タワーディフェンス、制約遵守、コードリファクタリング、およびExcelで使用されています。 自動彼らは変革とDCFに関する質問で1位を獲得し、特にその強みは成果を出す能力にある。彼らは文書を作成したり、ウェブページを運営したり、要件を具体的な成果物に分解したりすることができる。

GLM 5.1は、コードのデバッグ、中国語の文章作成、DCF(割引キャッシュフロー)の用語など、批判的思考を必要とする問題において優れた能力を発揮します。厳密な説明を提供し、財務モデリングに対する深い理解を示しています。

DeepSeek V4 Proは、どちらかというと堅実でエンジニアのような開発者ツールと言えるでしょう。優れた構造化コード機能を備えており、コードリファクタリング中に20個のテストを正常に実行することに成功しました。

DeepSeek V4 Flashは、軽量なタスクに適しています。単一ファイルページ、小規模なデモなどに最適です。速い草稿自体は悪くないが、厳密な論理展開、制約条件の遵守、複雑なビジネス用語の使用といった点で不十分である。

実際に試用してみた結果、Hy3に対する私の印象は非常に明確です。日常業務に十分使える製品です。

もちろん、まず最初に明確にしておきたいのは、今回のテストにはWorkBuddyを使用したということです。これはテンセント独自のプラットフォームです。 Agent Tencent独自のモデルを使用すれば、互換性の面で多少のメリットが得られるかもしれない。しかし、いずれにせよ、最終的な結果は明白だ。ページは正常に動作し、ファイルも送信でき、複雑なタスクも分割できるため、全体的な完了率は確かに非常に高い。

さらに重要なことに、WorkBuddyでHy3を使用するのは現在無料です。無料所要時間は2週間です。頻繁にコードを実行したり、ウェブページを作成したり、分析レポートを作成したりするユーザーにとっては、実質的に半月分のトークン料金を節約できるのと同等の効果があります。後からAPIを統合する場合でも、価格はそれほど高くなく、DeepSeek-V4-Proよりも若干安価です。

私が本当に楽しみにしているもう一つの点は、Hy3が既に元宝やWeChat読書など、多くのテンセント製品と連携していることです。これらは私が普段からよく使うツールでもあります。

また、Hy3の計算処理能力の消費量が7月8日午前10時頃にピークに達し、その後もキューが発生し、午後にはキュー率が50%を超える時間帯があったことも確認しました。これは、おそらく私以外にもHy3を良いと思っている人がいることを示しています。

今回のテスト後、Hy3を日常業務のバックアップリストに追加することにします。そして、国産モデルが今後も改良されていくことを期待しています。

元のリンク:Tencent Hy3が発売されたので、プロモーション資料にどれくらい盛り上がりがあるか見てみよう。