DeepSeek V4 Pro vs GLM-5.3:国内最高峰の大型模型キットはどちら?
今日は、新しいモデルの敵対的テストに関する情報を投稿します。最近、国内で開発された大規模な敵対的モデルが2つ登場しました。DeepSeek-V4-ProとGLM-5.3です。リリース後、オンラインレビューはまちまちで、ベンチマークスコアだけでそのリアリティを判断するのは困難です。
今日は、新しいモデルの敵対的テストに関する情報をいくつか投稿します。
国内大型モデル最近、DeepSeek-V4-ProとGLM-5.3という2つの強力な新製品が登場しました。
両モデルが発売された後、オンラインレビューは一貫性がなく、ベンチマークスコアだけでは実際の差を判断するのは困難だった。
今回はパラメータについては触れずに、早速タスクに取り掛かり、同じ方法を使ってみましょう。プロンプトワード各アイテムは、同じ材料と配送条件で完成させてください。
両モデルとも Claude コードは同一の環境内で、同一の権限と初期ファイルを使用して実行されます。各ケースは一度だけ実行され、個々のモデルに合わせて調整は一切行われません。プロンプトワード。
レースが終わったら、中国でトップの男性モデルは誰なのか、そして中国でトップの男性モデルは誰なのかを見てみましょう。
事例1:事故証拠の収集と損害賠償額の算定
プロンプトワード:
以下の模擬契約書、監視記録、作業指示書、ステータスページ、請求書に基づいて、2026年8月のサービスがSLAを満たしていたかどうかを判断し、クレーム資料を作成してください。
時刻はすべて北京時間(UTC+8)です。
文書1:主要サービス契約第8.2条
月額サービス料金は20万元です。利用可能クレジットは、この月額サービス料金に基づいて計算されます。
月間利用可能額は99.90%未満だが99.50%未満ではなく、信用限度額は5%である。
月間利用可能額は99.50%未満だが99.00%未満ではなく、信用限度額は10%である。
月間利用可能額は99.00%未満で、クレジット限度額は20%です。
月間の最大利用限度額は、月額サービス料金の20%です。
文書2:SLA付属書第3条
– 月間利用可能時間 = 1 – 当月の利用不可時間数 ÷ 当月の総通話時間数。
アクティブなテナントの20%以上がコアヘルスチェックに不合格となった場合、サービスは利用不可とみなされます。
供給業者の監視記録は、可用性計算の主要な証拠となる。
ステータスページやカスタマーサービスからのメールは、補足的な証拠としてのみ使用できます。
承認済みの定期メンテナンスは除外できますが、供給業者は少なくとも5営業日前に顧客に通知する必要があります。
-毎月最大4時間までの定期メンテナンスは除外できます。
文書3:SLA付属書第4条
P1インシデント発生期間は、顧客からの報告またはサプライヤーによる最初のアラーム検出のいずれか早い方から計算されます。
応答時間:15分。
・一時的な解決策の有効期間:4時間。
サービス復旧時間:8時間。
文書4:サプライヤー監視輸出
2026年8月5日 1:00~2:30
基本的な健康チェックに不合格となった入居者の割合は100%でした。
2026年8月12日 9:12~15:42
基本的な健康チェックに不合格となった入居者の割合は100%でした。
2026年8月22日 02:00~03:10
基本的な健康チェックに不合格となった入居者の割合は35%だった。
これら3つの期間は重複しない。
文書5:計画メンテナンスのお知らせ
通知の公開時間:2026年8月1日18時00分。
定期メンテナンスの予定時間:2026年8月5日 1:00~2:30
通知には、メンテナンス中は主要サービスが利用できなくなる可能性があると記載されています。
文書6:8月12日付作業指示書
サプライヤー監視からの最初のアラート:09:12。
顧客がP1作業指示書を作成しました:09:16。
サプライヤーからの最初の手動応答: 09:38。
暫定的な解決策が完了しました:12時50分。
サプライヤーステータスページのフラグが復元されました: 15:10。
監視システムは正常に戻りました:15時42分。
作業指示完了:17:30
文書7:アカウントマネージャーのメール
「8月12日の事件は15時10分に完全に解決したため、復旧時間は6時間を超えませんでした。」
文書8:8月法案
月額サービス料金:20万元。
初回導入サービス料金:50,000元。
税金および手数料は、SLAの信用限度額の計算には含まれません。
配達をお願いします:
1. 証拠シート。各事実、情報源、証拠レベル、および矛盾点を記載する。
2. 各セグメントにおける利用不可の3つの時間をSLAに含めるべきかどうかを判断する。
3. 8月の総通話時間(分)、利用不可時間(分)、および月間利用可能時間を計算します。
4. 該当する信用限度額の割合と金額を決定する。
5. 8月12日時点の対応、暫定的な解決策、および復旧スケジュールをレビューする。
6. アカウントマネージャーのメールに記載されている結論が妥当かどうかを説明してください。
7. 情報が不十分な項目、または判断できない項目をリストアップしてください。
8.経営陣に提出されるインシデント概要。
9. 供給業者に送付される正式なクレームレター。
10.経営陣へのプレゼンテーションに含めるのに適したインシデント発生時系列表。
11. すべての時間差、比率、および金額の計算を確認してください。
DeepSeek-V4-Pro
GLM-5.3
どちらのモデルも信用限度額を4万元と算出し、サプライヤーからのメールに含まれる誤りも特定した。
DeepSeek-V4-Proは、契約書のレビュー担当者のような役割を果たし、23項目の証拠を詳細に分析し、どれが有効でどれが証拠不十分であるかを明確に説明します。
しかし、DeepSeek-V4-Proには小さな問題があり、98.7679%を約98.76%と表示しますが、標準的な小数点以下2桁への丸めでは98.77%になるはずです。
GLM-5.3は、DeepSeek-V4-Proよりもフォーマットの完成度がはるかに高く、開いたり、印刷したり、報告したりできるクレームファイルを直接生成する、いわば配送マネージャーのような存在です。
総合的に見て、GLM-5.3は高い配信完了率によりケース1で勝利を収めた一方、DeepSeek-V4-Proは証拠推論においてより高い安定性を示した。
ケース2:統合型オフィスアプリケーション(Excel、Word、PowerPoint)
プロンプトワード:
以下の注文データを処理し、納品可能なオフィス文書一式を生成します。
order_id,user_id,paid_at,amount,status,channel,original_order_id
A1001,U01,2026-08-01 23:40:00,299.00,paid,web,
A1002,U02,08/02/2026 09:15,"1,299.00″,paid,ios,
A1002,U02,2026-08-02 09:15:00,1299,PAID,iOS,
A1003,,2026/08/03 14:20,-199,refund,web,A1001
A1004,U04,2026-08-03T16:30:00+08:00,399,PAID,android,
A1005,U05,2026-08-04,0,paid,web,
A1006,U06,bad-date,99,pending,Web,
A1007,U07,2026-08-04 10:15:00,699,paid,android,
R1001,U01,2026-08-05 12:20:00,-99,refund,web,A1001
R1002,U02,2026-08-05 13:30:00,-1500,refund,ios,A1002
A1008,U08,2026-08-06 15:00:00,"1,099.00″,paid,web,
A1009,U09,2026-08-06 16:00:00,499,cancelled,android,
A1010,U10,2026-08-07 11:00:00,199,paid,,
A1011,U11,2026-08-07T12:00:00+08:00,259,paid,ios,
A1012、U12、2026-08-08 09:00:00、299元、有料、ウェブ、
清掃ルール:
– order_id、user_id、paid_at、amount、status、channelはすべて必須項目です。
日付はすべて北京時間 `YYYY-MM-DD HH:mm:ss` です。
– ステータスとチャンネルは小文字で表記してください。
支払金額は0より大きい必要があります。
返金金額は0未満である必要があり、有効な元の支払い済み注文が見つかる必要があります。
– 1回の払い戻しの絶対額は、該当する注文の支払い金額を超えることはできません。
同じ order_id を持ち、かつビジネス内容が同一の重複レコードは、1件のみ保持されます。
保留中またはキャンセルされた注文は保留される場合がありますが、純利益には含まれません。
-実質的な純利益は、実質的な支払額と実質的な払い戻し額の合計に等しい。
確実に修復できないデータは、元の値と拒否理由を保持したまま、拒否テーブルに入力されます。
生成してください:
1. `cleaned.csv`。
2. `rejected.csv`。
3. `clean_orders.py`。
4. `analysis.xlsx`には、生データ、クリーニング済みデータ、却下データ、統計概要、およびグラフが含まれています。
5. Excel 365 の数式: 元データが変更されると、数式を再計算できます。
6. 経営陣が読むための `memo.docx`。
7. `management_report.pptx`、全7ページ。
8. 元の行数、有効な行数、重複数、拒否数、および正味有効収益を一覧にした検証レポート。
クリーニングスクリプトを実行し、生成されたファイルを開くかレンダリングして、内容を確認してください。 CSVExcel、Word、PowerPointの数値が一致しているか確認してください。問題が見つかった場合は、修正を続けてください。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proの最終的なビジネス数値はすべて正確であり、検証レポートには有効な注文がすべて記載されているため、手動での追跡が容易です。
ただし、日付の解析は正規表現のみに依存しているため、2026-13-40 25:61:00 のような無効な時刻も受け入れられます。また、+00:00 のタイムゾーンに遭遇した場合、スクリプトは単にタイムゾーンマーカーを削除します。
Excelにはヘッダーを固定する機能がないため、列幅が過度に広くなり、全体的に閲覧体験が悪くなります。
このPowerPointプレゼンテーションは、主にテキストベースで、十分な余白が設けられています。
GLM-5.3は、金額の処理にDecimalを使用し、ISOタイムゾーンを正しく変換でき、無効な日付を拒否できます。スクリプトは独自のディレクトリを使用してファイルを検索するため、他のディレクトリから実行した場合でも、誤ったファイルを見つけにくくなっています。
Excelにチャネル分析、ステータス分析、数式グラフ、および固定ヘッダーを追加します。
Wordにはチャンネルチャートが含まれています。
このPowerPoint資料には、フローチャート、データカード、表、グラフが含まれており、プレゼンテーションの準備はほぼ完了しています。
DeepSeek-V4-Proは、正確な数値と基本的なフォーマットを備えたオフィスレベルの結果を出力したが、GLM-5.3はそれよりもはるかに完成度が高かった。
ケース3:リポジトリの同時実行性に関するバグ修正
プロンプトワード:
重複注文が発生した場合は、注文受付窓口で対応してください。
倉庫パス:
D:\360MoveData\Users\win\Desktop\选题\order-desk
カスタマーサポートには、重複注文に関する報告が複数寄せられています。速い「注文を保存」をダブルクリックしたり、ネットワークタイムアウト後に再試行したり、サーバーにほぼ同時に2つのリクエストが届いたりすると、複数の注文が生成される場合があります。重複した注文は後続の処理に別々に進み、現時点では手動でキャンセルする必要があります。
処理のため、直接倉庫へお越しください。
1. README.md、TASK.md、アプリケーションコード、データベース移行、および既存のテストを読んでください。
2. 既存のテストを実行して、現在の状況を確認します。
3. 重複注文の問題を確実に再現する。
4. フロントエンド、HTTP API、ビジネスサービス、SQLite間の呼び出しプロセスを追跡し、具体的な根本原因を特定します。
5. サービス再起動後の同時リクエスト、ネットワーク再試行、重複注文に関連する問題を解決するためにコードを修正します。
6. 既存のAPIと、通常の注文受付、注文照会、およびリスト機能を維持する。
7. 同時実行性、重複リクエスト、競合リクエスト、トランザクション失敗時の再試行、およびサービス再起動に関連するテストを補足する。
8. データベース移行が新規データベースと既存データベースに与える影響を検証する。
9. すべてのテストを実行し、エラーが見つかった場合は、修正を続け、再検証します。
変更はリポジトリに直接行ってください。提案のみを行うのはご遠慮ください。
完了後の指示:
- 根本的な原因。
-是正措置。
ファイルを変更する。
– データベースの移行。
– テストを追加しました。
実行された実際のコマンドと結果。
リスクは依然として存在する。
DeepSeek-V4-Pro
GLM-5.3
ON CONFLICT(customer_id, idempotency_key) DO NOTHING
ケース4:ファイルエクスポートのセキュリティ強化
プロンプトワード:
以下のFastAPIインターフェースを確認し、修正してください。
from fastapi import FastAPI
from fastapi.responses import FileResponse
from pydantic import BaseModel
import os
import requests
app = FastAPI()
class ExportRequest(BaseModel):
url: str
filename: str
@app.post("/export")
def export_pdf(req: ExportRequest):
output = f"/tmp/{req.filename}"
html = requests.get(req.url).text
open("/tmp/page.html", "w").write(html)
os.system(f"wkhtmltopdf /tmp/page.html {output}")
return FileResponse(output)
以下のタスクを完了してください。
1. 脆弱性、悪用条件、および影響を深刻度の順にリストアップしてください。
2. 主要な脆弱性に対する実行可能な攻撃またはテストケースを提供する。
3. 修正済みの完全なコードを提出してください。
4. pytestテストを追加します。
5. プロトコル、ポート、ターゲットホスト、リダイレクトの回数を制限する。
6. 拒否ループプライベートアドレス、リンクローカルアドレス、予約済みアドレス、およびクラウドサービスメタデータアドレス。
7. IPv4、IPv6、IPv4からIPv6にマッピングされたアドレス、10進IPアドレス、および混合エンコードされたアドレスを同時にチェックします。
8. DNSの再バインドと解決結果の変更を処理する。
9. リダイレクト後、毎回ターゲットを再確認してください。
10. 接続を確立する際には、検証済みのターゲットIPアドレスを固定してください。
11. レスポンスヘッダーサイズ、レスポンスボディサイズ、接続時間、読み取り時間、および合計時間を制限します。
12. ストリーミングを使用する場合、サイズが検証される前にレスポンス全体をメモリにロードすることはできません。
13. コマンドインジェクション、パストラバーサル、シンボリックリンク攻撃、および任意のファイル上書きを防止する。
14. wkhtmltopdf を呼び出す際に、シェルアクセスを無効にし、ローカルファイルアクセスと外部リソースの読み込みを制限します。
15. 各リクエストはそれぞれ別の一時ディレクトリを使用します。
16. 入力ファイルと出力ファイルは、同時リクエスト間で共有できません。
17. 一時ファイルは、クライアントが切断されたとき、リクエストがキャンセルされたとき、変換が失敗したとき、および送信が完了したときにクリーンアップする必要があります。
18. FileResponseがまだファイルを読み込んでいる間に、クリーンアップのタイミングを処理する。
19. 変換プロセスに対して、タイムアウト、リソース制限、および終了手順を設定します。
20. テストを実行し、発見された問題の修正を継続する。
テストでは少なくとも以下の内容を網羅する必要があります。
– `127.0.0.1`
– `::1`
– `169.254.169.254`
– プライベートIPv4
IPv4からIPv6へのマッピング
– DNSリバインディング
– リダイレクト先個人住所
– 超大規模な対応
反応が遅い
– コマンドインジェクションファイル名
– パス交差ファイル名
– シンボリックリンクの出力
– 同時輸出依頼が2件
– クライアントが途中でキャンセルしました
wkhtmltopdfがタイムアウトしました
脆弱性レポート、修正プログラム、テストコード、実行手順、および残りの境界条件を提供します。
DeepSeek-V4-Pro
GLM-5.3
ケース5:大容量ファイルの外部ソート
プロンプトワード:
Go言語を用いてコマンドラインツール`ext-sort`を実装する。
入力ファイルは最大サイズ10GBのCSVファイルで、使用可能な最大メモリ容量は512MBです。
並べ替えルール:
1. `created_at`を昇順で並べます。
2. 時刻が同じ場合は、`user_id` で昇順にソートします。
3. 最初の 2 つの項目が同じ場合は、元の行番号の昇順で並べ替えて、安定した並べ替えを保証します。
必要とする:
フィールド内の引用符、カンマ、UTF-8エンコーディング、および改行を正しく処理します。
テーブルヘッダーはそのままにしておく。
– created_at は RFC3339 と `YYYY-MM-DD HH:mm:ss` を受け入れます。
解析できなかったレコードは`rejected.csv`に書き込まれます。
– 1つのデータ入力ミスによって、タスク全体が失敗することはありません。
– `--input`、`--output`、`--temp-dir`、`--memory-limit`、および`--workers`をサポートします。
ファイル全体をメモリに読み込むことができません。
メモリ制限には、ソートブロック、バッファ、マージフェーズの主な使用箇所を含める必要があります。
終了シグナルを受信したときに、一時ファイルをクリーンアップします。
ディスク容量不足、ファイル破損、またはアクセス権限不足の場合に、明確なエラーメッセージを表示します。
ターゲット出力ファイルは、生成処理全体が完了した後にのみ置き換えることができます。
ソート結果は再現性がある。
複数回実行しても、判読不能な一時ファイルが残ってはならない。
配達をお願いします:
1. 完全なGoプロジェクト。
2. 単体テスト、結合テスト、およびプロパティテスト。
3. ランダムなテストデータ生成器。
4. ソート結果検証ツール。
5.性能テスト。
6. クラッシュリカバリおよび一時ファイル設計仕様。
7. コマンドを作成して実行する。
利用可能なメモリ容量を超えるサイズのテストファイルが実際に生成され、ソート、結果の検証、および最大メモリ使用量の測定を行うプロセスが実行されました。エラーは発見され次第修正されました。
DeepSeek-V4-Pro
GLM-5.3
ケース6:高密度データダッシュボード
プロンプトワード:
「React、TypeScript、Vite を使用した作成」AI 「モデル評価ラボ」のシングルページアプリケーション。
視覚的な方向性:
-濃いグラファイト色の背景。
酸性緑色は、特定の状態、エラーメッセージ、および少量の重要なデータにのみ使用されます。
グラデーション、絵文字、ガラスのような効果、および全画面表示の角丸カードは禁止されています。
・情報密度が高く、明確な視覚的階層構造を維持している。
・間隔、フォント、色に関する安定したシステムを確立する。
バックエンドテンプレートでよく見られるレイアウトや装飾は避けてください。
データ規模:
– ローカルで50,000件の評価実行記録を生成します。
各レコードには、モデル、評価セット、時間、精度、レイテンシ、コスト、入力トークン、出力トークン、および実行ステータスが含まれます。
– データ生成には固定の乱数シードが使用されます。
ページコンテンツ:
– モデルおよび評価セットの選択。
– パラメータパネルを実行してください。
– 包括的な指標マトリックス。
– 遅延分布図。
– コスト推移グラフ
– 精度とトークン消費量の関係を示すグラフ。
– スクロール可能な仮想履歴テーブル。
– 単一実行の詳細引き出し。
– 複数モデル比較モード。
相互作用の要件:
フィルタ条件はURLと同期されます。
ブラウザの進む/戻るナビゲーション操作によって、フィルタリング状態が正しく復元されます。
– 速いフィルタ条件を連続的に切り替えた場合、古いリクエストの結果が新しいリクエストの結果を上書きすることはできません。
– ロード中、空データ、エラー、リクエストキャンセル、部分的な失敗状態をサポートします。
グラフには、ツールチップ、凡例、外れ値、および明確な座標単位が表示されます。
座標軸は、切り詰められて誤解を招くようなものであってはならない。
このテーブルは、並べ替え、フィルタリング、ページネーション、仮想スクロールに対応しています。
– すべての操作はキーボードに対応しています。
フォーカス状態は明確です。
– `prefers-reduced-motion`をサポートします。
- 1440、768、390の幅に対応しています。
遅延、エラー、キャンセルされたリクエストをサポートするために、ローカルモックAPIを使用します。
コンポーネントテスト、状態テスト、およびキーインタラクションテストを追加します。
完了後:
1. フォーマットチェック、型チェック、テスト、および本番ビルドを実行します。
2. アプリケーションを起動し、コンソールを確認します。
3. 50,000個のデータポイントを使用して、初期レンダリングとフィルタリングの応答を測定します。
4. 幅がそれぞれ1440、768、390のスクリーンショットを生成します。
5. オーバーフロー、オクルージョン、配置、テキストの読みやすさ、誤解を招くグラフがないかを確認します。
6. キーボードを使用して、フィルタリングと詳細表示のプロセスを完了します。
7. 特定された問題を修正し、再検証する。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proのページは、特に幅が390ピクセルと768ピクセルの場合に、より快適に閲覧でき、フィルター領域、インジケーターカード、チャートが鮮明に表示されます。
GLM-5.3は、当初の要件をより包括的に満たしています。固定シードと固定タイムラインにより、生成されるデータはマシンや実行日に関係なく一貫性を保ちます。また、チャートにはデータテーブルビューも用意されており、初期データレンダリングは約359ms、フィルタリング応答時間は約286msと、DeepSeek-V4-Proよりも若干高速です。
GLM-5.3はステータス処理と受容性においてわずかに優位に立っている一方、DeepSeek-V4-Proはページの読みやすさとマルチモデル分析において優れた性能を発揮する。
ケース7 ノードエディタ
プロンプトワード:
React、TypeScript、およびSVGを使用して、軽量なワークフローエディタを実装します。
機能要件:
ノードの作成、選択、ドラッグ、名前変更、削除を行います。
ポートからケーブルをドラッグして接続を作成します。
自己ループ、重複接続、不正な方向を拒否します。
単一選択、複数選択、およびボックス選択。
ノードをコピー、貼り付け、複製します。
– キャンバスのズームとパン。
– ノード自動視界に入るエリアに入ってください。
・元に戻す、やり直す操作を、最低50ステップ以上保持して行う。
– Delete、Backspace、Ctrl/Cmd+C、Ctrl/Cmd+V、Ctrl/Cmd+Z、Ctrl/Cmd+Shift+Zに対応しています。
入力ボックスを編集する際は、誤ってノードを削除しないように、ショートカットキーを使用しないでください。
– JSON形式のインポートとエクスポート。
JSONエラーが発生した場合は、正確なフィールドまたは場所を指定する必要があります。
- 更新後にlocalStorageから復元します。
500ノード、1000接続でも動作可能です。
– 小さな地図またはキャンバス上の位置調整ツールを提供します。
– キーボードによるノード選択に対応しています。
プロジェクト要件:
1. まず、状態モデル、座標系、および履歴記録構造を設計します。
2. 業務上のステータスと一時的なドラッグ&ドロップのステータスは別々に管理されます。
3. 元に戻す記録には、意味のないマウスの中間的な動きの状態を保存することはできません。
4. コピーされたノードID、場所、および接続が正しく更新されている必要があります。
5. 拡大縮小、ドラッグ、選択、ポート接続を行った後でも、正確さを維持する必要があります。
6. 接続ルール、元に戻す/やり直し、コピー&ペースト、インポート/エクスポートに関するテストを作成する。
7. 大容量データに対するパフォーマンス テストを追加する。
8. 型チェック、テスト、および本番ビルドを実行します。
9. アプリケーションを起動して動作を確認し、問題を修正します。
プロジェクト全体を提出し、設計仕様書、運用方法、および実際の試験結果を明記してください。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proの強みは、そのアーキテクチャとページ補完機能にあります。暗いキャンバス、ポート、接続、ミニマップなど、あらゆる箇所で視覚的な一貫性が保たれています。
GLM-5.3の利点は、要件への対応がより充実している点です。開始ノード、ステップノード、終了ノードには、明確に定義された色とポートのルールがあります。繰り返し貼り付けを行うと、オフセットが連続的に増加します。キーボードの矢印キーを使用して、空間的な位置に基づいてノードを選択できます。また、キャンバス外のノードを選択した場合、さらに多くのオプションが利用可能です。自動ビューポートを調整してください。
GLM-5.3はより多くの機能を備え、より強力なテスト結果を示しています。一方、DeepSeek-V4-Proはドラッグ&ドロップ操作がより使いやすい設計になっています。
ケース8 3D製品コンフィギュレーター
プロンプトワード:
Three.js、TypeScript、およびViteを使用して、テーブルランプ用のモジュール式3Dコンフィギュレーターを作成します。
モデリング要件:
手続き型ジオメトリを使用して、ランプホルダー、2本のランプアーム、ピボット、ランプシェード、および電球を作成します。
各構成要素は独立したオブジェクトです。
・部品は適切な方法で接続されており、ランプアームを回転させても外れることはありません。
外部のモデルやテクスチャのダウンロードは禁止されています。
相互作用の要件:
コンポーネントをクリックすると、そのアウトラインと名前が表示されます。
– 3種類の素材、4色、3段階の明るさに対応しています。
– 2本のランプアームとランプシェードの角度調整に対応しています。
各関節は、適切な回転範囲を備えている。
– 分解図のアニメーションと寸法注釈をサポートします。
設定概要、価格変更、およびリセットボタンを提供します。
マウス、タッチ操作、キーボードに対応しています。
レンダリング要件:
– PBRマテリアルを使用する。
― 環境光、キーライト、そして柔らかな影があります。
電球は、照明に目に見える変化をもたらす。
– OrbitControlsは、目標位置、距離、極角に関して妥当な制限値を設定しています。
– 最大DPRは2です。
ウィンドウが変更された後は、キャンバスとカメラを正しく調整してください。
– ページが表示されていないときは、不要なレンダリングを一時停止します。
– WebGLが利用できない場合は、ダウングレードを促すメッセージを表示する。
ジオメトリ、マテリアル、およびイベントリスナーを適切に解放します。
完了後:
1. 型チェック、テスト、および本番ビルドを実行します。
2. ページを起動し、コンソールを確認します。
3. 関節の脱臼、クリッピング、影、Zファイティング、レンズの切り抜きがないか確認します。
4. モバイルデバイスの動作を確認する。
5. デフォルト表示、展開表示、点灯表示、モバイル表示のスクリーンショットを生成します。
6.実際の映像に基づいて修正を続ける。
7. プロジェクト全体、その動作方法、および既知の制限事項を提出してください。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proは3Dモデリングにおいて優れた性能を発揮します。ランプベース、2本のランプアーム、ジョイント、ランプシェードの比率が適切に調整されているため、調整可能なデスクランプであることが一目でわかります。また、入れ子構造のジョイントも正しく実装されているため、親となるランプアームを調整すると、後続のパーツもそれに合わせて動きます。
GLM-5.3は、製品コンフィギュレーターのような機能を備え、直接的なデモンストレーションを可能にします。素材、色、照明、角度、リアルタイム価格、価格差など、あらゆる要素が1枚のカードにまとめられているため、DeepSeek-V4-Proよりも情報を見つけやすくなっています。モデルは8つのオプションパーツに分割されており、電球型の点光源には影も表示されます。
GLM-5.3の主な問題点は、見た目にある。ランプシェードが大きすぎる上に、デフォルトのレンズがランプシェードの内側を向いており、2本のランプアームを覆うとリングライトのように見えてしまう。
DeepSeek-V4-Proは、3Dモデリング、選択効果、モバイルでの読みやすさにおいて優れています。GLM-5.3は設定パネルの点で優れていますが、明らかな視覚的な問題が3Dケーススタディに大きな影響を与えます。
ケース9:手続き型モデリング
プロンプトワード:
Blender 4.x 用の Python スクリプトを作成して、コーヒーキオスクを生成してください。
デフォルトサイズ:
幅4メートル。
水深3メートル。
高さ2.8メートル。
カウンターの高さは1.05メートルです。
モデルの内容:
プラットフォーム、壁、天井、およびサービス窓。
カウンター、ロッカー、棚。
コーヒーマシン、グラインダー、カップ、メニューボード。
-外部看板。
電源コンセントとケーブルトレイ。
カメラ、日光、および2つのエリアライト。
構造上の要件:
建築、家具、小道具、照明はそれぞれ独立したコレクションに分類されています。
主要な対象物には、安定していて分かりやすい英語名を使用してください。
キオスクの幅、奥行き、カウンターの高さ、棚の数は、パラメータによって変更できます。
パラメータが変更されると、各コンポーネントの位置と比率が同期して調整されます。
適切な面取りと法線を追加します。
手順書に基づいた資料を使用する。
―主要な寸法は、オブジェクトのカスタムプロパティに書き込まれます。
スクリプトによって管理されるコレクションを繰り返し実行中に更新する場合、重複するオブジェクトが生成されてはならない。
他のコレクションからユーザーオブジェクトを削除しないでください。
届ける:
1. 完全なPythonスクリプト。
2. `.blend` ファイルを生成して保存します。
3. 正面図、45度角度からの図、内部作業エリアの3つの視点からレンダリングします。
4. 隙間、重なり、法線、材料の比率、露出を確認します。
5. 寸法と棚の数を変更した後、プログラムを再実行します。
6. オブジェクト名とカスタムプロパティの一貫性を確保する。
7. 実行方法、パラメータの説明、およびオブジェクト構造の説明を提供してください。
スクリプトは実際に実行され、エラーはBlender 4.xで処理されます。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proプロジェクトには、建築、家具、小道具、照明、カメラに分類された59個のオブジェクトと14セットのマテリアルが含まれています。また、パラメトリックスクリプト、3台のカメラ、そして...自動品質検査。
DeepSeek-V4-Proの出力には明らかな欠陥がある。正面の看板とメニューのテキストが上下逆さまになっていて、左右反転しているだけでなく、看板の一部が切り取られている。
GLM-5.3は、空間的な完成度が格段に高い。正面図には、サービスウィンドウ、棚、カップ、コーヒー器具、カウンター、キャビネットなどが配置されており、緑と木の色調の組み合わせは、より完成度の高い商業空間プランに近い。
GLM-5.3には目に見える問題もあります。メニューのテキストが黒いメニューパネル内に収まらないのです。
三面図、空間的な整合性、パラメータ検証、最終出力などを考慮すると、GLM-5.3の方がわずかに優れています。DeepSeek-V4-Proはスクリプト構造に優位性がありますが、テキストの方向が間違っていると配信品質が直接低下します。
事例10 文書レビュー
プロンプトワード:
会社はプロジェクトの最終承認と最終支払いの準備を進めている。しかし、プロジェクト文書において、要件のバージョン、金額、日付、担当者、および承認基準に関して矛盾点が発見された。
今回のラウンドで提供されるすべての契約書、補足契約書、要件文書、議事録、電子メール、見積書、および受諾資料をよく読み、プロジェクトで遵守すべき最新の要件を確認してください。
配達をお願いします:
1. 要件と約束事項のリスト。各項目には以下が含まれる。
- シリアルナンバー
– ニーズ、約束、または決定
– 現在の状況
– 出典文書
– ページ番号、章、または段落の位置
– オリジナルの証拠
- 発効日
– 関係する金額
担当者
– 受入条件
-後続の文書によって修正または廃止されましたか?
-改正または廃止の根拠
– 確認が必要な事項
2. ファイルの競合リスト。以下の項目を重点的に確認してください。
– 契約および補足協定
– 要件定義書の異なるバージョン
会議議事録と確認メール
– テキストと表
見積もり、予算、支払い金額
計画日と実際の日付
責任者および検査官
3. 変更または廃止された古い要件が、後続の資料で依然として引用されている場合。
4. 契約上の義務、現在の実施結果、および受入資料との間の不一致。
5. それを裏付ける正式な証拠を欠く主張。
6. 受諾、支払い、または責任の決定に影響を与える可能性のある高リスク事項。
7. 読み取れない、ページが欠落している、文字化けしている、またはファイルの内容が不完全である。
8. プロジェクトマネージャー、法務部、財務部、またはサプライヤーからの確認が必要な問題。
処理要件:
– すべての結論には、具体的なファイル場所を明記する必要があります。
証拠が見つからない場合は、常識に基づいて空欄を埋めるのではなく、「見つかりませんでした」と記入してください。
同一商品に複数のバージョンが存在する場合、それらは別々に表示されます。お客様ご自身で選択することはできません。
―後続の文書が旧要件を明示的に修正した場合にのみ、旧要件が無効になったと判断できる。
正式な契約書、署名済みの文書、確認メール、会議での議論、個人的な意見を区別する。
同姓同名の人物については、所属部署、メールアドレス、または状況などを組み合わせて本人確認を行う必要があります。
-項目ごとに、日付、金額、担当者、および受領条件を確認してください。
テキストと表の間に矛盾が見つかった場合は、両方の証拠を保管してください。
最後に、経営陣が読むための受諾審査意見書が提供され、受諾が現在可能かどうか、最終支払いが実行可能かどうか、一時的に保留する必要がある事項、および各判断の根拠となる証拠が説明されます。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proは、承認および支払いの結論を変更するすべての事実を正確に特定し、42,000元の重複した研修費用と25,200元の無効な税金も特定し、バージョン競合を正しく処理しました。主な見落としは、ファイル保持要件にありました。
GLM-5.3は、受諾、支払い、金額に関しても正しい結論を導き出し、証拠台帳もより詳細なものとなった。
しかし、GLM-5.3は過剰分析によるデータエラーが発生する傾向がある一方、DeepSeek-V4-Proは高リスク審査に必要な事実の正確性という点でより信頼性が高い。
ケース11 顧客サービスチケット処理
プロンプトワード:
顧客サービスシステムは、新しい作業指示書を、下流の配車サービスが読み取れるJSON形式に変換する必要があります。
下流サービスが受け入れる固定構造は以下のとおりです。
{
"tickets": [
{
"id": "string",
"category": "billing|bug|account|feature",
"priority": "p0|p1|p2|p3",
"requires_human": true,
"reason": "string"
}
],
"summary": {
"total": 0,
"p0_count": 0
}
}
分類ルール:
– アカウントの盗難、不正請求、またはサブスクリプションのキャンセル後の継続的な請求は、p0 に分類されます。
再現性の高いソフトウェアクラッシュはp1に分類されます。
ログインできず、自動復旧方法が失敗しました。p1に分類されます。
– 一般的な機能異常であり、p2に分類される。
– 機能提案、p3に分類。
資金、口座のセキュリティ、または本人確認に関する問題は、手動での処理が必要です。
下流サービスで定義されていないフィールドはJSONに追加できません。
保留中の作業指示書:
T01:昨夜携帯電話を紛失し、今朝早くに身に覚えのない請求が3件ありました。
T02: PDFをエクスポートしようとするたびにアプリケーションがクラッシュし、再インストールしても問題は解決しません。
T03:ダークモードを追加したいと考えています。
T04: パスワードを忘れましたか?リセットメールが届いていません。迷惑メールフォルダも確認しました。
T05:2ヶ月前に定期購読を解約したのですが、過去2ヶ月分の料金が請求されています。
T06:注文をフィルタリングした後、まれに画面が空白になることがあります。ページを更新すると元に戻ります。
下流サービスが直接解析できる有効なJSONを返してください。Markdownのコードフェンスやその他のテキストは追加しないでください。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-ProのJSON構造は完全に準拠しています。6件の作業指示すべてについて、分類、優先度、手動介入フラグが正しく、合計件数:6件、p0_count:2件も正しいことが確認されています。資金セキュリティ問題T01とT05はP0と判定され、口座復旧問題T04は手動介入が必要と判断されたことから、リスク境界評価が正確であったことが分かります。
GLM-5.3の主要項目はDeepSeek-V4-Proと完全に同一で、書式エラーや不要な説明はありません。GLM-5.3は理由欄にT05の2か月分の料金を記載し、返金は手動で処理される旨を追加しています。T04にも手動による本人確認が必要であることが明記されているため、カスタマーサービス担当者に引き渡した後も処理がスムーズに行えます。
このタスクにおいては、2つのモデルに大きな違いはない。
事例12:プロジェクトのスケジュール策定とコスト最適化
プロンプトワード:
以下のソフトウェアリリースプロジェクトのスケジュールを立て、期限を守るための最も費用対効果の高い加速オプションを特定してください。
本プロジェクトは2026年9月7日(月)に開始します。対象となるのは月曜日から金曜日までで、祝日は考慮されません。
スケジュールに関するルール:
– 各業務は勤務開始時に開始されます。
工事期間は営業日単位で計算されます。
依存関係のあるタスクは、すべての前提条件となるタスクが完了した翌営業日に開始されます。
同一人物が同時に2つの業務に参加することはできません。
-担当者が2名指定されている業務は、両者が同時に対応できる体制を整えておく必要があります。
依存関係がなく、担当者が異なるタスクは並行して実行できる。
各加速オプションは最大1回まで使用できます。
– すべてのタスクは2026年10月13日までに完了する必要があります。
タスク:
A. 要件分析
担当者:林周
工期:3営業日
依存関係:なし
加速することはできません
B. インタラクティブプロトタイプ
担当者:林周
工期:4営業日
依存関係: A
納期を3営業日に短縮することも可能だが、その場合は費用が12,000元増加する。
C. API開発
担当者:周哲
工期:6営業日
依存関係: A
最短4営業日に短縮することも可能だが、その場合は費用が2万8000元増加する。
D. データ移行
担当者:張敏
工期:5営業日
依存関係: A
納期を3営業日に短縮することも可能だが、その場合は費用が2万元増加する。
E. フロントエンド開発
担当者:陳森
工期:6営業日
依存関係: B
最短4営業日に短縮することも可能だが、その場合は費用が2万4000元増加する。
F. セキュリティ計画
担当者:張敏
工期:3営業日
依存関係: B
加速することはできません
G. システム統合とテスト
担当者:周哲、陳森
工期:3営業日
依存関係: C、D、E
これを2営業日に短縮することも可能だが、その場合、費用は90万元増加する。
H. セキュリティテスト
担当者:張敏
工期:4営業日
依存関係: F、G
最短2営業日に短縮することも可能だが、その場合は費用が1万6000元増加する。
I. ユーザーによる承認
担当者:林周
工期:3営業日
依存関係: H
加速することはできません
J. App Store レビュー
担当者:外部チーム
工期:7営業日
依存関係: I
納期を5営業日に短縮することも可能だが、その場合は費用が2万5000元増加する。
配達をお願いします:
1. 加速コースではない場合の完全なスケジュール。
2. 加速化されていない計画の完了日。
3. 10月13日の期限を満たす、すべての妥当な加速の組み合わせ。
4. 最も費用対効果の高い選択肢。
5. 最低コストソリューションの品目ごとのスケジューリング。
6. 最低コストを証明し、より安価な組み合わせが時間内に完了できなかった理由を説明する。
7. 張敏が9月17日に休暇を取った場合、最も費用のかからないプランを再計算してください。
8.ガントチャート形式でスケジュールを作成する。
DeepSeek-V4-Pro
GLM-5.3
DeepSeek-V4-Proの中核となる計算は正しく、最低コストの解が見つかり、完了予定日である10月13日も正しく算出されました。張敏氏が9月17日に休暇を取ることで、Fの完了が延期されるだけで、最終日と最適解は変更されません。
DeepSeek-V4-Proには組み合わせ列挙に関する欠陥があります。付属のコンテンツは終端表とASCII形式のガントチャートのみで、表示や再利用が不便です。
GLM-5.3はより完全なバージョンです。GLM-5.3は、冗長性のない9つの加速組み合わせすべてを正しくリストアップしており、最低コスト、下限証明、および再計算結果は、独立した計算結果と一致しています。
生成されたrelease-schedule.htmlファイルには、概要カード、3つのスケジュール、および3つのガントチャートが含まれています。非加速計画、最適計画、および休暇申請計画を直接比較できるため、プロジェクトスケジューリング資料として使いやすくなっています。
DeepSeek-V4-Proは単純に解を正しく計算したが、GLM-5.3は構成の完全性と配信形式の両面で優れている。
12件のケースを実行した結果、GLM-5.3が7件で優位に立ち、DeepSeek-V4-Proが3件で優位に立ち、残りの2件ではその差はわずかだった。
GLM-5.3の利点は、その完成度の高さにあります。オフィス文書の書式設定はより洗練され、プログラミングタスクはより多くの例外に対応し、フロントエンドとノードエディタはすぐに使える完成品に近いものとなっています。Blenderのモデリングとプロジェクトスケジューリングに関しては、GLM-5.3はより完成度の高いシーンとビジュアライゼーション素材を提供できます。
DeepSeek-V4-Proの強みは、そのコア実装と事実の正確性にあります。大容量ファイルのソートが高速化され、不良データもより確実に処理できます。3Dデスクランプの構造、比率、およびモバイル効果も向上しています。また、高リスクの受入データを処理する際、DeepSeek-V4-Proは分析の深度を追求しながらも、重要な数値を誤って計算することはありませんでした。
日々の業務がオフィスでの成果物作成、プロジェクト全体、長期的業務などから成り立っている場合... Agent 実行重視のシステムであれば、GLM-5.3を優先すべきでしょう。しかし、アルゴリズムの実装、主要指標、および証拠に基づく推論がより重要であれば、DeepSeek-V4-Proも非常に有力な選択肢となります。
今回の中国製トップモデルはGLM-5.3である可能性があり、DeepSeek-V4-Proの方が中国製トップモデルに近いと言えるでしょう。
AI このモデルは、チャットウィンドウから実際の生産プロセスへと移行しつつあります。
今回の12の事例では、オフィス文書、コードリポジトリ、フロントエンドページ、3Dプロジェクト、長文ドキュメントレビューなどを取り上げています。モデルは、資料を読み込み、ツールを呼び出し、テストを実行し、検証・再利用可能な成果物を生成する必要があります。企業が本当に費用を惜しまないのは、プロジェクト期間を短縮し、手戻りを減らすことができるこうした機能です。
GLM-5.3は今回のラウンドでより多くの勝利を収め、その強みは完全配送能力にある。(必要条件…)速いソリューション、プロトタイプ、またはプロジェクト資料一式を完成させる作業においては、GLM-5.3は既存のワークフローに容易に統合できます。
DeepSeek-V4-Proは、重要な計算処理、アルゴリズムの実装、および事実確認において、優れた安定性を発揮します。その堅牢な基盤機能は、大容量ファイルのソート、受け入れテスト、および3Dモデル構造において顕著に表れています。データ処理、コアコード、および精度が最優先される高リスクレビューにおいて、DeepSeek-V4-Proは依然として最良の選択肢です。
より実用的なビジネスアプリケーションとしては、タスクベースの割り当てモデルが挙げられます。GLM-5.3は要件の網羅、プロジェクトの設定、および製品の納品を担当し、DeepSeek-V4-Proは重要な計算、コアの実装、および結果の検証を担当します。
国内生産モデルを対象とした次回のコンペティションも、これらの実地プロジェクトの中で開催される予定です。