ニュース
Zhipu Tangjie: GLM-5.3を拡張し、同じベースでトレーニングしました。
Zhipu AIの唐傑氏によると、GLM-5.3とGLM-5.2は同じベース、アーキテクチャ、総パラメータ数、活性化パラメータを使用しており、主に1か月以上にわたる長期環境と強化学習の拡張を通じてトレーニングされているとのことです。
Zhipu AIの唐傑氏は、GLM-5.3とGLM-5.2は同じベース、アーキテクチャ、パラメータの総数、活性化パラメータの数を使用しており、主な変更点は拡張されたトレーニングによるものだと述べた。
彼らの説明によると、チームは1か月かけて長距離環境と強化学習を拡張し、スケーリング法則の事後学習のための制御実験としてGLM-5.3を使用したとのことです。この記述は、能力向上はパラメータの増加のみに依存するものではないことを示していますが、これは研究開発チームによる直接的な実験解釈であり、独立したベンチマークの再現に取って代わるものではありません。
ソース:唐傑の公式声明。