project
InternSVG - 上海AIラボが発表した統合SVGモデリングスイート
InternSVGは、上海人工知能研究所などが開発した、統一SVGモデリングのための包括的な「データ評価モデル」スイートです。1600万以上のサンプルを含むSAGoggeデータセット、標準化されたSArenaベンチマーク、そして…という3つの主要コンポーネントで構成されています。
InternSVGとは何ですか?
InternSVGは、上海人工知能研究所などが開発した、統一SVGモデリングのための包括的な「データ評価モデル」スイートです。1600万以上のサンプルを含むSAgogeデータセット、標準化されたSArenaベンチマーク、そしてInternVL3-8Bに基づく統一マルチモーダル大規模モデルという3つの主要コンポーネントで構成されています。SVG固有のトークンと2段階のトレーニングにより、InternSVGはアイコン、イラスト、化学構造、アニメーションの理解、編集、生成のための統一モデリングを実現し、既存の手法を大幅に凌駕します。
InternSVGの主な機能
-
意味理解InternSVGは、SVGコードの意味と構造を解析し、詳細な説明や多肢選択式質問への回答の生成をサポートし、グラフィックコンテンツと属性を正確に識別することができます。
-
コマンド編集色の変更や幾何学的変換といった低レベルの編集から、意味的な色置換やスタイル転送といった高度な編集まで、10種類の編集操作をサポートしています。
-
クロスモーダル生成テキストや画像から静的なSVG(アイコン、イラスト、化学式など)を生成する機能、およびテキストや動画からベクターアニメーションを生成する機能をサポートしています。
InternSVGの技術的原則
-
建築基礎ViT-MLP-LLMパラダイムはInternVL3-8Bに基づいて構築されています。InternViT-300Mは入力画像や動画を処理するビジュアルエンコーダーとして使用され、Qwen2.5-7B言語モデルはMLP射影層を介して接続され、シーケンスモデリングが行われます。
-
SVG限定トークンSVG構文用に200以上の特殊トークンが設計され、55のコアタグ、42の属性、数値範囲を網羅し、シーケンス長を30~50%圧縮することで、長いシーケンスモデリングにおけるコンテキストの負担を効果的に軽減しています。
-
サブワード埋め込みの初期化新しいトークンは、事前に学習されたサブワードに分解され、それらの埋め込みが平均化されて初期値として使用されます。これにより、意味的な事前知識が保持され、トレーニング損失が約40%削減されるため、収束が大幅に加速されます。
-
2段階の漸進的トレーニング第1段階では、単純なアイコンと化学データを用いてモデルを訓練し、基本的な文法認識能力を確立します。第2段階では、長尺の連続イラストと複雑なアニメーションデータを導入し、段階的な学習戦略を通して、複雑な構造を処理するモデルの能力を徐々に向上させます。
-
統合タスクモデリング理解、編集、生成という3種類のタスクを同時に処理するために共有トランスフォーマーアーキテクチャを使用することで、タスク間での知識の積極的な転移が可能になり、各タスクごとにモデルを個別にトレーニングする必要がなくなり、パラメータ効率と汎化能力が大幅に向上します。
InternSVGの使い方
- 環境準備リポジトリをクローンした後、Python 3.9の仮想環境を作成し、依存関係をインストールしてください。評価が必要な場合は、ViCLIPのチェックポイントをダウンロードしてください。
- モデル展開HuggingFaceからInternSVG-8Bモデルの重みをダウンロードし、LMDeployを使用してAPIサービスを起動することで、マルチGPU並列推論をサポートできます。
- 推論を呼び出す: 標準のOpenAI APIフォーマットを介してリクエストを送信します。テキストや画像を入力としてSVGを生成したり、SVGコードを入力として理解および編集したりできます。
- カスタムトレーニングデータセットを準備し、特別なトークンを追加するスクリプトを実行した後、第1段階(単純なデータ)と第2段階(完全なデータ)で順次ファインチューニングトレーニングを実行します。
- モデル評価SArenaベンチマークデータセットをダウンロードし、モデルの出力に対して推論を実行し、さまざまな評価指標を計算してパフォーマンスを検証します。
InternSVGプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/hmwang2002/InternSVG
- ハギングフェイスモデルライブラリ:https://huggingface.co/InternSVG/InternSVG-8B
- arXiv技術論文:https://arxiv.org/pdf/2510.11341
InternSVGの重要な情報と使用要件
- プロジェクトの位置付けInternSVGは、上海人工知能研究所が上海交通大学、南京大学、その他の機関と共同で開発した統合型SVGモデリングスイートです。ICLR 2026に採択されました。
- コアコンポーネントこれは、1600万を超えるサンプルを含むSAgogeマルチモーダルデータセット(アイコン、イラスト、化学構造、ベクターアニメーションの4つの主要分野を網羅)、標準化されたSArena総合評価ベンチマーク(統一されたタスク定義と評価指標を提供)、およびInternVL3-8Bに基づくInternSVG-8B統一マルチモーダル大規模モデルという3つの主要コンポーネントで構成されています。
- ハードウェア環境推論には少なくとも1つのGPUが必要であり(スループットを向上させるには複数のGPUを推奨)、トレーニングには96個のNVIDIA A800 GPUまたは同等の計算能力が必要です。
ソフトウェアの依存関係Python 3.9が必要であり、PyTorch、Transformers、LMDeploy(サービス展開用)、およびLLaMA-Factory(トレーニング用)をインストールする必要があります。
InternSVGの主な利点
- すべてのタスクにわたる統一モデリング従来のSVGの理解、編集、生成といったタスクが互いに分離されているという制約から脱却し、単一のモデルアーキテクチャを通じてタスク間の知識の正の転移を実現することで、異なるタスクに対するモデルの繰り返し学習を回避し、パラメータ効率と汎化能力を大幅に向上させています。
- 超大規模データ基盤SAgogeは、現在までに最大規模のSVGマルチモーダルデータセット(1600万以上のサンプルを含む)であり、アイコン、長尺のシーケンスイラスト、化学構造、ベクターアニメーションという4つの高価値分野を網羅しています。このデータセットは、単純な静的グラフィックスから複雑な動的シーケンスまで、幅広いモデルに対する包括的なトレーニングサポートを提供します。
- 専門的かつ技術的な最適化このシステムは、200種類以上のSVG固有の特殊トークンとサブワード埋め込み初期化戦略を革新的に導入し、2段階の段階的トレーニング(単純なアイコンから複雑なアニメーションまで)と組み合わせることで、シーケンス長を30~50%効果的に圧縮し、収束を加速させ、長いシーケンスのモデリングの難易度を大幅に軽減します。
- 総合的なパフォーマンスでトップSArenaの標準化ベンチマークテストにおいて、Claude-4-SonnetやGPT-4oといった最も強力な独自モデルと比較して、理解精度は約11%向上し、編集タスクのPSNRは約34%向上し、生成タスクのFIDは約56%削減され、すべてのタスクとドメインにおいて顕著な優位性を達成しました。
- 専門分野における精度化学有機構造式の生成など、トポロジーの正確性と記号の標準化が極めて重要な専門的な場面において、結合角、原子のラベル付け、および環状構造の簡略化の精度は既存の基準値を大幅に上回り、科学的可視化の高精度要件を満たしています。
InternSVGと類似競合他社との比較
| 比較対象寸法 | InternSVG | StarVector | OmniSVG |
|---|---|---|---|
| テクニカルルート | 統合型マルチモーダル大型モデル(InternVL3-8B) | LLMベース(CodeLlamaアーキテクチャ) | 統合型マルチモーダルフレームワーク(Qwen-VLの基本) |
| タスク範囲 | 理解+編集+生成+アニメーション(タスクの完全なクローズドループ) | 生成されるのは静的アイコンのみです(テキストベース/画像ベース)。 | データの理解と生成はできるが、体系的な編集機能は備えていない。 |
| データスケール | SAgoge 1600万サンプル(4つのドメイン) | 数百万個のアイコンデータ | 化学・アニメーション分野を除き、データの多様性は限られている。 |
| アニメーションのサポート | テキストからSANIへの変換とビデオからSANIへの変換をサポートします | サポートされていません | サポートされていません |
| 編集能力 | 10種類の編集操作(色/形状/スタイル) | サポートされていません | 基本的な生成のみで、命令の編集はできません。 |
| 専門分野 | 化学構造式と長い配列図を網羅 | 一般的なアイコンのみ | アイコンと基本的なイラスト |
| シーケンス処理 | 8000個以上のトークンからなる長いシーケンスをサポートします。 | 短いシーケンスのアイコン最適化 | 中程度の長さの配列 |
| コードのコンパクト性 | 1.3kトークン(非常に効率化されています) | コードはかなり冗長だ。 | ミディアム丈 |
InternSVGの応用事例
- デジタルデザイン制作デザイナーは、テキストによる説明や参照画像を用いて、高品質なベクターアイコンやイラストを素早く生成できます。自然言語コマンドに基づいた色調整やスタイル変換などのきめ細かな編集にも対応しており、UI/UXデザインの効率を大幅に向上させます。
- 科学的可視化化学や生物学などの科学研究分野では、研究者は分子名や構造画像を自動的に正確なベクトル形式の化学構造式に変換することができ、論文の図解や教科書の出版におけるグラフィックの標準化と編集可能性に関する厳格な要件を満たすことができる。
- インテリジェントなコンテンツ理解SVGアイコンやイラストの意味内容と幾何学的構造を自動的に解析し、視覚障害者支援、画像検索、グラフィックコンテンツに基づくインテリジェントな質問応答および知識抽出をサポートします。
- ダイナミックメディアプロダクションテキストスクリプトや参照ビデオから、ベクターアニメーション(ローディングアニメーションやアイコン効果など)を生成し、軽量で無限に拡張可能なアニメーションリソースを出力することで、マルチ端末表示のニーズに対応します。
- 教育・技術関連文書InternSVGは、自然言語コマンドによるグラフィック要素のリアルタイム調整をサポートしており、デザインの専門家ではない人でも高品質なベクター形式の教育コンテンツを作成する際のハードルを下げます。