project
Inkling - Thinking Machines Labによるマルチモーダルな基礎モデル
Inklingは、Thinking Machines Labが開発した、オープンウェイト方式のマルチモーダル基盤モデルです。このモデルは、テキスト、画像、音声入力をネイティブにサポートし、ハイブリッドエキスパートアーキテクチャを採用し、410億個のアクティベーションパラメータを用いてクロスモーダル推論を実現します。
インクリングとは何ですか?
Inklingは、Thinking Machines Labが開発した、オープンな重み付け機能を備えたマルチモーダル基盤モデルです。テキスト、画像、音声入力をネイティブにサポートし、ハイブリッドエキスパートアーキテクチャを採用、410億個のアクティベーションパラメータによるクロスモーダル推論を実現します。開発者は、Tinkerプラットフォームを通じて重みをダウンロードし、必要に応じて微調整できます。単一のベンチマークで最高スコアを目指すモデルとは異なり、Inklingはエージェントベース、プログラミング、ビジョン、音声処理など、幅広いタスクにおいてバランスの取れたパフォーマンスを目指しており、さまざまなワークフローに組み込むことができる汎用性の高いバックエンド推論エンジンとなっています。
インクリングの主な機能
-
マルチモーダルなネイティブ理解テキスト、画像、音声入力を同時に処理でき、音声認識、視覚的な質問応答、グラフ推論、長時間の音声分析をサポートしています。
-
インテリジェントエージェントとツール呼び出し複数のフレームワークに対応したツール機能が組み込まれており、ブラウザ操作、コード生成、ターミナルタスク、複数ラウンドにわたる共同開発などが可能です。
-
制御可能な推論力推論深度(エフォートパラメータ)の調整をサポートしており、トークンコストとパフォーマンスの柔軟なトレードオフを可能にしながら、低遅延シナリオでの高い効率性を維持します。
-
長時間のコンテキスト処理最大100万個のトークンコンテキストをサポートするため、長文ドキュメントの分析、複数ターンにわたる対話、複雑なワークフローに適しています。
-
オープンウェイトと微調整Hugging Faceを通じてすべてのウェイトデータが提供され、Tinkerプラットフォームと組み合わせることで、エンドツーエンドの微調整機能と自己学習機能が実現します。
インクリングの技術原則
-
MoEスパースアーキテクチャ: 66 層のデコーダ専用 Transformer、トークンごとに 256 個のエキスパート + 2 つの共有エキスパートのうち 6 個のエキスパートがアクティブ化され、総パラメータ数は 9750 億、アクティブ化パラメータ数は 410 億です。
-
エンコーダーレスマルチモーダル画像は40×40ピクセルのブロックで4層のhMLPを用いて符号化され、音声はdMelスペクトログラムの離散的なトークンとして入力されます。すべてのモダリティは、統一的なデコードのために共通の潜在空間に投影されます。
-
ハイブリッド注意機構局所的注意層と全体的注意層を交互に用いることで、長期的な文脈記憶と計算効率のバランスが取れる。
-
定量的展開BF16、MXFP8、NVFP4の精度に対応しています。NVFP4量子化後、動作に必要なビデオメモリはわずか600GBです。
-
トレーニングデータテキスト、画像、音声、動画データ(合計45兆トークン)で事前学習されたデータは、重複排除、フィルタリング、および合成処理を経て、性能向上を図った。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Inklingの使い方
-
オンライン体験Inkling Playground(Tinkerコンソール)https://tinker.thinkingmachines.ai/playground にアクセスして、モデルと直接対話し、そのスタイルと機能をテストしてください。
-
API呼び出しTinkerプラットフォームまたはサードパーティの推論サービスプロバイダーを介してAPIにアクセスし、それを利用してください。
tml-renderersパッケージの統合は迅速です。 -
ローカル展開Hugging Faceから重みをダウンロードし、SGLang、vLLM、TokenSpeed、Unsloth、またはHugging Faceフレームワークを使用してデプロイします。BF16には2TBのVRAMが必要で、NVFP4 Quantized Editionには600GBが必要です。
-
微調整カスタマイズTinkerプラットフォームにデータをアップロードし、微調整タスクを作成してトレーニングを実行することで、モデルが独自の反復最適化に参加できるようにします。
-
推論強度の調整努力パラメータは、コストとパフォーマンスの要件に合わせて生成されるトークンの数を制御します。
インクリングの主な利点
-
高効率推論曲線Terminal Benchなどのテストにおいて、Nemotron 3 Ultraはトークン数を3分の1に減らしながら同等のパフォーマンスを達成し、長時間の処理コストを大幅に削減しました。
-
バランスの取れた総合的な能力単一の領域に過度に適合することなく、インテリジェントエージェント、プログラミング、ビジョン、オーディオ、指示への準拠といった様々な側面において競争力を維持します。
-
ネイティブマルチモーダル音声および映像コンポーネントは、後処理なしでゼロから学習されます。音声および画像理解は、オープンウェイトモデルの中でもトップクラスです。
-
安全性と制御性誤拒否率の低いFORTRESSセキュリティ保護機能を内蔵。Llama Guardなどの下流レビューツールとのオーバーレイをサポートし、多層防御システムを構築できます。
インクリングのプロジェクトアドレス
- プロジェクト公式サイト:https://thinkingmachines.ai/news/introducing-inkling/
- ハギングフェイスモデルライブラリ:https://huggingface.co/thinkingmachines/Inkling
- 技術論文:https://thinkingmachines.ai/model-card/inkling/
Inklingの類似製品の比較
| 寸法 | Inkling | GLM 5.2 |
|---|---|---|
| 重み付けプロトコル | Apache 2.0 | オープンウェイト |
| マルチモーダルサポート | テキスト+画像+音声(ネイティブ) | テキスト+画像 |
| インテリジェントエージェントプログラミング | Terminal Bench 2.1: 63.8% | Terminal Bench 2.1: 82.7% |
| 視覚的推論 | MMMU Pro: 73.5% | MMMU Pro: 60.0% |
| 指示に従いました | IFBench: 79.8% | IFBench: 73.3% |
| セキュリティ上の対立 | FORTRESS: 78.0% | FORTRESS: 71.3% |
| 推論効率 | 調整可能な労力パラメータをサポートし、トークン使用量を抑えつつ高いコスト効率を実現します。 | 固定された推論パターン |
インクリングの応用例
-
エンタープライズインテリジェントエージェントセントラルバックエンド推論モデルとして、顧客サービス、データ分析、コード生成などの複数のツールを連携させ、企業の内部ワークフローに適応するように微調整されたインテリジェントエージェントシステムを構築します。
-
マルチモーダルなコンテンツモデレーションソーシャルメディアやライブストリーミングプラットフォーム上のテキスト、画像、音声コンテンツを同時に分析し、効率的なコンプライアンスレビューとリスク特定を実現します。
-
インタラクティブ教育アシスタント音声と視覚入力に基づいて、学生にリアルタイムの問題解決、図解による説明、プログラミング指導を提供し、数百万トークンからなる教材のコンテキストをサポートします。
-
低遅延プログラミングアシスタント低負荷パラメータモードでは、コード補完、ターミナルコマンド生成、軽量バグ修正が極めて低い遅延で完了し、IDEプラグインが組み込まれています。
-
長文の法律・財務分析100万個のトークンコンテキストを使用して、契約書、調査報告書、財務諸表に対してページ間の相関推論を実行し、重要な用語とリスクポイントを抽出します。