Tinker API - Thinking Machines Labが提供するモデル微調整API
Thinking Machines Labが最初にリリースした製品であるTinker APIは、言語モデルの微調整に特化して設計されています。言語モデルの微調整プロセスを簡素化することで、研究者や開発者はアルゴリズムとデータに集中でき、微調整に関する心配をする必要がなくなります。
Tinker APIとは何ですか?
Thinking Machines Labが最初にリリースした製品であるTinker APIは、言語モデルの微調整に特化して設計されています。言語モデルの微調整プロセスを簡素化し、研究者や開発者が複雑な分散トレーニングインフラストラクチャを気にすることなく、アルゴリズムとデータに集中できるようにします。Tinker APIは、次のような低レベルの操作プリミティブを提供します。forward_backwardそしてsampleTinkerは、開発者が独自の微調整アルゴリズムや強化学習アルゴリズムを構築できるようにし、小規模から大規模まで様々なオープンウェイトモデルをサポートします。モデルの切り替えは、コード内の単一の文字列を変更するだけで済みます。TinkerはLoRAテクノロジーを統合しており、複数のトレーニングタスクがコンピューティングリソースプールを共有できるため、コスト効率が最適化されます。オープンソースライブラリであるTinker Cookbookがリリースされ、様々なトレーニング後処理手法の実装が含まれています。Thinking Machinesの社内クラスタ上で動作するマネージドサービスとして、Tinkerはタスクスケジューリング、リソース割り当て、障害回復といった面倒なタスクを処理するため、開発者はアルゴリズムとデータに集中できます。現在、無料のプライベートテストを実施中で、将来的には使用量ベースの料金モデルが導入される予定です。
Tinker APIの主な機能
-
低レベル操作プリミティブ:供給
forward_backwardそしてsampleこれには、カスタムの微調整アルゴリズムや強化学習アルゴリズムの構築をサポートする操作プリミティブが含まれています。 -
幅広いモデルサポートQwen-235B-A22Bなど、小型から大型までのオープンウェイトモデルに対応しています。モデルの切り替えは、コード内の文字列を1つ変更するだけで済みます。
-
LoRa技術の統合これにより、複数のトレーニングタスクがコンピューティングリソースプールを共有できるようになり、コスト削減につながります。
-
オープンソースのサポートライブラリ様々な学習後処理手法の実装例を収録した「Tinker Cookbook」をリリースしました。
-
マネージドサービスこれは、内部のThinking Machinesクラスター上で動作し、タスクスケジューリング、リソース割り当て、および障害復旧を自動的に処理します。
-
使いやすいネイティブなPythonインターフェースを提供するため、学習や使用が容易です。
Tinker APIプロジェクトのアドレス
- プロジェクト公式サイト:https://thinkingmachines.ai/blog/announcing-tinker/
Tinker API の使い方
-
アクセスを要求するユーザーホワイトリストへの追加を申請するには、公式のTinker申請ページ(https://form.typeform.com/to/jH2xNWIg)にアクセスしてください。
-
インストールと設定Tinker APIをインストールし、関連する環境を設定してください。
-
コードを書くTinkerが提供する低レベルの操作プリミティブを使用して、ファインチューニングアルゴリズムや強化学習アルゴリズムを作成します。
-
トレーニングを実施するトレーニング課題をThinking Machinesの管理インフラストラクチャに送信して実行を依頼してください。
Tinker APIのアプリケーションシナリオ
-
形式的な定理の証明プリンストン大学のゲーデル研究チームは、TinkerとLoRAを用いて、形式的な定理証明のための大規模な言語モデルを微調整し、わずか20%のデータで、完全にパラメータ監視型の微調整モデルに匹敵する性能を達成した。
-
化学推論モデルのトレーニングスタンフォード大学のロツコフ研究室は、Tinkerを用いて化学推論モデルを訓練した。LLaMA 70Bモデルをベースに強化学習を行った結果、IUPAC命名法を化学式に変換する精度が15%から50%に向上した。
-
マルチエージェント強化学習バークレーのSkyRLチームは、非同期のオフポリシー学習と複数ラウンドのツールを組み合わせた、独自のマルチエージェント強化学習ループを実行した。
-
長期コンテキストAI制御タスクRedwood Researchは、Tinkerを使用して、長コンテキストAI制御タスクにおける強化学習のためのQwen3-32Bモデルを訓練した。
-
古典的な監視微調整Tinkerは、古典的な教師ありファインチューニングから、高度に実験的な強化学習パイプラインまで、さまざまなアプリケーションをサポートしています。