project
Kiln AI - カスタムモデルの微調整のための、オープンソースのAIプロトタイピングおよびデータセットコラボレーションツール。
Kiln AIは、大規模言語モデル(LLM)の微調整、合成データの生成、データセットの共同作業を簡素化するオープンソースのAI開発ツールです。Kiln AIは、Windows、macOS、Linuxに対応した直感的なデスクトップアプリケーションを提供しています。
Kiln AIとは何ですか?
Kiln AIは、大規模言語モデル(LLM)の微調整、合成データの生成、データセットの共同作業を簡素化するオープンソースのAI開発ツールです。Kiln AIは、Windows、macOS、Linuxに対応した直感的なデスクトップアプリケーションを提供し、ユーザーはコード不要で自動デプロイにより、Llama、GPT4o、Mixtralなどの様々なモデルを微調整できます。Kiln AIは、トレーニングデータ生成のためのインタラクティブなツールを提供し、Gitベースのバージョン管理をサポートし、チームコラボレーションを促進します。Kiln AIは、自動データ生成、マルチモデル統合をサポートし、ユーザーデータのセキュリティを確保するためにプライバシーを最優先します。Kiln AIのPythonライブラリはオープンソースであるため、開発者は既存のワークフローに簡単に統合できます。
Kiln AIの主な機能
- 直感的なデスクトップアプリケーションWindows、macOS、Linuxシステムに対応し、ワンクリックでインストールと使用が可能で、シンプルで直感的なデザインを採用しています。
- ゼロコードによる微調整Llama、GPT4o、Mixtralなどの複数の言語モデルをサポートし、サーバーレスによる自動デプロイに対応しています。
- 合成データ生成トレーニングデータを生成するためのインタラクティブな視覚化ツールを提供します。
- チームワークGitベースのバージョン管理を採用し、複数ユーザーによる共同作業をサポートしており、QA担当者、プロジェクトマネージャー、ドメインエキスパートが共同でデータセットの構築に参加するのに適しています。
- 自動プロンプト生成連鎖思考、少数のサンプルに基づくプロンプト、多数のサンプルに基づくプロンプトなど、データからプロンプトを自動生成する機能をサポートしています。
- 幅広い対応機種とプロバイダー:Ollama、OpenAI、OpenRouter、Fireworks、Groq、AWS、またはOpenAI APIと互換性のあるあらゆるプラットフォームに基づくモデルをサポートします。
Kiln AIの技術原則
- Gitベースのバージョン管理基盤となるバージョン管理システムとしてGitを使用し、複数ユーザーによる共同作業とデータセットのバージョン管理をサポートしています。データセットファイルはJSON形式で保存され、並行作業と競合解決に対応しています。
- サーバーレスデプロイメント精緻に調整されたこのモデルは、手動でのサーバー設定を必要とせず、クラウドまたはローカルストレージへの自動デプロイをサポートします。複数のクラウドプラットフォームとローカル環境に対応しています。
- 対話型データ生成ツール本システムは、ユーザーが視覚化ツールに基づいて高品質な合成データを生成できるよう、インタラクティブなインターフェースを提供します。また、少数ショット学習や多数ショット学習など、様々なデータ生成戦略をサポートしています。
- Pythonライブラリの統合開発者が既存のワークフローにデータセットを簡単に統合できるオープンソースのPythonライブラリを提供します。Jupyter Notebookでの使用をサポートし、データサイエンティストによる詳細な分析を容易にします。
- マルチモデル対応アダプターパターンに基づいており、複数の言語モデルとプラットフォームをサポートし、統一されたAPIインターフェースを提供することで、ユーザーが異なるモデルやプロバイダー間を容易に切り替えられるようにしています。
Kiln AIのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/Kiln-AI/Kiln
Kiln AI クイックスタート
- ダウンロードしてインストールする:
- デスクトップアプリケーション提供されているダウンロードリンクを使用して、macOS、Windows、Linux 用の無料デスクトップアプリケーションをダウンロードしてインストールしてください。
- Pythonライブラリ`pip install kiln-ai` コマンドを使用すると、Python ライブラリのインストール、データセットのワークフローへの統合、ファインチューニングされたモデルの構築、ノートブックでの Kiln AI の使用、カスタムツールの構築などを行うことができます。
- アプリケーションを起動する:
- Androidのインストールが完了したら、アプリケーションを起動し、指示に従ってプロジェクトやタスクを作成し、AIプロバイダー(Ollama、OpenAI、OpenRouterなど)に接続してください。
- サンプルタスクを使ってすぐに試してみるか、ニーズに合わせてカスタムタスクを定義してください。
Kiln AIのモデルとAIプロバイダー
- KilnがサポートするAIモデルとプロバイダー:
- サポート対象のプロバイダーKiln AIは、OpenAI、Groq、OpenRouter、AWS、Fireworksなど、さまざまなクラウドサービスプロバイダーやAIモデルと互換性があります。ユーザーは独自のAPIキーを提供する必要があります。システムはユーザーのデータセットにアクセスしません。
- 対応サーバーユーザーは、vLLMなどに使用するLiteLLMなど、OpenAI互換のサーバーに接続できます。
- AIプロバイダーを設定する:
- 初期設定Kilnを初めて起動すると、アプリケーションは1つ以上のAIプロバイダーを設定するように促します。Kiln AIのコア機能を使用するには、少なくとも1つのプロバイダーが必要です。
- プロバイダーの追加または削除ユーザーは、「設定 > AIプロバイダーとモデル」で新しいプロバイダーを追加したり、~/.kiln_ai/settings.yaml ファイルを編集して既存のプロバイダーを削除したりできます。
- モデルの使用と追加:
- 推奨ビルトインモデルこのモデルはテスト済みで、Kiln AIのすべての機能と互換性があります。非常に使いやすく、エラーもありません。ユーザーは設定ページで任意のAIプロバイダーに接続し、実行画面でモデルを選択するだけで済みます。
- カスタムモデルユーザーがリストにないモデルを使用したいが、そのモデルがKiln AIでサポートされているAIプロバイダーである場合は、「設定 > AIプロバイダーとモデル」の「モデルの追加」でそのモデルを選択する必要があります。すると、そのモデルはモデルドロップダウンメニューの「未テスト」セクションに表示されます。
- カスタムOpenAI互換サーバーユーザーがOpenAI互換サーバー(LiteLLM、vLLMなど)を所有している場合、Kiln AIで使用できます。ユーザーは「設定 > AIプロバイダーとモデル」で「カスタムAPI」を追加する必要があります。このAPIでサポートされているすべてのモデルは、モデルドロップダウンメニューの「未テスト」セクションに表示されます。
Kiln AIによる合成データ生成
- 動作原理:
- 合成データ手法
- ゼロサンプルデータ生成データは、追加の設定なしに、タスク定義に基づいて直接生成されます。
- トピックツリーデータ生成生成されたトピックツリー(ネストされたトピックを含む)に基づいて、膨大なデータを迅速に生成します。ユーザーは、トピックの自動生成を選択するか、手動でトピックを追加することができます。
- 構造化データ生成タスクで構造化された入力または出力が必要な場合、生成されるデータはユーザー定義のJSONスキーマに従います。生成された値はすべて検証され、スキーマに準拠しないデータは保存されません。
- オプションを生成する:
- モデル選択OpenAI、Anthropic、Llama、Google、Mistralなど、複数のモデルとOllamaなどの複数のホストをサポートしています。ユーザーはニーズに応じて適切なモデルを選択できます。
- プロンプトオプションいくつかの例題を採点した後、サンプル数を減らす、サンプル数を増やす、思考連鎖ヒントなど、より強力なヒントオプションをアンロックして、生成されるデータの質を向上させることができます。
- 人間による指導:
- 同社は、米国国内の話題だけでなく、世界的な話題を網羅したコンテンツを制作している。
- スペイン語で例文を作成してください。
- モデルによる分類が難しい問題(風刺情報など)に対して、特定のデータを生成する。
- 合成データ手法
- 反復:
- 「合成データセット」タブを開きます。
- 高品質なモデルを選びましょう(処理速度が十分でなくても、価格が高くても量産モデルも含めて)。
- 問題点を実証するためのデータ生成を開始する。その際、人間の指導とより優れたモデルを用いて、出力品質を確保する。
- スタイルが間違っている例を手動で削除してください。
- 合成データツールは、(モデルとガイダンスを組み合わせることで)正確なデータを生成でき、生成規模を数百サンプルにまで拡大できる。
- 新しい合成データセットを保存します。
Kiln AI チューニングガイド
- ステップ1:タスクと目標を定義する
- タスク定義Kiln UIで、初期プロンプト、要件、入出力モードなどを含む新しいタスクを作成します。
- 例題ニュースの見出しを生成する:ニュースのトピックの要約が与えられたら、さまざまなスタイルのニュースの見出しを生成します。
- ステップ2:合成データを使用してトレーニングデータを生成する
- 合成データ生成高品質な合成データセットを迅速に生成するための対話型インターフェースを提供します。
- 生成プロセス複数のモデルと複数のプロンプト戦略に対応し、9分で920個のトレーニングサンプルを生成します。
- ヒントとコツ高品質なモデルと詳細なヒント(複数サンプルに関するヒントや連鎖思考など)を活用することで、データ品質を向上させます。
- ステップ3:微調整するモデルを選択する
- 対応モデル:
- OpenAIGPT-4oと4o-Mini
- Mistral:Mixtral 8x7b MoE
- 他の: Llama 3.2 (1b/3b/11b)、Llama 3.1 (8b/70b) など。
- 対応モデル:
- ステップ4:微調整作業を開始する
- 微調整操作Kiln UIの「微調整」タブで、モデル、データセット、およびトレーニングパラメータを選択します。
- データセットの分割モデルの微調整後には、テストセットと検証セットを作成してモデルのパフォーマンスを評価することをお勧めします。
- ステップ5:モデルをデプロイして実行する
- 自動展開微調整後、システムは追加の設定を必要とせずにモデルを自動的に展開します。
- 使用方法Kilnのユーザーインターフェースに基づいて、「実行」タブを選択して使用してください。
- ステップ6(オプション):独自のインフラストラクチャでトレーニングを実施する
- エクスポートデータセットデータセットを一般的な形式にエクスポートして、独自のインフラストラクチャで微調整してください。
- 推薦プラットフォームUnslothとAxolotlは、複数のオープンソースモデルをサポートしています。
- 例Unslothノートブックを使用して、Kiln AIからエクスポートされたデータセットを読み込み、ローカル環境またはGoogle Colabで微調整します。
- 次のステップ
- 評価モデルテストセットと検証セットを使用して、微調整されたモデルの性能を評価します。
- 反復的な改善ハイパーパラメータを調整し、プロンプトを最適化し、エラーを修正し、評価結果に基づいて微調整を行います。
- データ戦略この手法は「段階的」なデータ戦略を採用しており、少数の高品質なサンプルから徐々に大量の合成データへと拡大していく。
- 料金FireworksとOpenAIのファインチューニングモデルは「サーバーレス」方式で展開され、料金は使用量に基づいて課金され、固定費は発生しません。
Kiln AIトレーニング推論モデルガイド
- 推論モデルのトレーニングにおける重要なステップ:
- トレーニングデータに「推論」が含まれていることを確認してください。推論モデルや連鎖的な思考を促すツールを用いて訓練データを生成し、データセットに推論内容が含まれるようにします。
- 推論を含むトレーニングデータセットを作成します。データセットを作成する際は、推論や思考を含むサンプルをフィルタリングしてください。
- 適切なトレーニング戦略を選択する推論データを含む「最終応答と中間推論」トレーニング戦略を選択してください。
- 微調整モデルを呼び出す際には、適切なヒントを使用してください。最良の結果を得るためには、トレーニング時と同じ指示を使用することをお勧めします。
- 論理的思考と連鎖的思考の選択:
- 推論モデルドメイン横断的な推論能力を必要とするシナリオに適しており、大規模な推論モデル(Deepseek R1など)を微調整することで、より小さく高速なモデルを作成します。
- 連鎖思考シンプルな「段階的な思考」を促すプロンプトに基づいて出力品質を向上させたり、思考プロンプトをカスタマイズして特定のタスク向けのトレーニングセットを生成したりできます。
Kiln AIの応用シナリオ
- インテリジェントな顧客サービスインテリジェントな顧客サービスシステムは、顧客サービス対話データセットを生成し、言語モデルを微調整することで、応答の精度と関連性を向上させます。
- 医療分野医療分野におけるAIプロジェクトでは、医師(ドメインエキスパート)が医療データセットを作成し、データサイエンティストがモデルを微調整し、QAチームがデータ品質の検証を担当します。
- 迅速なプロトタイピングと実験:テキスト生成ツールを開発する際は、少数のサンプルに基づくヒント機能とマルチモデルサポートを活用して、さまざまなモデルの生成効果を迅速に検証しましょう。
- 教育する:教育テクノロジー企業は、教育用AIモデルを微調整するために、生徒の質問と回答を含む教育データセットを構築している。
- 金融業界金融業界は、リスク評価モデルを微調整し、すべてのデータをローカルで処理し、顧客データが漏洩しないように徹底している。