project
DataChef - 上海AIラボが復旦大学と共同でオープンソース化した、AIデータレシピ生成モデル。
DataChefは、上海人工知能研究所と復旦大学が共同開発したオープンソースのAIデータレシピ生成モデルです。このモデルは、強化学習を通じて、データ選択、クリーニングなどを含む、大規模なモデル適応タスクのための完全なデータ処理パイプラインを自動的に生成します。
DataChefとは何ですか?
DataChefは、上海人工知能研究所と復旦大学が共同開発したオープンソースのAIデータレシピ生成モデルです。このモデルは、強化学習を通じて、大規模なモデル適応型タスクのための完全なデータ処理パイプラインを自動的に生成します。これには、データ選択、クリーニング、合成、定式化などのステップの実行可能コードが含まれます。DataChefは、入力として対象タスクと利用可能なデータソースのみを必要とし、AIが自動的にデータを「精製」します。32ビット版は、数学、コーディング、金融など6つのドメインにわたるテストでGemini-3-Proに近いパフォーマンスを達成し、一部のタスクでは産業グレードの専門家レシピを凌駕しており、データエンジニアリングが手作業の経験から自動化という新しいパラダイムへと移行することを示しています。
DataChefの主な機能
-
レシピの自動生成DataChefは、対象となるタスクと利用可能なデータソースに基づいて、完全なデータレシピを自動的に生成できます。
-
コード出力このモデルは実行可能なPythonデータ処理コードを出力し、生データからトレーニングセットまでの自動化されたパイプラインを構築します。
-
多段階処理データ選択、クリーニング、拡張、混合、重複排除など、さまざまな処理操作をサポートします。
-
即時研修と応募生成されたデータ式は、大規模モデルを特定の領域に適合させるための微調整に直接使用できます。
-
品質検証DataChefには、データ品質を評価し、最適化プロセスをガイドできるデータ検証機能が組み込まれています。
DataChefの技術原則
-
タスクモデリングDataChefは、データレシピ生成をエンドツーエンドの強化学習タスクとしてモデル化します。ポリシーモデルはタスク指示を受け取り、自然言語による計画とPythonコードを含むデータレシピを生成します。
-
エージェント報酬メカニズムトレーニングフィードバックのコストが高いという問題に対処するため、研究チームは代理報酬メカニズムとしてデータ検証ツールを設計した。この検証ツールは、サンプルを5つの品質レベルに分類し、サンプルサブセットに基づいてスコアリングすることで、低コストかつリアルタイムでデータ品質を予測する。
-
トレーニングの最適化トレーニングプロセスでは、コールドスタート方式の教師ありファインチューニング初期化と、オンライン強化学習最適化のためのGRPOアルゴリズムを組み合わせ、推論とコード生成を分離することでポリシーの安定性を向上させ、モデルが広大なコード組み合わせ空間において最適なデータスキームを効率的に探索できるようにします。
DataChefの主要情報と使用要件
-
研究開発チーム上海人工知能研究所(舒生普宇チーム)と復旦大学の共同研究
-
モデルサイズ:オープンソースの32Bパラメータ版(DataChef-32B)
-
パフォーマンスレベル6つの限定テストタスクにおいて、トップレベルのクローズドソースモデルであるGemini-3-Proに匹敵する性能を発揮し、一部のタスクでは産業グレードの専門家による定式化を凌駕する。
-
コアイノベーションエンドツーエンドのデータレシピ生成をグローバルな意思決定問題としてモデル化し、オンライン強化学習によって自動的な最適化の完了を実現したのは今回が初めてである。
-
データ基盤19のドメイン、31の評価セット、257のソースデータセットを網羅しています。
- 環境設定Python 3.12でpipを使って依存関係をインストールする
-
ハードウェアリソース32Bモデルを実行するには、十分なビデオメモリまたはAPIアクセス機能が必要です。
-
モデルのエンドポイントプランナーおよびコーダーモデルのAPIエンドポイントを設定する必要があります(OpenAI互換インターフェースをサポート)。
DataChefの主な利点
-
エンドツーエンドの自動化従来の局所的なヒューリスティックルールから脱却し、データレシピの生成をエンドツーエンドのタスクへと昇華させ、AIが操作手順の手動による配置を必要とせずに、完全かつ実行可能なデータ処理パイプラインを直接出力します。
-
強化学習主導オンライン強化学習による自動最適化ループを形成することで、モデルは広大なコード組み合わせ空間内で自ら進化し、より良いデータソリューションを継続的に探索し、手動による試行錯誤を繰り返す必要性を排除することができる。
-
低コストの検証メカニズムこの革新的なモデルは、データ検証エージェント報酬信号を提案しており、完全なモデルトレーニングを必要とせずにリアルタイムでデータ品質を予測できるため、従来のデータエンジニアリングの効果を検証するコストを大幅に削減できます。
-
優れた性能32Bパラメータのオープンソースモデルは、複数のテストでGemini-3-Proに匹敵する性能を示し、一部の複雑なタスクでは産業グレードの専門家によるレシピを凌駕しており、AIが生成したソリューションが人間の経験に基づく設計よりも優れていることを証明している。
-
オープンインフラストラクチャこれは19分野を網羅する大規模なタスクプールを構築し、完全にオープンソースであり、自動データエンジニアリングや自己進化型AIといった最先端の研究を体系的に支援する。
DataChefの使い方
-
環境インスタレーションPython 3.12の仮想環境を作成するには...
pip install -e .このコマンドを実行すると、DataChefのインストールが完了します。 -
設定ファイルサンプル設定ファイルをコピーして、名前を付けてください...
datachef.config.jsonモデルのエンドポイントアドレス、APIキー、およびPlannerとCoderのモデル名を入力してください。 -
入力準備完了タスクファイルはJSONL形式で作成し、各行にはタスクID、タスクの説明と評価基準、および候補となるデータソースのリストを含めます。
-
実行して生成する:埋め込む
datachef-eval --config testこのコマンドを実行するとプロセスが開始され、システムは自動的にデータレシピプラン、Pythonコードを生成し、検証を実行します。 -
出力を取得する:存在する
data/code/そしてdata/data-verifier/生成されたデータ処理コード、実行レポート、およびデータ品質検証スコアは、該当ディレクトリから取得できます。 -
パラメータを調整する:合格
--timeoutコード実行のタイムアウトを設定します。--max_workers並列ワーカーの数を制御する。--parse_reasoningモデルの推論プロセスを出力します。
DataChefプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/yichengchen24/DataChe
- ハギングフェイスモデルライブラリ:https://huggingface.co/yichengchen24/DataChef-32B
- arXiv技術論文:https://arxiv.org/pdf/2602.11089
- オンラインでデモを体験してください:https://huggingface.co/spaces/yichengchen24/DataChef
DataChefの競合製品比較
| 寸法 | DataChef | Data-Juicer Sandbox | AIDE |
|---|---|---|---|
| 研究開発機関 | 上海人工知能研究所 + 復旦大学 | アリババDAMOアカデミー | マイクロソフトリサーチ |
| コアポジショニング | エンドツーエンドのデータレシピの自動生成 | データサンドボックスプローブ分析とオペレーター最適化 | 自動化されたデータサイエンスとモデル開発 |
| テクニカルルート | オンライン強化学習+データ検証エージェント報酬 | 調査・分析・改善のワークフローと、その後のトレーニングに関するフィードバック | 反復的な探索と試行錯誤の実行+外部知識の検索 |
| 自動化レベル | パイプラインコード全体を完全に自動生成 | 半自動化されており、オペレータープールの手動定義が必要です。 | 自動化だが、あらかじめ設定されたワークフローテンプレートに依存している |
| フィードバック機構 | 低コストでリアルタイムのデータ検証が可能、特別なトレーニングは不要 | 実際のモデルを用いたトレーニングと評価に頼るのはコストがかかる。 | 実行結果に基づく反復最適化 |
| 出力形式 | 実行可能なPythonコードとトレーニングデータセット | データ処理演算子の最適化された組み合わせ | 包括的なデータサイエンスソリューション |
DataChefの応用シナリオ
-
ドメイン全体にわたる大規模モデルのトレーニング数学、プログラミング、金融、医療、気象学といった分野別に適したデータレシピを自動的に生成し、分野固有のモデルを迅速に構築することを可能にする。
-
データエンジニアリングの自動化これは、専門家の経験に依存する従来の手動によるデータ選別およびマッチングプロセスに取って代わり、生データからトレーニングセットまでの完全自動化処理を実現します。
-
モデルのトレーニング後の最適化既存の基本モデル向けに高品質な微調整データを生成し、特定のタスクにおける性能を向上させる。
-
低資源環境におけるデータ拡張データが不足している分野において、訓練用サンプルを自動的に合成し、データ拡張技術を用いて有効な訓練データの規模を拡大する。
-
AI研究の自動化自動化されたAI研究のためのインフラストラクチャとして、自己進化するAIシステムのためのデータ自己改善のクローズドループをサポートする。