AB
AiBoss
project

検証者エンジニアリング - 中国科学院、アリババ、小紅書が共同で立ち上げた、新たな研修後パラダイム。

検証エンジニアリングは、中国科学院、アリババ、小紅書が共同で立ち上げた、新しいポストトレーニングパラダイムです。これは、基本モデル設計における効果的な監視信号の提供という課題に取り組んでいます。検証エンジニアリング…

検証エンジニアリングとは何ですか?

中国科学院、アリババ、小紅書が共同で立ち上げた、新しい学習後パラダイムである検証エンジニアリングは、基本モデル設計における効果的な監視信号の提供という課題に取り組んでいます。自動検証器に基づき、検証タスクを実行し、基本モデルにフィードバックを提供する検証エンジニアリングは、探索、検証、フィードバックの3つのフェーズで構成され、モデルのパフォーマンスを最適化します。閉ループフィードバック機構に基づき、モデルの汎化能力を向上させ、汎用人工知能の実現に向けた重要なステップとなります。

検証エンジニアリングの主な機能

  • 検索指示に基づき、モデルの出力分布から代表的なサンプルまたは潜在的な問題サンプルを抽出する。
  • 確認する生成された候補応答を評価するために、さまざまな検証ツール(ルール検出、評価指標、手動注釈など)を使用します。
  • フィードバック検証結果に基づく教師ありファインチューニングやコンテキスト学習などの手法を用いて、モデルのパフォーマンスを向上させる。
  • モデルのパフォーマンスを向上させる閉ループフィードバックに基づいて、モデルの精度と信頼性は継続的に向上する。

検証技術の技術的原則

  • 目的条件マルコフ決定過程(GC-MDP)バリデータープロジェクトは、状態空間、行動空間、遷移関数、目標空間、目標分布、および報酬関数を含むGC-MDPとして形式化されます。
  • 検索構造線形探索とツリー探索、状態行動空間におけるナビゲーション、探索と活用のバランス。
  • バリデータ分類検証の基準は、バイナリ、スコア、ランキング、テキストフィードバック、検証の粒度(ラベルレベル、思考レベル、軌跡レベル)、検証ツールのソース(プログラムベース、モデルベース)、および分類検証ツールの追加トレーニングが必要かどうかです。
  • フィードバック方法
    • トレーニングに基づくフィードバック:データに基づいてモデルパラメータを効率的に更新します。
    • 推論に基づくフィードバック:モデルパラメータを変更せずに、推論中に入力または戦略を修正する。

Verifier Engineeringのプロジェクト住所

検証エンジニアリングの応用シナリオ

  • 自然言語処理(NLP)機械翻訳、テキスト要約、感情分析、質問応答システム、対話システムなどは、バリデーターエンジニアリングに基づくモデルの言語理解および生成能力を向上させる。
  • コード生成とプログラミング支援開発者がコードを記述およびデバッグする際に役立ち、コードスニペットを自動的に生成し、コードの品質を最適化します。
  • 教育と学術研究個々の学習ニーズに合わせた学習提案を行い、学生の課題やレポートを自動的に評価する、インテリジェントな教育アシスタントを構築する。
  • コンテンツのモデレーションとセキュリティヘイトスピーチ、誤情報、ポリシー違反コンテンツなど、不適切なコンテンツを検知・フィルタリングすることで、プラットフォームコンテンツの安全性を確保します。
  • 質疑応答と検索エンジン検索エンジンの精度を向上させ、より関連性の高い正確な情報検索結果を提供するため。