project
アライナー - 北京大学が開発した残差補正モデルアライメント技術
Alignerは、北京大学の研究チームが提案した大規模言語モデルのアライメント手法です。アライメントされた回答とアライメントされていない回答間の修正残差を学習することで、モデルのパフォーマンスを向上させます。自己回帰型のseq2seqモデルを採用し、質問と回答の修正残差の関係に基づいて動作します。
アライナーとは何ですか?
北京大学の研究チームが提案した言語モデルアライメント技術であるAlignerは、アライメントされた回答とアライメントされていない回答間の修正残差を学習することで、モデルのパフォーマンスを向上させます。自己回帰型のseq2seqモデルを採用し、クエリ・回答・修正(Q-A-C)データセットで学習させることで、複雑な人間からのフィードバックに基づく強化学習(RLHF)プロセスを不要にしています。Alignerの最大の特長は、その効率性と柔軟性にあります。プラグアンドプレイモジュールとして、モデルパラメータへのアクセスを必要とせずに、さまざまなオープンソースモデルやAPIベースのモデルに直接適用できます。
アライナーの主な機能
- 修正された残差学習自己回帰型のseq2seqモデルであるAlignerは、Query-Answer-Correction(Q-A-C)データセットでトレーニングされ、アラインメントされた回答とアラインメントされていない回答の違いを学習することで、より正確なモデルアラインメントを実現します。
- 弱い一般化から強い一般化へパラメータの小さいアライナーモデルを用いてパラメータの大きいLLMを微調整することで、強力なモデルの性能を大幅に向上させることができる。
- プラグアンドプレイAlignerは、GPT3.5、GPT4、Claude2など、パラメータが利用できないモデルもアライメントできます。
- トレーニングプロセス:
- データ収集様々なオープンソースデータセットからクエリを取得し、独自の回答を生成します。
- 解答訂正元の回答は、GPT-4、Llama2-70B-Chat、および人間の注釈を用いて修正され、人間の価値観に合致するように調整されました。
- モデルトレーニング修正されたデータセットに基づいて、Alignerモデルは元の回答を整列された回答に修正するように訓練されます。
アライナーのパフォーマンス
- 利便性と安全性を向上させる実験によると、Aligner-7Bを使用することで、GPT-4の有用性と安全性をそれぞれ17.5%と26.9%向上させることができる。
- 弱い一般化から強い一般化へAligner-13Bの監視下でLlama2-70Bを微調整した結果、補助性と安全性がそれぞれ8.2%と61.6%向上した。
- 複数機種対応Aligner-7Bのアライメント機能は、クローズドソース、オープンソース、セキュア/アンセキュアのアライメント済みモデルを含む11種類のモデルのヘルプ機能とセキュリティを向上させます。
アライナーのプロジェクトアドレス
- プロジェクト公式サイト:https://pku-aligner.github.io/
- GitHubリポジトリ:https://github.com/PKU-Alignment/aligner
- ハギングフェイスモデルライブラリ:https://huggingface.co/aligner/aligner-7b-v1.0
- arXiv技術論文:https://arxiv.org/pdf/2402.02416
アライナーの応用シナリオ
- 複数ターンの対話シナリオ複数ターンにわたる対話において、Alignerは対話の整合性を向上させることができ、特に報酬が少ない状況下で効果を発揮します。
- 人間の価値観と報酬モデルの整合性アライナーは特定のコーパスで学習させることができ、先行モデルの出力を修正して特定の値を反映させることができます。
- MoE-Alignerのストリーミングと並列処理Alignerを専門化・統合することで、より強力で包括的なハイブリッドエキスパート(MoE)Alignerを作成することができる。