project
CAR - ByteDanceと復旦大学が共同で立ち上げた適応型推論フレームワーク
CAR(Certainty-based Adaptive Reasoning)は、ByteDanceと復旦大学が共同開発した適応型推論フレームワークです。大規模言語モデル(LLM)およびマルチモーダル大規模言語モデル(MLLM)の様々なタスクにおける性能を向上させます。
CARとは何ですか?
CAR(Certainty-based Adaptive Reasoning)は、ByteDanceが復旦大学と共同開発した適応型推論フレームワークです。大規模言語モデル(LLM)およびマルチモーダル大規模言語モデル(MLLM)の推論効率と精度を様々なタスクにおいて向上させます。このフレームワークは、モデルの回答に対する確信度(パープレキシティレベル(PPL)で測定)に基づいて詳細な推論が必要かどうかを判断し、短形式推論と長形式推論を動的に切り替えます。短形式回答に対するモデルの確信度が低い場合、CARは精度向上のために長形式推論をトリガーします。確信度が高い場合は、短形式回答を直接出力することで、計算リソースと時間を節約します。CARは、ビジュアル質問応答(VQA)や重要情報抽出(KIE)などのタスクで非常に優れた性能を発揮し、数学などの複雑な推論タスクでも良好なパフォーマンスを示します。
CARの主な機能
- 動的な推論切り替えCARは、短い回答と詳細な推論をインテリジェントに切り替えることができます。簡単な質問には、効率性を高めるために直接短い回答を出力し、複雑な質問には、正確性を確保するために詳細な推論を実行します。
- 推論効率を向上させるCARは、モデルによって生成されるトークンの数を大幅に削減し、計算コストと推論時間を短縮し、実用的なアプリケーションにおけるモデルの効率を向上させます。
- 推論の精度を向上させる詳細な推論が必要な場合は、長形式推論を有効にして、複雑なタスクにおけるモデルのパフォーマンスを向上させ、推論結果の正確性を確保してください。
- 複数のタスクに適応可能CARは、視覚的質問応答(VQA)や重要情報抽出(KIE)などのタスクに適用可能であり、数学的推論や常識的推論などの複雑なタスクにおいて役割を果たし、幅広い適用範囲を持つ。
自動車技術の原理
- モデルトレーニングLLMまたはMLLMは、短形式と長形式の両方の推論回答を含む訓練データを使用して学習されます。訓練中、モデルはさまざまなプロンプトに基づいて適切な短形式または長形式の推論回答を生成する方法を学習します。最適化の目的は交差エントロピー損失であり、予測されたトークンの確率分布と真のトークンの分布の差を最小化することによってモデルを訓練します。
- 短い回答を得るためのPPLトレーニングデータに対して短答式推論を実行し、各短答式に対するパープレキシティレベル(PPL)を計算します。PPLは、モデルが回答にどれだけ確信を持っているかを示す指標です。PPLが低いほど、モデルの回答に対する確信度が高くなります。
- ガウス分布モデリング正解および不正解の短答式問題に対するPPLスコアはガウス分布に従うと仮定します。訓練データに基づいて分布のパラメータを推定し、正解および不正解のPPLの平均と分散をそれぞれ計算して、2つのガウス分布モデルを取得します。
- 推論プロセス新しい入力に対しては、まず短い回答を生成し、正解確率(PPL)を計算します。次に、そのPPL値における正解確率をガウス分布モデルに基づいて計算します。
CARプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2505.15154
CARアプリケーションシナリオ
- 視覚的質問応答(VQA)CARは、簡単な質問に対しては直接短い回答を出力することで効率性を向上させ、複雑な質問に対しては詳細な推論を実行することで正確性を確保します。
- 重要情報抽出(KIE)推論方法は信頼度に基づいて動的に選択されるため、使用するトークンの量を削減しつつ、高い精度を維持できる。
- 数学的推論簡単な数学の問題には直接解答を出力し、複雑な問題には詳細な推論を実行することで、精度と効率を向上させる。
- 常識的な推論単純な常識的な質問には直接答えが示されますが、複雑な質問にはトークン消費量を削減するために詳細な推論が用いられます。
- マルチモーダルタスクテキスト情報と画像情報を組み合わせ、推論方法を動的に選択することで、マルチモーダルタスクの精度と効率を向上させることができる。