AB
AiBoss
project

LongReward - 清華大学、中国科学院、およびZhipu AIは共同で、長文テキストにおける大規模言語モデルの性能を向上させる手法を発表しました。

LongRewardは、清華大学、中国科学院、Zhipu AIが共同開発した手法で、AIフィードバックに基づいて長文テキスト向けの大規模言語モデル(LLM)の性能を向上させることを目的としています。LongRewardは、有用性、論理性、忠実性、完全性などを評価します。

LongRewardとは何ですか?

清華大学、中国科学院、およびZhipu AIが共同開発したLongRewardは、AIフィードバックに基づいて長文テキスト向け大規模言語モデル(LLM)の性能を向上させる手法です。LongRewardは、有用性、論理性、忠実性、完全性の4つの側面からモデルの応答を評価し、報酬シグナルを提供するとともに、強化学習を用いてモデルを最適化します。これにより、モデルは長文テキストの処理においてより正確かつ一貫性のある結果を示し、指示にもより適切に対応できるようになります。最終的に、長文テキストの処理能力が向上し、短い指示への対応効率も改善されます。

LongRewardの主な機能

  • 多次元評価長文モデルの回答は、有用性、論理性、忠実性、完全性という4つの側面から評価されます。
  • 報酬信号が提供される容易に入手可能な大規模言語モデル(LLM)をスコアリングツールとして使用し、長文テキストモデルの応答に対して報酬信号を提供し、これらの信号は強化学習(RL)に使用されます。
  • 学習統合の強化オフライン強化学習アルゴリズムであるDPO(直接選好最適化)を組み合わせることで、モデルの出力を最適化して選好要件を満たすようにし、モデルのパフォーマンスを向上させる。
  • パフォーマンスの向上文脈情報の理解と活用の向上、誤認識の低減など、長文テキスト処理におけるモデルのパフォーマンスを大幅に向上させる。
  • 指示に従う能力の向上モデルが短い指示に従う能力を高めることで、モデルの使いやすさと柔軟性を向上させる。

LongRewardの技術的原則

  • 多次元評価
    • 親切心評価基準には、モデルの応答がユーザーのクエリに関連しているか、有用な情報を提供しているか、ユーザーのニーズを満たしているかなどが含まれる。
    • 論理性モデルの応答の論理的一貫性、すなわち視点の一貫性と推論の正しさを確認してください。
    • 忠実モデルの応答に含まれる事実情報が文脈と一致しているかどうかを測定し、情報の信憑性を確保する。
    • 完全評価課題は、モデルの回答が質問に関連する文脈におけるすべての重要な点を網羅し、十分な情報と詳細を提供しているかどうかを判断することです。
  • 既存の大規模言語モデル(LLM)を活用するモデルによって生成されたコンテンツを採点するためのスコアリングツールとして、入手しやすい高性能なLLM(論理言語モデル)を使用する。
  • 少数ショット学習と思考連鎖(CoT)有用性と論理性のスコアリングにおいて、LLMは少数ショット学習とCoTを用いて、クエリとレスポンスの内容に基づいて直接スコアリングを行います。
  • 事実記述の分解と検索忠実度評価においては、モデル応答は事実に基づいた記述に分解され、それぞれの記述が裏付けられているかどうかを判断するために、文脈の中で最も関連性の高い部分が抽出される。
  • 粗粒度コンテキスト分解完全性評価では、コンテキストを大まかなブロックに分割し、質問に関連する情報を抽出し、モデル回答が重要な情報をすべて含んでいるかどうかを評価します。

LongRewardのプロジェクトアドレス

LongRewardの応用シナリオ

  • 長文文書の理解と質疑応答(質問と回答)長文の文書、報告書、書籍などを処理する際の、モデルの質問応答性能を評価および改善するために使用されます。
  • テキスト要約モデルが長文記事や複数の文書の集合体の主要内容をよりよく理解し、要約できるようにするため。
  • 教育と学術研究学術研究において、LongRewardは、大量の文献やデータを処理するモデルの能力を評価・改善するために使用され、研究と学習を支援します。
  • 法的および財務的分析法律分野や金融分野では、LongRewardは大量の法律文書、契約書、財務報告書を分析・理解するために利用されています。
  • 医療記録分析医療分野において、LongRewardの補助モデルは、患者の詳細な医療記録を理解・分析し、診断や治療に関する意思決定を支援します。