AB
AiBoss
project

DianJin-R1 - アリババクラウド同義電津と蘇州大学が共同で開発した大規模金融推論モデル

DianJin-R1は、アリババクラウドの同義電金チームと蘇州大学が共同開発した、金融分野向けの大規模推論強化モデルです。金融業務に特化して設計されており、高度な技術と包括的なデータサポートを統合しています。このモデルは、教師あり推論を強化します...

DianJin-R1とは何ですか?

DianJin-R1は、Alibaba Cloudの同義電金チームと蘇州大学が共同開発した、金融分野向けの大規模な強化推論モデルです。金融タスクに特化して設計されており、高度な技術と包括的なデータサポートを統合しています。このモデルは、強化された監視と強化学習によって、金融推論タスクのパフォーマンスを向上させます。その中核となるのは、CFLUE、FinQA、および中国コンプライアンス検査(CCC)データセットを統合したDianJin-R1-Dataデータセットで、多様な金融推論シナリオを網羅しています。DianJin-R1には、DianJin-R1-7BとDianJin-R1-32Bの2つのバージョンがあり、どちらも監視付き微調整(SFT)と強化学習(RL)の2段階プロセスで最適化され、グループ相対ポリシー最適化(GRPO)手法を採用し、2つの報酬シグナルを組み合わせて推論品質を最適化しています。金融分野におけるCFLUE、FinQA、CCCなどのベンチマークテストにおいて、DianJin-R1は非推論モデルを大幅に上回る性能を発揮します。CCCデータセットでは、推論モデルの単一実行時の性能がマルチエージェントシステムの性能を凌駕します。

DianJin-R1の主な機能

  • 高度な財務推論このアプローチは、強化された監視学習と強化学習を組み込むことで、金融タスクにおける推論能力を向上させます。金融テストセットであるCFLUE、FinQA、およびCCCにおいて、DianJin-R1は基本モデルを上回る性能を発揮します。
  • 高品質データセットのサポートDianJin-R1-Dataデータセットを基盤として構築されており、CFLUE、FinQA、およびCCCデータセットを統合し、さまざまな金融推論シナリオを網羅しています。
  • 構造化推論の出力このモデルは、推論の手順と最終的な答えを構造化された形式で生成できるため、理解しやすく、応用しやすい。
  • 強化学習の最適化推論品質を最適化するために、フォーマット報酬と精度報酬を組み合わせたグループ相対ポリシー最適化(GRPO)アルゴリズムが使用されます。
  • 高効率な推論能力実際の応用において、DianJin-R1の単一呼び出し推論モデルは、マルチエージェントシステムと同等、あるいはそれ以上の性能を発揮し、計算コストも低く抑えられています。

電晋R1の技術原理

  • 高品質なデータセットの構築DianJin-R1の中核を成すのは、CFLUE、FinQA、および独自の中国コンプライアンス検査(CCC)データセットを統合したDianJin-R1-Dataデータセットです。このデータセットは、多様な金融推論シナリオを網羅しており、検証済みの注釈によって高いデータ品質とドメイン関連性が保証されています。
  • 構造化教師あり微調整(SFT)このモデルは、教師ありファインチューニング(SFT)フェーズを通じてトレーニングされ、構造化されたフォーマットを使用して推論ステップと最終的な回答を生成します。具体的には、各トレーニングインスタンスには、質問、推論パス(フォーマットは...)が含まれます。 <think>...</think>)と回答(フォーマットは <answer>...</answer>このモデルは、これらの構造化された入力と出力から学習し、一貫性のある推論手順と正しい回答を生成します。
  • 強化学習の最適化DianJin-R1は、教師ありファインチューニングを基盤として、強化学習のためのグループ相対ポリシー最適化(GRPO)アルゴリズムをさらに適用しています。このアルゴリズムは、フォーマット報酬(構造化された出力の生成を促す)と精度報酬(正解に対する報酬)という2つの報酬信号を導入することで、推論の質をさらに向上させています。

DianJin-R1のプロジェクトアドレス

DianJin-R1の応用事例

  • 財務リスク評価およびコンプライアンス検査DianJin-R1は、複雑な財務コンプライアンス業務を効率的に処理できます。例えば、CCC(中国コンプライアンス検査)データセットを用いたアプリケーションでは、単一の呼び出しでマルチエージェントシステムと同等、あるいはそれ以上のパフォーマンスを実現し、計算コストを大幅に削減できます。
  • 金融に関する質疑応答とカスタマーサービスFinQAデータセットを用いたテストにおいて、DianJin-R1は強力な金融質問応答能力を発揮し、顧客に正確な金融情報と解決策を提供しました。これは、金融機関の顧客サービスの質と効率の向上に貢献します。
  • 金融検査と教育DianJin-R1モデルはCFLUEデータセットにおいて特に優れた性能を発揮し、精度を77.95%から86.74%に向上させました。これは、このモデルが金融試験や教育シナリオにおける補助的なトレーニングに活用でき、受験者が金融知識をより深く理解し習得するのに役立つことを示しています。
  • 複雑な財務業務における推論と意思決定構造化推論と強化学習によって最適化されたDianJin-R1は、財務諸表分析や投資判断といった複雑な財務業務を処理することができる。