AB
AiBoss
project

RedOne - Xiaohongshuが立ち上げたソーシャルメディアプラットフォーム

RedOneは、Xiaohongshuがソーシャルネットワーキングサービス(SNS)分野向けに開発した初のカスタム大規模言語モデル(LLM)です。このモデルは3段階のトレーニング戦略を採用し、社会的・文化的知識を取り入れることでマルチタスク機能を強化し、プラットフォームの標準規格に準拠しています。

RedOneとは何ですか?

RedOneは、Xiaohongshuがソーシャルネットワーキングサービス(SNS)向けに開発した初のカスタム大規模言語モデル(LLM)です。このモデルは、3段階のトレーニング戦略を採用し、ソーシャルカルチャーの知識を取り入れることでマルチタスク機能を強化し、プラットフォームの規範や人間の嗜好に適合させています。ベースモデルと比較して、RedOneは8つのソーシャルタスク全体で平均14.02%のパフォーマンス向上、バイリンガルベンチマークでは7.56%の向上を実現しています。有害コンテンツ検出における露出を11.23%削減し、閲覧後の検索におけるページクリック率を14.95%向上させています。RedOneはソーシャルドメインにおいて優れたパフォーマンスを発揮し、SNSアプリケーションを強力にサポートします。

RedOneの主な機能

  • 内容理解ユーザー生成コンテンツを分類し、テーマを特定し、意図を理解することができる。
  • 情報抽出タグの予測、質問への回答、キーワードの検出など、非公式なソーシャルメディア投稿から構造化された情報を抽出します。
  • 意味的マッチングユーザーのクエリとソーシャルノート間の意味的な関係を特定し、関連性の評価を提供する。
  • ユーザー行動モデリング閲覧履歴に基づいて後続のクエリを生成するなど、ユーザーの行動をシミュレートする。
  • 対話と役割シミュレーション感情的な交流を伴う会話やグループチャットにおけるロールプレイングをサポートします。
  • 翻訳する多言語環境において、元のトーンや感情を損なうことなくメモを翻訳する。
  • 有害コンテンツの検出有害コンテンツへの接触を減らし、プラットフォームのセキュリティを向上させる。
  • 閲覧後の検索最適化ユーザーのクリック率を高め、コンテンツ発見機能を強化する。

RedOneの技術原則

  • 事前トレーニング(CPT)を継続するRedOneの継続的な事前学習フェーズでは、ソーシャルドメインに関する基礎知識がモデルに組み込まれます。研究者たちは、一般的な高品質コーパスやソーシャルネットワークプラットフォームから大規模なデータを収集し、非公式な議論、短いコメント、皮肉な発言など、さまざまなソーシャルコミュニケーションパターンを網羅しました。綿密に設計されたデータフィルタリングプロセスを使用して、低品質のデータが除去され、データの混合分布が最適化されたことで、Qwen2.5に基づいてモデルをさらに学習させることが可能になりました。
  • 教師ありファインチューニング(SFT)綿密に設計されたタスク定義とデータ構築に基づき、教師あり微調整フェーズでは、事前学習の目標と実際のSNSアプリケーションのニーズとのギャップを埋めます。研究者らは、大量の実際のユーザー生成コンテンツを収集し、コンテンツ理解、情報抽出、意味マッチングを含む6つのコア機能を定義し、それぞれの機能を特定のタスクにマッピングしました。2段階の学習戦略に基づき、第1段階では大規模な一般データとSNSデータの混合データで学習を行い、第2段階ではSNSデータの割合を増やして、主要タスクにおけるモデルのパフォーマンスをさらに最適化します。
  • 選好最適化(PO)選好最適化段階では、暗黙的な選好シグナルを利用して、モデルの出力を人間の選好やプラットフォームの仕様により合致させます。研究者らは、タスクの種類(主観的タスクと客観的タスク)に応じて異なる戦略を用いて様々な選好ペアを作成し、専門家を招いて選好のラベル付けを行い、データセットを拡張しました。直接選好最適化(DPO)アルゴリズムに基づき、選好データセットからのシグナルを用いてモデルの出力を最適化し、人間の選好により近づけます。
  • データハイブリッド化と汎用機能の維持トレーニング中は、一般的なドメインデータとSNSドメインデータが混合され、モデルの汎用性を維持しながらSNSドメインにおける適応性を向上させ、特定のドメインにおけるモデルのパフォーマンスを強化し、未知のタスク(ドメイン外、OOD)における汎化能力を向上させます。

RedOneのプロジェクトアドレス

  • arXiv技術論文:https://www.arxiv.org/pdf/2507.10605

RedOneアプリケーションシナリオ

  • 有害コンテンツの検出ヘイトスピーチ、誤情報、ポルノ、暴力などの有害コンテンツを効果的に識別し、フィルタリングします。有害コンテンツへの接触を減らすことで、プラットフォームのセキュリティとユーザーエクスペリエンスを大幅に向上させます。
  • 閲覧後の検索最適化ユーザーの閲覧履歴や行動に基づいて、より正確な検索候補や推奨コンテンツを生成することができ、これによりユーザーのコンテンツ発見能力が向上し、プラットフォームとのユーザーインタラクションが強化される。
  • 内容の理解と分類ユーザーが作成したコンテンツを自動的に分類・理解することで、プラットフォームがコンテンツをより適切に管理・推奨できるようになります。
  • 情報抽出タグ、キーワード、重要な事実などの重要な情報を、非公式なソーシャルメディアの投稿から抽出することは、コンテンツの推奨、情報の集約、知識グラフの構築に非常に役立ちます。
  • 意味的マッチングユーザーの検索クエリとソーシャルノート間の意味的な関連性を評価し、より正確な検索結果と推奨コンテンツを提供します。