AB
AiBoss
project

VibeThinker-3B - Weiboがオープンソース化した、30億個のパラメータを持つ推論モデル。

VibeThinker-3Bは、Sina Weiboチームがオープンソース化した、30億個のパラメータを持つ推論モデルです。Qwen2.5-Coder-3Bをベースに構築されており、改良されたスペクトル・信号変換後処理を採用することで、検証可能な数学的およびプログラミング的タスクにおいて優れた性能を発揮します。

VibeThinker-3Bとは何ですか?

VibeThinker-3Bは、Sina Weiboチームが開発したオープンソースの30億パラメータの高密度推論モデルです。Qwen2.5-Coder-3Bをベースに構築されており、改良されたSpectrum-to-Signal後処理プロセスにより、数学やプログラミングなどの検証可能な推論タスクにおいて、Gemini 3 ProやClaude Opus 4.5といった主要な大規模モデルに匹敵する性能を実現しています。小型モデルの可能性を探り、従来のスケーリング法則を補完するものです。

VibeThinker-3Bの主な機能

  • 高度な数学的推論同校はAIME’26で94.3点、HMMT’25で89.3点、BruMO’25で93.8点を獲得した。
  • 競技プログラミングLiveCodeBench v6は1回の合格で80.2%の合格率を達成し、LeetCodeの最新の週次/隔週コンテストの合格率は96.1%にも達しています。
  • STEM推論IMO-AnswerBenchで76.4点(+CLRにより80.6点に向上)のスコアを獲得し、複雑な科学的問題の解決を支援します。
  • 指示に従いましたIFBenchは74.5点を獲得し、書式設定や制約チェックに対する感度の高さを示した。
  • テスト中のスケーリング(CLR)主張レベルの信頼性評価戦略を導入することで、推論段階における回答の信頼性をさらに向上させることができる。

VibeThinker-3Bの技術原理

  • 基本モデルQwen2.5-Coder-3Bをベースに構築された、30億個のパラメータを持つアーキテクチャは変更されておらず、パフォーマンスの向上はすべて、トレーニング後のテクノロジースタックの徹底的な最適化によるものです。
  • スペクトルから信号への変換パラダイム中核となる訓練プロセスは、「スペクトルフェーズ」(SFTの拡張された機能範囲)と「シグナルフェーズ」(RLVRによる検証可能なタスクの精密な最適化)に分けられます。
  • 2段階コースSFT第1段階では、数学、プログラミング、STEM(科学、技術、工学、数学)、会話能力を幅広く網羅し、第2段階では、難易度の高い長文の推論問題に焦点を当て、学習プロセスの深度を徐々に高めていく。
  • 多様性の探求の抽出単一の最適解を追求するのではなく、複数の有効な推論経路を保持することで、複雑な問題に対するモデルの汎化能力を高める。
  • MGPO強化学習GRPOに重みを追加して、現在の戦略にとって「簡単すぎず難しすぎない」サンプルを最適化することを優先します。
  • マルチドメイン逐次強化学習強化学習は数学→プログラミング→STEM(科学、技術、工学、数学)の順序で厳密に実施され、実験の結果、この順序が全体的に最良の結果をもたらすことが示された。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

VibeThinker-3Bの使い方

  • モデルをダウンロードモデルの重みを取得するには、HuggingFaceまたはGitHubリポジトリにアクセスしてください。
  • ローカル展開トランスフォーマーなどのフレームワークに基づいた3Bパラメータモデルをロードし、民生用ハードウェアでの動作をサポートします。
  • 推論の呼び出し数学、プログラミング、またはSTEMに関する質問を入力すると、モデルは完全な推論過程(CoT)を含む回答を出力します。
  • CLRを有効にする(オプション)数学関連のタスクでは、クレームレベルの信頼性評価を有効にすることで、精度をさらに向上させることができます。

VibeThinker-3Bの主な利点

  • 最小限のパラメータで、最先端のパフォーマンスを実現わずか30億個のパラメータで、検証可能な推論タスクにおいて、数百億個のパラメータを持つ最先端モデルの性能と比較評価することができる。
  • コースベースの2段階SFT幅広い能力範囲から、難易度の高い長文の推論問題まで、推論の深さは段階的に増していく。
  • マルチドメイン強化学習強化学習は、数学→プログラミング→STEMの順序で順次実行され、全長64Kの文脈的推論の軌跡全体が保持されます。
  • オフライン自己蒸留統一蒸留のために高品質な軌跡が選択され、学生モデルがまだ習得していない正しい経路の学習が優先される。

VibeThinker-3Bプロジェクトの住所

  • GitHubリポジトリ:https://github.com/WeiboAI/VibeThinker
  • ハギングフェイスモデルライブラリ:https://huggingface.co/WeiboAI/VibeThinker-3B
  • arXiv技術論文:https://arxiv.org/pdf/2606.16140

VibeThinker-3Bと類似製品との比較

寸法 VibeThinker-3B Claude Opus 4.5
開発者 Sina Weibo AIチーム Anthropic
パラメータサイズ 3B(高密度モデル) 金額は非公開(推定では数千億ドルから数兆ドル)。
オープンソースレベル 完全オープンソース(用紙+コード+重量) クローズドソース(API/製品のみ)
展開方法 ローカルの消費者向けGPUは実行できます クラウド専用API
位置 検証可能な推論専用エンジン ユニバーサルスマートアシスタント

VibeThinker-3Bの応用事例

  • アルゴリズム競技会準備AIME、HMMT、IMOなどの数学競技問題の解決を支援し、複数の推論経路に関する参考情報を提供します。
  • プログラミング面接トレーニングLeetCodeやLiveCodeBenchなどでプログラミング問題を練習し、詳細な解説付きの正解を入手しましょう。
  • STEM教育と個別指導これは、物理学、化学、生物学などの科学分野における問題を解決するための、段階的な導出プロセスを提供するものです。
  • エッジ推論の展開このモデルはパラメータ数がわずか30億個しかないため、携帯電話やIoTデバイスなどの低計算能力環境でのローカル動作に適しています。
  • 推論能力に関する研究: 小規模モデルにおける推論の上限を探るためのベンチマークとして、スケーリング法則に関する学術研究のための代替的な道筋を提供する。