project
Models.dev - OpenCodeチームによるオープンソースのAIモデルデータベース。
Models.devは、OpenCodeチームによるオープンソースのAIモデルデータベースです。Models.devは、OpenAI、Anthropic、Googleなど数十の主要ベンダーのモデル情報を標準化されたTOML形式で統合し、価格、モデル
Models.devとは何ですか?
Models.devは、OpenCodeチームが提供するオープンソースのAIモデルデータベースです。Models.devは、OpenAI、Anthropic、Googleなど、数十もの主要ベンダーのモデル情報を標準化されたTOML形式で統合しています。価格、コンテキストウィンドウ、ツール呼び出し、知識カットオフなどの主要な仕様を網羅し、開発者が直接利用できる公開JSON API(models.dev/api.json)を提供しています。Models.devは、断片化されたAIモデル情報という課題を解決し、開発者がワンストップでクエリを実行し、正確なコスト見積もりを行い、効率的にモデルを選択できるよう支援します。
Models.devの主な機能
-
ワンストップでモデル情報を照会できますOpenAI、Anthropic、Google、Metaなど、数十もの主要ベンダーによる基本的な対話モデルと専門的なドメインモデルが含まれているため、検索のために複数の公式ウェブサイトを切り替える必要がなくなります。
-
正確なコスト見積もりこのツールは、100万トークン(米ドル)あたりの入力/出力/推論/キャッシュ読み取り/キャッシュ書き込みコスト、および音声入出力コストの詳細な記録を提供し、プロジェクトが予算を正確に見積もるのに役立ちます。
-
機能仕様比較標準化された表示モデルは、ツール呼び出し、推論/思考連鎖、構造化出力、温度制御、ファイル添付、知識期限、コンテキストウィンドウ、入出力トークンの最大数、およびサポートされているモダリティなどの主要な指標をサポートする必要があります。
-
公開JSON API:供給
models.dev/api.jsonこのインターフェースを使用すると、開発者はプロジェクト内で完全なモデルデータを直接呼び出し、モデル選択ツール、コスト計算ツール、または管理パネルを構築できます。 -
プロバイダーロゴを取得する:合格
models.dev/logos/{provider}.svgこのインターフェースは、様々なメーカーのロゴを直接取得します。 -
コミュニティコラボレーションの維持管理データはTOML形式で保存され、プロバイダーごとに分類されています。また、継続的なデータベース更新を保証するために、コミュニティからの貢献もサポートされています。
Models.devの技術的原則
-
三相ループアーキテクチャ入力は Prelude (標準の Transformer レイヤー) によってエンコードされ、T 回の反復で Recurrent Block ループに入り、最終的に Coda によって出力されます。各ループは、元の入力 e を注入することによって隠れ状態のドリフトを防ぎます。
-
暗黙の思考連鎖各ループは思考連鎖推論の1ステップに相当しますが、連続的な潜在空間で静かに実行され、中間トークンを出力しません。また、複数の推論パスを同時にエンコードすることをサポートしています。
-
LTI安定性制約ループを線形時不変システムとして扱い、Aを負の対角行列としてパラメータ化して離散化することにより、スペクトル半径ρ(A) < 1を厳密に保証し、残差爆発とトレーニング発散の問題を根本的に解決します。
-
MoE+ 循環的相乗効果MoEはドメイン間の幅広さを提供し、ループメカニズムは推論の深さを提供します。ループ内で隠れ状態が変化するにつれて、ルーターは異なるエキスパートのサブセットを選択する可能性があり、各ループ計算が固有のものになります。
-
適応停止このシステムはACT(適応型計算時間)メカニズムをサポートしており、モデルがループを停止するタイミングを動的に決定することで、「考え過ぎ」を回避します。
Models.devの使い方
-
インストール:
pip install open-mythosオプション[flash]フラッシュアテンション2を有効にする。 -
構成:選ぶ
mlaまたはgqaアテンションタイプ、MythosConfig寸法、ヘッド数、ループ数などのパラメータを設定します。 -
モデルを作成する:
OpenMythos(cfg)ネットワークを初期化します。 -
推論生成: 電話
model.generate(max_new_tokens=8, n_loops=8)、合格n_loops推論の深さを制御する。 -
電車:使用
training/3b_fine_web_edu.pyスクリプトは、単一のカード上で直接実行することも、複数のカードを介して実行することもできます。torchrun起動する。
Models.devに関する重要な情報と使用要件
-
環境Python + PyTorch; Flash Attention 2にはCUDAとコンパイルツールチェーンが必要です。
-
単語分割ツール:使用
openai/gpt-oss-20bトークナイザー。 -
正確さH100/A100の場合はbfloat16を推奨します。古いGPUの場合は、float16 + GradScalerを使用してください。
-
トレーニング構成AdamWオプティマイザ、2000ステップ後にコサイン減衰を伴う線形ウォームアップ、目標トークン数は約300億。
-
スケールカバレッジ1B実験モデルと1T理論構成の両方について、あらかじめ定義されたパラメータが存在する。
Models.devの主な利点
-
パラメータの高効率L回の反復を行うk層ループは、kL層の固定深度ネットワークと同等であり、パラメータの数がk層型であることと、推論深度に応じてメモリ使用量が増加しないことだけが異なります。
-
推論は拡張可能であるテスト中の反復回数を増やすことで、予測可能な飽和減衰パターンに従って推論能力を向上させることができる。
-
トレーニングの安定性LTI制約メカニズムは、リカレントモデルの学習における不安定性や損失の急増といった問題を完全に解決します。
-
システムの一般化このシステムは、分布外(OOD)組み合わせ推論において卓越した能力を発揮し、3段階の「洞察」プロセスを通じて能力を飛躍的に向上させます。
-
深度外挿5段階の推論チェーンはテスト中に10段階まで正常に拡張できるが、標準のTransformerでは失敗する。
Models.devのプロジェクトアドレス
- プロジェクト公式サイト:https://models.dev/
- GitHubリポジトリ:https://github.com/anomalyco/models.dev
Models.devの類似製品との比較
| 寸法 | OpenMythos | DeepSeek-V3 | Qwen2.5 |
|---|---|---|---|
| コアアーキテクチャ | ディープループトランスフォーマー(RDT) | MoE Transformer | Dense / MoE Transformer |
| 注意機構 | MLA/GQA切り替え可能 | MLA | GQA |
| 循環論法 | コア機能(潜在的暗黙的CoT) | なし | なし |
| オープンソースレベル | 完全オープンソース(コード+トレーニングスクリプト+ドキュメント) | オープンソースのウェイト | オープンソースのウェイト |
| モデルサイズ | 1B – 1T 事前構成済み | 671B(一般参謀) | 0.5B~72Bなど |
| 製品ポジショニング | 研究検証/理論的再現 | 量産グレードの一般モデル | 量産グレードの一般モデル |
| 推論拡張機能 | ループの数を増やして深さを拡張する | 階数は固定 | 階数は固定 |
Models.devの応用シナリオ
-
AIアーキテクチャ研究: ループ型トランスフォーマー、暗黙的推論チェーン、およびテスト時計算の拡張理論を検証する。
-
注意機構実験円形アーキテクチャにおけるMLAとGQAのKVキャッシング効率と推論品質を比較する。
-
教育省の研究:スパースエキスパートルーティングとループ深度を組み合わせた場合の、マルチドメインタスクへの影響をテストする。
-
モデルトレーニングオープンソースのコードとスクリプトに基づいて、FineWeb-Eduなどのデータセットで、カスタムスケールのモデルをゼロからトレーニングします。
-
安定性試験LTI制約、スペクトル半径制御、連続深度バッチ処理などの技術の実際的な効果を検証する。