Gemma 4 - Googleのオープンソースのマルチモーダル大規模モデルシリーズ
Gemma 4は、Googleが開発したオープンソースのマルチモーダル大型モデルシリーズで、Gemini 3アーキテクチャに基づいています。モデルには、E2B/E4B(携帯電話/Raspberry Piで動作)、26B MoE(3.8Bパラメータのみ有効化)、31B Dense(Arena認定のオープンソースモデル)などがあります。
Gemma 4は、Googleが開発したオープンソースのマルチモーダル大型モデルシリーズで、Gemini 3アーキテクチャに基づいています。モデルには、E2B/E4B(携帯電話/Raspberry Piで動作)、26B MoE(3.8Bパラメータのみ有効化)、31B Dense(Arena認定のオープンソースモデル)などがあります。
InternSVGは、上海人工知能研究所などが開発した、統一SVGモデリングのための包括的な「データ評価モデル」スイートです。1600万以上のサンプルを含むSAGoggeデータセット、標準化されたSArenaベンチマーク、そして…という3つの主要コンポーネントで構成されています。
JoyAI-Image-Editは、JD.comが開発したオープンソースのコマンド誘導型画像編集モデルで、JoyAI-Imageマルチモーダルベースモデルをベースに構築されています。このモデルは、自然言語コマンドによる正確かつ制御可能な空間操作とインテリジェントな画像修正をサポートします。
GLM-5V-Turboは、Zhipu AIが開発したネイティブなマルチモーダルコーディング基盤モデルで、ビジュアルプログラミングとAIエージェント向けに特化して設計されています。このモデルは、事前学習段階からビジュアル機能とテキスト機能を深く統合しており、画像、動画、設計図などの理解をサポートします。
Qwen3.6-Plusは、アリババ傘下のTongyi Labが開発したエージェントプログラミングモデルで、エンコードされたインテリジェントエージェントの機能を大幅に強化することに重点を置いています。このモデルは、デフォルトで最大100万トークンの超長文コンテキストをサポートし、SWE-bench、Terminal-Bench、その他のベンチマークにおけるコード修正が含まれています。
Claw-codeは、Claude Codeのソースコードが流出した後に開始されたクリーンルームリライトプロジェクトです。法的リスクを回避するため、開発者はOpenAI CodexのOmXワークフローオーケストレーションを使用し、Typからコアアーキテクチャをリファクタリングしました。
Wan2.7-Imageは、Tongyi Labsが開発したAI画像生成・編集モデルです。顔の形、目の形、骨格など、キャラクター画像の高度なカスタマイズをサポートし、単調な「AI標準顔」に別れを告げ、4000以上のキャラクターを正確に生成できます。
Lightpandaは、AIエージェントと自動化のために特別に設計されたオープンソースのヘッドレスブラウザです。Zig言語でゼロから開発されており、ChromiumやWebKitに依存していません。このツールのメモリ使用量はChromeのわずか1/16で、実行速度は…
Veo 3.1 Liteは、Googleの最新AI動画生成モデルで、Veo 3.1 Fastと同等の生成速度を維持しながら、価格は50%以上低くなっています。このモデルは、テキストや画像からの動画生成をサポートし、縦向きと横向きの柔軟な切り替えが可能です。
TeamClawは、AIを活用した従業員チーム管理プラットフォームであり、「一人AIオフィス」として位置づけられています。このプラットフォームでは、実際の従業員を雇用するのと同様に、AIの役割(CEO、アナリストなど)を定義し、役割を即座に割り当てることができます。また、インストールにも対応しています。
ColaMDはオープンソースのMarkdownエディタです。このツールは、AI編集後のファイルの更新を確認するために手動で更新する必要がある従来のエディタの問題点を解決し、バックエンドの変更とフロントエンドのコンテンツをリアルタイムで同期させ、まるでリアルタイムで閲覧しているかのような感覚を実現します。
Harrier-OSS-V1は、Microsoftが開発したオープンソースの多言語テキスト埋め込みモデルで、Multilingual MTEB v2ベンチマークにおいて最先端(SOTA)のパフォーマンスを実現しています。このモデルはデコーダーのみのアーキテクチャを採用し、最終的なトークンプーリングとL2回帰を利用しています。
LongCat-AudioDiTは、Meituanがオープンソース化した高忠実度拡散ベースのテキスト音声合成(TTS)モデルです。その核となる革新性は、メル周波数スペクトルなどの中間表現を用いるのではなく、波形潜在空間における拡散を通してテキストを直接生成することで、エラーの蓄積を効果的に回避している点にあります。
Vision2Webは、清華大学とZhipu AIが共同で立ち上げた、ビジュアルWebサイト開発評価ベンチマークです。マルチモーダルAIエージェントのエンドツーエンドのWebサイト構築能力を評価するために使用されます。Vision2Webには、難易度が段階的に上がる3つのレベルに分かれた193の実際のWebサイトタスクが含まれています。
wecom-cli(エンタープライズWeChat CLI)は、公式エンタープライズWeChatチームが提供するオープンソースのコマンドラインツールで、人間とAIエージェントが端末からエンタープライズWeChatを操作できるようにします。このツールは、連絡先、ToDoリスト、会議、メッセージ、カレンダー、ドキュメントなど、幅広い機能を網羅しています。
PixVerse V6は、PixVerse Technologyが発表した最新のAI映像生成モデルです。このモデルは、カメラ制御、キャラクター表現、マルチカメラによる映像・音声生成において画期的な進歩を遂げ、より精密なカメラワーク、より滑らかなフレーム間キャラクター感情表現、そしてより洗練された物理的相互作用を実現しています。
Pretextは、元ReactコアメンバーのCheng Lou氏によって作成された、オープンソースの純粋なJavaScript/TypeScriptベースの複数行テキスト計測・レイアウトライブラリです。DOMのリフローを完全に回避し、純粋な算術演算を用いて複数行テキストのサイズを正確に計測します。
Pascal Editorは、Claude氏の協力を得て開発された、Webベースのオープンソース3D建築エディタです。インストール不要でブラウザ上で動作し、WebGPU技術を利用して高性能なレンダリングを実現します。
Qwen3.5-Omniは、アリババ傘下のTongyi Labが開発したフルモーダルな大規模モデルで、テキスト、画像、音声、音声・動画入力を同時に理解できます。このモデルは、Thinker-Talker協調アーキテクチャとHybrid-MoE技術を採用し、215種類の音声を処理できます。
Mureka V9は、Kunlun Wanweiが開発した最新のAI音楽モデルです。このモデルは、音楽のメロディー、表現力、アレンジ、構成といった主要な指標において、Suno V5などの競合製品を凌駕し、ボーカルや楽器の人工分析においてトップクラスの成績を収めています。
Excellent Vision社が開発したGigaWorld-1は、WorldArenaランキングでトップに輝いた、具現化された世界モデルです。このモデルは、明示的なモーションモデリングと微分可能な物理法則を組み合わせたAC-WM(モーション制御世界モデル)アーキテクチャを採用しています。
MicroCoderは、Microsoft Research Asiaがケンブリッジ大学およびプリンストン大学と共同で立ち上げた、コードベースの大規模モデルトレーニング最適化プロジェクトです。アルゴリズム、データ、評価、経験という4つの側面からトレーニングを包括的に最適化することで、Qwen3などの次世代モデルにおけるトレーニングのボトルネックに対処します。
KAT-Coder-Pro V2は、KuaishouのKwaiKATチームが開発した主力AIプログラミングモデルであり、エージェント型コーディングシナリオ向けに高度に最適化されています。このモデルは、Claude Code、Cline、OpenClawなど、10種類以上の主要なAIコーディング方式とネイティブに互換性があります。
Matrix-Game 3.0は、Skywork AIが開発したリアルタイムインタラクティブワールドモデルで、720p@40FPSでのリアルタイム生成をサポートしています。このモデルは、自己修正のためのエラーバッファリングメカニズムを採用し、カメラベースの認識とメモリ検索を組み合わせることで、...