Magnitudeは、ビジュアルAIエージェントを搭載したオープンソースのエンドツーエンドテストフレームワークです。Magnitudeは、自然言語を使用してテストケースを作成し、強力な推論エージェントでテストフローを計画および調整し、高速なビジュアルエージェントに基づいてテストを実行します。
Magnitudeは、ビジュアルAIエージェントを搭載したオープンソースのエンドツーエンドテストフレームワークです。Magnitudeは、自然言語を使用してテストケースを作成し、強力な推論エージェントでテストフローを計画および調整し、高速なビジュアルエージェントに基づいてテストを実行します。
Pollinations.AIは、無料で使いやすいテキストおよび画像生成APIを提供するオープンソースのAIコンテンツ生成プラットフォームです。Pollinations.AIは登録やAPIキーを必要とせず、画像生成を含むさまざまな機能をサポートしています。
Kimina-Proverは、Dark Side of the MoonとNuminaチームが共同開発した大規模な数学定理証明モデルです。このモデルは大規模な強化学習を用いて訓練されており、人間のように推論することができ、Lean 4言語で厳密な証明を提供します。
BlenderMCPは、モデルコンテキストプロトコル(MCP)に基づいてBlenderとClaude AIを統合するツールです。BlenderMCPはソケットサーバーを使用してBlenderとAI間の双方向通信を可能にし、3Dオブジェクトの作成、変更、削除をサポートします。
OpenAI o4-miniは、OpenAIが開発した小型推論モデルで、高速かつコスト効率の高い推論に最適化されています。OpenAI o4-miniは、数学、プログラミング、視覚化タスクにおいて優れた性能を発揮し、AIME 2024および2025の有力候補です。
Codex CLI は、OpenAI が開発した軽量のエンドポイントベースのコーディングエージェントです。自然言語コマンドに基づいて、Codex CLI は開発者が効率的にコードを生成し、ファイル操作を実行し、バージョン管理を実行できるように支援します。Codex CLI はコードをサポートしています...
Neural4D 2oは、DreamTechが開発したマルチモーダルインタラクションをサポートする初の大型3Dモデルです。このモデルは、テキスト、画像、3Dデータ、モーションデータを用いて共同で学習され、文脈の一貫性と3D生成における高い精度を実現しています。
InternVL3は、上海人工知能研究所が開発したオープンソースのマルチモーダル大規模言語モデル(MLLM)であり、卓越したマルチモーダル知覚および推論能力を誇ります。このモデルシリーズは、1Bから78Bまでの7つの異なるサイズがあり、テキストを同時に処理できます。
Doubao 1.5·UI-TARSは、ByteDanceが開発したグラフィカルユーザーインターフェース(GUI)とのインタラクションのためのエージェントモデルです。知覚、推論、行動実行といった人間のような能力に基づき、グラフィカルインターフェースとの継続的かつスムーズなインタラクションを実現します。このモデルは…
GoodWeBotは、RPA技術を用いて開発されたオープンソースのAI WeChatボットです。ワンクリックでインストール不要の操作が可能で、ダウンロード後すぐに使用できます。Cozeなどの主要なAIと統合されており、インテリジェントな返信、プライベートチャット、グループチャットなどを実現します。
Wan2.1-FLF2V-14Bは、14個のパラメータを持つオープンソースの最初と最後のフレームのビデオ生成モデルです。ユーザーが提供する最初と最後のフレーム画像に基づいて、モデルは滑らかで高精細なビデオ遷移効果を自動的に生成し、さまざまな機能をサポートします。
InstantCharacterは、TencentのHunyuanプラットフォームがオープンソース化した、カスタマイズ可能な画像生成プラグインです。Diffusion Transformer(DiT)フレームワークをベースに、スケーラブルなアダプタ(複数のTransformerエンコーダを含む)を導入し、数千万サンプルをサポートします。
MAI-DS-R1は、DeepSeek R1をベースにMicrosoftが開発したAIモデルです。MAI-DS-R1はトレーニング後に最適化されており、センシティブなトピックに関するプロンプトの99.3%に対応できます。これはオリジナルバージョンと比較して2倍の改善であり、有害コンテンツのリスクを50%削減します。MAI...
FramePackは、スタンフォード大学が開発したオープンソースのAI動画生成モデルです。入力フレームのコンテキスト長を圧縮することで、動画生成における「忘却」と「ドリフト」の問題を解決し、計算コストを抑えながら大量のフレームを効率的に処理することを可能にします。
FastAPI-MCPは、FastAPIアプリケーションのエンドポイントをモデルコンテキストプロトコル(MCP)に準拠するように自動的に変換するオープンソースツールです。設定は不要で、FastAPIアプリケーションを指定するだけで、すべてのエンドポイントを自動的に検出して変換します。
MineWorldは、Microsoft Researchが開発したMinecraftをベースにしたオープンソースのリアルタイムインタラクティブワールドモデルです。ゲームシーンやアクションを離散的なトークンに変換するために、ビジョンモーション自己回帰型Transformerアーキテクチャを採用しています。
HumanRigは、アリババチームが開発した3Dヒューマノイドキャラクターの自動リギング研究プロジェクトです。大規模で高品質なデータセットと革新的な手法を提供することで、高品質なデータセットの不足による既存のリギング技術の限界に対処します。
GigaTokは、30億個のパラメータを持つ自己回帰画像生成のためのビジュアル単語セグメンテーションツールです。セグメンテーションツールの特徴を、事前学習済みのビジュアルエンコーダ(DINOv2など)のセマンティック特徴と意味的正則化によって整合させ、潜在的特徴を効果的に制約します。
SkyReels-V2は、Kunlun Tech SkyReelsチームによって開発された、無限の長さの動画生成モデルです。拡散強制フレームワークに基づいており、マルチモーダル大規模言語モデル(MLLM)、多段階事前学習、強力な...
OpenUtauは、UTAUサウンドライブラリおよびリサンプラーと互換性のあるオープンソースの音声合成ツールです。VSQXインポート、多言語インターフェース、プリレンダリング機能をサポートしており、クリエイターが作品を素早くプレビューして時間を節約できます。OpenUtauの最新の…
Gemma 3 QAT(Quantization-Aware Training)は、Googleの最新のオープンソースモデルであり、Gemma 3の量子化最適化バージョンです。量子化対応トレーニング技術により、Gemma 3 QATはメモリ使用量を大幅に削減します。
ImagePulseは、Modaコミュニティによって立ち上げられたオープンソースプロジェクトであり、モデル機能を細分化し、細分化された機能データセットを構築することで、次世代の画像理解および生成モデルのためのデータセットサポートを提供します。このプロジェクトには、複数の機能が含まれています。
SimpleARは、復旦大学のビジョン・学習研究室とByteDance Seedチームが共同開発した、純粋な自己回帰型画像生成モデルです。簡潔な自己回帰アーキテクチャを採用し、学習および推論プロセスを最適化することで、高品質な画像生成を実現します。
Aetherは、上海AIラボが開発したオープンソースの生成世界モデルで、完全に合成データで学習されています。Aetherは、3D時空間モデリングと生成モデリングを深く統合した初のモデルであり、4D動的再構成、モーション条件付きビデオ予測などの機能を備えています。