PromptFill - AI描画専用に設計された、オープンソースの構造化プロンプト生成ツール。
PromptFillは、AI描画専用に設計された構造化されたプロンプト生成ツールです。視覚的な穴埋め操作を通して、複雑なプロンプトを素早く作成できます。メモリ過負荷、文法的な混乱、再利用性の低さなど、従来のプロンプトが抱える問題を解決します。
PromptFillは、AI描画専用に設計された構造化されたプロンプト生成ツールです。視覚的な穴埋め操作を通して、複雑なプロンプトを素早く作成できます。メモリ過負荷、文法的な混乱、再利用性の低さなど、従来のプロンプトが抱える問題を解決します。
Fun-Audio-Chatは、Alibaba CloudのTongyi Bailingチームがオープンソース化した次世代のエンドツーエンド音声対話モデルで、音声理解、感情認識、タスク実行の機能を備えています。このモデルは、5Hzと25Hzのフレームレートを併用するデュアル解像度設計を採用しています。
GLM-4.7は、Zhipu AIが開発したオープンソースモデルで、コーディング能力、推論能力、ツール連携の向上に重点を置いています。このモデルは、多言語プログラミング、複雑なタスクプランニング、フロントエンドデザインの美学に優れており、様々なプログラミングフレームワークをサポートしています。
NitroGenは、NVIDIAがスタンフォード大学、カリフォルニア工科大学、その他の機関と共同で開発したオープンソースの汎用ゲームAIモデルです。1,000以上のゲームを網羅する40,000時間分のビデオデータで学習されており、大規模な行動クローニング技術を採用しています。
Qwen-Image-Layeredは、アリババが開発したAI画像編集モデルです。通常の画像を自動的に独立したRGB透明レイヤーに分割し、Photoshopと同様のレイヤー編集機能を実現します。これは、アテンションメカニズムと位置エンコーディングによって実現されています。
FunctionGemmaは、Googleが開発した軽量AIモデルで、関数呼び出しの最適化に特化しており、2億7000万個のパラメータを備えています。Gemma 3アーキテクチャに基づいており、モバイルデバイス、ブラウザ、その他のエッジデバイスで動作するように設計されており、...
T5Gemma 2は、Googleが開発した新しいオープンソースのエッジサイドマルチモーダル長コンテキストエンコーダー・デコーダーモデルです。このモデルは、回帰によって従来のTransformerアーキテクチャを最適化し、バインドワード埋め込みやマージドアテンションメカニズムなどの革新的な機能を導入し、パラメータスケーリング機能も備えています。
GPT-5.2-Codexは、OpenAIが開発したインテリジェントエージェントプログラミングモデルで、複雑なソフトウェアエンジニアリングと防御的なサイバーセキュリティのために特別に設計されています。このモデルはGPT-5.2のアップグレード版であり、指示への準拠、長いコンテキストの理解などの機能が向上しています。
EcomBenchは、Tongyi LabsとSkylenageが共同で開発した、eコマースシナリオにおけるAI能力評価ベンチマークです。実世界のデータに基づいて構築されたEcomBenchは、政策コンサルティング、コスト見積もり、製品選定決定など、7つのカテゴリを網羅しています。
Kairos 3.0は、DaXiao Roboticsが提唱するACE(Advanced Computing Equipment)開発パラダイムに基づいた、業界初のオープンソースかつ商用利用可能な世界モデルです。
VTP(Visual Tokenizer Pre-training)は、MiniMaxビデオチームが開発したオープンソースのビジュアル生成モデルの事前学習フレームワークです。このフレームワークは、コントラスト学習、自己教師あり学習、再構成学習を統合することで、ビジュアルトークナイザーの最適化に重点を置いています。
TRELLIS.2は、Microsoftが開発したオープンソースの40億パラメータを持つ3D生成モデルで、単一画像から高精細な3Dアセットを効率的に生成するように設計されています。その中核となる革新性は、複雑なトポロジー(オープンテーブルなど)を処理できるO-Voxelスパースボクセルアーキテクチャにあります。
Seed 1.8は、ByteDanceが開発した汎用エージェントモデルで、強力なマルチモーダル機能を備え、テキストと画像入力に対応しています。このモデルは、検索、コード生成、GUI操作機能を統合しており、複雑なワークフローを効率的に完了させることができます。
SHARPは、Appleが開発したオープンソースのAIモデルで、1枚の2D写真を1秒未満でリアルな3Dシーンに変換できます。このモデルは、3Dガウス表現技術と、単一のフィードフォワードパスを持つニューラルネットワークを使用して、シーンの3D表現を高速に予測します。
Step-GUIは、StepLeapStarが開発したAIエージェントシリーズのモデルで、クラウドベースのStep-GUIとエッジベースのStep-GUI Edgeの2種類があります。クラウドベースのモデルは複雑なタスクの処理に優れており、エッジベースのモデルは軽量でモバイルデバイス上でローカルに実行できます。
SAM Audioは、Metaが開発したオープンソースの音声セグメンテーションモデルで、テキスト、視覚情報、時間的断片などのマルチモーダルな手がかりを用いて、複雑な音声混合物から特定の音を分離することができます。そのコア技術は、Perception Encoder Audioviです。
Gemini 3 Flashは、Googleが開発した高速かつ低コストの最先端インテリジェントモデルです。Gemini 3をベースに、大幅に向上したパフォーマンスと、強力な推論能力、マルチモーダル理解能力を誇ります。
Animate Anyoneは、アリババ知能コンピューティング研究所が開発したオープンソースのフレームワークで、静止画像内のキャラクターや人物をアニメーション化します。拡散モデルに基づいており、ReferenceNet、Pos...
ReplaceAnythingは、アリババインテリジェントコンピューティング研究所が開発したオープンソースのAI画像コンテンツ置換フレームワークです。高度な人工知能技術を活用し、写真や画像内のオブジェクトをインテリジェントに置換できます。ユーザーは…
Outfit Anyoneは、アリババインテリジェントコンピューティング研究所が立ち上げたオープンソースプロジェクトで、高品質な仮想試着機能を提供しています。この技術により、ユーザーやモデルは実際に服を試着することなく、自分に似合うかどうかをプレビューできます。Outfit Anyone...
PhotoMakerは、Tencent PCGのARC Labs、南開大学、東京大学の研究者らが最近発表した、リアルなAIキャラクター生成と写真スタイリングのためのオープンソースモデルおよびフレームワークです。ユーザーは、PhotoMakerを使って、
FaceChainは、アリババDAMOアカデミーが開発した、ポートレートやデジタルアバターを生成するためのオープンソースAIフレームワークです(Miaoduck Cameraの無料オープンソース版に似ています)。ユーザーは、少なくとも1枚の写真を提供するだけで、ユニークなアバターを生成できます。
I2VGen-XLは、アリババDAMOアカデミーが開発したオープンソースの画像から動画への生成モデルです。革新的なカスケード拡散方式により、テキストから動画へのデータと動画構造を分離し、静止画像を重要な誘導要素として活用します。
MagicVideo-V2は、ByteDanceが開発したAIビデオ生成モデルです。テキストから画像への変換モデル、ビデオモーションジェネレーター、参照画像埋め込みモジュール、フレーム補間モジュールを統合し、エンドツーエンドのビデオ生成を実現します。