NodeTool - AIを活用したワークフロー可視化ツール。ノードをドラッグ&ドロップするだけで、複雑なワークフローを設計できます。
NodeToolは、オープンソースのAIワークフロー可視化ツールです。NodeToolは幅広いAIツールとモデルを統合しており、シンプルで視覚的なインターフェースにより、コーディングなしで迅速なプロトタイプ作成とテストが可能です。NodeToolは…をサポートしています。
NodeToolは、オープンソースのAIワークフロー可視化ツールです。NodeToolは幅広いAIツールとモデルを統合しており、シンプルで視覚的なインターフェースにより、コーディングなしで迅速なプロトタイプ作成とテストが可能です。NodeToolは…をサポートしています。
VMB(Visuals Music Bridge)は、中国科学院情報工学研究所、中国科学院大学サイバー空間セキュリティ学院、上海人工知能研究所、上海交通大学などの機関によって開発されたマルチモーダル音楽生成フレームワークです。
Doubaoのビジュアル理解モデルは、Doubaoが開発した高度なAIモデルであり、視覚認識と推論能力を備えています。強力な視覚位置特定機能を誇り、複数のターゲット、小さなターゲット、一般的なターゲットのバウンディングボックス位置特定をサポートしています。
Doubao 3D生成モデルは、Doubaoが開発した3D生成モデルであり、Doubao大規模モデルファミリーに属します。これらのモデルは3D-DiTアーキテクチャに基づいており、高品質な3Dモジュールを生成できます。Volcano EngineデジタルツインプラットフォームveOmniverseと組み合わせて使用すると、...
MV-Adapterは、北京航空航天大学、VAST、上海交通大学の研究チームによって開発された、マルチビューで一貫性のある画像生成モデルです。MV-Adapterは、事前学習済みのテキストから画像への拡散モデルを、マルチビューで一貫性のある画像生成モデルに変換することができます。
FACTS Groundingは、Google DeepMindが開発した、大規模言語モデル(LLM)の能力を評価するためのベンチマークです。これは、与えられた文脈に基づいて、捏造された情報を使用せずに事実に基づいた正確なテキストを生成するモデルの能力を測定します。FACTS Grounding...
MarkItDownは、Microsoftが提供する多機能なオープンソースの文書処理ツールです。PDF、PPT、Word、Excel、画像、音声、HTMLなど、さまざまなファイル形式をMarkdown形式に変換できます。OCRによるテキスト認識、音声認識などにも対応しています。
EMMA-Xは、シンガポール工科デザイン大学が開発した、70億個のパラメータを持つ身体化されたマルチモーダル行動モデルです。これは、証拠に基づいた思考連鎖(CoT)推論データに基づいてOpenVLAを微調整することによって作成されました。EMMA-Xは、階層的な身体化されたデータセットを組み込んでいます...
WeaveFoxは、Ant Groupが立ち上げたAI搭載のフロントエンドインテリジェント開発プラットフォームで、開発者やクリエイターに全く新しい生産性向上ツールを提供します。その中核機能は、デザイン案を高品質なフロントエンドコードに迅速に変換することであり、様々なデザインドキュメントに対応しています。
UniRealとは? UniRealは、香港大学とAdobe Researchが共同開発したフレームワークで、様々な画像生成・編集タスクを可能にすることに重点を置いています。現実世界のダイナミクスをシミュレートすることで、単一のモデル内で画像処理を行うことができます。
X-AnyLabelingは、複数の深層学習アルゴリズムを統合した画像アノテーションソフトウェアで、アノテーションの効率と精度向上に重点を置いています。X-AnyLabelingは、画像や動画の多様なアノテーションスタイルをサポートし、さまざまなAIトレーニングシナリオに適応し、さらに…
Explorerは、Odysseyが開発したジェネレーティブワールドモデルで、あらゆる画像を詳細な3Dワールドに変換できます。Explorerモデルは、リアルなワールドの生成に優れ、ダイナミックなエフェクトにも対応しています。Explorerはガウススプラッシュに基づいています...
Gemini 2.0 Flash Thinkingは、Googleの最新の推論機能強化型AIモデルで、複雑な問題における効率的な推論と解釈性を実現するように設計されています。Chatbot Arenaのリーダーボードで優れたパフォーマンスを発揮し、前モデルを凌駕しています。
Genesisは、カーネギーメロン大学、メリーランド大学、スタンフォード大学、MITなどの研究機関が共同開発したオープンソースのジェネレーティブ物理エンジンです。世界中のあらゆるものをシミュレートできます。Genesisはシンプルな言語で記述でき、高速です。
AniDocは、香港科技大学、アントグループ、南京大学、浙江大学、香港大学が共同開発した、簡略化された2Dアニメーション着色AIモデルです。ビデオ拡散モデルに基づいて、参照画像に従ってスケッチシーケンスをカラーアニメーションに自動的に変換します。
ElevenLabs Flashは、ElevenLabsが開発した低遅延音声合成モデルで、高速な対話型AI向けに設計されています。ElevenLabs Flashには2つのバージョンがあり、Flash v2は英語のみをサポートし、Flash v2.5は32言語をサポートしています。
OpenAIのo3モデルは、o1に続く次世代推論モデルです。これは、画像推論を思考プロセスに統合したOpenAI初のモデルであり、ユーザーは思考プロセスの中で画像を直接考慮することができます。ユーザーは、ぼやけた画像、反転した画像、低品質の画像などをアップロードできます。
StyleStudioは、西湖大学AI研究所、復旦大学、南洋理工大学、香港科技大学(広州)が共同開発した、テキスト駆動型のスタイル変換モデルです。参照画像のスタイルとテキストプロンプトの内容を統合することができます。
RWKV-7は、RWKVシリーズの最新大規模モデルアーキテクチャバージョンです。従来の注意機構や線形注意機構のパラダイムを凌駕し、より柔軟な状態進化能力を備え、同じ計算能力では注意機構では解決できない問題を解決できます。
PromptWizardは、Microsoftが提供する自動提案最適化フレームワークで、特定のタスクにおける大規模言語モデル(LLM)のパフォーマンスを向上させます。自己進化と自己適応のメカニズムに基づき、PromptWizardはフィードバック主導の批判と…
INFPは、2人対話インタラクション専用に設計された、音声駆動型のヘッド生成フレームワークです。対話音声に基づいて役割を自動的に切り替えるため、手動での役割割り当てや切り替えは不要です。INFPは、アクションベースのヘッド生成と…の2つのフェーズで構成されています。
VisionFMは、眼科分野全般の人工知能向けに特別に設計された、マルチモーダルかつマルチタスクな視覚基盤モデルです。560,457人の被験者から得られた340万枚の眼科画像を用いて事前学習されており、幅広い眼疾患を網羅しています。
MetaMorphは、命令チューニングによって視覚的理解と生成を実現するマルチモーダル大規模モデル(MLLM)です。このモデルは、視覚予測命令チューニング(VPiT)と呼ばれる手法を提案しています。
AgentScopeは、アリババグループが提供するオープンソースのマルチエージェント開発プラットフォームであり、開発者がマルチエージェントアプリケーションを容易に構築・展開できるよう支援します。AgentScopeは、高い使いやすさ、堅牢性、分散環境への対応に加え、様々な組み込みモデルAPIを備えています。