ACE++ - Alitongyiが発表した、アップグレードされた画像生成・編集モデル
ACE++は、アリババ同義研究所が開発した高度な画像生成・編集ツールです。命令ベースかつコンテキスト認識型のコンテンツ補完技術により、高品質な画像作成・編集機能を実現しています。
ACE++は、アリババ同義研究所が開発した高度な画像生成・編集ツールです。命令ベースかつコンテキスト認識型のコンテンツ補完技術により、高品質な画像作成・編集機能を実現しています。
LLaVA-Radは、Microsoft Researchが開発した小型のマルチモーダルモデルで、臨床放射線レポートの生成に重点を置いています。これはLLaVA-Medプロジェクトの派生プロジェクトであり、特に胸部X線(CXR)画像に特化しています。LLaVA-Medのアーキテクチャとトレーニングに基づいています。
Satoriは、MIT、ハーバード大学、その他の研究機関の研究者によって開発された、推論能力の向上を目的とした大規模な7Bパラメータ言語モデルです。Qwen-2.5-Math-7BをベースとするSatoriは、小規模フォーマットの微調整と大規模な機能強化を活用しています。
Gokuは、香港大学とByteDanceが共同開発した新しい動画生成モデルで、画像と動画の同時生成に特化して設計されています。高度な整流変換フレームワークに基づいており、テキストベースの動画、画像ベースの動画などをサポートしています。
AnythingLLMは、マルチモーダルなインタラクションをサポートする、無料のオープンソースのフルスタックAIクライアントです。AnythingLLMは、テキスト、画像、音声など、複数の入力方法をサポートし、あらゆるドキュメントやコンテンツをさまざまな言語モデルのためのコンテキストに変換します。
VideoCaptioner(中国語名:Kaka Subtitle Assistant)は、大規模言語モデル(LLM)に基づいたインテリジェントな字幕処理ツールで、動画字幕の生成と最適化プロセスを簡素化します。VideoCaptionerは、音声認識、字幕分割などをサポートしています。
Zonosは、Zyphraが開発した高忠実度テキスト音声合成(TTS)モデルです。Zonosは、16億個のパラメータを持つTransformerモデルとハイブリッドSSMモデルの2つのモデルで構成されており、どちらもApache 2.0ライセンスの下でオープンソースとして公開されています。Zonosは…
InspireMusicは、アリババ傘下のTongyi Labsが開発したオープンソースの音楽生成技術で、人工知能を用いてユーザー向けに高品質な音楽を生成します。マルチモーダル大規模モデル技術に基づいており、シンプルなテキストによる説明や音声プロンプトに対応しています。
YAYI-Ultraは、Zhongke Wengeが開発した企業向け大規模言語モデルのフラッグシップバージョンであり、強力なマルチドメイン専門機能とマルチモーダルコンテンツ生成機能を備えています。数学、プログラミング、金融、世論、漢方医学、セキュリティなど、複数の分野をサポートしています。
HUGWBC(Humanoid Unified and General Whole-Body Controller)は、上海交通大学と上海AI研究所が共同開発した、精密な動作制御を可能にするヒューマノイドロボットの全身制御装置です。HUGWBCは…
テスト時選好最適化(TPO)は、推論フェーズ中に言語モデルの出力を動的に最適化し、人間の選好により合致させる新しいAI最適化フレームワークです。TPOは報酬シグナルをテキストフィードバックに変換します...
PDF to Podcastは、NVIDIAが提供するAIツールで、PDF文書を音声に変換します。NVIDIA NIMマイクロサービスアーキテクチャに基づいており、PDF文書をポッドキャストなどの魅力的な音声コンテンツに変換します。大規模言語モデル(LLM)とテキスト読み上げ技術を活用しています。
InternVideo 2.5は、上海人工知能研究所、南京大学、および中国科学院深圳先進技術研究院が共同開発したオープンソースのマルチモーダル動画ビッグデータモデルです。動画理解の分野、特に長尺動画処理において大きな進歩を遂げています。
HumanDiTは、浙江大学とByteDanceが共同で提案した、ポーズ誘導型の高忠実度人物動画生成フレームワークです。拡散変換(DiT)をベースとしており、大規模データセットで学習し、動画を生成できます。
ProtGPS(タンパク質局在予測モデル)は、MITとホワイトヘッド生物医学研究所が開発した深層学習ベースのタンパク質言語モデルです。タンパク質の局在を予測するために使用されます。
potpie.aiは、AI技術を用いてコードベース向けにカスタマイズされたエンジニアリングエージェントを作成するオープンソースプラットフォームです。コードベースから構築されたナレッジグラフに基づき、potpie.aiはコードコンポーネント間の関係性を深く理解し、自動生成を実現します。
MoMaskは、テキスト記述に基づいて高品質な3D人体モーションを生成するために、生成マスキングモデリング技術を使用する革新的な3D人体モーション生成ツールです。MoMaskは階層的な量子化スキームを採用し、人体モーションを複数の離散的なレイヤーとして表現します。
UltraMemは、ByteDanceのDoubao Big Modelチームが提案した、斬新な超疎モデルアーキテクチャであり、推論時に従来のMoEアーキテクチャで発生する高いメモリアクセスコストの問題に対処します。このアーキテクチャは、メモリアクセスと計算効率を最適化することで、推論コストを大幅に削減します。
AxBenchは、スタンフォード大学が開発した言語モデル(LM)制御手法を評価するためのベンチマークフレームワークです。合成データで生成された学習データと評価データに基づいて、概念検出とモデル制御におけるさまざまなモデル制御手法を比較します。
Lumina-Videoは、上海AI研究所と香港中文大学が開発した動画生成フレームワークです。Next-DiTアーキテクチャに基づいており、動画生成の時空間的な複雑さを最適化します。様々なスケールを持つマルチスケールNext-DiTアーキテクチャを採用しています。
Pippoは、Meta Reality Labsが開発した画像から動画を生成するモデルで、1枚の写真から1K解像度のマルチビュー高解像度ポートレート動画を生成できます。このモデルはマルチビュー拡散トランスフォーマーに基づいており、30億枚のポートレート画像で事前学習されています。
Animate Anyone 2は、アリババグループのTongyi Labsが開発した高精細キャラクターアニメーション生成技術です。環境情報を組み合わせることで、よりリアルなキャラクターアニメーションを生成します。従来の方法とは異なり、環境情報を抽出して…
DeepClaudeは、DeepSeek R1とClaudeモデルを深く統合した高性能オープンソースAIツールで、推論、創造性、コード生成機能を兼ね備えています。DeepClaudeは、遅延ゼロの瞬時応答を提供し、...
AuraFusion360は、仮想現実や建築ビジュアライゼーションなどの分野で主に用いられる、360°境界のないシーン復元のための新しい参照ベースの手法です。ガウス散乱で表現された3Dシーンの高品質な復元を実現します。