PromptFixは、Microsoftが開発したオープンソースのAI画像編集ツールで、プロンプトを使用して様々な画像処理タスクを実行します。
PromptFixは、Microsoftが開発したオープンソースのAI画像修復ツールです。拡散モデル技術に基づいており、ユーザーの指示に従って損傷した画像を処理し、不要な要素を除去できます。PromptFixは、カラー化を含むさまざまな画像処理タスクをサポートしています。
PromptFixは、Microsoftが開発したオープンソースのAI画像修復ツールです。拡散モデル技術に基づいており、ユーザーの指示に従って損傷した画像を処理し、不要な要素を除去できます。PromptFixは、カラー化を含むさまざまな画像処理タスクをサポートしています。
Show-oは、マルチモーダルな理解と生成を統合した統一型Transformerモデルです。自己回帰モデルと離散拡散モデルを組み合わせることで、視覚的な質問応答、テキストから画像への変換、テキスト誘導による修復と拡張など、さまざまなタスクを柔軟に処理できます。
浙江大学とByteDanceが共同開発したMimicTalkは、NeRF(ニューラル放射場)技術に基づいています。わずか15分で、パーソナライズされた表現力豊かな3D音声顔モデルを学習できます。MimicTalkは、音声認識技術と音声合成技術を組み合わせたものです。
Wonder Animationは、Autodeskの子会社であるWonder Dynamicsが開発した革新的なAI技術です。Wonder Animationのベータ版がWonder Studioで利用可能になりました。Wonder Animationは、ビデオから3Dへの変換をベースとしています。
TimeSuiteは、上海AIラボが開発した新しいフレームワークで、長尺動画理解タスクにおけるマルチモーダル大規模言語モデル(MLLM)の性能を向上させます。効率的な長尺動画処理フレームワークと高品質の動画データセットTimeSuiteを活用しています。
EMMAは、GeminiモデルをベースとしたWaymoのエンドツーエンドのマルチモーダル自動運転モデルです。生のカメラセンサーデータを、計画された軌道、認識された物体、道路地図要素などの運転固有の出力に直接マッピングします。EMMAは、従来とは異なる...
DreamVideo-2は、復旦大学、アリババグループ、その他の機関が共同開発した革新的なゼロサンプル動画カスタマイズフレームワークです。DreamVideo-2は、1枚の画像と一連のバウンディングボックスから、特定のテーマと正確なモーション軌跡を持つ動画を生成できます。
NotebookMLXはNotebookLMのオープンソース版で、NotebookLlamaの機能を統合しています。PDF文書を、理解しやすく共有しやすい音声ポッドキャスト形式に変換できます。このプロジェクトは、MLXテクノロジーに基づいた自然言語処理機能を実装しており、以下のような機能が含まれています。
HOVERはNVIDIAが発表した150万個のパラメータを持つ小型モデルです。正式名称は「Humanoid Versatile Controller」で、人型ロボット向けの多機能全身神経制御コントローラーを意味します。このモデルは150万個のパラメータを用いて複雑なロボット動作を実現します。
Voice Changerは、Cartesiaが開発した新モデルで、あらゆるオーディオクリップの音声を、元の音声の感情や表現を損なうことなく、別の音色に変換できます。ユーザーは、Cartesiaが提供する様々な高品質音声ライブラリから選択できます。
Oasisは、DecartとEtchedが共同開発した、世界初のリアルタイムAI生成ゲームです。このゲームは、ゲームエンジンを使用せずにAIモデルによって直接生成されたインタラクティブなビデオコンテンツを、毎秒20フレームでリアルタイムにレンダリングします。プレイヤーは…
Quark Intelligenceは、Quark Technologiesが開発した、博士号レベルの推論能力を備えた全く新しいインテリジェント学習モデルです。AI技術に基づき、問題の段階的な解説を提供し、いつでも質問に答えることができます。特に大学院入学試験の数学などの問題解決に役立ちます。
OSAID 1.0(オープンソースAI定義 – 1.0)は、AIシステムがオープンソースとなるための条件を明確にするために、オープンソースイニシアティブ(OSI)が発表した公式標準規格です。OSAID 1.0の開発に携わった人々は、
MobileLLMは、10億未満のパラメータを持つ大規模な言語モデルであり、Metaによってモバイルデバイスのユースケース向けに最適化され、クラウドコストの上昇やレイテンシの問題に対処しています。MobileLLMは、ディープシンアーキテクチャ、組み込み共有、およびグループ化されたクエリアテンションメカニズムに基づいています。
SmolLLM2は、Hugging Faceが開発した、デバイス内アプリケーション向けのコンパクトかつ大規模な言語モデルです。1.7B、360M、135Mの3つの異なるパラメータレベルを提供し、さまざまなアプリケーションシナリオとリソース制約に対応します。このモデルの理解は…
Genmoai-smolはオープンソースのビデオ生成モデルで、Genmoaiのtxt2videoモデルをフォークし、メモリ使用量を削減し、リソースが限られたデバイスでもビデオを作成できるように、シングルGPUデバイス向けに最適化されています。このモデルは、高レベルの...
VirSci(Virtual Scientists)は、上海人工知能研究所が開発したマルチエージェントAI科学研究ツールです。科学者チームの共同作業をシミュレートすることで、科学イノベーションを加速させます。このシステムは、大規模言語モデル(LLM)に基づいています。
Self-Lengthenは、アリババのQianwenチームが開発した革新的な反復型トレーニングフレームワークで、大規模言語モデル(LLM)の長文生成能力を向上させます。このフレームワークは、ジェネレーターとエキスパンダーという2つの役割に基づいており、これらが連携して長文を生成します。
Amphionは、香港中文大学深圳校の呉志正准教授率いるチームが、上海人工知能研究所および深圳ビッグデータ研究所と共同で開発したオープンソースの音声、音楽、およびスピーチ生成ツールキットです。このツールキットは、以下の機能をサポートしています。
LongRewardは、清華大学、中国科学院、Zhipu AIが共同開発した手法で、AIフィードバックに基づいて長文テキスト向けの大規模言語モデル(LLM)の性能を向上させることを目的としています。LongRewardは、有用性、論理性、忠実性、完全性などを評価します。
Fish Agentは、FishAudioが開発した革新的なエンドツーエンドの音声処理モデルであり、自動音声認識(ASR)とテキスト音声合成(TTS)技術を統合しています。従来の意味エンコーダー/デコーダーを必要とせずに、音声間処理を実現します。
MeetingMindは、AIを搭載した会議アシスタントで、録音機能とファイルアップロード機能に基づいて会議の音声を自動的に文字起こしし、タスク、決定事項、質問などの重要な情報を抽出することで、ユーザーが会議の内容を簡単に把握・分析し、適切な行動を取れるように支援します。
星辰大規模モデルプラットフォームは、中国電信が立ち上げたAI大規模モデル収集プラットフォームであり、意味論、画像認識、音声認識といったマルチモーダル領域を網羅しています。様々なパラメータレベルのモデルを含み、長文テキスト処理をサポートし、多言語音声認識やマルチタスク機能を備えています。
Fast GraphRAGは、Microsoftが提供する高性能な知識グラフ検索フレームワークであり、解釈可能で高精度なエージェント駆動型検索ワークフローを提供するように設計されています。検索拡張(RAG)テクノロジーと知識グラフを組み合わせることで、大規模な検索のパフォーマンスを向上させます。