TrackGo - 高度な制御が可能なAIビデオ生成技術
TrackGoは、高度な制御可能なAIビデオ生成技術であり、自由形状のマスクと矢印を使用してビデオ内のオブジェクトの動きを柔軟かつ正確に制御するメカニズムをユーザーに提供します。この技術の中核はTrackAdapterです。
TrackGoは、高度な制御可能なAIビデオ生成技術であり、自由形状のマスクと矢印を使用してビデオ内のオブジェクトの動きを柔軟かつ正確に制御するメカニズムをユーザーに提供します。この技術の中核はTrackAdapterです。
GPT Pilotは、人間の開発者のワークフローを模倣することで、アプリケーションをゼロから構築するのに役立つAIプログラミングツールです。ユーザーはコードを記述し、プログラムをデバッグし、ユーザーと問題について話し合い、コードレビューを依頼することができます。これはまさに...
GaussianEditorは、ガウススプラッティングに基づいた3D編集アルゴリズムであり、ユーザーが3Dシーンを迅速かつ正確に修正することを可能にします。ガウスセマンティックトラッキングと階層型ガウススプラッティングにより、高度な編集機能を提供します。
Seed-ASRは、ByteDanceが大規模言語モデル(LLM)に基づいて開発したASR(自動音声認識)モデルです。2,000万時間以上の音声データと約90万時間のペアASRデータで学習されており、中国語(北京語)と13言語に対応しています。
mPLUG-Owl3は、アリババが開発した高度な汎用マルチモーダル大規模モデルで、複数の画像ファイルや長時間の動画ファイルの理解と処理に特化して設計されています。精度を維持しながら推論効率を大幅に向上させ、2時間の動画をわずか4秒で分析することが可能です。
Moffeeは、Markdown構文を使用してプロフェッショナルなプレゼンテーションを素早く作成できるオープンソースのMarkdownからPowerPointへの変換ツールです。Moffeeはレイアウト、ページネーション、スタイルを自動的に処理し、リアルタイムプレビューとPDFまたはHTML形式へのエクスポートをサポートしています。
Lingoは、Westlake Xinchenが中国で初めて発表したエンドツーエンドの大規模音声モデルです。技術的には、リアルタイムでの割り込み、リアルタイムでのコマンド制御、超人間的な音声表現、歌唱や会話といった機能を備えています。中国語の音声表現はGPT-4oよりも優れています。
ShanHai Big Modelは、Unisoundが開発したマルチモーダルAIビッグモデルであり、豊富な知識リザーブとマルチモーダルなインタラクション機能を備えています。ShanHai Big Modelは、テキスト、音声、画像など様々な形式を通してユーザーとリアルタイムで対話し、情報を提供します。
AIEditorは、AI向けに設計された次世代リッチテキストエディタです。Web Componentsに基づいて開発されたAIEditorは、Layui、Vue、React、Angular、Svelteなど、ほぼすべてのフロントエンドフレームワークをサポートしています。AIEditorは、以下のフレームワークと互換性があります。
Omagesは、画像拡散技術を用いて3D形状の幾何学的情報とテクスチャ情報を64x64ピクセルの2D画像にエンコードすることで、3Dモデリングプロセスを簡素化するオープンソースの3Dモデル生成プロジェクトです。
Puyu Lingbi IXC-2.5は、上海人工知能研究所が開発した新世代のマルチモーダル大規模モデルです。7バイトの大規模言語モデルバックエンドを搭載し、最大96KBの長文コンテキストを処理でき、超高解像度画像や高精細ビデオにも対応しています。
GLM-4-Flashは、Zhipu AIが初めてリリースした無料の大規模モデルAPIです。GLM-4-Flashは、複数ターン対話と多言語処理をサポートするだけでなく、Webブラウジングやコード実行などの高度な機能も備えています。開発者や企業は、Zhipu AIを利用して…
AgentGenは、香港大学とマイクロソフトが共同で立ち上げたAIプロジェクトフレームワークです。多様な環境とタスクを自動生成することで、大規模言語モデル(LLM)のプランニング能力を大幅に向上させます。AgentGenはBI-EVOLメソッドを利用して、挑戦的な環境とタスクを生成します。
MotionGenは、MotionGen Technology社が開発した3Dモーション生成モデルです。大規模モデル、物理シミュレーション、強化学習アルゴリズムを組み合わせることで、シンプルなテキストコマンドのみを使用して、リアルで滑らかな3Dモーションを素早く生成できます。MotionGenは…
NewOne VideoのBig Modelは、NewOne Technologyが開発したAI動画制作ビッグモデルです。独自開発のAIアルゴリズムとディープラーニング技術を活用し、スクリプト作成から完成品までワンクリックで制作できます。スクリプト生成、感情豊かな音声合成、3D要素作成などの機能を備えています。
Google初のAIゲームエンジンであるGameNGenは、DOOMのリアルなゲーム映像を毎秒20フレームでリアルタイムに生成することができ、プレイヤーの60%にとって現実と見分けがつかないほどだ。GameNGenは、ゲーム開発がもはや従来の手法を必要としなくなる可能性を示唆している。
GLM-4-Plusは、Zhipu AIの最新ハイインテリジェンスフラッグシップモデルであり、言語理解と長文処理において画期的な進歩を遂げています。PPOなどの革新的な技術を採用することで、推論能力と指示理解能力を大幅に向上させています。GLM-4-Plusは、いくつかの重要な分野で優れた性能を発揮します。
Shusheng Puyuは、上海人工知能研究所が開発したオープンソースのAIモデルで、卓越した推論能力と非常に長いテキストを処理する能力を誇ります。Shusheng Puyuは最大100万語のテキスト入力をサポートし、自律的にウェブ検索を実行できます。
CogView-3-Plusは、Zhipu AIが開発した最新のAIテキスト画像生成モデルです。従来のUNetではなくTransformerアーキテクチャを採用し、拡散モデルにおけるノイズプランニングを最適化しています。CogView-3-Plusは画像生成において非常に優れた性能を発揮し、…
GLM-4V-Plusは、Zhipu AIが開発した最新のマルチモーダルAIモデルで、画像と動画の理解に重点を置いています。GLM-4V-Plusは、静止画像を正確に分析できるだけでなく、動的な動画コンテンツの時間的認識と理解能力も備えており、キャプチャと...
MetaHuman-Streamは、ERNerf、MuseTalk、Wav2lipなどの複数の高度なモデルを統合した、最先端のリアルタイムインタラクティブストリーミングAIデジタルヒューマン技術です。音声クローニングとディープラーニングアルゴリズムをサポートし、スムーズで自然な対話を実現します。
Qwen2-VLは、Alibaba DAMO Academyが開発したオープンソースのビジュアルマルチモーダルAIモデルで、高度な画像および動画理解能力を備えています。Qwen2-VLは多言語に対応し、様々な解像度やアスペクト比の画像を処理でき、動的な動画をリアルタイムで分析できます。
ProPainterは、南洋理工大学のS-Labチームが開発したAIビデオ復元プロジェクトです。デュアルドメイン伝播とマスク誘導型スパースビデオトランスフォーマーを組み合わせることで、ビデオ復元の性能を効果的に向上させます。ProPainterは自動的に...
auto-video-generatorは、AIを搭載した自動ナレーション動画生成ツールで、ワンクリックでナレーション動画を生成できます。ユーザーはトピックを入力するだけで、システムが自動的にスクリプトを作成し、音声合成を行い、画像を生成して動画に統合します。これにより、動画制作の効率が大幅に向上します。