ShotAdapter - AdobeとUIUCが共同開発したマルチレンズビデオ生成フレームワーク
ShotAdapterは、AdobeがUIUCと共同開発した、テキストからマルチカメラビデオを生成するためのフレームワークです。高度に調整された事前学習済みのテキストビデオモデルに基づいており、トランジションマーカーとローカルアテンションマスキング戦略を導入することで、マルチカメラビデオを実現します。
ShotAdapterは、AdobeがUIUCと共同開発した、テキストからマルチカメラビデオを生成するためのフレームワークです。高度に調整された事前学習済みのテキストビデオモデルに基づいており、トランジションマーカーとローカルアテンションマスキング戦略を導入することで、マルチカメラビデオを実現します。
Index-AniSoraは、Bilibiliがオープンソース化した高度なアニメ動画生成モデルです。このモデルは、アニメクリップ、国産アニメ、VTuberコンテンツなど、さまざまなアニメスタイルの動画をワンクリックで生成できます。モデルには1000万以上の動画が含まれています。
LightLabは、Googleなどが開発した拡散モデルに基づく画像光源制御モデルです。単一画像内の光源をきめ細かくパラメータ制御できます。ユーザーは光源の強度や色を調整したり、仮想光源を挿入したりすることができます。
WorldPM(World Preference Modeling)は、アリババグループのQwenチームと復旦大学が開発した一連の選好モデリングモデルです。大規模なトレーニングを通じて選好モデルのスケーラビリティを明らかにします。このモデルは1500万件のデータに基づいています。
SketchVideoは、中国科学院大学、香港科技大学、およびKuaishou Kelingチームによって開発された、スケッチベースのビデオ生成および編集フレームワークです。ユーザーはキーフレーム上にスケッチを描き、テキストプロンプトと組み合わせることで、ビデオの空間レイアウトを実現できます。
Custom-SVGは、Adobeと香港城市大学が共同開発した2段階のSVGカスタマイズフレームワークです。テキストプロンプトに基づいてカスタマイズされたスタイルを持つ高品質のSVGグラフィックを生成します。このフレームワークは、2段階の生成ワークフローを導入しています...
YuLan-OneSimは、中国人民大学高陵AI研究所のRUC-GSAIチームが開発した新しいタイプのソーシャルシミュレーターです。大規模言語モデル(LLM)エージェントに基づいており、モデル構築のためのプログラミングを必要とせずに人間の社会的行動をシミュレートします。
MathModelAgentは、数理モデリング専用に設計されたエージェントであり、問題分析から論文作成までの全プロセスを自動化できます。マルチエージェント連携に基づいて、数理モデルの構築、コードの記述、結果の検証、フォーマット済みドキュメントの生成を自動的に行います。
Steamer-I2Vは、BaiduのSteamerチームが開発した画像から動画への生成モデルです。静止画像を動画に変換することで、卓越した映像生成能力を発揮します。このモデルは、国際的に認知されている動画生成ベンチマークであるVBenchで高いスコアを獲得しています。
ScaleMCPは、PwCが開発したツール選択手法であり、大規模言語モデル(LLM)エージェントにモデルコンテキストプロトコル(MCP)ツールを動的に装備させるものです。これは、自動的に同期されるツールストレージシステムとMCPサーバーに基づいています。
WeCloneは、チャットログからデジタルアバターを作成するためのワンストップソリューションです。大規模言語モデル(LLM)のチャットログに基づく微調整により、モデルに特定のスタイルを与え、WeChat、QQ、Telegramなどのチャットボットに連携させます。
Agent Squadは、複数のAIエージェントを連携させて複雑な対話を処理するための、軽量でオープンソースのマルチエージェントフレームワークです。Agent SquadはPythonとTypeScriptの両方をサポートし、ユーザー入力に基づいてデータを動的にルーティングします。
Magentic-UIは、人間参加型AIエージェントシステムを研究するためにMicrosoftが開発したオープンソースの研究プロトタイプです。Magentic-UIは、ユーザーと協力してブラウジングなどの複雑なWebタスクを完了できる、人間中心のAIエージェントです。
EvoAgentXは、進化アルゴリズムを用いてマルチエージェントシステムの生成と最適化を自動化するオープンソースのAIエージェント自己進化フレームワークです。ターゲット記述に基づいてワークフローを自動的に生成し、反復的な最適化によってパフォーマンスを向上させることができます。
NLWebは、Microsoftが立ち上げたオープンソースプロジェクトで、ウェブサイトの自然言語インターフェースの作成を簡素化し、あらゆるウェブサイトをAI駆動型アプリケーションにすることを可能にします。NLWebは、Schema.orgやRSSなどの半構造化データとLLMを組み合わせて使用します。
Doubao Voice Podcast Modelは、ByteDanceの子会社であるVolcano Engineが開発した音声ポッドキャストモデルです。ストリーミングモデルに基づいており、テキストを数秒で2人対話型のポッドキャストに変換できます。低コスト、高効率、そして高いインタラクティブ性を特長としています。
Veo 3は、Google I/Oで発表された次世代動画生成モデルです。Veo 3は、動画の背景効果音を生成できるGoogle初のモデルです。鳥のさえずりや街の交通音など、シーンに合わせて画像を合成し、対応する効果音を追加することができます。
II-Agentは、大規模言語モデル(LLM)と連携することで、複数のドメインにわたるワークフローを簡素化・強化するオープンソースのエージェントフレームワークです。調査・事実確認、コンテンツ生成、データ分析など、いくつかの主要な機能を備えています。
News Agentsは、端末ベースのニュース集約・要約システムです。エージェントフレームワークとしてAmazon Q CLIを使用し、RSSニュースソースの解析にはModel Context Protocol(MCP)を採用、端末のセグメンテーションとマルチタスク処理にはtmuxを活用しています。
Imagen 4は、Googleの最新の画像生成AIモデルです。最大2K解像度の画像生成をサポートし、リアルなディテールを実現するとともに、複雑な布地の質感、水滴の屈折、動物の毛皮の質感などを鮮明にレンダリングします。テキストレンダリングに関しては…
Pixel3DMMは、ミュンヘン工科大学、ユニバーシティ・カレッジ・ロンドン、およびSynthesiaが共同開発した、単一画像からの3D顔再構成フレームワークです。DINOモデルをベースに、このフレームワークは、単一のRGB画像から顔を正確に再構成するための特殊な予測ヘッドを導入しています。
AutoBEは、ユーザーが記述した要件に基づいて高品質なバックエンドコードを自動生成する、AI駆動型のバックエンドサーバーコード生成ツールです。TypeScript、NestJS、Prisma、Postgresなどの技術スタック上に構築されており、...
Gemma 3nは、Google I/Oで発表されたエッジベースのマルチモーダルAIモデルです。Gemini Nanoアーキテクチャをベースに、レイヤーごとの埋め込み技術を採用することで、メモリ使用量を2~4Bパラメータモデルのレベルまで圧縮しています。モデルパラメータの数は...
BAGELはByteDanceが開発したオープンソースのマルチモーダルベースモデルで、140億個のパラメータを持ち、そのうち70億個がアクティブです。ハイブリッドトランスフォーマーエキスパート(MoT)アーキテクチャを採用し、2つの独立したエンコーダを通して画像のピクセルレベルおよび意味的パラメータをキャプチャします。