SeedVR - 南洋理工大学とByteDanceが共同開発した拡散変換器モデルで、汎用的なビデオ復元を可能にする。
SeedVRは、南洋理工大学とByteDanceが開発した拡散変換モデルであり、高品質な汎用ビデオ復元を実現できます。SeedVRは、導入されたシフトウィンドウ注意機構に基づいており、大きな(64×64)ウィンドウと境界での注意機構を採用しています。
SeedVRは、南洋理工大学とByteDanceが開発した拡散変換モデルであり、高品質な汎用ビデオ復元を実現できます。SeedVRは、導入されたシフトウィンドウ注意機構に基づいており、大きな(64×64)ウィンドウと境界での注意機構を採用しています。
AutoDroid-V2は、清華大学人工知能産業研究所が開発したモバイルGUI自動化スクリプトエージェントです。Small Language Models(SLM)に基づいており、コード生成技術によってデバイス上のGUIエージェントのパフォーマンスを向上させます。AutoDroid...
EnerVerseは、Zhiyuan Roboticsチームが開発したロボット向け初の4Dワールドモデルです。未来の具現化空間を生成することで、ロボットが複雑なタスクを完了できるように導きます。このモデルは、自己回帰拡散モデルとスパースメモリ機構(Spars...)を組み合わせたものです。
Seerは、上海AI研究所、北京大学コンピュータ科学技術学院、北京大学ソフトウェア・マイクロエレクトロニクス学院が共同開発したエンドツーエンドの運用モデルであり、ロボットの視覚予測と動作実行の高度な連携を実現しています。
ArtCrafterは、清華大学、鵬城研究室、およびLenovo Researchが共同開発した、テキストから画像へのスタイル変換フレームワークです。拡散モデルに基づき、スタイル表現、コンテンツの一貫性、出力の多様性といった点で従来の手法の限界を克服しています。
Ingredientsは、複数の本人確認(ID)写真とビデオ拡散トランスフォーマーを組み合わせた、カスタムビデオ作成のための強力なフレームワークです。Ingredientsは、3つのコアモジュールに基づいて高度にカスタマイズされたビデオ作成を可能にします。
MultiBoothは、清華大学深圳国際大学院、Meta、香港科技大学などの機関によって開発された、複数の概念を含む画像生成手法です。テキストからユーザーが指定した複数の概念を含む画像を生成できます。MultiBoothは、以下のような画像を生成します。
Aria-UIは、香港大学とRhymes AIが共同開発した、グラフィカルユーザーインターフェース(GUI)のローカライズタスク向けに設計された大規模なマルチモーダルモデルです。純粋に視覚的なアプローチに基づいており、HTMLやAXTreeなどの補助入力に依存せず、大規模な...
TransPixarは、香港中文大学、Adobe Research、香港科技大学、SmartMooreが共同でオープンソース化した、高度なテキストからビデオへの生成手法です。これは、事前学習済みのRGBビデオモデルを拡張し、透明度情報を含むRGBAビデオを生成します。
STARは、南京大学、ByteDance、西南大学が共同開発した革新的な実世界ビデオ超解像(VSR)フレームワークです。低解像度(LR)ビデオから高解像度(HR)ビデオを生成し、細部を保持することができます。
Wanxiang 2.1は、アリババがリリースしたTongyi Wanxiangのアップグレード版です。独自開発の高効率VAEとDiTアーキテクチャに基づき、時空間コンテキストモデリング機能を強化し、無制限の長さの1080Pビデオの効率的なエンコードとデコードをサポートし、中国語テキストからビデオへの生成を初めて実現しました。
Spark Minutesは、iFlytekが提供する音声・動画処理プラットフォームで、文字起こし、要約、翻訳、分析機能を統合しています。一般会議、インタビュー、営業会議、研修会など、様々な場面で幅広く利用されています。会議の重要な内容を効率的に要約するのに役立ちます。
Hallo3は、復旦大学と百度が共同開発した、拡散変換ネットワーク(DTN)に基づくポートレート画像アニメーション技術であり、非常にダイナミックでリアルな動画を生成できます。Hallo3は…
rStar-Mathは、Microsoft Research Asiaが立ち上げた革新的な研究プロジェクトです。モンテカルロ木探索(MCTS)に基づく深層思考により、小規模言語モデル(SLM)がOpenAIの大規模数学推論能力に匹敵、あるいはそれを凌駕することを可能にします。
Stability AIとイリノイ大学アーバナ・シャンペーン校が開発したSPAR3Dは、1枚の画像から3Dモデルを生成する高度な手法です。1枚の画像から高品質の3Dオブジェクトを効率的に再構築します。SPAR3Dは2段階設計に基づいており、第1段階では…
Search-o1は、中国人民大学と清華大学が開発した革新的なフレームワークで、複雑な問題に直面した際の大規模推論モデル(LRM)の推論能力を向上させることを目的としています。これは、統合エージェント検索強化生成(RAG)メカニズムとReason...に基づいています。
ConceptMasterは、マルチコンセプトビデオのカスタマイズのための革新的なフレームワークです。テスト中に調整を必要とせずに、拡散トランスフォーマーモデル上で高品質でコンセプトに一貫性のあるカスタムビデオを生成します。このフレームワークは、分離された...
SenseTime社は、マルチモーダル大規模モデルであるSenseNovaを2025年1月10日に正式に発表しました。このモデルはネイティブな融合モダリティを実現し、深層推論とマルチモーダル情報処理能力の両方を大幅に向上させています。
Agent Laboratoryは、AMDとジョンズ・ホプキンス大学が共同開発した研究フレームワークであり、大規模言語モデル(LLM)に基づいており、科学的発見の加速、コスト削減、研究品質の向上を目指しています。Agent Laboratoryは、以下の要件を満たしています。
XinYanYiMaは、AIプログラミングアプリケーション開発を専門とする企業で、海外向け製品「The Dark Side of the Moon」の創業者であるMing Chaoping氏によって設立されました。正式名称はShenzhen XinYanYiMa Technology Co., Ltd.で、2024年9月23日に設立され、広東省深圳市に所在しています。
PPTAgentは、中国科学院ソフトウェア研究所の中国情報処理研究所が開発した革新的なフレームワークです。人間のワークフローを模倣した2段階編集方式に基づき、文書から高品質のプレゼンテーションを自動的に生成します。PPTAgentは、文書を分析し、…
HoloDriveは、SenseTimeや上海人工知能研究所などが提案した、自動運転向けの包括的な2D-3Dマルチモーダル街路シーン生成フレームワークです。このフレームワークは、カメラ画像とLiDAR点群を統合的に生成することで、自動運転における2Dシーン生成のギャップを埋めます。
Perception-as-Controlは、Alibaba Tongyi Labsが開発した画像およびアニメーションフレームワークであり、ユーザーの意図に基づいてきめ細かなモーション制御を実現できます。Perception-as-Controlは、3D知覚モーション表現の構築に基づいており、...
Motion Dreamerは、香港科技大学(広州)の研究者らが提案した、自然な動きのある動画を生成する動画生成フレームワークです。2段階の生成方法に基づいており、まず入力画像と動きの条件に基づいて中間的な動きの表現を生成し、次に…