FlowDirector - 西湖大学と中南大学が共同開発した動画編集フレームワーク
FlowDirectorは、西湖大学のAGI Labチームが中南大学と共同で開発した、トレーニング不要の革新的なビデオ編集フレームワークです。自然言語による指示に基づいてビデオコンテンツを正確に編集するために特別に設計されています。このフレームワークは直接...
FlowDirectorは、西湖大学のAGI Labチームが中南大学と共同で開発した、トレーニング不要の革新的なビデオ編集フレームワークです。自然言語による指示に基づいてビデオコンテンツを正確に編集するために特別に設計されています。このフレームワークは直接...
DreamActor-H1は、ByteDanceが開発したDiffusion Transformer(DiT)モデルに基づくフレームワークです。人物と製品のペア画像から、高品質な人物ベースの製品デモンストレーションビデオを生成する機能をサポートしています。このフレームワークは、人物を...
Kimi-Devは、Moonshot AIが開発したオープンソースモデルで、ソフトウェアエンジニアリングタスク向けに特別に設計されています。このモデルは72バイトのパラメータを持ち、最新のDeepSeek-R1と比較して優れたプログラミング機能を誇り、クローズドソースモデルと比較しても非常に優れたパフォーマンスを発揮します。S...
ThinkChainは、AIツールのインテリジェントなインタラクション機能を強化するオープンソースフレームワークです。このフレームワークは、ツールの実行結果をAI(Claudeなど)の思考プロセスにリアルタイムでフィードバックし、AIがツールを呼び出し、さらに…といった動的なフィードバックループを形成します。
Office-PowerPoint-MCP-Serverは、モデルコンテキストプロトコル(MCP)に基づいたオープンソースツールで、プレゼンテーションの自動作成と編集のために特別に設計されています。このツールは、PowerPointを実装するためにpython-pptxライブラリを使用しています。
MeWM(Medical World Model)は、香港科技大学(広州)などの機関が提唱した革新的な医療モデルであり、疾患の動態をシミュレーションすることで臨床意思決定を支援することを目的としています。MeWMは、戦略モデル、動的モデル、および逆動的モデルから構成されています。
Skywork-SWE-32Bは、Kunlun Wanweiによって開発された、ソフトウェアエンジニアリング(SWE)向けのオープンソースの32ビット自律型コードエージェント基盤モデルです。このモデルは、ソフトウェアエンジニアリングのタスク、特にリポジトリレベルのコード修復機能に重点を置いており、複数ターンのやり取りや長文のコードを処理できます。
Self Forcingは、Adobe Researchとテキサス大学オースティン校が共同開発した、斬新な自己回帰型動画生成アルゴリズムです。従来の生成モデルにおけるトレーニング時とテスト時の露出バイアス問題を解決します。トレーニングを通じて…
SongGenerationは、Tencent AI Labが開発した大規模なAI音楽生成モデルです。このモデルは、音質、音楽性、生成速度など、AI音楽生成分野における主要な課題に取り組んでいます。SongGenerationは、LLM-DiT融合アーキテクチャに基づいています。
OneRecは、Kuaishouが新たに開発したエンドツーエンドの生成型推薦システムです。エンコーダー・デコーダーアーキテクチャを採用し、スパースなMixture-of-Experts(MoE)技術を活用することで、高い計算性能を維持しながらモデル容量を向上させています。従来のシステムと比較して…
Kimi-Researcherは、KimiがDark Side of the Moonの下で開発した次世代エージェントモデルで、エンドツーエンドのエージェント型強化学習(RL)技術を用いてトレーニングされており、特に深層研究タスク向けに設計されています。これは…
Pangu Model 5.5は、ファーウェイの最新世代の大規模人工知能モデルであり、同社の開発者会議(HDC 2025)で発表されました。このモデルは「詩作ではなく、行動する」ことを重視し、現実世界の産業課題の解決と、様々な産業のインテリジェント化の推進に焦点を当てています。
Stream-Omniは、GPT-4oに類似した大規模な言語、画像、音声処理プラットフォームであり、中国科学院計算技術研究所のインテリジェント情報処理重点実験室、中国科学院人工知能セキュリティ重点実験室、および中国科学院大学が共同で開発したものです。
MindOmniは、Tencent ARC Labが清華大学深圳国際大学院、香港中文大学、香港大学と共同で開発したマルチモーダル大規模言語モデルです。強化学習アルゴリズム(RGPO)に基づいており、視覚言語モデルを大幅に改善します。
Yuanzhi Medical Big Modelは、United Imaging Intelligenceが医療分野向けに開発したマルチモーダル人工知能モデルです。テキスト、画像、画像認識、音声など、複数のモーダルデータを統合することで、医療現場における高度なインテリジェントソリューションを提供します。
RAG-Anythingは、香港大学データインテリジェンス研究所が開発したオープンソースのマルチモーダルRAGシステムです。このシステムは、テキスト、画像、表、数式を含む複雑な文書の処理をサポートし、文書の取り込みからインテリジェントなクエリまで、エンドツーエンドのソリューションを提供します。
Dive3Dは、北京大学と小紅書(小紅書)の共同開発によるテキストから3Dへの生成フレームワークです。このフレームワークは、従来のKLダイバージェンス目的関数の代わりにスコア暗黙的マッチング(SIM)損失関数を使用することで、パターン崩壊を効果的に回避しています。
PreenCutは、高精度な音声文字起こしにWhisperXを使用し、DeepSeekとDoubaoのAPIを組み合わせることで意味検索とインテリジェントな編集機能を提供するオープンソースのAIビデオ編集ツールです。このツールは、自動音声文字起こし、AIによるインテリジェントなセグメンテーションなど、さまざまな機能を備えています。
Lingshuは、Alibaba DAMO Academyが開発した、医療分野に特化した大規模なマルチモーダル言語モデルです。このモデルは、X線、CTスキャン、MRIなど12種類以上の医用画像モダリティをサポートし、マルチモーダル質問応答、テキストベースの質問応答、医療関連の質問応答などに優れています。
Ring-liteは、AntTechが開発したMoEアーキテクチャに基づく軽量推論モデルです。このモデルはLing-lite-1.5をベースにしており、独自のC3PO強化学習トレーニング手法を採用することで、複数の推論ベンチマークにおいて高いパフォーマンスを実現しています。
PosterCraftは、香港科技大学(広州)や美団などが共同開発した、高品質で美的に優れたポスターを作成するための統合フレームワークです。このフレームワークは、モジュール式のデザインプロセスや固定された事前定義レイアウトを廃止し、モデルの自由な探索と一貫性をサポートします。
Confucius3-Mathは、NetEase Youdaoが提供する大規模オープンソースモデル「Confucius Says 3」シリーズの数学モデルです。中国で初めて数学教育に特化したオープンソース推論モデルであり、140億個のパラメータを持ち、K-12(幼稚園から高校まで)の数学教育シナリオに最適化されています。
Hunyuan-GameCraftは、TencentのHunyuanチームと華中科技大学が共同開発した、高ダイナミックレンジのインタラクティブゲームビデオ生成フレームワークです。キーボードとマウスの入力を共有カメラ表現空間に統合することで、きめ細かな表現を実現します。
ImmerseGenは、ByteDanceのPICOチームと浙江大学が共同開発した革新的な3Dワールド生成フレームワークです。ユーザーが入力したテキストプロンプトとエージェントが誘導するアセットのデザインと配置に基づいて、アルファテクスチャを備えたワールドを生成します。