SVDQuant - MITが開発した、拡散モデルの学習後量子化手法。
SVDQuantは、MITの研究チームによって開発された、学習後の量子化手法です。拡散モデルの場合、モデルの重みと活性化値を4ビットに量子化することで、メモリ使用量を削減し、推論処理を高速化します。SVDQuantは、高精度低ランク分岐吸収法を導入しています。
SVDQuantは、MITの研究チームによって開発された、学習後の量子化手法です。拡散モデルの場合、モデルの重みと活性化値を4ビットに量子化することで、メモリ使用量を削減し、推論処理を高速化します。SVDQuantは、高精度低ランク分岐吸収法を導入しています。
Meta Motivoは、メタバース体験のリアリティを高めるためにMeta Inc.が開発したAIモデルです。Meta Motivoは、仮想ヒューマノイドAIの全身の動きを制御することで人間の行動をシミュレートし、ユーザーインタラクションを強化します。このモデルは非線形…
Step-1o Audioは、Step-1o Technologyが開発した、中国初の数百億個のパラメータを持つエンドツーエンドの音声モデルです。強力な感情認識機能を備え、ユーザーの声のトーンから感情を正確に識別し、状況に応じて適切な応答を提供します。
360gpt2-o1は、360が独自開発したAIモデルであり、推論能力が大幅に向上し、特に数学的および論理的推論タスクにおいて優れた性能を発揮します。このモデルは、合成データ、ポストトレーニング、および「スローシンキング」パラダイムを通じて最適化されています。
POINTS 1.5は、Tencent WeChatがリリースしたマルチモーダル大規模モデルであり、POINTS 1.0のアップグレード版です。このモデルは、POINTS 1.0のLLaVAアーキテクチャを引き続き使用しており、ビジュアルエンコーダ、プロジェクター、大規模言語で構成されています。
K1ビジュアル思考モデルは、KimiのK1シリーズに属する強化学習AIモデルです。エンドツーエンドの画像理解と思考連鎖技術をネイティブにサポートし、数学にとどまらず、より基礎的な科学分野にもその機能を拡張しています。K1モデルは、画像理解、数学、思考連鎖などの分野で優れた性能を発揮します。
FreeScaleは、南洋理工大学、アリババグループ、復旦大学が開発した推論フレームワークで、微調整を必要とせず、事前学習済みの拡散モデルによる高解像度画像および動画の生成能力を向上させます。FreeScaleは、さまざまな画像を処理および融合することに基づいています。
Freestylerは、西北工業大学コンピュータサイエンス学部の音声・言語処理グループ(ASLP@NPU)、マイクロソフト、香港中文大学深圳研究院ビッグデータ研究所が共同開発したラップ音楽生成モデルです。直接...
SnapGenは、Snap Inc.、香港科技大学、メルボルン大学、およびその他の機関が共同開発したテキストから画像への変換(T2I)拡散モデルです。モバイルデバイス上で高解像度(1024x1024ピクセル)の画像を迅速に生成でき、必要なのは...
CosyVoiceは、アリババ傘下のTongyi Labがオープンソース化した大規模な自然音声合成モデルです。中国語、英語、日本語、広東語、韓国語の5言語に対応しており、わずか3秒から10秒の音声サンプルで、イントネーションや感情表現を含む音色を忠実に再現できます。
Wuwen Chip氏が発表したMegrez-3B-Omniは、画像、音声、テキストデータを処理できる世界初のオープンソースのエッジサイド型フルモーダル理解モデルです。Megrez-3B-Omniは、複数の主要なテストセットにおいて34Bモデルを凌駕する性能を発揮します。
Veo 2は、Google DeepMindが開発したAIビデオ生成モデルで、テキストや画像プロンプトに基づいて高品質なビデオコンテンツを生成できます。Veo 2は最大4K解像度のビデオ制作をサポートし、カメラ制御コマンドを理解し、シミュレートすることができます。
RDT(Robotics Diffusion Transformer)は、清華大学AI研究所のTSAILチームによって開発された、双腕ロボットにおける拡散動作のための世界最大の基礎モデルです。RDTは10億個のパラメータを持ち、人間の介入なしに動作を実行できます。
Apolloは、Metaとスタンフォード大学が共同開発した大規模マルチモーダルモデル(LMM)であり、動画理解に焦点を当てています。体系的な研究に基づき、ApolloはLMMにおける動画理解の主要な推進要因を明らかにし、「スケーリング制約」を導入しています。
BrushEditは、テンセントと北京大学などが共同開発した高度な画像編集フレームワークです。BrushNetモデルの改良版であり、マルチモーダル大規模言語モデル(MLLM)と2分岐画像修復モデルを組み合わせています。
Bocha Semantic Rerankerは、Bocha AIが開発したセマンティックランキングモデルで、検索およびRAGアプリケーションにおける検索結果の精度を向上させます。Bocha Semantic Rerankerモデルはテキストセマンティクスに基づいており、初期ランキングを実行します...
Ruyiは、TuSimple Technology Co., Ltd.が開発した大規模ビデオモデルです。一般消費者向けグラフィックカードでの動作を想定して設計されており、マルチ解像度・マルチ期間のビデオ生成に対応し、ファーストフレーム制御、ファースト&ラストフレーム制御、モーション制御、カメラ移動などの機能を備えています。
大規模アクションモデル(LAM)は、マイクロソフトが大規模アクションモデル向けに開発したフレームワークです。これらは、現実世界のアクションを実行できるインテリジェントシステムであり、従来の大規模言語モデル(LLM)を凌駕します。
Leffa(Learning Flow Fields in Attention)は、Meta AIが開発した、制御可能な人物画像を生成するためのフレームワークです。フローフィールド学習をアテンションメカニズムに組み込むことで、人物の外観と姿勢を正確に制御します。Leffaは…
LatentLMは、Microsoft Researchと清華大学が共同開発したマルチモーダル生成モデルです。テキストなどの離散データと画像や音声などの連続データを均一に処理できます。このモデルは、変分オートエンコーダー(VAE)を使用して連続データを処理します。
Lyraは、香港中文大学、SmartMore、香港科技大学が共同開発した、高性能なマルチモーダル大規模言語モデル(MLLM)です。音声、視覚、言語のモダリティにおける対話機能の強化に重点を置いています。Lyraは、オープンソースの大規模モデルとマルチモーダル技術に基づいています。
Manga Image Translatorは、ワンクリックで漫画や画像内のテキストを翻訳できるオープンソースの漫画画像テキスト翻訳ツールです。Manga Image TranslatorはOCR技術を使用してテキストを認識し、機械翻訳と組み合わせてテキストを変換します。
Ivy-VLは、AI Safeguardがカーネギーメロン大学およびスタンフォード大学と共同開発した軽量マルチモーダルAIモデルで、モバイルデバイスおよびエッジデバイス向けに特化して設計されています。このモデルは30億個のパラメータを持ち、他の大規模マルチモーダルモデルと比較してサイズを大幅に削減しています。
ColorFlowは、清華大学とテンセントARCラボが共同開発した画像シーケンスカラー化モデルです。シーケンス内の個々の人物のアイデンティティを高い精度で保持しながら、画像をカラー化することができます。検索強化、コンテキスト学習、超解像技術に基づいています。