Llama 3.1 - Metaの最新かつ最も強力なオープンソースAIモデル
Llama 3.1はMetaの最新オープンソースAIモデルで、8B、70B、405Bの3つのバージョンがあります。4050億個のパラメータを持つバージョン405Bは、現在利用可能なオープンソースモデルの中で最大規模の一つです。Llama 3.1は128Kのコンテキスト長をサポートしています。
Llama 3.1はMetaの最新オープンソースAIモデルで、8B、70B、405Bの3つのバージョンがあります。4050億個のパラメータを持つバージョン405Bは、現在利用可能なオープンソースモデルの中で最大規模の一つです。Llama 3.1は128Kのコンテキスト長をサポートしています。
GPT-4o Long Outputモデルは、OpenAIの最新の超長文出力AIモデルで、最大64,000トークン(小説約200ページ分に相当)のテキスト出力をサポートしています。オリジナルのGPT-4oモデルと比較すると、出力能力は16倍向上していますが、…
MindSearchは、上海人工知能研究所の共同研究チームによって開発されたオープンソースのAI検索フレームワークです。大規模な情報収集と処理機能を兼ね備えています。InternLM2.5 7B対話モデルを利用することで、MindSearchは以下のようなデータを取得できます。
Diffreeは、OpenGVLabが開発したAIテクスチャマッピングフレームワークです。画像内の適切な位置を自動的に検出し、ユーザーのテキスト記述に基づいて新しいオブジェクトを追加します。インテリジェントなマスク予測により、手動で描画することなく新しいオブジェクトの位置を決定します。
FLUX.1は、Stable Diffusionの創設チームによって開発されたオープンソースのAI画像生成モデルです。120億個のパラメータを持つ、現在までに最大のテキストから画像への生成モデルです。FLUX.1には、最高性能のFLUX.1 [pro]、オープンソースの非商用版、そして...の3つのバリアントがあります。
Stable Fast 3D (SF3D) は、Stability AI が開発した革新的な 3D メッシュ再構築技術で、1 枚の画像から 0.5 秒で高品質の 3D モデルを生成できます。Stable Fast 3D は、高度な Transformer ネットワークを利用しています。
Toraは、アリババが開発したAIビデオ生成フレームワークです。軌道誘導拡散トランスフォーマー(DiT)技術に基づき、テキスト、視覚情報、軌道条件を融合して、物理世界のダイナミクスに適合する高品質なビデオコンテンツを生成します。Toraは軌道…
Whisper-Medusaは、aiOlaが開発したオープンソースのAI音声認識モデルです。OpenAIのWhisperテクノロジーとaiOlaのイノベーションを組み合わせたWhisper-Medusaは、マルチヘッドアテンションメカニズムを導入し、並列処理を可能にして、大幅な改善を実現しています。
FoleyCrafterは、上海人工知能研究所と香港中文大学深圳校が共同開発したAIビデオ吹き替えフレームワークです。FoleyCrafterは、ビデオ内の動作を自動的に検出し、適切な効果音を追加できます。
MinerUは、上海人工知能研究所のOpenDataLabチームが開発したオープンソースのインテリジェントデータ抽出ツールです。複雑なPDF文書の効率的な解析と抽出に特化しています。MinerUは、画像、数式、表、その他の要素を含むマルチモーダルPDF文書からデータを抽出できます。
CogVideoXは、Zhipu AIが開発した最新のオープンソースAI動画生成モデルで、Zhipu AIの商用製品「Qingying」と同じルーツを持っています。CogVideoXは英語のプロンプトに対応しており、720×480の解像度で毎秒8フレームの6秒間の動画を生成できます。
PhotoMaker V2は、テンセントが開発したAI画像生成フレームワークで、非常に短時間でリアルなポートレート写真を生成できます。初代モデルと比較して、バージョンV2ではキャラクターの一貫性と制御性が大幅に向上し、ユーザーは…
SEED-Storyは、テンセントが香港科技大学および香港中文大学と共同開発したマルチモーダルストーリー生成モデルです。マルチモーダル大規模言語モデル(MLLM)に基づいており、テキストトークンとビジュアルトークンを予測し、ビジュアルデトークナイザーを通してストーリーを生成します。
FlashFaceは、アリババが香港大学と共同開発した高精度AIポートレートツールです。ユーザーが提供した顔画像とテキスト入力に基づいて、パーソナライズされた高精度のポートレート写真を迅速に生成できます。FlashFaceは高精度の本人確認機能を備えています。
EasyAnimateは、アリババが開発したAI動画生成ツールで、テキストベースと画像ベースの両方の動画生成に対応しています。ユーザーは動画の開始フレームと終了フレームとして画像をアップロードできるため、より柔軟な動画編集が可能になります。EasyAnimateは…
EmoTalk3Dは、ファーウェイ・ノアズアーク研究所、南京大学、復旦大学が共同開発した3Dデジタルヒューマンフレームワークです。そのコア技術は、豊かな感情表現を持つ3D会話アバターを合成する能力にあります。EmoTalk3Dは、キャプチャと再現が可能で、…
SAM 2(Segment Anything Model 2)は、Meta社が開発したAIオブジェクトセグメンテーションモデルで、リアルタイムの画像および動画オブジェクトセグメンテーションに特化しています。ゼロショット汎化機能を備え、未知のオブジェクトを正確にセグメント化し、統一されたアーキテクチャを採用しています。
Wordwareは、日常的な言語を使って誰でも複雑なAIエージェントやアプリケーションを構築できる統合開発環境(IDE)です。ユーザーはプログラミングの知識がなくても、あらかじめ用意されたツールやモデルを使って、カスタマイズされたアプリケーションを迅速に開発できます。
Qwen2-Mathは、アリババの同義千文プラットフォームが開発し、Qwen2言語モデルを基盤とした、数学的問題を解決するためのオープンソースAIモデルです。複雑な数学的問題を解決するために特別に設計されています。専用の数学コーパスで事前学習を行い、指示に基づいて微調整を行った後、以下の性能を発揮します。
Aideは、コードコメント、言語変換、スマートペースト、バッチ処理、変数命名、カスタムコマンドなどの機能を備えた、無料のオープンソースAIプログラミングプラグインです。開発者がコードを迅速に理解、記述、リファクタリングするのに役立ちます。Aideは以下をサポートしています...
MaxKBは、Feizhi Cloudが提供するオープンソースのAI知識ベース質問応答システムです。ドキュメントアップロード、オンラインドキュメントクローリング、自動テキスト分割、ベクトル化などの機能をすぐに利用できます。ユーザーはMaxKBをサードパーティのビジネスシステムに簡単に組み込むことができます。
ExAvatarは、DGISTとMetaのCodec Avatars Labが共同開発した3Dデジタルアバター生成モデルです。短い動画から人物画像をクローンし、3Dデジタルアバターに変換します。スマートフォンのスキャン機能に対応しており、全身の動きや表情を素早く捉えることができます。
Tailorは、顔認識や音声認識などのインテリジェント技術を統合した、無料のオープンソースAI動画編集ツールです。動画編集、生成、最適化という3つの主要機能を提供し、顔編集、音声編集、ナレーション生成、字幕作成などを行うことができます。
StableDragは、テンセントが南京大学と共同開発したAI画像編集フレームワークです。まるで画像に高精度GPSを搭載するように、画像のドラッグ操作を安定かつ正確に行うことができます。どんな調整をしたい場合でも、StableDragは正確な操作をサポートします。