Nemotron 3 - NVIDIAの最新オープンソースAIモデルシリーズ
Nemotron 3は、NVIDIAの新しいオープンソースモデルシリーズで、Nano、Super、Ultraの3つのサイズが用意されています。これらのモデルは、効率的かつ高精度なマルチインテリジェンスシステムを構築するために設計された、画期的なHybrid Expert(MoE)アーキテクチャを採用しています。
Nemotron 3は、NVIDIAの新しいオープンソースモデルシリーズで、Nano、Super、Ultraの3つのサイズが用意されています。これらのモデルは、効率的かつ高精度なマルチインテリジェンスシステムを構築するために設計された、画期的なHybrid Expert(MoE)アーキテクチャを採用しています。
Banana Slidesは、nano banana proモデルをベースにしたオープンソースのAIプレゼンテーション作成ツールです。ミニマルなデザインと強力なAI機能を備え、高品質なPPTを素早く作成できます。ユーザーは…
Wanxiang 2.6は、Alitongyiが発売した高度なビデオ生成モデルシリーズで、プロの映画・テレビ制作および映像制作向けに設計されています。このモデルはロールプレイング機能をサポートしており、ユーザーは映画のようなビデオを素早く生成できます。
Seedance 1.5 Proは、ByteDanceのSeedチームが開発した、音声と映像が同期したネイティブなマルチモーダル動画生成モデルです。このモデルは、テキストプロンプトに基づいて高品質な動画コンテンツを生成でき、多様な音声や効果音に対応し、複数の言語をカバーしています。
Live Avatarは、アリババが複数の大学と共同で開発したリアルタイムのデジタル人体モデルです。音声と映像を駆動することで、長さ無制限のデジタル人体動画を生成できます。
GPT Image 1.5は、OpenAIの最新の画像生成モデルであり、より強力な指示追従能力と精密な編集機能を備えています。画像全体の整合性を維持しながら、ユーザーの要求に応じて指定された部分のみを変更することが可能です。
LongCat-Video-Avatarは、Meituan LongCatチームが開発した音声駆動型キャラクターアニメーションモデルです。このモデルは、キャラクターのアイデンティティと自然な動きの一貫性を維持しながら、超リアルなリップシンク付き長尺動画を生成できます。LongCat-Video...
MiMo-V2-Flashは、Xiaomiがオープンソース化した高性能言語モデルで、総パラメータ数3090億、アクティベーションパラメータ数150億を誇ります。エージェントAI向けに特別に設計されており、スライディングウィンドウアテンション(SWA)とグローバルアテンションを組み合わせたハイブリッドアテンションアーキテクチャを採用しています。
Molmo 2は、アレン人工知能研究所(Ai2)が開発したオープンソースのビデオ分析モデルで、ビデオの理解、ポインティング、トラッキングに重点を置いています。Qwen 3とOlmoアーキテクチャに基づいており、強力なビデオ分析機能を備え、ビデオの認識、ポインティング、トラッキングを実行できます。
A2UI(Agent-to-User Interface)は、AIとユーザーインターフェース間のインタラクションに使用される、Googleが開発したオープンソースのエージェントベースのインターフェースプロトコルです。A2UIは、AIが生成したJSON記述を使用して、クライアントがインタラクティブなインターフェースをネイティブに、シームレスにレンダリングできるようにします。
HY WorldPlay 1.5は、Tencent Hunyuanチームが開発したオープンソースのリアルタイムインタラクティブワールド生成モデルです。ユーザーはテキストや画像を入力するだけで、キーボードなどを使って独自の仮想世界を素早く作成できます。