Keling 2.6が遂にリリースされました!映像とサウンドを体感してください!
Keling 2.6が正式リリースされました。初の「音声・映像同時生成」モデルを搭載し、映像、自然な音声、効果音、環境音を単一の出力で生成できます。テキストベースの音声・映像と画像ベースの音声・映像の2つの生成パスに対応しており、モノローグ、ナレーション、複数人による対話、音楽演奏、創作シナリオなど、様々な用途に適しています。
Keling 2.6が正式リリースされました。初の「音声・映像同時生成」モデルを搭載し、映像、自然な音声、効果音、環境音を単一の出力で生成できます。テキストベースの音声・映像と画像ベースの音声・映像の2つの生成パスに対応しており、モノローグ、ナレーション、複数人による対話、音楽演奏、創作シナリオなど、様々な用途に適しています。
小紅書は上海盛東世章科技有限公司を買収し、同社のAI検索製品「点点(DianDian)」をグループのエコシステムに正式に統合しました。この買収により、小紅書のAI検索機能が強化され、コンテンツeコマースにおける競争力が向上します。買収後、小紅書はAI戦略の実施を加速させ、バイトダンスやアリババといった巨大企業との競争に対抗し、ユーザー行動経路を最適化し、コンテンツエコシステムを強化していく予定です。
国産の最先端画像モデル「Seedream 4.5」が、LiblibAIプラットフォーム上で正式にリリースされました。バージョン4.0と比較して、新モデルは一貫性の維持、正確なテキスト/レイアウトレンダリング、複数画像参照生成、リアルなテクスチャシミュレーションといった機能が大幅に向上しています。特に中国語のポスターや販促資料などのローカライズされたコンテンツの処理に優れており、10枚以上の参照画像の融合にも対応しています。
SenseTimeは、南洋理工大学との共同研究により、世界初のネイティブマルチモーダルアーキテクチャであるNEOを発表しました。これは、「ビジュアルエンコーダー+プロジェクター+言語モデル」という従来のパッチワーク型パラダイムを打破するものです。このアーキテクチャは、ネイティブタイル埋め込み、3D回転位置エンコーディング、ネイティブマルチヘッドアテンションという3つの主要なイノベーションを通じて、視覚と言語の深い統合を実現しています。
AWS re:Invent カンファレンスで、Amazon Web Services は 10 項目の主要な AI アップデートを発表しました。自社開発の AI チップ Trainium4 (パフォーマンスが 6 倍向上) と Trainium3 サーバーのリリース、第 2 世代の大型モデル Amazon Nova 2 シリーズ (Lite、Pro、Sonic、Omni) が多くの主流モデルを凌駕するパフォーマンスを発揮、Alibaba、Kimi などの中国企業によるモデルを含む 18 のオープンソースモデルが Bedrock プラットフォームに追加、エンタープライズレベルの AI アプリケーションを強化するための AgentCore 開発ツールと 4 つのインテリジェント エージェント (自律プログラミングやセキュリティ運用など) のリリースです。
Anthropicは、人気のJavaScriptツールチェーン企業であるBunを非公開の金額で買収したことを発表しました。Bunの創設者であるJarred Sumner氏は、BunのツールがClaude CodeなどのAIプログラミング製品で広く使用されていることから、Anthropicに加わりました。Sumner氏は、AIプログラミング分野におけるAnthropicの将来性に明るい見通しを持っています。今回の買収により、Bunの高性能ランタイムとパッケージング技術がClaude Codeおよび将来のAIツールに深く統合され、パフォーマンスと配信効率が向上します。Bunは引き続きオープンソースとして、独自開発を継続します。
Mistral AIは、Apache 2.0オープンソースライセンスの下で、新世代のMistral 3モデルをリリースしました。このシリーズには、675パラメータのMistral Large 3ハイブリッドエキスパートモデルと、14パラメータ、8パラメータ、3パラメータのMistral 3エッジモデルが含まれています。3000個のH200 GPUでトレーニングされたLarge 3は、画像認識能力を備え、LMARaenaオープンソースモデルの中で2位にランクされています。
PixVerseは、動画生成モデル「PixVerse V5.5」をリリースし、国内初となる絵コンテと音声の同時生成技術を実現しました。このモデルは「ディレクターレベル」の知能を備え、ワンクリックで5秒、8秒、10秒のマルチショット構成のナラティブユニットを生成し、ロングショット、ミディアムショット、クローズアップ間の自然なトランジションを自動的に実現します。その革新性は、人間の声、環境音、感情表現の吹き替えを同時に生成することで、キャラクターの口の動きと音声の完璧な同期を保証する点にあります。
NVIDIAは、自動運転システム向けのビジョン・言語・アクションモデルであるAlpamayo-R1をリリースしました。このモデルは、因果推論機能を実現します。従来のエンドツーエンドシステムがロングテールシナリオで抱える限界を克服するため、「因果連鎖」データセットを用いて、車両が単にコマンドを実行するのではなく、「なぜこのように走行するのか」を理解できるように支援します。主なイノベーションとして、構造化された因果アノテーションシステム、拡散ベースの軌跡デコーダ、およびマルチステージトレーニング戦略の3つが挙げられます。
Runwayは、匿名ユーザー「Whisper Thunder(別名)David」名義で人工知能分析ランキングのトップに立った動画生成モデル「Gen-4.5」を正式にリリースしました。Gen-4.5は、動きのクオリティ、キューワードの忠実度、視覚的なリアリズムにおいて新たな基準を打ち立て、ELOスコア1247を達成。Veo 3/3.1、Kling 2.5、Sora 2 Proといった主流モデルを凌駕しています。正確な物理シミュレーション機能、複雑なシーン構築、映画のような映像クオリティを誇り、複数の制御モードに対応しています。
LiblibAIは、世界初となる統合型マルチモーダル動画モデル「Keling O1」を発表しました。このモデルは、動画コンテンツの追加・削除、スタイルの再描画、ショットの拡張といった複数のタスクを統合した初の統合型モデルです。最大7枚の参照画像をサポートし、コンテンツの一貫性を維持できるほか、自然言語コマンドによる動画のインテリジェントな編集や、動画参照画像の生成も可能です。
StepStarはGELab-Zeroをオープンソース化し、40億パラメータのGUIエージェントモデルであるGELab-Zero-4B-previewをリリースしました。このモデルは、その規模において複数のベンチマークテストで最先端(SOTA)の結果を達成し、複雑であいまいなコマンドもスムーズに実行できます。また、このプロジェクトでは推論エンジニアリングのインフラストラクチャ全体をオープンソース化し、ワンクリックでのデプロイとマルチデバイスでのタスク分散をサポートすることで、モバイルエージェントの大規模デプロイにおけるエンジニアリング上の課題を解決します。
ByteDanceは、次世代動画理解モデル「Vidi2」を発表しました。このモデルは、時空間位置特定などのコアタスクにおいて、GPT-5やGemini 3 Proを凌駕する性能を発揮します。数時間にも及ぶ長尺動画コンテンツを正確に理解し、編集タイムポイント、字幕、BGMなどの詳細情報を含む完全なJSON編集ソリューションを直接生成できるため、未編集の映像から完成品まで、AIによる自動編集が可能になります。
DeepSeekは、標準バージョンと、思考能力を強化した特別バージョンを含むDeepSeek-V3.2を正式にリリースしました。標準バージョンは推論能力と出力効率のバランスが取れており、GPT-5レベルに達しています。特別バージョンは、IMOやICPCなどの国際大会で金メダルを獲得しており、Gemini-3.0-Proに匹敵する推論能力を備えています。今回のアップグレードは、思考とツール呼び出しが初めて統合されたものであり、エージェント評価においてオープンソースモデルとして最高レベルを達成しています。
Tencent Hunyuan 3D Studioがバージョン1.1にアップグレードされ、新しいアートグレード3D生成モデルPolyGen 1.5が統合されました。これにより、エンドツーエンドのネイティブ四角形メッシュ生成技術において画期的な進歩を遂げました。このモデルは革新的な適応型ハイブリッドトポロジー機能を備えており、配線が整然としたプロフェッショナルグレードの3Dアセットを直接生成できます。配線品質や構造的完全性といった主要指標において、既存の最先端手法を凌駕しています。
Kunlun TechのAI音楽プラットフォーム「Mureka」は、V7.6とO2デュアルモデルを正式にリリースし、AI音楽制作を「プロ品質×リアルタイム体験」という新たな段階へと押し上げました。MusiCoTのきめ細かな音楽モデリングシステムをベースにしたこの新モデルは、アレンジ構造、意味マッピング、音場品質において大幅な改善を実現し、10言語での生成とカスタムアーティスト機能をサポートしています。
DeepSeekは、IMO(国際数学オリンピック)の金メダル級の推論能力を実現した次世代数学モデル「DeepSeek-Math-V2」をオープンソース化しました。このモデルは、革新的な自己検証メカニズムを導入し、「生成器・検証器・メタ検証」という3層アーキテクチャを採用することで、AIが自身の推論プロセスを検証・修正できるようにしています。IMO 2025テストでは83.3%という高得点を獲得し、Putnam 2024テストではほぼ満点に近いスコアを記録しました。
清華大学傘下のAIインフラ企業である武文新瓊(WuwenXinQiong)は、約5億元のシリーズA+資金調達ラウンドを完了し、設立から2年半で総額約15億元を調達した。今回の資金調達は、ソフトウェアとハードウェアの連携技術における同社の優位性を強化し、デジタル世界と物理世界におけるインテリジェントエージェントの大規模かつ広範な応用を加速するために活用される。
ByteDanceのSeedチームは、あらゆる視点からの空間認識を実現するために単一のTransformerアーキテクチャを革新的に採用した視覚空間再構成モデル「Depth Anything 3」をオープンソース化しました。このモデルは、統一された「深度光線」表現手法を用いて、カメラ姿勢推定や幾何学的再構成などのタスクを簡潔なフレームワークに統合し、主流モデルであるVGGTと比較して、カメラ姿勢精度と幾何学的再構成においてそれぞれ35.7%と23.6%の向上を実現しています。
Alibabaは、6バイトのパラメータで高効率な画像生成モデルであるZ-Imageをオープンソース化しました。このモデルはシングルストリームDiTアーキテクチャを採用し、テキストとビジュアルセマンティックトークンを均一に処理することでパラメータ効率を向上させています。リリースされたバージョンは3つあります。Z-Image-Turboは、8ステップの高速生成をサポートする軽量蒸留バージョンで、リアルな画像生成とバイリンガルテキストレンダリングに優れています。Z-Image-Baseは、コミュニティによる微調整とカスタマイズのためのベースモデルです。Z-Image-Editは画像編集に特化しており、自然言語コマンドに基づくクリエイティブな編集をサポートしています。
AIプログラミングプラットフォーム「TRAE」の中国版が、SOLOモードを正式にリリースし、無料で提供開始した。このモードは、SOLO Coderエージェントを内蔵しており、開発計画を事前に作成してから実行に移す共同作業ワークフローをサポートし、複数のエージェントをスケジュールして複雑なタスクを処理することができる。また、新しい3列レイアウトを採用することで、複数のタスクを並行して開発することが可能になり、コード変更比較ツールやコンテキスト管理機能も内蔵されている。
テンセントのHunyuan 3D Creation Engineが、同社の国際プラットフォームで正式にリリースされました。同時に、APIもテンセントクラウドの国際サイトで公開され、世界中の開発者が利用できます。このエンジンは、テキストから3D、画像から3D、スケッチから3D、インテリジェントトポロジーなどのコア機能をサポートしており、テキスト、画像、スケッチを使用して、数分で高品質な3Dモデルを生成できます。
国内AIコンテンツ制作プラットフォームであるLiblibAIは、次世代画像生成アルゴリズム「F.2」を正式にリリースした。このモデルは、テキストから画像への生成、複数画像参照、画像編集という3つの主要機能において包括的なアップグレードを実施し、文字やスタイルの一貫性、複雑な指示への対応能力、そしてきめ細やかなテキストレンダリング効果を大幅に向上させた。
Black Forest Labsは、テキストから画像への生成、複数画像の参照、画像編集をサポートするオープンソースの画像生成・編集モデル「FLUX.2」をリリースしました。FLUX.2は、より豊かなディテール、より鮮明なテクスチャ、そして安定したライティングを提供します。バージョンは4種類あり、FLUX.2 [pro](トップクラスのクローズドソースモデルに匹敵)、FLUX.2 [flex](パラメータ調整可能)、FLUX.2 [dev](オープンソースの32B加重モデル)、そしてFLUX.2 [klein](近日公開予定の軽量モデル)です。