Nvidiaの新型NitroGenモデルは、ほぼ全てのゲームを動作させることができる。
NVIDIAのオープンソース汎用ゲームAIモデル「NitroGen」は、ゲーム映像を視聴することでコントローラーの入力信号を直接生成でき、1,000種類以上のゲームジャンルでゼロショットゲームプレイをサポートします。40,000時間分のゲーム動画データセットで学習されたこのモデルは、ロボット工学向けに設計されたGR00Tアーキテクチャを採用しており、ゲーム横断的な汎化能力に優れています。
NVIDIAのオープンソース汎用ゲームAIモデル「NitroGen」は、ゲーム映像を視聴することでコントローラーの入力信号を直接生成でき、1,000種類以上のゲームジャンルでゼロショットゲームプレイをサポートします。40,000時間分のゲーム動画データセットで学習されたこのモデルは、ロボット工学向けに設計されたGR00Tアーキテクチャを採用しており、ゲーム横断的な汎化能力に優れています。
Volcano Engine Forceカンファレンスにおいて、Vibe開発プラットフォームが正式に「Vibe Coding」へとアップグレードされ、無料の公開テストが開始されました。このアップグレードは、プラットフォームがAIアプリケーション構築ツールから、開発者の創造性を高めるプラットフォームへと変貌を遂げたことを意味し、新たなVibe Coding開発パラダイムの導入となります。ユーザーは、ビジネス要件を自然言語で記述するだけで、インテリジェントエージェント、ワークフロー、クロスプラットフォームアプリケーションを自動的に生成できます。
Appleは、1枚の2D写真をわずか1秒でリアルな3Dシーンに変換できる新しいAIモデル「SHARP」をオープンソース化すると発表した。従来の手法と比較して3桁の高速化を実現し、ほぼリアルタイムの3D変換体験を提供する。このモデルは、高度な3Dガウススプラッター技術に基づいており、ニューラルネットワークを用いて、単一のフィードフォワードで数百万個の3Dガウス球の位置と形状を予測する。
MiniMaxのビデオチームは、同社のビジュアル生成モデルの主要コンポーネントであるVTPをオープンソース化し、トークナイザーのスケーリング特性を初めて提案しました。この技術は、複数の表現学習手法を統合し、潜在的学習可能性と一般的な表現学習を結びつけることで、下流の生成システムのパフォーマンスを大幅に向上させます。
OpenAIは、これまでで最も高度なエージェントコーディングモデルであるGPT-5.2-Codexをリリースしました。このモデルは、複雑なソフトウェアエンジニアリングタスクにおいて大きなブレークスルーを達成しています。新バージョンでは、命令の遵守、長いコンテキストの理解、サイバーセキュリティ性能が大幅に向上し、SWE-Bench ProやTerminal-Bench 2.0などのベンチマークで最先端の結果を実現しています。独自のコンテキスト圧縮技術により、大規模なコードベースを効率的に処理し、複雑なリファクタリングや移行タスクをサポートします。
Meituanは、最先端の仮想人間動画生成モデル「LongCat-Video-Avatar」をリリースし、オープンソース化しました。このモデルは、動きのリアリズム、長時間の動画の安定性、そして人物の同一性の一貫性という3つの主要な側面において、大きなブレークスルーを達成しています。音声と映像の同時生成および動画の連続再生をネイティブにサポートし、革新的なクロスセグメント潜在空間スティッチング技術によって、長時間の動画生成における画質劣化の問題を効果的に解決し、5分間の高品質動画を安定して生成します。
Aishi TechnologyとAlibaba Cloudは、AI動画生成分野における緊密な協力関係を構築する包括的な協力協定を締結しました。Alibaba Cloudは、インフラストラクチャと大規模モデルサービスを含むフルスタックのAIサポートをAishi Technologyに提供し、同社が独自開発した動画生成モデル「PixVerse」のグローバル展開を促進します。
スウェーデンのAIプログラミングスタートアップ企業Lovableは先日、新たな資金調達ラウンドを完了し、企業価値が66億ドルに急上昇した。これは6ヶ月前と比べて3倍以上であり、ヨーロッパで最も価値の高いスタートアップ企業の1つとなっている。今回の資金調達ラウンドには、Accelなどの著名なベンチャーキャピタル企業が参加しており、AIプログラミングツール分野における競争の激化を示している。
Meta社は、テキスト、画像、または時間ベースの手がかりを用いて複雑な音声から目的の音声を正確に抽出できる、初の統合型マルチモーダル音声分離モデル「SAM Audio」をリリースしました。このモデルは知覚エンコーダーを用いたオーディオビジュアル技術に基づいており、ユーザーは動画内のオブジェクトをクリックして対応する音声を分離したり、「犬の鳴き声」などのテキストコマンドを入力してノイズを除去したりすることができます。
Step-Star社が開発したGUIエージェントモデル「Step-GUI」が全面的にアップグレードされました。新モデルは200種類以上のタスクシナリオに対応し、推論ステップの延長、意味理解の強化、汎化能力の向上を実現しています。モバイル端末、PC、自動車など複数のプラットフォームで使用可能で、最短10分で導入できます。同社はAPIを無償公開するとともに、技術レポートとGUI-MCPプロトコルも公開しました。
ByteDanceは、汎用エージェントモデル「Seed 1.8」を正式にリリースしました。このモデルは、検索、コード生成、グラフィカルユーザーインターフェース操作など、多様な機能を統合しており、テキストと画像の両方の入力をサポートし、ネイティブな視覚理解機能を備えています。複数のベンチマークテストで優れたパフォーマンスを発揮し、OSWorld GUIエージェントタスクで61.9、BrowseComp-en検索タスクで67.6のスコアを獲得し、いずれも業界トップクラスの評価を得ています。
Googleは、高速かつ低コストのGemini 3 Flashモデルを正式にリリースしました。このモデルは、複数のベンチマークテストで優れた性能を発揮し、前モデルのGemini 2.5 Proを凌駕するとともに、一部の指標ではGemini 3 ProやGPT-5.2といった最先端モデルに匹敵する性能を実現しています。最新の推論機能とマルチモーダル機能を備え、応答速度は3倍向上し、コストも大幅に削減されています。
テンセントは、リアルタイムのインタラクティブ体験をサポートする中国初のワールドモデル「WorldPlay 1.5」を正式にリリースしました。ユーザーはテキストや画像を入力することで独自の3Dインタラクティブワールドを生成し、キーボード、マウス、ゲームパッドを使って自由に探索できます。このモデルは、24FPSのリアルタイム生成、分単位の3D幾何学的整合性、空間記憶機能を備えており、一度シーンを離れた後も再び戻ってきた際に整合性を維持します。
Xiaomiは、オープンソースの大規模モデル「MiMo-V2-Flash」を正式にリリースしました。このモデルはMoEアーキテクチャを採用し、総パラメータ数は3090億、アクティブパラメータ数は150億です。複数のベンチマークテストで非常に優れたパフォーマンスを発揮し、特にプログラミング能力が際立っています。SWE-benchテストでは、73.4%の解像度を達成し、他のすべてのオープンソースモデルを凌駕しました。ハイブリッドスライディングウィンドウアテンションやマルチトークン予測などの革新的な技術により、1秒あたり150トークンという高速な推論速度と極めて低い推論コストを実現しています。
OpenAIは、新たな主力画像生成モデルであるGPT Image 1.5をリリースしました。このモデルは、キーワードの忠実性、ディテールの保持、テキストレンダリングにおいて大きな進歩を遂げており、照明や構図といった元の画像の主要な特徴を維持しながら、画像を正確に生成または編集することができます。
ByteDanceは、音声と映像の同時生成を可能にする新世代オーディオ・ビデオ制作モデル「Seedance 1.5 pro」をリリースした。このモデルは、テキストと画像による生成から音声と映像を合成することを可能にし、正確な音声・映像同期、多言語・方言対応のリップシンク、映画のようなカメラコントロール、そしてダイナミックな物語表現において画期的な進歩を実現している。
Jimeng AI Web版が全面的にアップグレードされ、ワンストップの「AI映画スタジオ」が誕生しました。主なアップデート内容は以下のとおりです。Seedance 1.5 Proをベースにした「Video 3.5 Pro」モデルがリリースされ、音声と映像の同時生成や方言リップシンクに対応。インテリジェントマルチフレーム2.0では、「ビデオ+ビデオ」のスティッチングやクリップのきめ細かな編集が可能になり、最大20クリップのワンテイクに対応。Image 4.1と4.5モデルでは、それぞれグラフィックデザイン機能とポートレートの美しさが強化されています。
SenseTimeは、AIオフィスアシスタント「Little Raccoon 3.0」をリリースし、ドラフト作成から最終製品納品まで3つの大きな飛躍を実現しました。このアシスタントは、ワンクリックで高品質なPowerPointプレゼンテーションを作成できるだけでなく、グラフや画像などの要素をフル編集でき、すぐに使えるプレゼンテーションを提供します。また、「ロングチェーン思考」機能により、数百万のデータポイントを数秒で処理し、マルチモーダル分析を行うことで、複雑なタスクを深く理解することが可能です。
Alibaba CloudのTongyi Bailingオープンソース音声ツインモデルFun-CosyVoice3とFun-ASR。Fun-CosyVoice3は、わずか3秒の音声で9言語と18の方言にわたる音声クローンと感情制御をサポートし、最初のパケット遅延を50%削減、中国語と英語の混合音声のエラー率を56.4%削減します。Fun-ASRは、ノイズの多い環境で93%の精度を達成し、31言語と方言の混合音声の認識をサポートし、ストリーミング認識の最初の単語の遅延を160ミリ秒に削減します。
NVIDIAは、Nano、Super、Ultraの3つのバージョンを含む、オープンソースのAIモデルファミリー「Nemotron 3」をリリースしました。Nanoバージョン(パラメータ数300億)は既に利用可能で、ハイブリッドエキスパートアーキテクチャを採用し、前バージョンに比べてスループットが4倍、推論トークン生成量が60%削減、コンテキストウィンドウは100万トークンとなっています。このファミリーはマルチエージェントシステム向けに設計されており、通信オーバーヘッドや推論コストといった課題への対応を目指しています。
アリババは、ロールプレイング機能をサポートする中国初の動画生成システムであるマルチモーダルモデル「同義万翔2.6」をリリースしました。このモデルは、音声と映像の同期、マルチカメラによるストーリーテリング、音声駆動型生成をサポートし、15秒の高解像度動画を直接生成できます。ロールプレイング機能では、ユーザーが参考動画をアップロードすると、AIがキャラクターの外見と声を再現し、一人または複数人によるパフォーマンスコンテンツを生成できます。画像生成に関しては、このモデルは芸術的なスタイルを融合させ、細部を描写する能力を向上させ、テキストと画像の混在レイアウトや複数画像の融合など、商用レベルの制作をサポートします。
LiblibAIプラットフォームは、動画参照生成、音声・映像同期、インテリジェントなマルチカメラスケジューリングという3つのコア機能をサポートする動画生成モデル「Tongyi Wanxiang Wan 2.6」をグローバルにリリースしました。このモデルは、15秒間の1080P高解像度動画を直接出力でき、二次編集なしで完全な物語生成を実現します。動画参照生成機能により、あらゆるキャラクターの外見と声を5秒以内に再現でき、単独/二人芝居や複数人による対話シーンでの音声・映像同期をサポートします。
Googleは、Gemini TTSモデルのアップグレード版であるGemini 2.5 FlashおよびProテキスト読み上げモデルをリリースしました。これにより、表現力、音声速度制御、複数話者シナリオでのパフォーマンスが向上しています。新しいモデルでは、スタイル、イントネーション、発音をより細かく制御でき、状況に応じて音声速度を調整します(興奮しているときは速く、強調したいときは遅く)。また、多言語の対話においても一貫したキャラクターボイスを維持することで、よりリアルな体験を実現します。
アントグループのAIヘルスアシスタント「AQ」がアップデートされ、中国語名が「Ant Afu」に変更された。同時に「健康目標」機能もリリースされた。このアプリは、健康相談、画像診断(レポート、医療記録、処方箋、薬箱などに対応)、個人および家族の健康記録管理、予約やクラウドベースの医療サポートといった医療・健康サービスを提供する。