ByteDanceは、複雑なタスクをリアルタイムで実行できる初の3Dオープンワールド汎用AIエージェント「Lumine」をリリースした。
ByteDanceのSeedチームは、3Dオープンワールド内で複雑なタスクをリアルタイムで時間単位で実行できる、初の汎用AIエージェント「Lumine」をリリースしました。視覚言語モデルに基づき、エンドツーエンドのアーキテクチャを通じて知覚、推論、行動を統合し、ゲーム内APIを必要とせず、画面画像とキーボード/マウス操作のみに依存しています。
ByteDanceのSeedチームは、3Dオープンワールド内で複雑なタスクをリアルタイムで時間単位で実行できる、初の汎用AIエージェント「Lumine」をリリースしました。視覚言語モデルに基づき、エンドツーエンドのアーキテクチャを通じて知覚、推論、行動を統合し、ゲーム内APIを必要とせず、画面画像とキーボード/マウス操作のみに依存しています。
JetBrainsは、Linux Foundationと提携し、世界初のオープンソース、多言語、マルチフレームワーク対応のAIプログラミングエージェントベンチマークプラットフォームであるDPAI Arenaを発表しました。これは、実際のソフトウェア開発タスクにおけるAIツールの効率向上を客観的に測定し、業界のギャップを埋めるとともに、パッチ適用やコードレビューといった多様なワークフローにおける再現可能な評価をサポートします。
陳天橋氏率いるShandaチームが開発したオープンソースの長期記憶オペレーティングシステムEverMemOSは、AIエージェント向けに特化して設計されており、大規模言語モデルにおける固定コンテキストウィンドウによって引き起こされるメモリ断片化の問題に対処します。人間の脳の記憶メカニズムに基づき、このシステムは4層アーキテクチャ(エージェント層、メモリ層、インデックス層、インターフェース層)を採用し、LoCoMoベンチマークで92.3%、LongMemEval-Sベンチマークで82%という高いスコアを達成し、業界ベンチマークを上回りました。
アリババは、Qwenの最も強力なモデルをベースに構築され、ChatGPTとのベンチマークテストを徹底的に実施したQianwenアプリを正式にリリースしました。Qwenのオープンソースエコシステムを活用したこのアプリは、世界中で6億回以上ダウンロードされ、119言語に対応し、インテリジェントな複数アプリケーションのスケジュール管理やマルチモーダルなインタラクションなどの機能を備え、世界中のユーザーにとってAI生産性向上ツールとなっています。
Google DeepMindが開発した最新のAI天気予報モデル「WeatherNext 2」は、従来モデルよりも8倍高速で、1時間単位の精度で正確な予報を生成できます。生成関数ネットワーク(FGN)技術を用いることで、従来のスーパーコンピューターでは数時間かかる15日間の世界規模の気象シミュレーションをわずか1分で完了させ、数百もの気象シナリオを出力できます。
アントグループは、マルチモーダルな汎用AIアシスタント「凌光アプリ」を正式にリリースしました。このアプリは、動的な3Dモデルやインタラクティブマップなど、構造化された思考に基づき、論理的に明快で視覚的なコンテンツを生成し、知識の提示をより鮮やかにします。ユーザーは自然言語で記述するだけで、30秒以内にパーソナライズされたAIアプリケーションを作成できます。AGIカメラ技術を搭載し、リアルタイムのビデオストリームを通じて物理世界を分析し、テキストから画像/ビデオ、画像から画像/ビデオの作成をサポートし、物体やシーンを識別して知識を説明することができます。
イーロン・マスク氏率いるxAI社は、感情知能と実用性の向上に重点を置いた最新のAI対話モデル「Grok 4.1」をリリースした。このモデルはLMArenaのランキングで1483点を獲得し、2位のモデルを31点上回りトップに立った。「思考モード」と「即時モード」という2つのトラック設計を先駆けて採用しており、高度な推論を有効にしなくても、基本バージョンで他のモデルのフル構成を凌駕する性能を発揮する。
Anthropicは、MicrosoftとNvidiaから合計150億ドルの投資を確保しました。内訳はMicrosoftが50億ドル、Nvidiaが100億ドルです。Anthropicは300億ドル相当のAzureコンピューティングパワーを購入することを約束しており、Nvidiaと緊密に連携してモデルのパフォーマンス最適化を図ります。ClaudeモデルはMicrosoft Azure上で利用可能となり、世界三大クラウドプラットフォームすべてで利用できる最先端モデルとなります。
AiPPTは、「詳細調査」機能のエージェント版を正式にリリースし、ユーザーによる内部テストへの参加を呼びかけました。この機能は、実際の分析担当者のワークフローをシミュレートし、「理解・考察・質問」のサイクルを通じて、詳細なウェブ検索と論理的な整理から、豊富な図解を用いた調査レポートやプレゼンテーション資料の作成まで、全プロセスを自動的に完了させます。
Googleは、次世代マルチモーダル大規模モデル「Gemini 3」を正式にリリースしました。このモデルは、複数のベンチマークテストで優れた性能を発揮し、LMARaena分野ではEloスコア1501で1位を獲得しました。ネイティブなマルチモーダル理解、高度な推論、エージェントプログラミング機能を備え、100万トークンのコンテキストウィンドウをサポートし、学術的推論、数学、コード開発などのタスクにおいて、従来モデルや競合モデルを大幅に上回る性能を発揮します。
人型ロボット企業Star Ageは、Geely Capital主導による約10億元のシリーズA+資金調達ラウンドを完了した。同社の受注総額は5億元を超え、物流分野における最大受注額は5000万元近くに達している。海外事業は総収益の50%を占めている。今回の資金調達により、技術革新と商業化が加速される見込みだ。
OpenAIは、GPT-5.1-Codexに代わるプログラミングモデル「GPT-5.1-Codex-Max」をリリースし、Codex統合インターフェースのデフォルトモデルとなりました。このモデルは、SWE-Bench Verifiedテストで77.9%の精度を達成するなど、複数のプログラミングベンチマークでGoogle Gemini 3 Proを1.7ポイント上回る性能を発揮しました。また、「圧縮」メカニズムを組み込むことで、24時間以上の連続動作を可能にし、トークン効率を約30%向上させています。
AI動画スタートアップのLuma AIは、シリーズCラウンドで9億ドルの資金調達を行い、企業価値は40億ドルに達した。このラウンドは、サウジアラビアの公共投資基金の子会社であるHumainが主導した。調達資金は、マルチモーダルAIシステムの開発と、2GW規模のインテリジェントコンピューティングクラスター「Project Halo」の構築に活用される。
AI音楽プラットフォームのSunoは、シリーズC資金調達ラウンドで2億5000万ドルを調達し、企業価値は昨年の約5倍にあたる24億5000万ドルに達した。このラウンドはMenlo Venturesが主導し、NVIDIAのNVenturesをはじめとする複数の機関投資家が参加した。Sunoの主力製品はテキストから楽曲全体を生成するもので、最新バージョンのv5では音声の自然さとコマンド実行精度が大幅に向上している。
Meta社はSAM 3DとSAM 3モデルをリリースし、2D画像からの3D再構成において大きなブレークスルーを達成しました。SAM 3Dは、物体シーン再構成と人体姿勢推定の2つのモデルで構成されています。革新的なデータエンジンにより、約100万枚の画像から3Dラベル付きデータを生成し、複数のベンチマークテストで既存の手法を凌駕する性能を発揮します。
シンガポールを拠点とするAIフィンテック企業RockFlowは、Ant Group主導による数百万ドル規模の資金調達ラウンドを完了した。同社は、自然言語を通じてユーザーの投資意図を理解し、データ分析からリアルタイム取引まで全プロセスを自律的に実行できる、世界初の金融取引向けAIエージェント「Bobby」を発表した。今回の資金調達ラウンドは、金融サービスにおけるAI技術の革新的な応用を加速させ、複雑な金融サービスへのアクセス性とパーソナライゼーションの向上を推進するだろう。
Xiaomiは、自動運転と身体化インテリジェンスを統合した業界初のクロスドメインモデル「MiMo-Embodied」をリリースし、完全オープンソース化しました。このモデルは、身体化インテリジェンスの3つのコアタスクと自動運転の3つの主要タスクを統合し、屋内インタラクションと道路意思決定機能間の双方向の知識伝達を可能にします。29のコアベンチマークテストで優れた性能を発揮し、既存のオープンソースモデルや専用モデルを総合的に凌駕しています。
テンセントのオープンソース動画生成モデル「HunyuanVideo 1.5」は、わずか83億個のパラメータで5~10秒の高精細動画を生成できます。DiTアーキテクチャをベースとしたこのモデルは、中国語と英語の両方でテキストベースおよび画像ベースの動画生成をサポートしています。強力なコマンド理解能力を備え、カメラの動き、表情、身体の動きを正確に制御できます。ネイティブで480p/720p出力に対応しており、超解像処理により1080pにアップスケールすることも可能です。14GBのVRAMを搭載した一般消費者向けグラフィックカードでもスムーズに動作するため、ユーザーにとっての参入障壁が大幅に低減されています。
Googleは、Gemini 3のマルチモーダル機能と深く統合されたプロ仕様の画像生成モデル「Nano Banana Pro」をリリースしました。このモデルは2K/4Kの高解像度出力に対応し、最大14枚の参照画像を融合しながら5人の人物間で一貫性を維持できます。また、高精度なローカル編集、多言語テキストレンダリング、映画のような色彩と明るさのコントロールといった機能を備えています。Gemini 3の知識推論機能と検索エンジンと組み合わせることで、非常に精度の高いインフォグラフィックを生成できます。
アレン人工知能研究所(AI2)が発表したオープンソースの大規模言語モデルであるOlmo 3シリーズには、Olmo 3-Base(7Bおよび32Bパラメータ)、Olmo 3-Think、Olmo 3-Instruct、Olmo 3-RL Zeroが含まれており、それぞれプログラミング、読解、数学的問題解決、複雑な推論、複数ターン対話、強化学習などのタスクに優れています。
アリババのAIアシスタント「千文(Qianwen)」が、新しいドメイン名「qianwen.com」を正式に公開し、ユーザーのアクセス利便性をさらに向上させました。ユーザーはウェブブラウザから直接千文を利用できるようになり、アプリと一貫したシームレスなユーザーエクスペリエンスを実現しています。また、千文ウェブブラウザでは、プロフェッショナルユーザー向けにQwen3シリーズのモデルオプションも拡充されています。
Meta社は、テキストプロンプト一つでインタラクティブかつナビゲーション可能な3Dワールドを生成するWorldGenシステムを発表しました。このシステムは、手続き型論理推論と拡散モデルを統合し、ゲームやシミュレーションなどに適した、幾何学的に厳密で視覚的に豊かな3Dシーンを出力します。スタイルと構造の一貫性が高く、50m×50mのフルテクスチャシーンを生成可能です。
マイクロソフトは、PC操作専用に設計された初のオープンソースインテリジェントエージェントモデル「Fara-7B」をリリースしました。70億個のパラメータで構成され、Windows 11をサポートし、クラス最高のパフォーマンスを誇ります。このモデルは、追加のアクセシビリティツリーや複数の大規模モデル間の連携に頼ることなく、ウェブページのスクリーンショットを視覚的に分析することで、クリックや入力などのアクションを実行します。マイクロソフトは、ウェブページのタスクをシミュレートするための新しい合成データ生成プロセスを構築しました。Fara-7BはQwen2.5-VL-7Bプラットフォームをベースとしており、128kコンテキストをサポートしています。
OpenAIは、ChatGPT向けに新たな「ショッピングリサーチ」機能を発表しました。これは、従来のeコマースプラットフォームやコンテンツコミュニティにおける消費者の意思決定プロセスに取って代わるものです。この機能はGPT-5ミニモデルをベースに最適化されており、対話型の質問を通してユーザーの嗜好を理解し、記憶機能を組み合わせてパーソナライズされた購入ガイドを生成し、商品リンクや視覚的な比較インターフェースを直接提供します。