霊光アプリが世界モデル体験機能をリリース
Lingguangアプリは、「世界モデル体験」機能をリリースし、モバイルデバイスで初めて世界モデル機能を利用できるようになりました。ユーザーは画像をアップロードし、「画像から世界を生成」を選択するか、探索コマンドを入力するだけで、ワンクリックでインタラクティブな3D仮想世界を生成できます。仮想世界に入ると、ジョイスティックで移動を操作し、一人称視点で自由に探索できるため、ゲームのように没入感のある探索体験ができます。
Lingguangアプリは、「世界モデル体験」機能をリリースし、モバイルデバイスで初めて世界モデル機能を利用できるようになりました。ユーザーは画像をアップロードし、「画像から世界を生成」を選択するか、探索コマンドを入力するだけで、ワンクリックでインタラクティブな3D仮想世界を生成できます。仮想世界に入ると、ジョイスティックで移動を操作し、一人称視点で自由に探索できるため、ゲームのように没入感のある探索体験ができます。
アリババ傘下のプラットフォーム「Duiyou」は、期間限定で1秒あたりわずか12 Duiyouポイントという低価格で動画作成ができる「HappyHorse 1.0」を発表しました。これにより、5秒の動画が1元以下で作成可能になります。ユーザーは公式サイトにログインし、「動画作成」をクリックすることで体験できます。このモデルは、3Dアニメーション広告、ドローンカメラの動き、複数人による実写シーンのインタラクション、雰囲気のある映像など、様々なシナリオに対応しており、デザイナー、AI愛好家、その他のグループに、コスト効率の高い高性能動画制作機能を提供します。
LibTVは、テキストベース動画、画像ベース動画、参照画像生成の3つのモードをサポートする新世代動画モデル「HappyHorse 1.0」を発表しました。このモデルは、15秒の1080Pマルチカメラナレーション動画を出力できます。自然言語による動画編集、映画のような画質、インテリジェントなシーン配置、音声と映像の同期生成、マルチスタイル再生機能などを備え、キャラクターの動きの自然さ、微表情の描写、会話のリアリティを大幅に向上させています。
人型AI企業Star Ageは、SF Express Groupが主導し、Sequoia China、IDG Capital、CICC Capitalなどの業界関係者が共同出資する形で、2億ドルを超える新たな資金調達ラウンドを完了した。Star Ageは業界初のプロダクト・マーケット・フィット(PMF)を達成し、すでに中国郵政、SF Expressなどと提携して10以上の物流センターにロボットを導入している。一部のシナリオでは、その運用効率は人間の85%を超えており、2026年第2四半期には数千台のロボットによる大量配送を開始する予定だ。
Xiaomiのロボット部門は、Xiaomi-Robotics-0の実機上でのトレーニングプロセス全体をオープンソース化しました。事前学習済みのベースを基に、20時間分のタスクデータを使用してイヤホン収納などの高精度な操作を実行できます。チームは、非同期推論、アクションプレフィックスと適応型重み付け、Λ型マスキング、ランダムオクルージョンの3つの戦略によってモデルの「怠惰効果」を克服し、動作の連続性と視覚的感度のバランスを実現しました。
DeepSeekは、すべてのAPIサービスにおける入力キャッシュヒットの価格を元の価格の1/10に引き下げたことを正式に発表しました。DeepSeek-V4-Proの入力キャッシュヒット価格は0.025円に、DeepSeek-V4-Flashは0.02円に値下げされました。また、Proモデルは5月5日までの期間限定で25%割引の対象となります。この大幅な値下げは、開発者のコスト削減と、長時間のコンテキストにおけるAPI利用の費用対効果向上を目的としています。
Alibaba Cloudは、エンタープライズグレードのインテリジェントエージェント構築プラットフォーム「JVS Crew」を発表しました。「統合性」をコンセプトに設計されたこのプラットフォームは、企業が既存のアプリケーションやSaaSに本番環境レベルのAIエージェント機能を迅速に組み込むことを支援します。JVS Crewは、エンタープライズレベルのシナリオにおけるOpenClawの欠点を克服し、ID、コンテンツ、実行という3つのセキュリティ層を通じて自律的な制御を実現します。また、セッション間メモリの完全管理、エンドツーエンドの可観測トレース、4段階の予算コスト管理機能を提供します。
次世代自動音声認識モデル「StepAudio 2.5」がリリースされました。このモデルは、大規模言語モデル推論高速化技術を音声認識分野に初めて導入した画期的なモデルです。ASR+MTP-5アーキテクチャをベースとし、推論速度を400%向上、レイテンシを60%削減、ピーク速度を500トークン/秒、コストを80%削減しました。中国語と英語の主要ベンチマークにおいて最先端(SOTA)性能を実現し、32Kのコンテキストウィンドウを再利用、30分間の音声を1回の処理で文字起こしできます。
DeepSeekの新モデルシリーズ「DeepSeek-V4」のプレビュー版が正式にリリースされ、オープンソース化されました。このシリーズには、deepseek-v4-proとdeepseek-v4-flashの2つのバージョンがあり、どちらも最大1MBの超ロングコンテキストをサポートしています。V4-Proは、エージェントエンコーディング、世界知識、推論性能において、トップレベルのクローズドソースモデルに匹敵する性能を発揮します。V4-Flashは、同様の推論機能を低コストで提供します。これらのモデルは、斬新なアテンションメカニズムとDSAスパースアテンションを採用しており、ロングコンテキストにおける計算およびメモリオーバーヘッドを大幅に削減します。
iFlytekのAIオフィスアシスタント「Loomy」は、招待コードなしでユーザーが登録して使用できる完全なオープン化を発表しました。Loomyは、金融、eコマース、教育など20以上の業界を網羅し、5,000以上の実際のタスクループを完了しており、新規ユーザーの定着率は70%です。今回のアップグレードでは、3つの主要機能が導入されます。IMツールの自然言語制御のためのLark、WeChat Work、DingTalk CLIとの統合。選択式質問を通じてプロフェッショナルなプレゼンテーションを生成するガイド付きPPT作成。オフィスの効率を向上させるための並列処理によるマルチタスクのサポート。
OpenAIは、次世代の主力モデルであるGPT-5.5を発表しました。これは「実務やインテリジェントエージェントのための新しいタイプの知能」として位置づけられています。このモデルはNVIDIAのGB200/GB300 NVL72システムと共同開発され、プログラミング、知識労働、科学研究において、前モデルやClaude Opus 4.7を凌駕しています。GPT-5.5は「強力になればなるほど遅くなる」という常識を覆し、GPT-5.4と同等の速度を実現しながら、消費トークン数を削減しています。
テンセントのHunyuanチームは、チームの事前学習、強化学習、インフラストラクチャを全面的に見直した後の最初の成果として、大規模モデル「Hy3プレビュー」を公開しました。このモデルは、高速思考と低速思考を組み合わせたMoEアーキテクチャを採用しており、合計2950億のパラメータ、210億の活性化パラメータ、25万6千の長文コンテキストを誇り、Hunyuan史上最もインテリジェントなモデルとなっています。Hy3プレビューは、FrontierScience-OlympiadやIMOAnswerBenchなどの難易度の高い推論リーダーボードで非常に優れたパフォーマンスを発揮し、エージェントとコードの機能が大幅に向上したことを実証し、1回の実行で完全なWeChatミニプログラムを生成できます。
ByteDanceは、次世代3D生成モデル「Seed3D 2.0」を発表しました。このモデルは、ジオメトリとテクスチャの両方において最先端(SOTA)のパフォーマンスを実現しています。2段階の粗密DiT戦略を採用することで、全体構造と細部を分離しています。また、統一されたPBR生成アーキテクチャとMoEおよびVLMの事前分布を組み合わせることで、マテリアルのリアリズムを大幅に向上させています。Seed3D 2.0は、コンポーネントレベルの分解、ジョイントモデリング、シーン合成といった下流工程の機能を拡張し、3D生成を「プロダクション対応」の標準へと押し上げています。
科学技術革新委員会日報によると、AIスタートアップ企業Anthropicの企業価値は、Forge Globalなどのプライベートエクイティ取引プラットフォームで約1兆ドルに急騰し、OpenAIの8800億ドルを上回った。この急激な企業価値の上昇は、Anthropicの流通量が減少しつつある株式を買い求める買い手が殺到していることが要因となっている。
StepStarとQianli Technologyは、包括的な戦略的パートナーシップを締結し、「ネイティブなインテリジェントドライビング基盤モデル」を共同で構築することを発表しました。このモデルは、AIをゼロからトレーニングして複雑な物理世界を直接理解し、物理AIの能力の限界を打ち破ります。StepStarは既にエージェントベースの大規模モデルとマルチモーダル技術に多大な投資を行っており、オープンソースの主力基盤モデルであるStep 3.5 Flashをリリースし、音声推論や自動運転評価などのベンチマークでトップクラスの地位を獲得しています。
OpenAIは、テキスト内の個人識別情報(PII)を検出・編集するために設計されたOpenAI Privacy Filterモデルを公開しました。このモデルは15億個のパラメータを持ち、12万8千のコンテキストをサポートし、ローカルで実行可能です。双方向トークン分類アーキテクチャに基づいており、名前、住所、メールアドレス、電話番号、アカウント、パスワードなど8種類のプライバシー情報を識別でき、PII-Masking-300kベンチマークで96%のF1スコアを達成しています。
アリババ傘下の同義千文チームは、270億個のパラメータを持つ高密度マルチモーダルモデル「Qwen3.6-27B」をオープンソース化しました。このモデルは、マルチモーダル思考モードと非思考モードをサポートし、エージェントプログラミング機能においてフラッグシップレベルのブレークスルーを達成。SWE-benchやTerminal-Benchといった主要なプログラミングベンチマークにおいて、前身であるオープンソースのフラッグシップモデル「Qwen3.5-397B-A17B」を凌駕しています。高密度アーキテクチャを採用しているため、MoEルーティングなしで展開でき、幅広い普及が期待されます。
OpenAIは、ChatGPTにワークスペースエージェントを導入したことを発表しました。これにより、チームは複雑なタスクや長期にわたるワークフローを処理するためのコラボレーションエージェントを作成できるようになります。Codexを基盤とするワークスペースエージェントは、ファイル処理、コード実行、ツール呼び出し、メモリ保存機能を提供し、クラウド上で24時間365日稼働可能です。このシステムはSlackとの連携とスケジュールされた操作をサポートしています。現在、ChatGPT Business、Enterprise、Edu、Teachersプログラムに対応しています。
SenseTimeのSageは、大規模なオンデバイスマルチモーダルインテリジェントエージェントプラットフォームモデルであり、MoEアーキテクチャ(合計320億パラメータ/30億アクティベーション)を採用することで、業界初の複雑なオンデバイスインテリジェントエージェントプラットフォームモデルとなっています。PinchBenchベンチマークテストでは、タスク完了率94%を達成し、Claude-Opus-4.6やGPT-5.4といった世界有数のクラウドベースの大規模モデルを凌駕しました。Sageは既にNVIDIA Orin Xプラットフォームに展開されており、北京モーターショーでSage Boxを発表することで、インテリジェントコックピットの進化をスーパーインテリジェントエージェントへと推し進めます。
Ant Financialの大規模モデル開発チームは、合計1040億個のパラメータと74億個の活性化パラメータを持つLing-2.6-flashをリリースしました。このモデルは、MLA+Lightning LinearとスパースMoEを組み合わせたハイブリッドアテンションアーキテクチャを採用しています。4枚のカードで構成されるH2O環境で、340トークン/秒の推論速度を実現し、トークン消費量は競合モデルの約1/10に抑えられています。また、BFCL-V4やSWE-bench Verifiedなどのエージェントベンチマークにおいて、最先端のパフォーマンスを達成しています。
イーロン・マスク氏率いる商業宇宙飛行大手スペースXは、AIプログラミング分野のユニコーン企業であるカーソル社との緊密な提携を発表し、今年後半に600億ドルで買収する計画を明らかにした。買収が最終的に破談となった場合、スペースXは提携のためにさらに100億ドルを支払うことになる。両社は、カーソル社の主要製品と、100万台のH100スーパーコンピュータに匹敵する計算能力を持つスペースXのスーパーコンピュータ「コロッサス」を組み合わせ、世界で最も強力なプログラミングAIを共同で構築する予定だ。
Loopitの親会社である永越智能は、世界有数のモバイルゲーム開発会社であるGarenaが主導し、BlueRun Venturesなどの機関投資家が参加する5,000万ドルの新たな資金調達ラウンドを完了した。これにより、同社の今年の資金調達総額は1億ドル近くに達した。百川智能の元共同創業者である陳維鵬氏が設立したLoopitは、リリースから2か月以内にGoogle Playのグローバル総合ランキングで8位、エンターテイメントランキングで1位を獲得し、イーロン・マスク氏からも称賛を受けた。
OpenAIは、思考能力を備えた初の画像生成モデルであるChatGPT Images 2.0(GPT-Image-2)を正式にリリースしました。このモデルは、精度、即時性、一貫性、視覚的な整合性に優れており、簡単な指示だけで、非常にリアルなアプリのスクリーンショット、TikTokの動画インターフェース、製品広告、学術論文のポスターなどを生成できます。中国語のテキストレンダリング機能も大幅に向上しています。
Alibaba傘下のTongyi Labsは、エージェントAI向けに特別に設計されたワンストップ自動最適化エンジン「AgentScope Tuner」の正式アップグレードを発表しました。この製品は、迅速なチューニング、モデル選択、および機能強化のための微調整という3つの主要機能を提供し、初期の軽量最適化から後期の高度なチューニングまで、ライフサイクル全体をカバーします。主な特長としては、ネイティブなエージェントのクローズドループ、統一されたAPI設計パラダイム、およびコード変更コストゼロが挙げられます。