Qwen3-Coder-Next オープンソース:小さくてもパワフル!
Tongyiが開発したオープンソースのプログラミングエージェントモデル「Qwen3-Coder-Next」は、80バイトのMoEアーキテクチャを採用し、推論ごとにわずか3バイトのパラメータしか使用しないため、計算負荷を大幅に軽減します。SWE-Bench Verifiedベンチマークでは70%を超える問題解決率を達成し、より大規模な高密度モデルに匹敵する性能を実現しています。
Tongyiが開発したオープンソースのプログラミングエージェントモデル「Qwen3-Coder-Next」は、80バイトのMoEアーキテクチャを採用し、推論ごとにわずか3バイトのパラメータしか使用しないため、計算負荷を大幅に軽減します。SWE-Bench Verifiedベンチマークでは70%を超える問題解決率を達成し、より大規模な高密度モデルに匹敵する性能を実現しています。
Cheetah Mobileは、同社初の国産AIツール「Yuanqi AI Bot」をリリースしました。このツールは、一般的なWindowsパソコンへのローカル展開に対応しています。ユーザーは、スマートフォンのLarkやDingTalkを介してリモート操作が可能で、自然言語コマンドを使用することで、ソフトウェアの起動、メールの確認、ウェブページの閲覧など、AIによるパソコンの自動操作を制御できます。システムクリーンアップ、AIによる文書作成、PPT作成といったオフィス支援機能も統合されており、複数のパーソナライズされたAIコンパニオンキャラクターも用意されています。
イーロン・マスク氏率いるAI企業xAIは、AI動画生成ツール「Grok Imagine」のバージョン1.0を正式にリリースした。これは同ツールのメジャーアップデート版となる。新バージョンでは、720p解像度で10秒間の動画生成に対応し、音質が大幅に向上したほか、音声と映像の同期機能や感情を込めたナレーション機能も搭載されている。
イーロン・マスク氏は、SpaceXがxAIの買収を完了し、合併後の企業価値が1兆2500億ドル、IPO価格が1株あたり526.59ドルになったことを正式に発表した。マスク氏は社内メモの中で、この統合により、AI、ロケット技術、宇宙インターネットなどを網羅する「地球上で最も野心的な垂直統合型イノベーションエンジン」が誕生すると述べている。合併後、SpaceXは宇宙空間にデータセンターを配備する計画を進め、宇宙空間の太陽エネルギー資源を活用してAIコンピューティング能力のコスト削減を目指す。
Zhipu AIは、わずか0.9B個のパラメータで「小型かつ高精度」な文書解析機能を実現したプロ仕様のOCRモデル「GLM-OCR」を正式にリリースし、オープンソース化しました。このモデルは、権威あるベンチマークであるOmniDocBench V1.5で94.6という最高スコアを獲得し、テキスト認識、数式認識、表解析、情報抽出などのタスクにおいて最先端(SOTA)の性能を発揮します。手書き文字、複雑な表、コード文書といった難易度の高いシナリオに特化して最適化されており、PDFや画像のバッチ処理をサポートし、1秒あたり1.86ページの処理能力を実現しています。
Qoderインテリジェントプログラミングプラットフォームは、初のカスタマイズモデルであるQwen-Coder-Qoderをリリースし、わずか5ヶ月で「モデル・エージェント・製品」という完全な構成を完成させました。Qwen-Coderプラットフォームをベースとしたこのモデルは、Qoderのエージェントフレームワーク向けに高度に最適化されており、実際のソフトウェアエンジニアリングベンチマークにおいてCursor Composer-1を上回るタスク解決率を達成し、Windowsシステムターミナルコマンドの精度では50%の差をつけています。
Vidu Q3が華々しく世界に登場しました!世界初の16秒音声・映像直接出力に対応したAI動画生成モデルとして、漫画、短編ドラマ、映画制作に特化して設計されています。高精細な音声・映像の同期出力、複数ショットの自由切り替え、多言語のセリフ・テキストレンダリングに対応し、映画のような映像美を実現。AIによる「ワンクリック動画制作」時代を切り開きます。
Kuafu Technologyは最近、Hubble InvestmentとZhengyang Investmentが主導し、既存株主のQiji Venture Capitalも参加する、数千万元規模のPre-A+ラウンドの資金調達を完了した。これは、前回の資金調達からわずか4ヶ月後のことである。同社の主力製品である「CodeFlying」は既に年間経常収益が1000万元を超えており、海外事業も急速に成長している。
StepStarは、エージェントシナリオ向けに特別に設計された次世代オープンソース基盤モデル「Step 3.5 Flash」をリリースしました。このモデルは、1960億個のパラメータを持つ疎なMoEアーキテクチャを採用し、トークンごとに約110億個のパラメータのみをアクティブ化し、256Kのコンテキスト長をサポートしています。主な利点としては、エージェントタスクや数学的推論においてクローズドソースモデルに匹敵する最大350 TPSの推論速度、そしてMTP-3テクノロジーによる大幅な効率向上により、1回の実行で3つのトークンを予測できる点が挙げられます。
Unitree Roboticsは、大規模なビジョン・言語・アクションモデルであるUnifoLM-VLA-0のオープンソース化を発表しました。Qwen2.5-VL-7Bアーキテクチャをベースとしたこのモデルは、340時間分の実機データで学習されており、2D/3D空間認識と動的予測機能を統合することで、従来のVLMが抱えていた物理的インタラクションにおける限界を克服しています。
Appleは、イスラエルのAIスタートアップ企業Q.aiを約20億ドルで買収した。これは、2014年のBeats買収以来、同社にとって2番目に大きな買収案件となる。Q.aiの中核技術は、顔の微表情や筋肉の動きを分析することで「無言発話」を認識するもので、ユーザーは発話せずに唇の動きだけでコマンドを入力できる。この技術は、2026年に発売予定のAirPods、iPhone、AIグラスに搭載され、プライベートで邪魔されないインタラクティブな体験を実現すると期待されている。
OpenAIは2月13日、GPT-4oやGPT-4.1シリーズなどの旧モデルをChatGPTプラットフォームから削除すると発表した。この動きはユーザーから強い反発を招き、GPT-4oの「温かい対話スタイル」は、特に創造的なコミュニケーションや感情的なサポートのニーズを満たす上で、かけがえのない感情的価値を持っていると述べるユーザーもいた。OpenAIは、主流モデルの最適化とGPT-5.2における個性と創造性の向上にリソースを集中させると述べている。APIサービスは当面影響を受けない。
Alibaba CloudのQianwenチームは、17億/6億パラメータバージョンと強制アライメントモデルを含む音声認識モデル「Qwen3-ASR」シリーズをオープンソース化しました。このシリーズは52の言語と方言をサポートし、22の中国語方言と複数の英語バリエーションを網羅しており、騒がしい環境や歌唱シーンでも安定した性能を発揮します。
SenseTimeは、オープンソースのマルチモーダル自律推論モデル「SenseNova-MARS」(8B/32Bバージョン)をリリースしました。MMSearchやHR-MMSearchといったコアベンチマークテストにおいて、同モデルは総合スコア69.74を達成し、Gemini-3-Pro(69.06)やGPT-5.2(67.64)を上回りました。これにより、動的な視覚推論と画像/テキスト検索の高度な統合をサポートする、初のオープンソースのエージェント型VLMとなりました。
Kunlun Techの子会社であるSkywork AIは、動画生成モデル「SkyReels-V3」のオープンソース化を発表しました。このモデルは、参照画像から動画への変換、動画の拡張、音声駆動型仮想アバターという3つの主要機能を単一のアーキテクチャに統合しています。画像から動画への変換技術は、参照の一貫性(0.6698)と視覚品質(0.8119)において、ViduやKlingといった主流モデルを凌駕しています。動画の拡張機能は、ショット間の遷移や物語の展開をサポートします。仮想アバターモジュールは、音声と映像が同期した長尺動画の生成を可能にします。
崑崙科技の子会社である崑崙天宮は、音楽モデル「Mureka V8」を正式にリリースし、「AI音楽は新しい音楽カテゴリーである」と発表した。MusiCoTテクノロジーシステムをベースにしたこのモデルは、メロディーの忠実性、ボーカルの表現力、アレンジのレイヤー、ミキシングの品質において画期的な進歩を遂げ、すぐにリリース可能な出力を生成する。
MiniMaxは、HoshinoやTalkieなどの製品の基盤となるAIロールプレイングモデル「MiniMax M2-her」の技術アーキテクチャを正式に公開した。その核心となるブレークスルーは、世界観の一貫性、ストーリー展開の多様性、ユーザーの好みへの対応力という3つの側面からロールプレイング能力を定量化する評価システム「ロールプレイングベンチ」の構築にある。このシステムは、100ラウンドに及ぶ対話テストで優れた性能を発揮した。
MiniMaxは、新世代AI音楽生成モデル「MiniMax Music 2.5」を正式に発表しました。このモデルは、イントロ、コーラス、ブリッジなど14のセグメント構造を画期的な精度で制御し、クリエイターがプロの編曲家のように楽曲全体の感情的な流れをデザインすることを可能にします。
アリババ傘下のTongyiは、AIにおける絵画スタイルの多様性の欠如や肖像画の均質化といった課題に対処するために設計された、6Bパラメータの非蒸留台座モデル「Z-Image」をリリースした。このモデルは、写実的なものからアニメ風のものまで、多様なスタイル生成をサポートし、ネイティブアーキテクチャの最適化により、LoRAやControlNetなどのファインチューニング手法との互換性を大幅に向上させている。
OpenAIは、研究ツールの断片化という課題に対処するため、GPT-5.2をベースとした無料の研究コラボレーションプラットフォーム「Prism」を発表しました。このプラットフォームはクラウドベースのLaTeXエディタを統合しており、無制限の共同研究者がリアルタイムで論文を執筆できます。AIは、全文のコンテキストに基づいて、要約から謝辞までの全プロセスを支援し、数式生成、文献管理、図表の最適化、文法校正などを行います。
DeepSeekは、次世代文書認識モデル「DeepSeek-OCR 2」をリリースし、オープンソース化しました。DeepEncoder V2アーキテクチャを採用したこのモデルは、従来の固定シーケンス画像スキャン方式を、因果関係を考慮した意味推論モードへと進化させています。軽量な言語モデルによって視覚トークンを動的に再配置することで、AIは人間と同じように、表や複数列レイアウトなどの複雑な文書を論理的な順序で理解することができます。OmniDocBenchベンチマークでは、総合スコア91.09%という記録的な高得点を達成し、読み上げ順序認識エラーを33%削減しました。
Viduは、「あらゆるものを参照可能」な世界初の映像制作モデル「Vidu Q2 Reference Pro」を正式に発売しました。このモデルは、エフェクト、表情、テクスチャ、モーション、キャラクター、シーンの6種類の参照タイプを革新的にサポートし、映像や画像を入力することで、ワンクリックでエフェクトの複製、演技の転送、背景の置き換えなどが可能になり、洗練された追加、削除、修正を実現します。
Dark Side of the Moonは、これまでで最もインテリジェントで汎用性の高いオープンソースモデルであるKimi K2.5をリリースしました。このモデルは、エージェントタスク、コード生成、画像/動画の視覚理解など、複数のベンチマークテストで最先端(SOTA)のパフォーマンスを実現し、マルチモーダル入力と4つの動作モードをサポートしています。革新的な「エージェントクラスタ」機能を搭載しており、最大100個のクローンを自律的に作成して複雑なタスクを並列処理することで、効率を最大4.5倍向上させます。
オープンソースプロジェクトのClawdbotはGitHubで大きな話題となり、わずか2日間でスター数が5,000から20,000に急増しました。このプロジェクトは、自己展開型のAIアシスタントをサポートし、ゲートウェイを介してチャットソフトウェア(WhatsAppやTelegramなど)と複数のAIモデル(Claude、GPTなど)を接続し、カレンダー管理、メール処理、自動化タスクなどの機能を統合することで、真に「会話型」のパーソナルアシスタントを実現します。