GoogleがGemini 3.5 Transcribeをリリース
Googleは、リアルタイムストリーミングと録音ファイルの両方に対応したAPIを提供し、85以上の言語をサポートする音声認識モデル「Gemini 3.5 Transcribe」をリリースした。
Googleは、リアルタイムストリーミングと録音ファイルの両方に対応したAPIを提供し、85以上の言語をサポートする音声認識モデル「Gemini 3.5 Transcribe」をリリースした。
Zhipuは、GLM-5シリーズ初のネイティブマルチモーダルモデルであるGLM-5.3-Flashをリリースしました。このモデルは、合計320個のパラメータと18個の活性化パラメータを持つMoEアーキテクチャを採用しており、モデルの重みも公開されています。
Google Labsは、「Vibe Coding」体験を重視したリアルタイムコラボレーションツール「Play with Putty」をリリースしました。ユーザーはプログラミングの知識を必要とせず、自然言語でニーズを説明するだけで、AIが自動的にコードを生成し、リアルタイムで使用可能なツールやウェブサイトとしてレンダリングします。このツールは、同じ共有スペース内のリンクを介して複数のユーザー間のコラボレーションをサポートし、変更は即座に同期されます。軽量で一般ユーザー向けの実験的なツールとして位置づけられており、ソフトウェア開発を個人による記述から集団的な対話へと変革し、リアルタイムコラボレーションによる迅速なプロトタイピングを可能にします。
アリババ傘下の同義千文は、125Bのメインモデルと6Bのシングルトークンアクティベーションパラメータを使用するQwen3.8-Flash-Nextをオープンソース化し、Qwen4向けに計画されている新しいアーキテクチャを先行して披露した。
Jimeng AIは、映画・テレビブランド「Jimeng Film Studio」を立ち上げ、8月から12月にかけて映画会社やAIクリエイターから映画・テレビ企画を募集する。映画は2段階(S/A)、テレビシリーズは3段階(S/A/B)で提供され、Tomato Novels IPとの連携により、コンピューティング能力、技術、配給などサプライチェーン全体にわたるサポートが提供される。同時に、クリエイター育成プログラムも開始され、クリエイティブファンドや「才能の響き」賞などが含まれる。優れた作品には、最大10万元の賞金と数百万元のプロモーションリソースが提供され、AIが生み出す映画・テレビIPの開発が支援される。
Stability AIは、7,600万ドル(約5億1,200万元)のシリーズB資金調達ラウンドの完了を発表しました。この資金は、クリエイティブ製品の開発、応用研究、およびプロフェッショナルサービスの拡大に活用されます。投資家には、EA、ソニー・ミュージック、ユニバーサル・ミュージック、ワーナー・ミュージック、AMDベンチャーズなどが名を連ねています。CEOのプレム・アッカラジュ氏は、投資家グループが資金、専門知識、業界での信頼性、そしてアーティストとの直接的なつながりを提供し、生成型AIを活用してクリエイティブなプロフェッショナルを支援すると述べています。
AIsphereは、リアルタイムマルチモーダルワールドモデル「PixVerse R2」に関する技術レポートを公開しました。PixVerse R1を基盤とするPixVerse R2は、リアルタイムワールドモデルのスケーリングの可能性をさらに探求し、Omni Causal AR統合アーキテクチャを通じて、テキスト、参照画像、音声、モーションなどのマルチモーダル入力をサポートすることで、同時生成、インタラクション、進化を伴う継続的なワールド操作を実現します。
OpenCode Go に Grok 4.6 が追加されました。公式ドキュメントによると、一般的なリクエストパターンに基づくと、5 時間ごとに約 169 件のリクエストが完了できると推定されていますが、実際の数は入力トークン、キャッシュトークン、出力トークンによって異なります。
OpenAIのプロダクトマネージャーは、回帰バグによりProおよびThinkingの会話の約3%が予期せずGPT-5.5-miniにルーティングされていたが、この問題はすでに修正されたと述べた。
Google Labsは、「Play with Putty」と呼ばれる研究実験を発表しました。これは、複数のユーザーがリアルタイムのVibeコーディングを通じてツールやウェブサイトを共同で構築できるものです。現在、候補者の選考が行われています。
Stability AIは、Electronic Arts、Sony Music、Universal Music、Warner Music、AMD Venturesなどの投資家から7,600万ドルのシリーズB資金調達ラウンドを完了したと発表した。
SenseTime社のSenseNova U1.5 Liteは、Token Planとの正式な統合を実現し、画像生成と編集をサポート。最大出力解像度は4096×4096ピクセルで、パブリックベータ期間中は無料で利用できます。
テンセントのWeChatビジョンチームは、WeMM-Embeddingをリリースした。これは2B、4B、9Bの3つのバージョンがあり、いずれもテキスト、画像、動画、ビジュアルドキュメント、およびそれらを組み合わせたマルチモーダル入力を統一的にサポートしている。
ByteDanceは、生産性向上シナリオ向けに設計されたエージェント製品「Doubao Work」を正式にリリースしました。タスクの細分化、ツールの呼び出し、複雑なワークフローをサポートし、Lark Enterprise Contextと統合されています。
QianwenアプリとPC版ワークアシスタントに、Alibaba Cloudトークンプランとの連携機能が新たに搭載されました。APIキーを設定することで、ユーザーは自身の利用枠を直接利用して複雑なタスクを実行できるようになります。
MiniMax-AIは、H3モデル向けのチェックポイント、量子化スキーム、ローカル実行、推論アクセラレーション、開発ツールなどのエコシステムリソースを集約した「Awesome MiniMax H3 Integrations」をリリースしました。
BreezeBlueは、30億個のパラメータを持つ音声モデル「Breeze TTS 2」をリリースしました。このモデルは、中国語と英語の音声クローン、音声デザイン、音調制御、ストリーミング合成をサポートしています。
Anthropicは、AIがユーザーの幸福に与える影響を測定するためのオープンソースの評価、ベンチマーク、測定方法を開発する独立系研究者を支援するため、500万ドルの助成金プログラムを設立した。
Appleは、最大512GBの統合メモリを搭載し、Thunderbolt 5とRDMAを介してマルチマシンAI推論クラスタをサポートする、M5 MaxとM5 Ultraバージョンの新しいMac Studioをリリースした。
IBMは、推論、ツール呼び出し、コーディング、エンタープライズエージェントのワークフロー向けに、3B、8B、30Bのパラメータバージョンで利用可能な言語モデルであるGranite 4.2をリリースしました。この言語モデルはApache 2.0ライセンスの下で提供されています。
Perplexityはポータブルコンピュータを導入しました。これにより、エージェントのワークフローをNVIDIA DGX Spark上でローカルに実行できるようになります。ローカルタスクはクレジットを消費せず、コンテンツをクラウドに送信する前にユーザーの承認を求めます。
Anthropicは、ClaudeチャットとCoworkのメモリーシステムを統合し、ユーザーがトピックごとにメモリーを表示、編集、削除できるようにします。機密性の高いトピックはデフォルトでは保存されず、チームおよびエンタープライズでの利用可能性は管理者によって制御されます。
LiblibAIは、映画レベルのコンテンツ制作に特化した海外向けAI動画制作プラットフォーム「Newtake」を発表しました。無限キャンバスとノードベースのワークフローを基盤とするこの製品は、ディレクターズコンソール、シネマティックライティング、マルチビュー分析、テクスチャキャラクターテーブル、プロフェッショナルなショット複製などの機能を統合しています。既にSeedance 2.5モデルとの連携も実現しています。この製品の最大の強みは、キャラクターの一貫性管理によってAI動画の顔交換における課題を解決し、視覚化されたノードベースのワークフローによってプロの映画・テレビ制作への参入障壁を低くすることにあります。
XiaohongshuのFireRedチームは、音声生成と編集を統合したモデルであるFireRedTTS3をオープンソース化しました。RedAEのセマンティック強化連続表現とLLM-DiTアーキテクチャに基づき、このモデルは24言語と21の中国語方言において、ゼロサンプル音色クローニング、自然言語音声デザイン、および指定領域の精密な音声編集を実現します。このモデルは4つの公開ベンチマークデータセットで最先端の結果を達成しており、オーディオコンテンツ、ゲームのナレーション、ブランドカスタマーサービスなどのシナリオに効率的なソリューションを提供します。