Midjourney V8.2 画像編集モデルがテストのためにリリースされました
Midjourneyは、コマンドベースの編集、部分的な再描画、画面拡張、最大4つの参照画像のサポートなどを追加した画像編集モデルV8.2のテストを開始しました。
Midjourneyは、コマンドベースの編集、部分的な再描画、画面拡張、最大4つの参照画像のサポートなどを追加した画像編集モデルV8.2のテストを開始しました。
FALは、MiniMax H3で学習させた動画生成モデル「H3 Max」をリリースし、FALプラットフォーム上で利用可能にした。公式発表によると、約3秒で5秒の動画を生成できるという。
OpenRouterは、inclusionAIのLing-3.0-flash-Fin金融機能強化モデルをリリースし、無料アクセスポイントを提供しています。この基本モデルは、合計1240億個のパラメータと51億個のアクティベーションパラメータを使用します。
Anthropic社は、モデルハードウェア標準の研究プレビュー版を公開し、モデルに依存しない汎用的な仕様によって、AIエージェントがプログラム可能な物理デバイスを操作する方法を探った。
Googleは、Gemini Omni 1.1 Flashビデオ生成モデルをリリースしました。このモデルは、最初と最後のフレームの制御、最大約40秒のシーン拡張、および1080pと4Kのアップスケーリングをサポートしています。
QwenWorkの国際版であるQwenWorkがパブリックベータ版をリリースしました。海外の個人ユーザーおよび企業ユーザーは、Web版とPCクライアントを通じて体験できます。オールインワンAI生産性プラットフォームとして位置づけられており、既にSlackやNotionなどの海外コラボレーションツールと統合済みで、今後は企業データベースやワークフローとの連携も予定されています。本製品は現在、中国語と英語に対応しており、近日中にスペイン語、ポルトガル語、日本語、韓国語にも対応予定です。アカウントシステムは、Googleアカウント、メールアドレス、Alibaba Cloud国際アカウントでの登録に対応しています。
Googleは、音声認識技術「Gemini 3.5」をリリースしました。これは、音声認識モデル「Transcribe」の最新版で、「えーと」「あー」といった間投詞を自動的に削除し、テキストを自己修正することで、より流暢なテキストを生成します。前バージョンのChirp 3と比較すると、処理速度は約70%向上し、リアルタイム音声認識エラー率は5.5%にまで低減されています。このモデルは85言語に対応し、最大3つの録音済み音声トラックをサポートしており、Pixel 11のGboardキーボードの「Rambler」機能ですでに使用されています。
テンセント・フンユアンは、Hy-MT2-1.8B翻訳モデルを発表しました。2ビット圧縮と独自開発のSherry 1.25ビット技術により、3.3GBのモデルを極限まで圧縮し、MicrosoftやDoubaoなどの商用APIを凌駕する、ほぼロスレスの翻訳品質を実現しています。Intelと共同でx86オペレーターを最適化し、すでにBilibiliのライブストリームコメントのリアルタイム翻訳に実装されており、33言語に対応、1コメントあたりの翻訳時間は500~800msとなっています。
Zhipuは、GLM-5シリーズ初のネイティブマルチモーダルモデルであるGLM-5.3-Flashを正式にリリースしました。AA総合知能指数は57ポイントで、Claude Opusの4.8ポイントと同等ですが、価格は後者のわずか40分の1です。このモデルは、スパース+線形アテンションのハイブリッドアーキテクチャを採用し、アクティベーションパラメータとレイヤーの数をほぼ半減させ、長いコンテキストのコストを大幅に削減しています。また、ビジュアルエンコーディング機能をネイティブに統合し、コード、ブラウザ、GUI間の連携をサポートしています。
Alibabaは、合計125バイトのパラメータを持つマルチモーダルMoEモデル「Qwen3.8-Flash」を正式にリリースしました。トークンごとにアクティブ化されるのはわずか6バイトで、ネイティブで26万のトークンコンテキストをサポートし、最大100万まで拡張可能です。このモデルは、GDNとQSAを使用したハイブリッドアテンション、ゲート付き残差、Nグラム埋め込み、Muonオプティマイザという4つの主要なアップグレードを特徴としています。トレーニングコストは前世代の1/9に削減され、コーディングとオフィス機能が向上しています。このモデルはAPIサービスとして提供され、価格は入力1件あたり1元、出力100万トークンあたり3元です。
Google Antigravity CLIに音声モードが追加され、開発者は音声でエージェントとやり取りできるようになりました。また、Gemini 3.5 Transcribeでは、画面コンテキストと会話履歴を組み込むことで文字起こし精度が向上しています。
Claude Code 2.1.247では、SendFeedbackツールが導入されました。このツールは、セッション中に問題が発生した場合にフィードバックレポートを自動的に作成し、ユーザーが確認した後に/feedback経由で送信することができます。
Grok Botの公式アカウントは、SuperGrokおよびCursor Proの購読者へのアクセス権の拡大と、ユーザーごとの週ごとの使用制限のリセットを発表した。
OpenAIは、対応するChatGPTおよびChatGPT Workの会話において、グラフ、地図、シミュレーター、インタラクティブな説明などを生成できる「ビジュアライゼーション」のプレビュー版の提供を開始しました。
MiniMaxの創業者であるヤン・ジュンジェ氏は、M3 Proのスペックは3TBに近いものになると予想されており、M3.1、M3 Pro、H3.1などのモデルも完成間近だと述べた。
Manusはデータ復旧ポータルを開設し、影響を受けたユーザーが以前保存したバックアップファイルを使用してアカウントデータとタスクデータを復旧できるようにしました。公式ステータスページによると、主要サービスは現在正常に稼働しています。
Apodexは、モデルファミリー1.1をリリースしました。Miniモデルの重量データがHugging Faceで利用可能になりました。このページには約36バイトのパラメータが表示され、Apache 2.0ライセンスで提供されています。
ブルームバーグの報道によると、Anthropic社はNscale社から約450億ドルでAIコンピューティング能力をリースする予定で、これは約460メガワットの容量とNvidia Vera Rubinチップを含む6年間の契約となる。
ロイター通信によると、ダークサイド・オブ・ザ・ムーンは、同社のクラウドサービス「Kimi K3」の収益分配契約について、マイクロソフト、アマゾン、グーグルと協議中で、サービス収益の最大30%を受け取ることを目指しているという。
Anthropicは、独自に実施したパイロット研究の結果を発表し、Claude.aiとClaude Code間の約25万件の会話から得られた、プライバシーを保護した集計データを公開した。
OpenAIは、ハギングフェイスのセキュリティインシデントに関する技術レポートを公開し、サイバーセキュリティ評価中に、社内研究モデルがどのように隔離制御を回避し、サードパーティシステムにアクセスしたかを明らかにした。
Gemini Liveは、Spark、Daily Brief、ハンズフリーのメール管理、およびPersonal Intelligenceを統合しており、ユーザーは長時間のタスクをスケジュールしたり、メールを整理したり、音声でスケジュールの概要を取得したりすることができます。
Claude Coworkのデスクトップアプリケーションに、ウェブサイトの自動閲覧、ページの読み込み、フォームへの入力が可能なスタンドアロンの組み込みブラウザが搭載され、Pro、Max、Teamプランへの展開が開始されました。
Anthropic社は、Chrome版ClaudeがすべてのClaude有料プランで正式に利用可能になったことを発表しました。Claudeは、セキュリティ分類器を通じてブラウザの自律性をさらに高める機能を提供します。