ジェネレーティブUI - GoogleのジェネレーティブインタラクティブインターフェースAI技術
ジェネレーティブUIは、Googleが開発した革新的なAI技術で、ユーザーの自然言語による入力に基づいて、AIが瞬時に完全なインタラクティブなユーザーインターフェースを生成することを可能にします。これらのインターフェースは、ウェブページ、ツール、ゲーム、教育アプリケーションなど、様々な形態に対応し、完全にカスタマイズ可能です。
ジェネレーティブUIは、Googleが開発した革新的なAI技術で、ユーザーの自然言語による入力に基づいて、AIが瞬時に完全なインタラクティブなユーザーインターフェースを生成することを可能にします。これらのインターフェースは、ウェブページ、ツール、ゲーム、教育アプリケーションなど、様々な形態に対応し、完全にカスタマイズ可能です。
MemOSは、インテリジェントエージェントやAIアプリケーション向けに長期記憶機能を提供するオープンソースのAIメモリ管理オペレーティングシステムです。MemOSは、統一されたメモリ抽象化レイヤーを通じて、テキストベースメモリ、アクティベーションメモリ、パラメータベースメモリなど、様々な種類のメモリをサポートしています。
Argus 1.0は、Ruishiがリリースした世界初のパノラマ画像入力に対応した大規模空間モデルです。Ruishiが蓄積した約100万セットの高解像度実空間データに基づいて学習されており、Transformerアーキテクチャを採用し、ミリ秒レベルのリアルタイム再構成を実現しています。
LoopToolは、上海交通大学とXiaohongshuチームが開発した、自動化されたモデル認識型の反復データ進化フレームワークです。大規模言語モデル(LLM)のツール呼び出しタスクにおけるパフォーマンスを向上させます。このフレームワークは、閉ループ最適化を利用しています。
SAM 3Dは、Meta社が開発した高度な3D再構築モデルで、SAM 3D ObjectsとSAM 3D Bodyという2つのサブモデルで構成されています。SAM 3D Objectsは、単一の画像からオブジェクトやシーンの3Dモデルを再構築でき、マルチビューにも対応しています。
GPT-5.1-Codex-Maxは、OpenAIが開発したインテリジェントなプログラミングモデルで、複雑で長期間にわたる開発タスク向けに設計されています。最新の推論アーキテクチャに基づき、複数のコンテキストウィンドウにまたがる「圧縮」技術を使用することで、大量のデータを処理できます。
SAM 3(Segment Anything Model 3)は、Meta AIの最新の高度なコンピュータビジョンモデルであり、テキスト、例、視覚的な手がかりを用いて、画像や動画内の物体を検出、セグメント化、追跡することができます。
PinMeは、静的ウェブサイトやフロントエンドプロジェクトを迅速に公開できる、オープンソースのワンクリックデプロイツールです。このツールは、IPFS分散ストレージとENSドメインを使用して永続的なリンクを生成するため、サーバーやDNSは不要です。
SeekDBは、OceanBaseが開発したオープンソースのAIネイティブデータベースであり、AIアプリケーション開発におけるマルチモーダルデータ融合とリアルタイム処理の課題を解決します。ベクトル検索、全文検索、構造化データフィルタリングを組み合わせた融合クエリをサポートしており、これらすべてを単一のSQLクエリで実現できます。
Nano Banana Pro(Gemini 3 Pro Imageとも呼ばれる)は、Googleが開発した次世代画像生成・編集モデルで、Gemini 3 Proの技術を搭載しています。このモデルは、高品質で高解像度(2Kおよび4K)の画像を生成できます。
HunyuanVideo 1.5は、TencentのHunyuanチームがオープンソース化した軽量動画生成モデルで、パラメータサイズは8.3Bです。拡散トランスフォーマーアーキテクチャに基づいており、テキストの説明や画像から5~10秒の高解像度動画を生成することができます。
MiMo-Embodiedは、Xiaomi初のオープンソースのクロスドメイン身体モデルであり、自動運転と身体知能の両方のタスクを統合し、環境認識、タスク計画、空間理解など、多くの面で優れた性能を実現しています。
Supertonicは、Supertone社が開発したオープンソースの高性能テキスト音声合成(TTS)システムで、極めて高速かつ軽量な設計を誇ります。わずか6600万個のパラメータで、リアルタイムの最大167倍の速度で音声を生成し、現在入手可能なTTSシステムの中で最速を実現しています。
Teammatesは、Ubisoftが開発した生成型AI技術に基づくAIチームメイトプロジェクトで、プレイヤーにより没入感のあるリアルなゲーム体験を提供することを目指しています。プレイヤーは、「パブロ、援護して」や「ソフィー…」といった音声コマンドをAIチームメイトにリアルタイムで送ることができます。
WorldGenは、Meta社の最新の高度なエンドツーエンドシステムで、単一のテキスト入力からインタラクティブでナビゲーション可能な3Dワールドを生成します。ユーザーは「中世の村」や「火星基地」などの説明を入力するだけで、システムが…
Olmo 3は、アレン人工知能研究所(AI2)が開発した大規模なオープンソース言語モデルシリーズです。このモデルには複数のバージョンがあり、Olmo 3-Base(7Bおよび32Bパラメータを持つ基本モデル)などが含まれます。
Claude Opus 4.5は、Anthropic社が開発した最新の高度なAIモデルです。このモデルは、プログラミング、システムレベルのタスク、定型的な調査、文書処理に優れており、複雑なソフトウェアエンジニアリングの問題にも巧みに対応します。
Fara-7Bは、Microsoftが開発したオープンソースのエージェントベースの小型言語モデル(SLM)で、コンピュータの使用に特化しています。このモデルは、Webページを視覚的に認識し、マウスやキーボードなどのインターフェース要素と対話することで、フォームへの入力や情報の検索といったタスクをユーザーが完了できるよう支援します。
HunyuanOCRは、TencentのHunyuanチームが開発したオープンソースのエンドツーエンドOCRビジュアル言語モデルです。Hunyuan独自のマルチモーダルアーキテクチャに基づいており、わずか10億個のパラメータで複数のOCRタスクにおいて最先端のパフォーマンスを実現します。非常に効率的で軽量なアーキテクチャを特徴としています。
FLUX.2は、Black Forest Labsが開発したビジュアルインテリジェンスモデルで、実際のクリエイティブワークフロー向けに特別に設計されています。このモデルは最大10枚のマルチイメージ参照をサポートし、最大4MP解像度の高品質画像を生成し、非常に高い性能を誇ります。
ViMaxは、香港大学データサイエンス研究所が開発したエンドツーエンドのマルチエージェント動画生成フレームワークです。アイデア、脚本、小説などを完全な動画に自動変換することを可能にします。このフレームワークは、監督、脚本家、プロデューサー、動画生成者といった役割を統合しています。
Z-Imageは、アリババ同義が開発した画像生成モデルで、60億個のパラメータを備えています。このモデルには、Z-Image-Turbo、Z-Image-Base、Z-Image-Editの3つのバリアントがあり、それぞれ高速推論、基本開発、画像編集に優れています。
Depth Anything 3(DA3)は、ByteDanceのSeedチームが開発した視覚空間再構築モデルです。単一のTransformerアーキテクチャを用いて、あらゆる視点からの視覚入力から3次元空間形状を復元します。
DeepSeek-Math-V2は、DeepSeekチームが開発したオープンソースの数学的推論モデルであり、自己検証可能な数学的推論を可能にします。このモデルは、解答の正しさに重点を置き、推論プロセスの厳密性を重視しています。