Optimus-1 - ハルビン工業大学と鵬城実験室が共同開発したインテリジェントエージェントフレームワーク
Optimus-1は、ハルビン工業大学(深圳)と鵬城研究所が開発したインテリジェントエージェントフレームワークであり、オープンワールド環境で長期タスクを完了するという課題に対処するために設計されています。このフレームワークは、構造化された知識とマルチモーダルな経験を組み合わせることで、インテリジェントエージェントが…
Optimus-1は、ハルビン工業大学(深圳)と鵬城研究所が開発したインテリジェントエージェントフレームワークであり、オープンワールド環境で長期タスクを完了するという課題に対処するために設計されています。このフレームワークは、構造化された知識とマルチモーダルな経験を組み合わせることで、インテリジェントエージェントが…
Fox-1は、TensorOperaがリリースした一連の小型言語モデル(SLM)であり、Fox-1-1.6BとFox-1-1.6B-Instruct-v0.1が含まれます。Fox-1モデルは、3兆件のWeb取得ドキュメントで事前学習されており、50億件のドキュメントでテストされています。
Llama 3.3は、Meta AI社が開発した70パラメータのモデルで、大規模な多言語事前学習済み言語モデルです。その性能は、40パラメータのLlama 3.1に匹敵します。このモデルは多言語対話に特化して最適化されており、英語、ドイツ語、フランス語、イタリア語などに対応しています。
Auroraは、xAIがAIアシスタントGrokに追加した新しい画像生成モデルです。Auroraは、特に肖像画など、リアルな画像の生成に優れています。ミッキーマウスなどの著名人や著作権で保護された人物の画像も生成できます。Auroraの…
One Shot, One Talkは、1枚の画像からパーソナライズされた詳細情報を備えた、完全にアニメーション化された会話アバターを生成できる高度な画像生成技術です。自然な表情や生き生きとした体の動きなど、リアルなアニメーション効果をサポートします。
GLM-4V-Flashは、Zhipu AIが初めてリリースした無料のマルチモーダルモデルAPIです。GLM-4V-Flashモデルは、画像記述生成、画像分類、視覚推論、視覚的質問応答(VQA)、画像感情分析など、高度な画像処理機能を備えています。
Clone-voiceは、ディープラーニング技術を用いて人間の声を分析・シミュレートし、高品質な音声クローンを実現するオープンソースの音声クローンツールです。中国語、英語、日本語、韓国語を含む16言語に対応しており、…
SNOOPIは、拡張されたシングルステップ拡散モデルに基づくガイダンスによってモデルのパフォーマンスと制御を強化する革新的なテキストから画像への生成フレームワークです。SNOOPIには、PG-SB(適切なガイダンス - SwiftBrush)とNASA(ネガティブなアウェイターンアテンション...
MEMO(Memory-Guided EMOtionaware diffusion)は、Skywork AI、南洋理工大学、シンガポール国立大学が共同開発した、音声駆動型のポートレートアニメーションフレームワークです。一貫性のあるアイデンティティと表現力を持つ画像を生成するために使用されます。
NVILAは、効率性と精度を両立させたNVIDIAのビジュアル言語モデルシリーズです。このモデルは、「まず拡大し、後で圧縮する」戦略を採用することで、高解像度画像や長時間の動画を効率的に処理します。NVILAは、トレーニングとファインチューニングの過程でシステム最適化が行われます。
O1-CODERは、北京交通大学の研究チームが立ち上げたオープンソースプロジェクトです。OpenAIのO1モデルを再現することを目的としており、コーディングタスクに焦点を当てています。O1-CODERは、強化学習(RL)とモンテカルロ木探索(MCTS)技術を組み合わせて、コーディングタスクの精度を向上させています。
SOLAMIは、南洋理工大学の研究チームが開発した革新的なVRベースの3DロールプレイングAIシステムです。ソーシャルビジョン・言語・行動モデルに基づき、音声や身振り手振りを用いて仮想キャラクターと没入感のあるインタラクションを行うことができます。
Florence-VLは、メリーランド大学とマイクロソフトリサーチが共同開発した革新的なマルチモーダル大規模言語モデル(MLLM)です。Florence-VLは、生成型ビジュアル基盤モデルFlorence-2を用いて視覚表現を強化し、画像キャプチャを可能にします。
OOTDiffusionは、さまざまな性別や体型にインテリジェントに適応し、服のサイズや形状を自動的に調整して自然なフィット感を生み出すオープンソースのAI仮想試着ツールです。OOTDiffusionは、上半身と全身の試着モードをサポートしています。
Googleの最新量子チップ「Willow」は、105個の物理量子ビットを搭載し、量子誤り訂正と計算効率において大きなブレークスルーをもたらしました。Willowは、量子コンピューティングにおける30年近くにわたる誤り訂正問題を解決し、…
GenMACは、香港大学、清華大学、およびマイクロソフトリサーチによって開発された、マルチエージェント協調のための反復フレームワークであり、テキストからビデオへの変換における複雑なシーン生成問題を解決するために使用されます。これは、タスクを設計、生成、再設計に分解することに基づいています。
Amurexは、リアルタイムの提案、インテリジェントな要約、要点の抽出、途中参加者のレビュー、完全な会議議事録作成などの機能を通じて、会議の効率向上を支援するAI搭載の会議アシスタントです。オープンソースツールであるAmurexは、透明性を重視しています。
EasyHealthは、北京大学健康コミュニケーション学部の教員と学生が開発したWeChatミニプログラムです。大規模言語モデル技術を基盤とした、健康教育のためのインテリジェントなQ&Aシステムです。AIを活用したインテリジェントなQ&A、感情知能アルゴリズム、健康記録など、様々な機能を提供します。
See3D(See Video, Get 3D)は、北京人工知能研究院が開発した3D生成モデルです。大規模なラベルなしインターネット動画から学習し、そこから3Dコンテンツを生成します。これは、従来のカメラベースのモデルとは異なります。
VISION XLは、潜在拡散モデル技術に基づいた高効率ビデオ復元および超解像ツールであり、高解像度ビデオの逆問題の解決に重点を置いています。このツールは、ビデオの欠落部分を修復し、ぼやけを取り除き、ビデオの鮮明度を大幅に向上させることができます。
SPDL(Scalable and Performant Data Loading)は、Meta AIが開発したオープンソースのデータロードツールで、AIモデルのトレーニング効率を向上させます。マルチスレッド技術に基づき、高スループットのデータロードを実現し、計算オーバーヘッドを削減します。
CausVidは、AdobeとMITが共同開発した自己回帰型リアルタイム動画生成技術であり、瞬時の動画再生を可能にします。蒸留法で事前学習された双方向拡散モデルに基づいた自己回帰型生成モデルを構築することで、動画生成の遅延を低減します。
ClotheDreamerは、上海大学、上海交通大学、復旦大学、およびテンセントYouTu Labが共同開発した3D衣服生成技術です。テキスト記述に基づいて、高精細な着用可能な3D衣服アセットを生成できます。ClotheDreamerは…
Directorは、インテリジェントなビデオエージェントを構築するためのフレームワークです。ユーザーは、ビデオ検索、編集、合成、生成といった複雑なビデオタスクを自然言語コマンドで実行し、結果をリアルタイムでストリーミングできます。VideoDBをベースとした「ビデオ・アズ・データ」プラットフォームです。