HouseCrafter - ノースイースタン大学とStability AIが、2Dの屋内シーンを3Dに変換する技術を発表
ノースイースタン大学とStability AIが開発した先進技術であるHouseCrafterは、2Dフロアプランを自動的に3Dインテリアシーンに変換します。ネットワーク規模の画像学習済み2D拡散モデルに基づいて、一貫性のあるマルチビューを生成します。
ノースイースタン大学とStability AIが開発した先進技術であるHouseCrafterは、2Dフロアプランを自動的に3Dインテリアシーンに変換します。ネットワーク規模の画像学習済み2D拡散モデルに基づいて、一貫性のあるマルチビューを生成します。
AMD-135Mは、AMD初の小型言語モデル(SLM)であり、特定のユースケースにおいてパフォーマンスとリソース消費のバランスを提供します。LLaMA2モデルアーキテクチャに基づいており、670億個のデータに基づくAMD Instinct MI250アクセラレータでトレーニングされています。
JoyHalloは、JD.comが開発したオープンソースのAIデジタルヒューマンモデルで、特に中国語(北京語)向けに設計されています。音声データに基づいてリアルな会話動画を生成でき、特に中国語の複雑な唇の動きやイントネーションの処理に優れており、多言語での動画生成も可能です。
Seed-VCは、コンテキスト学習に基づいて高音質な音声出力と音色の類似性を実現する、サンプル不要の音声変換技術です。ユーザーは特別なトレーニングを必要とせず、1秒から30秒の参照音声サンプルを提供するだけで音声認識が可能になります。
Phidiasは、3Dモデリング分野に検索強化型生成(RAG)の概念を導入した高度な3Dコンテンツ生成モデルです。このモデルは、ユーザーが提供する3D参照モデル、または大規模データベースから取得したモデルに基づいて、新しいコンテンツを生成するのに役立ちます。
Movie Genは、Meta社が開発したAI動画生成ツールです。テキストプロンプトに基づいて動画を生成・編集し、同期音声を追加できます。この技術には、最大16秒の高解像度動画の作成、既存動画への音声追加、編集などが含まれます。
Mini-LLaVAは、清華大学と北京航空航天大学の研究チームが共同開発した軽量マルチモーダル大規模言語モデルです。画像、テキスト、動画の入力を処理でき、効率的なマルチモーダルデータ処理を実現します。
MemoryScopeは、大規模言語モデル(LLM)を持つチャットボット向けに設計された長期記憶システムです。フレームワークを構築することで、チャットボットが基本的なユーザー情報、習慣、嗜好を記憶し、パーソナライズされた対話型体験を提供できるようになります。
CogView3は、清華大学とZhipu AIが共同開発したオープンソースのAI画像生成モデルで、リレー拡散技術を採用しています。このモデルは段階的に画像を生成します。まず低解像度の画像を生成し、次にリレー超解像技術を用いて高解像度にアップスケールします。
RTranslatorは、Androidデバイス向けに特別に設計された、オープンソースの無料オフラインリアルタイム翻訳アプリケーションです。MetaのNLLB翻訳モデルやOpenAIのWhisper音声認識など、高度なAI技術に基づいています。
Molmo 72Bは、アレン人工知能研究所(AI2)が開発したオープンソースのマルチモーダルAIモデルで、画像データとテキストデータの処理および理解を目的として設計されています。Qwen2-72Bモデルをベースに、OpenAIのCLIPを視覚化ツールとして使用しています。
ProX(Programming Every Example)は、大規模言語モデル用の事前学習済みデータの品質を向上させるために設計されたフレームワークです。人間の専門家がルールを策定する従来の手法とは異なり、ProXはデータクリーニングをプログラミング問題として扱います。
OutofFocusは、Gradoプラットフォームを利用したAI搭載の画像編集ツールで、ユーザーに直感的な画像編集インターフェースを提供します。その主要機能は、ユーザーからのテキスト入力を受け付け、自然言語処理を用いて処理することです。
TeleChat2-115Bは、中国電信傘下のTeleAI研究所が開発した大規模言語モデルであり、星辰意味論大規模モデルシリーズに属します。国内で開発された計算能力を用いて学習され、10兆トークンに及ぶ高品質な中国語と英語のデータセットを使用しています。
GroundingBoothは、セントルイスのワシントン大学、Adobe、パデュー大学の研究チームによって開発された、高度なテキストから画像へのカスタマイズフレームワークです。テキストと画像のアライメントモジュールとマスキングクロスアテンションレイヤーに基づいています。
Markmapは、Markdownテキストをマインドマップに変換するツールです。Markdownの構文に基づいて、リアルタイムで視覚的なマインドマップを生成し、ユーザーが直感的に情報を整理・表示できるようにします。Markmapは軽量で…
OLMoE(Open Mixture-of-Experts Language Models)は、Mixture-of-Experts(MoE)アーキテクチャに基づいた、大規模で完全オープンソースの言語モデルです。OLMoEは5兆トークンで事前学習されており、合計70億の…
WebDesignAgentは、AI技術を活用してユーザーが簡単にウェブサイトを作成できる自動ウェブデザインツールです。ユーザーは簡単なテキスト説明を入力するか、画像をアップロードするだけで、WebDesignAgentは完全に機能し、美しくデザインされたウェブサイトを生成します。
ChatMLXは、大規模言語モデル(LLM)に基づいた高性能macOSチャットアプリケーションで、MLXフレームワークを使用してデータと対話します。このアプリケーションは自然言語処理技術を利用して、ユーザーがデータと会話できるようにし、テキストベースの…をサポートしています。
CDial-GPTは、清華大学の研究チームによって開発された、大規模な中国語短文対話データセットLCCCと、そのデータセットに基づいた事前学習済み対話生成モデルです。LCCCデータセットは厳密なクリーニングプロセスを経ており、基本バージョン(LCCC-base...)が含まれています。
RD-Agentは、Microsoft Research Asiaが開発したオープンソースの自動化された研究開発(R&D)ツールです。AI技術を活用してデータ駆動型のAI研究開発プロセスを推進し、モデルとデータ開発の簡素化に重点を置いています。RD-Agentは…
FLUX 1.1 Pro(コードネーム「Blueberry」)は、Black Forest Labsが開発した最新のAI画像生成モデルです。前モデルに比べて最大6倍高速な生成速度を実現しながら、画像の適時性と多様性を維持しています。FLUX 1.1は、…
OpenAIが開発したRealtime APIは、テキストと音声を入力および出力としてサポートする、低遅延のマルチモーダル対話型APIです。Realtime APIを使用すると、開発者は音声対音声など、ほぼリアルタイムのインタラクティブなエクスペリエンスを構築できます。
Laminarは、大規模言語モデル(LLM)アプリケーション向けに設計されたオープンソースのオブザーバビリティおよび分析プラットフォームです。Laminarは、LLMデータの追跡、評価、注釈付け、分析のための包括的なツールスイートを提供し、開発者がより深い洞察を得られるようにします。