PhysGen3D - 清華大学をはじめとする複数の大学が共同開発した、一枚の画像からインタラクティブな3Dシーンを作成するためのツール。
PhysGen3Dは、単一の画像をインタラクティブな3Dシーンに変換し、物理的にリアルな動画を生成する革新的なフレームワークです。画像ベースの幾何学的および意味的理解と物理ベースのシミュレーションを組み合わせることで、単一の画像からインタラクティブな3Dシーンを作成することを可能にします。
PhysGen3Dは、単一の画像をインタラクティブな3Dシーンに変換し、物理的にリアルな動画を生成する革新的なフレームワークです。画像ベースの幾何学的および意味的理解と物理ベースのシミュレーションを組み合わせることで、単一の画像からインタラクティブな3Dシーンを作成することを可能にします。
EmotiVoiceは、NetEase Youdaoが提供するオープンソースのテキスト読み上げ(TTS)システムで、多言語、多音声、プロンプト制御による音声を提供します。EmotiVoiceは英語と中国語をサポートし、2000種類以上の音声を提供し、プロンプトに基づいてさまざまな絵文字を含むテキストを生成する機能をサポートしています。
Vibe Drawは、ユーザーが2Dキャンバスに描いたスケッチを美しい3Dモデルに変換するオープンソースのAI 3Dモデリングツールです。ユーザーはテキストプロンプトを使用したり、描画を続けながらモデルを繰り返し改良したり、ワンクリックで標準フォーマットにエクスポートしたりできます(...
OmniSQLは、自然言語の問題を効率的にSQLクエリ文に変換するオープンソースのテキストtoSQLモデルです。革新的なデータ合成フレームワークを通じて、初の100万レベルのテキストtoSQLデータセットであるSynSQL-2.5Mを生成します。
MegaTTS 3は、ByteDanceが浙江大学と共同開発したゼロショットテキスト音声合成システムです。わずか0.45バイトのパラメータを持つ軽量拡散モデルを採用し、高品質な音声を効率的に生成します。このシステムは音声をコンテンツ、オーディオ、そして…に分解します。
AutoGLMは、Zhipuが初めてリリースした無料AIエージェントであり、高度な研究と運用能力を備えています。人間の思考プロセスをシミュレートし、複雑な自由回答形式の質問にも対応できます。AutoGLMは、強力な推論能力と自律的な運用能力を誇ります。
cpmGO(MiniCPM Super Assistant)は、Mianwall Intelligenceが開発した世界初の純粋なエッジベースのインテリジェントアシスタントで、特に車載インテリジェントコックピット向けに設計されています。cpmGOはMianwall MiniCPMエッジモデルに基づいて開発され、ビジョン、音声、多機能性を備えています。
AReaL-bobaは、アリ研究所と清華大学が共同開発したオープンソースの強化学習トレーニングフレームワークです。AReaL-bobaはAReaLのアップグレード版であり、強化学習トレーニングへの参入障壁を下げ、ユーザーが推論モデルを容易にトレーニングできるようにします。
Qlibは、マイクロソフトリサーチアジアが金融業界向けに開発したAI搭載の定量投資ツールです。定量分析を行う研究者が投資分野におけるAI技術の可能性を探るのに役立ちます。Qlibは、データ抽出をサポートする高性能データ処理インフラストラクチャを提供します。
OpenDeepSearchは、オープンソースの推論モデルと推論エージェントに基づいて検索パフォーマンスを向上させるオープンソースのディープサーチツールです。Hugging FaceのSmolAgentsとのシームレスな統合に特化して最適化されており、ディープウェブ検索などをサポートしています。
Hi3DGenは、香港中文大学、深圳中文大学、ByteDance、清華大学の研究者らが共同開発した、高精度3Dジオメトリ生成フレームワークです。法線マップを中間表現として使用し、2D画像から高精度3Dモデルを生成できます。
GLM-Z1-Airは、Zhipu Technologyが開発した深層思考モデルで、GLM-4-Air-0414をベースにしています。GLM-Z1-Airは、事前学習段階でより多くの推論データを取り込み、アライメント段階で汎用的な能力を徹底的に最適化することで、強力な数学的能力を発揮します。
AI-ClothingTryOnは、Google Gemini AI技術を用いて仮想試着機能を実装したPythonベースのデスクトップアプリケーションです。AI-ClothingTryOnは、AI技術に基づいて、人物と衣服の写真を別々にアップロードすることをサポートしています。
GLM-4-Air-0414は、Zhipu Technologyが発表した320億個のパラメータを持つ基本モデルであり、AutoGLMの基盤となるモデルです。GLM-4-Air-0414は、事前学習段階でより多くのコードと推論データを組み込み、高度な身体能力の実現を目指しています。
Second Meは、Mindverseが開発したオープンソースのAIアイデンティティモデルです。ユーザーの「真の自己」を表す、完全にプライベートで高度にパーソナライズされたAIエージェントの作成をサポートします。Second Meは、チャットモードとブリッジモードを提供します。
FinGPTは、金融分野向けのオープンソースの大規模事前学習済み言語モデルであり、自然言語処理技術に基づいた金融イノベーションを推進します。強化学習と人間からのフィードバック(RLHF)技術を通じて、個々の嗜好を学習し、パーソナライズされた投資推奨を提供できます。
GLM-Z1-Ruminationは、Zhipuによって開発された熟考モデルであり、GLM-Z1をさらに最適化したもので、特定のパラメータGLM-Z1-Rumination-32B-0414が用いられています。GLM-Z1-Ruminationは、拡張強化学習を用いて学習されます。
Runway Gen-4は、AIスタートアップ企業Runwayが開発した高精細AI動画生成モデルです。追加の微調整やトレーニングを必要とせずに、複数のシーンにわたって人物、物体、環境の一貫性を維持することをサポートします。ユーザーは参照画像を提供します...
VantAIが開発したNeo-1は、その場での分子生成と原子レベルの構造予測を統合した世界初のAIモデルです。生体分子構造の予測や全く新しい分子の生成が可能で、分子ゲルなどの新規治療薬の設計において有望な可能性を示しています。
Amazon Nova Actは、Amazon AGI Labsが開発した汎用AIエージェントで、Webブラウザ内でタスクを実行するために使用されます。Amazon Nova Actを使用すると、開発者は付属のSDKに基づいてプロトタイプのインテリジェントエージェントアプリケーションを構築でき、次のようなタスクを実行できます。
Amodal3Rは、部分的にしか見えない2Dオブジェクト画像から完全な3D形状と外観を推論・再構築する条件付き3D生成モデルです。このモデルは、「ベース」となる3D生成モデルTRELLISをベースに、マスクの重み付けを組み込んでいます。
AutoAgentは、香港大学が開発した、コード不要の自動化されたLLM(学習モデル)インテリジェントエージェントフレームワークです。自然言語による対話に基づいており、プログラミングなしでインテリジェントアシスタントを作成できるため、インテリジェント検索、データ分析、レポート生成などのシナリオに適しています。
Text to Barkは、ElevenLabsが開発した、世界初のAI搭載型犬用テキスト音声合成モデルです。ユーザーがテキストを入力し、犬種を選択すると、このモデルは95%の犬において実際の鳴き声と区別がつかないほどリアルな犬の鳴き声を生成します。
Cuaはtrycuaチームによって立ち上げられたオープンソースのAIエージェントプロジェクトで、macOSユーザーに高性能な仮想化機能とAIエージェント機能を提供します。CuaはAppleの仮想化フレームワークに基づいており、Apple Siliceをサポートしています。