GLM-Zero - Zhipu AIが発表した深層推論モデル
GLM-Zeroは、Zhipu AIが開発した拡張強化学習技術に基づく推論モデルで、モデルの深層推論能力の向上に重点を置いています。数学的論理、コーディング、複雑な問題解決に優れており、AIME 2024、MATH500、LiveCなどのコンテストで成功を収めています。
GLM-Zeroは、Zhipu AIが開発した拡張強化学習技術に基づく推論モデルで、モデルの深層推論能力の向上に重点を置いています。数学的論理、コーディング、複雑な問題解決に優れており、AIME 2024、MATH500、LiveCなどのコンテストで成功を収めています。
AutoRAGは、中国科学院計算機技術研究所(ICT/CAS)、中国科学院人工知能セキュリティ重点実験室、および中国科学院大学の研究者らが共同開発した、新しい自律型反復検索モデルです。大規模なデータ処理向けに特別に設計されています。
MARS(Market Simulation)は、マイクロソフトリサーチアジアが開発した金融市場のシミュレーションおよび予測エンジンです。生成型ベースモデルであるLMM(大規模市場モデル)に基づいて、金融市場における注文の流れと市場動向をシミュレーションします。
StoryWeaverは、厦門大学の教育部マルチメディア信頼知覚・高効率コンピューティング重点実験室とNetEase Fuxi AI Labが共同開発したAIモデルです。知識強化型のストーリーキャラクターカスタマイズにより、高品質なストーリービジュアライゼーションを実現します。
StockMixerは、上海交通大学が開発した多層パーセプトロン(MLP)アーキテクチャで、株価予測に用いられ、シンプルさと強力な予測能力を兼ね備えています。このアーキテクチャは、指標混合、時間混合、銘柄混合という3つのステップに基づいています。
LaDeCoは、西安交通大学とマイクロソフトリサーチが共同開発した、自動化されたグラフィックデザインおよび構成手法です。デザインタスクを階層的なステップに分解することに基づいています。LaDeCoは入力されたデザイン要素に対してレイヤープランニングを実行し、それらを...
SEMIKONGは、Aitomatic、FPT Software、東京エレクトロンが共同開発した、半導体業界向けに特化して設計された大規模言語モデル(LLM)です。深い専門知識に基づき、半導体製造および設計に関連する問題を解決します。
MinT(Mind the Time)は、Snap Research、トロント大学、Vector Instituteが共同開発したマルチイベント動画生成フレームワークです。正確な時間制御に基づき、テキストプロンプトに基づいて複数のイベントを含む動画シーケンスを生成します。
トロント大学、Snap、UCLAの研究チームが開発した技術「Wonderland」は、1枚の画像から高品質で広範囲な3Dシーンを生成でき、カメラの軌道を制御することも可能です。この技術は、3D再構成モデルを効果的に構築できることを実証しています。
VersaGenは、テキストから画像を生成する生成型AIエージェントであり、柔軟なビジュアル制御を可能にします。VersaGenは、単一の視覚的被写体、複数の視覚的被写体、シーンの背景など、任意の要素の組み合わせを処理できます。
ILLUMEは、ファーウェイ・ノアズ・アーク・ラボが提案した、視覚理解と生成機能を単一のフレームワークに統合した、統一されたマルチモーダル大規模モデルです。このモデルは大規模言語モデル(LLM)に基づいており、連続画像入力と離散画像入力の組み合わせを採用しています。
AIGCPanelは、シンプルさと使いやすさで知られるオープンソースのAIデジタルヒューマンシステムです。ビデオ合成、サウンド合成、サウンドクローニングなどのコア機能をサポートしています。TypeScriptを使用して開発されており、クロスプラットフォームに対応し、AGPL-3.0ライセンスに準拠しているため、...
HuatuoGPT-o1は、香港中文大学深圳校と深圳ビッグデータ研究所が共同開発した、医療分野向けの複雑推論モデルです。複雑推論能力に基づいて医療問題の解決性能を向上させることを目的としています。このモデルは2つの...
LangGraphは、特にエージェントおよびマルチエージェントワークフローを作成するための大規模言語モデル(LLM)と組み合わせて使用する場合に、ステートフルなマルチエージェントシステムを構築するために設計されています。LangChainの一部として...
R2Rは、検索拡張生成に特化した高度なAI検索システムです。R2Rは、マルチモーダルコンテンツの取り込み、ハイブリッド検索、ナレッジグラフの構築、GraphRAGクラスタリング分析などを統合しています。
Elizaは、ai16zが開発したオープンソースのマルチエージェントシミュレーションフレームワークであり、自律型AIエージェントの作成、デプロイ、管理を目的としています。TypeScriptで開発されており、インテリジェントエージェント構築のための柔軟で拡張性の高いプラットフォームを提供します。
MagicMirrorは、ディープラーニング技術を用いてユーザーがワンクリックで外見を自在に変えられる、オープンソースのAI顔交換、ヘアスタイル変更、服装変更アプリケーションです。使いやすさ、ハードウェアへの優しさ、プライバシー保護、軽量設計が特徴で、ハイエンドなハードウェアは必要ありません。
PanoDreamerは、1枚の画像から一貫性のある360°3Dシーンを生成できる新しい手法です。既存の手法とは異なり、この手法では問題を2つの最適化タスク(1枚の画像によるパノラマ生成と深度推定)として構造化し、交互に最小値を取る手法を導入しています。
VideoMakerは、浙江大学、テンセント、ファーウェイ・ノアズアーク・ラボが共同開発した革新的なプロジェクトです。ビデオ拡散モデル(VDM)に基づいた、ゼロショットのカスタムビデオ生成フレームワークです。従来の方法とは異なり、VideoMakerは追加の...
TITANは、ハーバード大学医学部の研究チームが開発した、マルチモーダルな全スライス病理モデルです。視覚的自己教師あり学習と視覚言語アライメントによる事前学習を通して、微調整や臨床ラベル付けなしに、普遍的なスライス表現を抽出できます。
TANGOFLUXは、シンガポール工科デザイン大学(SUTD)とNVIDIAが共同開発した高効率なテキスト音声生成モデルです。このモデルは約5億1500万個のパラメータを持ち、単一のA40 GPUでわずか3.7秒で最大30秒の音声ファイルを生成できます。
MMedAgentは、医療分野向けに特別に設計されたマルチモーダルAIエージェントであり、さまざまなオープンソースの医療モデルを統合することで、多様な医療タスクを管理します。このシステムには、アクションとして、命令調整型マルチモーダル大規模言語モデル(MLLM)が含まれています。
VITRONは、Skywork AI、シンガポール国立大学、南洋理工大学が共同開発したピクセルレベルの視覚的大規模言語モデル(LLM)です。静止画像と動画を包括的に理解・処理することができ、画像や動画の理解を可能にします。
n8nはオープンソースの自動ワークフロー管理システムで、コードを一切書かずにドラッグ&ドロップで複雑なワークフローを作成できるローコードプラットフォームを提供します。n8nはAIを含む400以上のアプリケーションやサービスとの統合をサポートしています。