RWKV-7-2.9Bモデル(RWKV-7-World-2.9B-V3)は、RWKV財団が発表した高度なRNN大規模言語モデルです。RWKV World V3データセットで学習されており、29億個のパラメータを持ち、世界中のすべての言語をサポートしています。このモデルは…
RWKV-7-2.9Bモデル(RWKV-7-World-2.9B-V3)は、RWKV財団が発表した高度なRNN大規模言語モデルです。RWKV World V3データセットで学習されており、29億個のパラメータを持ち、世界中のすべての言語をサポートしています。このモデルは…
Data Formulatorは、Microsoft Researchが開発したオープンソースのAI駆動型データ視覚化ツールで、シンプルな操作とコマンドでユーザーが豊富なデータ視覚化を素早く作成できます。グラフィカルユーザーインターフェイス(GUI)と…
Magic 1-For-1は、北京大学、Hedra Inc.、Nvidiaが共同開発した高効率ビデオ生成モデルです。メモリ消費量と推論レイテンシを最適化することで、高品質のビデオクリップを高速に生成します。このモデルは、複雑なテキストをビデオに変換します。
Praison AIは、ローコードソリューションを使用してAIエージェントを作成および管理し、単純なものから複雑なものまでさまざまなタスクを自動化および解決する、本番環境レベルのマルチエージェントフレームワークです。Praison AIは、シーケンシャル、区切り、シーケンシャルワークフローなど、さまざまなプロセスタイプをサポートしています。
Goedel-Proverは、プリンストン大学、清華大学、その他の機関によって開発されたオープンソースの大規模言語モデル(LLM)です。数学の問題に対する形式的な証明の生成を自動化するために使用されます。自然言語処理に基づいており、
CineMasterは、Kuaishouが開発したテキストから動画を生成するフレームワークで、3D認識機能を備えています。ControlNetの動画版に似ており、様々な制御信号を用いて動画内のオブジェクトの位置やカメラの動きを正確に制御できます。
GAS(Generative Avatar Synthesis from a Single Image)は、カーネギーメロン大学、上海人工知能研究所、スタンフォード大学の研究者らが提案した技術で、1枚の画像から高品質で視点指向のアバターを生成するものです。
OpenThinker-32Bは、スタンフォード大学、カリフォルニア大学バークレー校、ワシントン大学などの機関が共同開発したオープンソースの推論モデルです。328億個のパラメータを持ち、16,000トークンのコンテキスト長をサポートしています。このモデルはわずか114kのデータしか使用しません。
ソーシャル メディア エージェントは、入力された URL に基づいて Twitter や LinkedIn の投稿を生成するインテリジェントなソーシャル メディア コンテンツ管理ツールです。ソーシャル メディア プラットフォームの認証を処理するために、人間とコンピュータの対話プロセスを使用します。
Matrix-Zeroは、Kunlun Techが開発した世界モデルであり、大規模3Dシーン生成モデルと大規模インタラクティブビデオ生成モデルの2つのサブモデルから構成されています。Matrix-Zeroは、ユーザーが入力した画像を、自由に探索可能なリアルな3Dモデルに変換することができます。
Sa2VAは、ByteDance、カリフォルニア大学マーセド校、武漢大学、北京大学が共同開発したマルチモーダル大規模言語モデルです。SAM2とLLaVAを組み合わせることで、画像や動画の緻密かつ詳細な理解を実現します。
WebLI-100Bは、Google DeepMindが提供する1000億組の画像とテキストのペアを含む大規模なデータセットで、視覚言語モデル(VLM)の事前学習に使用されます。WebLI-100Bは、WebLIデータセットのデータを基にした、WebLIデータセットの拡張版です。
BAG(Body-Aligned 3D Wearable Asset Generation)は、香港中文大学とテンセントが共同で提案した革新的な3Dウェアラブルアセット生成技術です。マルチビュー画像拡散モデルと制御ネットワーク(Control...
Tonggu Modelは、華南理工大学の深層学習・視覚計算研究所(SCUT-DLVCLab)が開発したAI言語モデルで、古典中国語テキストの処理に特化しています。白川2-7B-Baseに基づいて段階的に事前学習されており、...
ENEL(Exploring the Potential of Encoder-free Architectures in 3D LMMs)は、3D理解タスクにおける従来のエンコーダーアーキテクチャの限界に対処する革新的なエンコーダーフリー3D大規模マルチモーダルモデル(3D LMM)です。
AnyCharVは、香港中文大学、清華大学深圳国際大学院、香港大学が共同開発した文字制御型動画生成フレームワークです。任意の参照文字画像とターゲットとなる動画を組み合わせることで、高品質な文字制御型動画を生成できます。
NobodyWhoは、Godotゲームエンジン向けに設計されたプラグインで、ローカルで動作する大規模言語モデル(LLM)を通じてインタラクティブな小説作成を可能にします。Windows、Linux、macOSプラットフォームに対応しており、インターネット接続なしでも使用できます。
PIKE-RAG(Simplified Knowledge and Rational Augmented Generation)は、Microsoft Research Asiaが開発した検索機能を強化した生成フレームワークです。これは、複雑な産業用途における従来のRAGシステムの限界に対処するものです。
Collaborative Gym(Co-Gym)は、人間とエージェントのコラボレーションに焦点を当てたフレームワークであり、人間とAIエージェント間のリアルタイムのインタラクションとコラボレーションをサポートします。シミュレーションと実世界の両方の実験条件を通じて、...
TIGER(Time-frequency Interleaved Gain Extraction and Reconstruction Network)は、清華大学の研究チームが提案した軽量音声分離モデルです。時間周波数インターリーブモデリング戦略を採用しています。
NPOAは、オンライン上の世論をリアルタイムで監視し、特定のトピックやブランドに対する世論の感情を理解するのに役立つ、強力なオープンソースの世論監視ツールです。高度な自然言語処理技術に基づき、このシステムは大量のオンラインデータを分析できます。
Long-VITAは、Tencent YouTu Lab、南京大学、厦門大学が共同開発したオープンソースのマルチモーダルモデルです。100万トークンを超える長文入力にも対応でき、短文タスクでも優れた性能を発揮します。Long-VITAは段階的なトレーニングに基づいています。
杭州智珍科技が開発したWiseDiagは、人工知能を通じて医療サービスの効率と質を向上させることに重点を置いた、世界をリードする医療ビッグデータモデルです。このモデルは、730億のパラメータと32,000のコンテキスト長を誇り、…
CustomVideoXは、中国科学技術大学(USTC)と浙江大学などが共同で提案した革新的なパーソナライズド動画生成フレームワークです。参照画像とテキスト説明を用いて、高品質でカスタマイズされた動画を生成します。このフレームワークは、動画拡散トランスフォーマーに基づいています。