WiS(Who is Spy)は、Taotian GroupとAlibabaの技術研究チームが立ち上げた革新的なオンラインAIコンペティションプラットフォームです。大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)のテストと分析のために特別に設計されています。WiSは…
WiS(Who is Spy)は、Taotian GroupとAlibabaの技術研究チームが立ち上げた革新的なオンラインAIコンペティションプラットフォームです。大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)のテストと分析のために特別に設計されています。WiSは…
DRT-o1は、テンセント研究所が開発した一連のAIモデルで、ロングチェーン思考(CoT)技術を用いて文学作品の翻訳品質を大幅に向上させます。特に、比喩や寓話などの修辞技法を扱う際に効果を発揮します。このモデルは、…を理解することができます。
FastExcelは、大容量ファイルのメモリオーバーフローの問題を解決できる、高速かつ簡潔なExcel処理ツールを提供するオープンソースのJavaライブラリです。FastExcelはEasyExcelと互換性があり、パフォーマンスの最適化、バグ修正、指定されたファイルの読み込みなどの新機能を提供します。
FinRobotは、金融分野におけるアプリケーションに特化したオープンソースのAIエージェントプラットフォームです。大規模言語モデル(LLM)を活用し、金融分野における複雑な分析と意思決定が可能な特殊なAIエージェントを構築します。このプラットフォームは、金融思考連鎖(CoT)を利用してヒントを提供します。
DeepSeek V3は、著名なプライベートエクイティ大手Magic Square Quant傘下のAI企業DeepSeekが開発した最新のオープンソースAIモデルです。多言語プログラミング機能が大幅に向上しており、Aider多言語プログラミング評価におけるパフォーマンスは…
3DHM(3D Human Motions)は、カリフォルニア大学バークレー校の研究者によって開発された高度な3D人体動作生成技術です。静止画像から3D制御による動的な人体動画を生成することができ、静止画像から動きのある動画への変換を実現します。
Diff-Instructは、事前学習済みの拡散モデルから知識を抽出し、他の生成モデルの学習を誘導するために使用される高度な知識転送手法です。これは、新しい発散指標である積分カルバック・ライブラー(IKL)発散に基づいています。
VidTok(ビデオトークナイザー)は、マイクロソフトがオープンソース化した高度なビデオトークナイザーです。効率的なアルゴリズムを用いてビデオコンテンツを「ビデオワード」の連続に変換します。連続トークン化と離散トークン化の両方をサポートし、柔軟な圧縮率と多様な処理オプションを備えています。
Infinityは、ByteDanceが開発した、ビットレベルの自己回帰モデリングに基づくビジュアル生成モデルで、言語指示に基づいて高解像度でリアルな画像を生成できます。Infinityは、無限の語彙を持つタガー、分類器、ビットレベルの自己修正機能を活用しています。
ModernBERTは、Answer.AI、LightOn、ジョンズ・ホプキンス大学、NVIDIA、HuggingFaceが共同開発した、エンコーダーのみを使用する最新のTransformerモデルです。これは、従来のBERTモデルを大幅に改良したものです。
Cobaltは、クリーンで広告なしの快適な操作性を提供する、無料のオープンソース画像・音声・動画ダウンローダーです。Cobaltは、主要な動画サイト、ソーシャルメディア、音楽プラットフォームなど、あらゆるプラットフォームからの動画、音声、画像のダウンロードに対応しています。
CogAgent-9Bは、GLM-4V-9Bで学習された専用のエージェントタスクモデルです。入力としてスクリーンショットのみを必要とし、HTMLなどのテキスト表現は不要です。CogAgent-9Bは高解像度画像処理をサポートし、中国語と英語のバイリンガルです。
AGUVISは、香港大学とSalesforceが共同開発した、統一された純粋なビジュアルフレームワークです。自律型GUIエージェント向けに設計されており、Web、デスクトップ、モバイルデバイスなど、さまざまなプラットフォームで動作します。AGUVISは画像観察に基づいており、...
Enhance-A-Videoは、シンガポール国立大学、上海人工知能研究所、テキサス大学オースティン校が共同開発した動画生成強化アルゴリズムです。このアルゴリズムは、AI生成動画の品質を大幅に向上させます。特に、
Valleyは、ByteDanceが開発したマルチモーダルな大規模モデルで、テキスト、画像、動画データを含む多様なタスクを処理します。Valleyは、社内eコマースおよびショートビデオベンチマーク、そしてOpenComベンチマークでトップクラスの結果を達成しました。
UniT2IXLは、中国聯通AIが開発した中国語ネイティブのテキスト画像変換モデルで、国内のAscend AIハードウェアおよびソフトウェアプラットフォーム上で完全に学習および推論が行われます。このモデルは、長い中国語テキストに最適化された複合言語エンコーディングモジュールを採用しています。
DiTCtrlは、香港中文大学、テンセント、その他の機関が共同開発した、マルチモーダル拡散トランスフォーマー(MM-DiT)アーキテクチャに基づくマルチキュービデオ生成手法です。DiTCtrlは、追加のトレーニングなしで複数のキューを生成できます。
MNN(Mobile Neural Network)は、アリババグループがオープンソース化した軽量な深層学習推論フレームワークであり、モバイルデバイス、サーバー、PC、組み込みデバイスなど、さまざまなデバイス向けに効率的なモデル展開機能を提供します。MNNは…
Qiyuan Critical Care Modelは、TencentとMindray Medicalが共同開発した世界初の大型集中治療医療モデルです。ICU病棟向けに特化して設計されており、集中治療における主要な課題を解決します。このモデルは数兆ものパラメータを誇り、広範な医学的テストを受けています。
Poetry2Imageは、ハルビン工業大学が提案した、中国古典詩の画像生成に特化した反復補正フレームワークです。このフレームワークは、自動フィードバックと補正ループを通じて詩と画像の整合性を効果的に高めます。
PeterCatは、オープンソースのインテリジェントなQ&Aチャットボットアシスタントです。PeterCatは、開発者やコミュニティメンテナーが技術的な問題をより効率的に解決し、コミュニティサポートの効率性を向上させるのに役立ちます。PeterCatは自動的に構築された知識ベースに基づいており、GitHubと統合できます。
PartGenは、オックスフォード大学のビジュアルジオメトリグループとMeta AIが共同開発した、高度な3Dオブジェクト生成・再構築フレームワークです。PartGenは、意味のあるパーツで構成された3Dオブジェクトを認識・生成することができ、これらの3Dオブジェクトはテキストプロンプトに基づいて生成できます。
Vision Parseは、Vision LLM(Vision Language Models)に基づいてPDFファイルをMarkdown形式に変換するオープンソースのPDF文書変換ツールです。Vision Parseは、PDFからテキストと表をインテリジェントに識別して抽出することができ、さらに…
「Language of Motion」は、スタンフォード大学のFei-Fei Li氏のチームが開発したマルチモーダル言語モデルです。人間の動作から得られる言語情報と非言語情報を統合します。このモデルは、テキスト、音声、モーションデータを処理して、対応するターゲットを生成できます。