Open AgentKit - あらゆる用途に対応するオープンソースのAIエージェント開発プラットフォーム
Open AgentKit(OAK)は、ZeroOneが提供するオープンソースのAIエージェント開発プラットフォームであり、開発者にオープンで汎用的なエージェント開発ソリューションを提供します。OpenAI AgentKitに触発されたこのプラットフォームは、さまざまなモデルとエコシステムをサポートしています。
Open AgentKit(OAK)は、ZeroOneが提供するオープンソースのAIエージェント開発プラットフォームであり、開発者にオープンで汎用的なエージェント開発ソリューションを提供します。OpenAI AgentKitに触発されたこのプラットフォームは、さまざまなモデルとエコシステムをサポートしています。
BettaFishは、オープンソースのマルチエージェント型世論分析システムで、イベント、ブランド、製品に対する世論をユーザーが迅速に把握するのに役立ちます。このシステムは自然言語で動作し、ユーザーはチャットのようにリクエストを送信するだけで済みます。
Ouroは、ByteDanceのSeedチームが他の複数の機関と共同で発表したループ言語モデル(LoopLM)です。その名前は、ループと自己貪食の象徴である「ウロボロス」に由来しています。Ouroモデルは…
SAIL-Embeddingは、ByteDanceのDouyin SAILチームと香港中文大学のMMLabが共同開発したマルチモーダル埋め込みモデルです。マルチモーダル情報検索および推薦システムにおける実用的な応用上の課題に取り組んでいます。
FG-CLIP 2は、360社がリリースしたオープンソースの高精度なバイリンガル視覚言語アライメントモデルであり、視覚と言語の正確なアライメントという課題を解決するために特別に設計されています。視覚言語理解の分野、特に中国語と英語のバイリンガルタスクにおいて、大きなブレークスルーを達成しています。
NavFoM(Navigation Foundation Model)は、Galaxy Generalと北京大学、アデレード大学、浙江大学などのチームが共同で発表した、世界初のクロスオントロジー、フルドメインサラウンドビューナビゲーション基盤モデルです。フルシーンサポートなどの機能を備えています。
Handyは、完全にオフラインで動作し、Windows、macOS、Linuxシステムをサポートするオープンソースの音声認識デスクトップアプリケーションです。RustとReact/TypeScriptで構築されており、クリーンなインターフェースと簡単な操作が特徴です。ユーザーはすぐに...
UniWorld V2は、RabbitShow Intelligenceと北京大学のUniWorldチームが開発した次世代画像編集モデルです。革新的なUniWorld-R1トレーニングフレームワークを採用し、DiffucuTenを通して強化学習ポリシー最適化を画像編集に適用した最初のモデルです。
iFlytek Spark X1.5は、iFlytekが開発した大規模深層推論モデルであり、完全国産のコンピューティングプラットフォームを基盤としています。このモデルは、MoEモデルのエンドツーエンドの学習効率問題を初めて克服し、国際的な競合製品の93%を超えるエンドツーエンド性能を実現しました。
UNO-Benchは、MeituanのLongCatチームが開発した、フルモーダルな大規模モデル評価ベンチマークです。既存の評価システムの欠点を克服するため、UNO-Benchは高品質で多様なデータを用いて、モデルのシングルモーダル性能とフルモーダル性能を正確に測定します。
Kosmosは次世代AI科学者であり、FutureHouseが開発した自動研究システムRobinのアップグレード版です。Kosmosは構造化された世界モデルを採用しており、膨大な量の情報を効率的に統合できます。1回の実行で1500件の文書を解析することが可能です。
Kimi-k2 Thinkingは、Dark Side of the Moonが開発したAIモデルで、汎用的なエージェント機能と高度な推論能力を備えています。このモデルは、複数回のツール呼び出しを実行でき、最大256kバイトのコンテキスト処理をサポートし、複雑なタスクに適しています。
Open-o3 Videoは、北京大学とByteDanceが共同開発したオープンソースのビデオ推論モデルです。明示的な時空間情報(重要なタイムスタンプとバウンディングボックス)を統合することで、正確なビデオ推論を実現します。綿密に設計されたSTGRを通じて...
OmniVinciは、NVIDIAが開発したマルチモーダル言語モデルで、視覚、聴覚、言語、推論を含むマルチモーダルタスクの処理に特化して設計されています。独自のOmnialignNetテクノロジー、時間的埋め込みなどにより、クロスモーダルな意味的整合性を実現します。
Step-Audio-EditXは、StepStarがオープンソース化した世界初のLLMレベルの音声編集モデルです。感情、話し方、非言語的要素という3つの軸にわたるきめ細かな反復制御が可能で、怒り、喜び、悲しみといった感情の強さを自在にコントロールできます。
Maya1は、Maya Researchチームが開発したオープンソースのAI音声合成モデルで、感情表現豊かな音声を生成するために特別に設計されています。このモデルは自然言語による記述に基づいて音声を生成し、笑い声や泣き声など20種類以上の感情表現に対応しています。
AI-Traderは、香港大学が開発したオープンソースのAIトレーディングフレームワークです。このフレームワークは、様々なAIモデルが現実の市場環境で自律的に取引することを可能にし、AIの投資能力を探求します。マルチモデル競争をサポートし、市場データやニュースを統合します。
LocalAIは、完全なローカライズされたAIソリューションを提供するオープンソースのローカルAI推論フレームワークであり、マルチモーダルモデル(テキスト生成、画像生成、音声処理など)をサポートし、OpenAI APIと互換性があります。プライバシー保護を重視しています。
SuitAgentは、Claude Codeアーキテクチャに基づいたAI搭載の訴訟支援エージェントです。10個の専門AIエージェントが連携して複雑な訴訟案件を複数の独立実行可能なワークフローに分解し、効率的な法的文書の生成を可能にします。
ERNIE-5.0 Previewは、Baiduの最新のAI搭載大規模言語モデルです。LMArena Text Arenaのランキングでは、世界第2位、中国国内第1位を獲得しています。
NocoBaseは、オープンソースのデータファーストAIノーコード/ローコードプラットフォームです。マイクロカーネルとプラグインアーキテクチャに基づいており、すべての機能(権限、ワークフロー、API、テーマなど)はプラグイン可能で、必要に応じて使用できます。Node.jsと主要なデータベースをサポートしています。
Frappe Builderは、ユーザーが美しいウェブサイトを簡単に作成・公開できるローコード型のウェブサイト構築AIツールです。直感的なビジュアルエディターを通して、Figmaのようなデザイン体験を提供し、ユーザーはウェブページのレイアウトを素早く構築できます。
Qoder Rulesは、オープンソースの包括的なコードスタイルガイドおよびテンプレートシステムであり、開発者がQoderを使用してより効率的かつ標準化された開発を行うのに役立ちます。Qoder Rulesは、Alibaba Cloud AIアーキテクチャとベストプラクティスに準拠しており、開発ニーズを網羅しています。
SenseNova-SIは、SenseTime社が開発したオープンソースの空間知能モデルで、空間知能の向上に重点を置いています。大規模かつ高品質な空間データで学習されたこのモデルは、空間計測、関係性理解、視点転換といった主要分野において、その性能を大幅に向上させています。