OmniVision - エッジデバイス向けに最適化された、最小限のパラメータを持つマルチモーダルモデル。
OmniVisionは、エッジデバイス向けに最適化された9億6800万個のパラメータを持つコンパクトなマルチモーダルモデルです。OmniVisionは、画像入力とテキスト入力の両方を処理でき、LLaVAアーキテクチャの改良に基づいて、画像トークンの数を大幅に削減し、レイテンシを低減し、さらに...
OmniVisionは、エッジデバイス向けに最適化された9億6800万個のパラメータを持つコンパクトなマルチモーダルモデルです。OmniVisionは、画像入力とテキスト入力の両方を処理でき、LLaVAアーキテクチャの改良に基づいて、画像トークンの数を大幅に削減し、レイテンシを低減し、さらに...
Free Video-LLMは、革新的でトレーニング不要、かつ非常に効率的なビデオ言語モデルであり、キュー誘導型視覚認識技術を活用してビデオコンテンツの効率的な理解を実現します。このモデルは事前学習済みの画像LLMを使用しており、適応のための追加トレーニングは不要です。
LogoCreatorは、Together AIが提供するFlux Pro 1.1テクノロジーを使用してプロフェッショナルなロゴを素早く作成できるオープンソースのロゴジェネレーターです。このプロジェクトは、Next.jsとTypeScriptを使用してアプリケーションフレームワークを構築し、ShadcnとTailwindを組み込んでいます。
法信法基盤モデルは、清華大学と綿鼻智能の研究成果に基づいた、数千億のパラメータを持つ汎用モデルです。最高人民法院によって公開され、国家レベルの法務AIインフラとして位置づけられています。生成AIの基盤機能を提供します。
オーディオ分解は、フーリエ変換とエンベロープマッチングを用いて音楽中の個々の音符や楽器を分離し、音楽を楽譜に変換する音声処理技術です。オーディオ分解のオープンソースプロジェクトは、Matthewによって開発されました。
Florence-2は、Microsoft Azure AIが開発した汎用性の高いビジョンモデルであり、画像キャプション生成、物体検出、視覚的位置特定、画像セグメンテーションなど、さまざまなコンピュータビジョンタスクを実行できます。Florence-2はTransformerアーキテクチャに基づいています。
k0-mathは、Dark Side of the Moonが開発した最新の数学的推論モデルで、深い思考能力を重視しています。MATHなどのベンチマーク数学テスト、中学校入学試験、大学入学試験、大学院入学試験において、k0-mathはOpenAIのo1シリーズモデルを凌駕する性能を発揮します。このモデルは…
MagicQuillは、香港科技大学、アントグループ、浙江大学、香港大学が共同開発した、オープンソースのAI搭載型インタラクティブ画像編集ツールです。ユーザーフレンドリーなインターフェースとAIによるインテリジェントな提案機能により、正確な局所画像編集を可能にします。
ai-chatbotは、Vercelが立ち上げたオープンソースプロジェクトで、Next.jsフレームワークとVercel AI SDKをベースに構築されています。ai-chatbotは、開発者が高性能なチャットボットを迅速に構築できるよう、完全に機能し、簡単にカスタマイズできるAIチャットボットテンプレートを提供します。
LLaMA-Meshは、清華大学とNVIDIAが共同で立ち上げたプロジェクトです。3Dメッシュ生成と大規模言語モデル(LLM)を組み合わせることで、テキストプロンプトから直接3Dモデルを生成できます。このプロジェクトでは、3Dメッシュの保存にOBJファイル形式を使用しています。
iAgentsは、清華大学が開発したマルチAIエージェント連携フレームワークです。各ユーザーにパーソナルAIエージェントを装備することで、コラボレーションを促進し、日常業務を遂行します。エージェントはユーザーのファイルやコマンドを理解し、コラボレーションから学習し、自己管理を実現します。
DanceFusionは、清華大学が開発したオープンソースのフレームワークで、音声駆動型のダンスモーションの再構築と生成に特化しています。階層的な時空間Transformer-VAEと拡散モデルを組み合わせることで、DanceFusionはソーシャルメディア上の不完全なモーションキャプチャにも対応できます。
Symphony Creative Studioは、TikTokが提供するAI搭載の動画制作ツールで、広告主やコンテンツクリエイターの動画制作プロセスを効率化します。Symphony Creative Studioは、動画の生成、変換、拡張機能を統合しています。
Skywork O1は、Kunlun Techが発売したSkywork Model 4.0のバージョン4.0です。中国語の論理的推論能力を備えた中国初のO1モデルです。Skywork O1は、思考、計画、反省能力をモデル出力に組み込むことで、大幅な改善を実現しています。
Voyage Multimodal-3は、Voyage AIが開発した高度なマルチモーダル埋め込みモデルです。テキストと画像が混在したデータを処理し、複雑なドキュメント解析を必要とせずに、PDF、スライド、表などのスクリーンショットから重要な視覚的特徴を抽出できます。
Haliは、Terminusが国際的なアクセシブル・ラグジュアリーブランドButtonsと共同で開発した、マルチモーダルかつマルチエージェント型の協調型AIエージェントです。Haliは、人間のような思考、長期記憶、物理世界認識、マルチエージェント協調という4つの主要な特徴を備えています。その意味理解精度は…
Agent K v1.0は、Huawei Noah's Ark Labとユニバーシティ・カレッジ・ロンドン(UCL)チームが共同開発したエンドツーエンドの自律型データサイエンスエージェントです。さまざまなデータサイエンスタスクの処理を自動化、最適化、汎用化できます。Agent K v1.0は、…に基づいています。
Pixtral Largeは、フランスのMistral AIが開発した、1240億パラメータを持つオープンソースの超マルチモーダルモデルです。最先端の画像理解能力を誇り、128Kのコンテキストをサポートし、テキスト、グラフ、画像を理解できます。Pixtral LargeはMistral...をベースにしています。
Qwen2.5-Turboは、アリババが開発した高度な言語モデルで、コンテキスト長を12万8千語から100万語(英語で100万語、中国語で150万文字に相当)に拡張しています。この拡張により、小説などの長文テキストも処理できるようになります。
LLaVA-o1は、北京大学、清華大学、鵬城研究所、アリババDAMOアカデミー、リーハイ大学の研究者からなる研究チームによって開発されたオープンソースの視覚言語モデルです。Llama-3.2-Visionをベースにしています。
PixelWave Flux.1-dev 03は、FLUX.1-devモデルをベースにNVIDIA 4090上で最適化されたAI画像生成モデルです。優れた汎化能力を誇り、様々な芸術スタイル、写真、アニメ画像などを高いレベルで処理します。
Computer Use OOTBは、Claude 3.5 Computer Use APIを使用してコンピュータ制御を自動化するオープンソースのGUIフレームワークです。このフレームワークはクロスプラットフォーム動作をサポートしており、WindowsおよびmacOSシステムに簡単に展開できます。
Fireworks f1は、Fireworksが開発した複合AIモデルで、複雑な推論タスク向けに設計されています。推論レイヤーで複数のオープンモデルを融合することで、単一モデルを凌駕するパフォーマンスと信頼性を実現しています。f1モデルを使用することで、開発者は…
AgileGenは、人間とAIの協働を通じてソフトウェア開発プロセスを強化する生成型ソフトウェア開発フレームワークです。AgileGenは、エンドユーザーの意思決定とAgileGenインテリジェントエージェントという2つの主要コンポーネントで構成されています。このフレームワークは、Gherkinプログラミング言語を使用して設計されています。