Skywork R1Vは、Kunlun Tech初のオープンソース産業用マルチモーダル思考連鎖推論モデルであり、強力な視覚連鎖推論機能を備えています。Skywork R1Vは、視覚入力に対して多段階の論理推論を実行し、複雑な視覚タスクを解決できます。
Skywork R1Vは、Kunlun Tech初のオープンソース産業用マルチモーダル思考連鎖推論モデルであり、強力な視覚連鎖推論機能を備えています。Skywork R1Vは、視覚入力に対して多段階の論理推論を実行し、複雑な視覚タスクを解決できます。
Chirp 3は、Google Cloudが提供する高精細音声合成モデルで、自然で生き生きとした音声を生成するように設計されています。248種類の音声と31の言語に対応し、人間のイントネーションの微妙な違いを捉えることで、よりリアルな音声出力を実現します。
LangManusは、階層型マルチエージェントシステム設計に基づくAI自動化フレームワークです。コーディネーター、プランナー、研究者、プログラマーなど、それぞれ独自の役割を持つ様々なエージェントが連携して複雑なタスクを完了します。このフレームワークは、複数の…をサポートしています。
Cube 3Dは、Robloxが提供するAI搭載の3Dジェネレーターで、AI技術を用いて効率的に3Dモデルと環境を生成します。Cube 3Dは、テキスト記述から直接完全な3Dオブジェクトを生成する機能をサポートしており、ゲームエンジンとの互換性もあります。Cube 3Dは…
SmolDocling(SmolDocling-256M-preview)は、高効率かつ軽量なマルチモーダル文書処理モデルです。文書画像をエンドツーエンドで構造化テキストに変換でき、テキスト、数式、グラフなど様々な要素の認識をサポートします。
GR00T N1は、汎用ヒューマノイドロボット向けに特別に設計されたNVIDIA初のオープンソース基盤モデルです。言語や画像などのマルチモーダル入力に基づいて、多様な環境での操縦タスクを可能にします。GR00T N1は大規模な...
UniFluidは、Google DeepMindとMITが共同開発した、視覚生成と理解を統合した自己回帰フレームワークです。連続的な視覚タグに基づいてマルチモーダルな画像とテキスト入力を処理し、離散的な画像を生成します。
Multi-Speakerは、AudioShakeが開発した世界初の高解像度マルチスピーカー分離モデルです。オーディオストリーム内の複数の話者を異なるトラックに正確に分離し、従来のオーディオツールが抱えていた重なり合う音声の処理問題を解決します。
UniActは、異なるロボット間の行動の異質性という問題に対処する、斬新な具現化された基本モデルフレームワークです。共通の行動を学習することで、異なるロボット間で共有される基本的な行動特性を捉え、物理的な形状や制御インターフェースの違いによる影響を排除します。
ReCamMasterは、浙江大学、快手科技などが共同開発した動画再レンダリングフレームワークです。新しいカメラ軌跡に基づいて動画コンテンツを再生成できます。事前学習済みモデルとフレーム次元条件メカニズムを、マルチカメラ同期データと組み合わせることで、…
Stable Virtual Cameraは、Stability AIが開発したAIモデルで、2D画像をリアルな奥行きと遠近感を持つ3Dビデオに変換できます。ユーザーはカメラパスや様々な動的パス(例:...)を指定できます。
Instellaは、AMDが開発した30億個のパラメータを持つオープンソースの言語モデルシリーズです。このモデルは、自己回帰型Transformerアーキテクチャに基づいて、AMD Instinct™ MI300X GPU上で完全にゼロからトレーニングされ、36個のデコーダー層と3つの...
Maestroは、モバイルおよびWebアプリケーション向けのエンドツーエンドの自動テストフレームワークです。組み込みのフォールトトレランスとレイテンシートレランスのメカニズムに基づいて、従来のテストでよく見られる不安定性や待機の問題を解決します。Maestroは宣言型構文に基づいており、...
OLMo 2 32Bは、アレン人工知能研究所(Ai2)が開発した最新のオープンソース言語モデルであり、OLMo 2シリーズにおける重要な成果です。320億個のパラメータを持つこのモデルは、マルチスキル学術ベンチマークにおいてGPT-...を初めて上回りました。
InternVLは、上海人工知能研究所のOpenGVLabによって開発されたマルチモーダル大規模モデルで、視覚と言語タスクに焦点を当てています。これは、視覚モジュール(InternViTなど)と言語モジュール(...など)で構成されるViT-MLP-LLMアーキテクチャを採用しています。
Umi-OCRは、無料のオープンソースオフラインOCRテキスト認識ソフトウェアです。インターネット接続は不要で、解凍後すぐに使用できます。スクリーンショット、バッチ画像、スキャンしたPDFからのテキスト認識に対応しています。数式やQRコードの認識、2層構造の検索可能なPDFの生成も可能です。
Orpheus TTSは、Llama-3bアーキテクチャに基づいたオープンソースのテキスト音声合成(TTS)システムです。Orpheus TTSは、自然で感情豊かな、人間に近いレベルの音声生成をサポートし、サンプル不要の音声クローン機能を備えているため、事前の準備作業は不要です。
o1-proは、OpenAIが公式にリリースしたo1シリーズのアップグレード版です。o1-proは現在、OpenAIで最も強力な推論モデルであり、その最大の強みは大幅に向上した計算能力にあります。これにより、複雑な問題をより適切に処理し、より多くの情報を提供できます。
Crack Coderは、技術面接向けに特別に設計された、オープンソースのステルス型AI支援ツールです。Crack Coderはバックグラウンドで動作し、完全に目に見えないため、画面録画や監視ソフトウェアで検出されることはありません。Crack CoderはリアルタイムのAI機能を提供します...
YT Navigatorは、AIを搭載したYouTubeコンテンツ検索ツールで、ユーザーがYouTubeチャンネルのコンテンツを効率的に検索・閲覧するのに役立ちます。YT Navigatorの自然言語検索機能を使えば、特定のチャンネル動画を素早く見つけることができます。
Step-Video-TI2Vは、StepFunが開発したオープンソースの画像から動画への生成モデルです。300億個のパラメータを持ち、テキスト記述と画像入力に基づいて最大102フレームの動画を生成できます。
Dify-Plusは、Difyのエンタープライズレベルの拡張バージョンであり、gin-vue-adminをベースとした管理センターを統合しています。Dify-Plusは、ユーザー割り当て、キー割り当て、Web公開ページへのログインなどの機能をDifyに追加します。
gpt-4o-transcribeは、OpenAIが開発した高性能な音声テキスト変換モデルです。最新の音声モデルアーキテクチャに基づいており、膨大な量の多様な音声データで学習されているため、音声の微妙な違いを正確に捉え、単語エラー率を大幅に低減します(...
GPT-4o mini TTSは、OpenAIが開発した軽量のテキスト音声合成モデルです。テキストコンテンツを自然で流暢な音声に変換する機能をサポートしており、開発者は「calm」、「...」などのコマンドを使用して音声のトーン、感情、スタイルを制御できます。