Janus - DeepSeekが開発した、マルチモーダルな理解と生成タスクを統合する自己回帰フレームワーク。
Janusは、DeepSeek AIが開発した自己回帰フレームワークであり、マルチモーダルな理解と生成タスクの統合を目指しています。従来の手法の限界を克服するため、視覚エンコーディングを異なるパスに分離し、処理には単一のトランスフォーマーアーキテクチャを使用しています。
Janusは、DeepSeek AIが開発した自己回帰フレームワークであり、マルチモーダルな理解と生成タスクの統合を目指しています。従来の手法の限界を克服するため、視覚エンコーディングを異なるパスに分離し、処理には単一のトランスフォーマーアーキテクチャを使用しています。
PaddleOCR 2.9は、Baidu PaddlePaddleが開発したオープンソースの光学文字認識(OCR)ツールキットです。豊富なアルゴリズムとモデルを提供し、多言語をサポートし、データ注釈および合成ツールも備えています。
Mellumは、JetBrainsが開発した大規模言語モデル(LLM)であり、AI駆動型開発ツールを強化するために開発者向けに特別に設計されています。JetBrains IDEとの緊密な統合により、低遅延かつ高精度のコードを提供します。
Easegenは、コース制作やビデオ管理からインテリジェントなコースウェア生成、インテリジェントな質問生成まで、包括的なソリューションを統合したオープンソースのAI搭載デジタルヒューマンコース作成プロジェクトです。このプロジェクトは、PPTコースウェアのバッチ自動生成、デジタルヒューマンクローニング、音声認識などをサポートしています。
sCMは、OpenAIが開発した連続時間一貫性モデルであり、拡散モデルの原理に基づいています。sCMは理論的枠組みを簡素化し、サンプリングプロセスを最適化することで、画像生成速度を大幅に向上させています。sCMモデルは、わずか2回のサンプリングステップで画像を生成できます。
Moonshineは、リソース制約のあるデバイス向けに最適化された音声認識モデルで、高速かつ正確なリアルタイム音声テキスト変換サービスを提供します。現場での文字起こしや音声コマンド認識など、即時応答が求められるアプリケーションに適しています。Moonshineは…
Time-MoEは、エキスパート混合モデル(MoE)アーキテクチャに基づいた革新的な時系列基盤モデルであり、事前学習済み時系列モデルのパラメータ規模を数十億レベルにまで拡張します。このモデルは、スパースな活性化メカニズムを使用しています。
SynthIDは、DeepMindが開発した技術ツールで、AIが生成したコンテンツに埋め込まれたデジタル透かしを利用してコンテンツ識別を支援します。透かしは人間には見えませんが、機械は検出できるため、情報の信頼性が向上します。
WhispoはAIを活用した音声文字起こしツールで、Ctrlキーを押しながら音声を録音し、キーを離すと文字起こしされたテキストがテキスト入力対応アプリケーションに自動的に挿入されます。このツールのデータ処理は完全にAIによって行われます。
AutoGLM-Webは、ユーザーの操作をシミュレートするインテリジェントなブラウザアシスタントです。大規模な言語モデルに基づいて構築されており、ウェブページのアクセス、情報検索、コンテンツの要約などのタスクを実行できます。AutoGLM-Webは、簡単なテキストまたは音声コマンドに基づいて、…
OmniGenは、テキストから画像への変換、画像編集、トピック駆動型生成、視覚的条件付き生成など、さまざまな画像生成タスクを単一のフレームワーク内で処理できる、統合画像生成のための新しい拡散モデルです。OmniGenには、以下の機能が含まれます。
CogAgentは、清華大学とZhipu AIが共同開発したマルチモーダル視覚モデルで、グラフィカルユーザーインターフェース(GUI)の理解とナビゲーションに重点を置いています。従来のテキストベースのモダリティではなく、視覚的なモダリティを通してGUIインターフェースを認識するため、より適しています。
OMNE Multiagentは、天橋・クリッシー・チェン研究所(TCCI)が開発した大規模マルチエージェントフレームワークです。長期記憶(LTM)を基盤として構築されています。
DuoAttentionは、MITのHan Song氏のチームが提案した新しいフレームワークで、長いコンテキストを扱う際の大規模言語モデル(LLM)の推論効率を向上させることを目的としています。このフレームワークは、「検索ヘッド」と「ストリーミングヘッド」という2つのアテンションヘッドを区別することでモデルを最適化します。
HuggingChat for macOSは、Hugging Faceが開発したmacOSユーザー向けオープンソースチャットアプリケーションです。強力なオープンソース言語モデルに基づいており、高度なAI会話機能をユーザーのデスクトップに直接提供します。このアプリケーションは…
OmniParserは、Microsoft Researchが開発した画面解析ツールで、ユーザーインターフェースのスクリーンショットを構造化データに変換します。このツールは、大規模言語モデル(GPT-4Vなど)に基づくUIプロキシシステムのパフォーマンスを向上させるために特別に設計されています。
Dittoは、シンプルな自然言語による記述に基づいて複数ファイルからなるWebアプリケーションを作成できるFlaskベースのアプリケーションジェネレーターです。このツールは、シンプルなLLMループといくつかの補助ツールを使用してコーディングプロセスを自動化し、ユーザーの記述を変換します。
Flux.1 Liteは、Freepikチームが開発した軽量AIモデルで、現在アルファ版です。80億個のパラメータを持つトランスフォーマーアーキテクチャに基づいており、FLUX.1-devモデルから派生しています。Flux.1 Lite...
Phidataは、開発者がメモリ、知識、ツール、推論機能を備えたインテリジェントなエージェントシステムを構築できるよう支援するオープンソースのAIエージェントフレームワークです。協調的なエージェントチームの作成をサポートし、エージェントと対話するためのユーザーインターフェースを提供します。
Allegroは、Rhymes AIが開発した高度なテキスト動画生成モデルです。シンプルなテキスト入力を、最大720pの解像度、1秒あたり15フレーム、最大6秒の長さの高品質な動画コンテンツに変換できます。このモデルは動画生成の分野で優れた性能を発揮します。
FakeShieldは、北京大学の研究者によって開発されたマルチモーダルな大規模言語モデルフレームワークであり、画像の偽造を検出および特定することができます。このフレームワークは、画像の真正性を評価し、改ざんされた領域のマスクを生成し、ピクセルレベルおよび画像ベースの情報を提供できます。
MaskGCTは、FunWan Technologyが香港中文大学深圳校と共同開発した大規模音声合成モデルです。マスク生成モデルと音声表現の分離型エンコーディングに基づいており、音声クローニング、多言語合成、音声制御などのアプリケーションを可能にします。
GLM-4-Voiceは、Zhipu AIが開発したエンドツーエンドの感情表現音声モデルです。中国語と英語の音声を直接理解・生成でき、リアルタイムの音声対話に対応し、ユーザーの指示に応じて音声の感情、声調、速度、方言などの特徴を柔軟に調整できます。
Unboundedは、Googleとノースカロライナ大学チャペルヒル校が共同開発した無限ライフシミュレーションゲームです。従来のビデオゲームの制約から脱却し、大規模言語モデル(LLM)やビジュアル生成モデルなどの生成モデルを活用して、...