KHOJ - オープンソースAIパーソナライズドアシスタント、ワンストップ知識管理ツール
KHOJは、ユーザーが知識を統合・取得するのを支援するオープンソースのパーソナライズされたAIアシスタントです。PDF、Markdown、プレーンテキスト、GitHub、Notionファイルなど、ユーザーのオンラインおよびローカルドキュメントに接続し、セマンティック検索を使用して迅速に情報を検索します。
KHOJは、ユーザーが知識を統合・取得するのを支援するオープンソースのパーソナライズされたAIアシスタントです。PDF、Markdown、プレーンテキスト、GitHub、Notionファイルなど、ユーザーのオンラインおよびローカルドキュメントに接続し、セマンティック検索を使用して迅速に情報を検索します。
Luma Ray2は、Luma AIが開発した最新の動画生成モデルです。Lumaの新しいマルチモーダルアーキテクチャに基づいてトレーニングされたRay2は、Ray1の10倍の計算能力を誇り、高度な機能を備えています。高速かつ一貫性のある動画を生成できます。
RAIN(Real-time Animation Of Infinite Video Stream)は、RTX 4090 GPU 1基などの一般消費者向けハードウェアを使用して、無限のビデオストリームをリアルタイムでアニメーション化できる革新的なリアルタイムアニメーションソリューションです。コア...
Pipecatは、音声およびマルチモーダル対話エージェントの構築に特化したオープンソースのPythonフレームワークです。組み込みの音声認識、テキスト音声合成(TTS)、対話処理機能に基づいて、AIサービスの複雑な連携、ネットワーク伝送、音声処理を簡素化します。
RealtimeSTTは、低遅延アプリケーション向けに設計されたオープンソースのリアルタイム音声認識ライブラリです。強力な音声活動検出機能を備え、音声の開始と終了を自動的に認識し、WebRTCVADとSiloVADを使用して正確な検出を実現します。
Step R-mini(正式名称:Step Reasoner mini)は、Step Star社が開発した推論モデルです。Stepシリーズ初の推論モデルであり、じっくりと時間をかけて考え、繰り返し検証することで、積極的な計画立案、試行錯誤、そして内省に優れた能力を発揮します。
GLM-Realtimeは、Zhipuが発表した全く新しいエンドツーエンドのマルチモーダルモデルで、低遅延のビデオ理解と音声対話機能を備えています。また、歌唱機能も搭載しており、会話中に歌唱能力を披露することができます。このモデルは最大2分間の音声に対応しています。
CogView-3-Flashは、Zhipuが初めてリリースした無料のAI画像生成モデルです。テキスト記述に基づいて美的スコアの高い画像を生成でき、複数の解像度をサポートし、専門分野のニーズを満たします。このモデルは創造性の多様性を誇り、…に基づいています。
MangaNinjaは、正確なマッチングと細かな制御を実現する、参照ベースの線画着色手法です。革新的なパッチ再配置モジュールとポイント駆動制御方式により、着色精度と画質を向上させています。また、以下の処理にも対応しています。
AutoMouserは、ユーザーの操作をインテリジェントに追跡し、OpenAIのGPTモデルに基づいてSeleniumテストコードを自動生成するChrome拡張機能です。クリック、ドラッグ、ホバーなどのユーザーのブラウザ操作を記録します。
CogVideoX-Flashは、Zhipuが初めてリリースした無料のAI動画生成モデルです。CogVideoXの独自開発エンドツーエンド動画理解モデルを継承し、強力な動画生成機能を備えています。CogVideoX-Flashはテキストベースの動画などをサポートしています。
Mini-InternVLは、大規模モデルであるShusheng·Wanxiangの「ミニ」バージョンです。上海AI研究所、清華大学、南京大学などが共同で開発した、軽量でマルチモーダルな大規模言語モデルシリーズです。1B、2B、4Bの3つのパラメータバージョンがあります。
Weeboは、Whisper Small、Llama 3.2、Kokoro-82Mの技術を搭載したリアルタイム音声チャットボットです。音声認識および音声生成技術を用いて、ユーザーと自然で流暢な会話を行い、リアルタイムの音声インタラクションを提供します。
ParGoは、ByteDanceが中山大学と共同で提案した革新的なマルチモーダル大規模言語モデルコネクタです。これは、マルチモーダル大規模言語モデル(MLLM)における視覚モダリティと言語モダリティの整合性を向上させます。これは、ローカルトークンとグローバルトークンを組み合わせることによって実現されます。
MatterGenは、マイクロソフトが開発した革新的な生成モデルで、特に無機材料向けに設計されています。独自の拡散プロセスに基づき、原子の種類、座標、周期格子を段階的に洗練させることで、周期表全体にわたる安定かつ多様な無機材料を生成します。
XMusicは、テンセントマルチメディアラボが独自開発したAI搭載の汎用音楽フレームワークです。ユーザーは動画、画像、テキスト、タグ、ハミングなど、あらゆるコンテンツをアップロードするだけで、XMusicは感情、スタイル、リズムを自在にコントロールできる高品質な音楽を生成できます。
Seaweed APTは、ByteDanceが開発した敵対的学習後モデルであり、画像と動画をワンストップで生成できる。Seaweed APTは、事前学習済みの拡散モデルをベースとしており、それを実世界のデータに直接適用する。
OmAgentは、Om AIと浙江大学濱江研究所が共同でオープンソース化したマルチモーダル言語プロキシフレームワークです。デバイス側でのインテリジェントエージェントの開発を簡素化します。OmAgentは再利用可能なプロキシコンポーネントをサポートしており、開発者が複雑なマルチモーダルシステムを構築するのに役立ちます。
T2A-01-HDは、Conch AIの海外版が発表した新しい音声モデルです。音声クローニングに対応しており、わずか10秒の音声データで、感情のニュアンスを保持しながら正確に音声を複製できます。このモデルは、音声の微妙な感情の違いを捉えることができるインテリジェントな感情システムを搭載しています。
Uni-AdaFocusは、清華大学自動化系の研究チームが開発した、汎用性の高い高効率な動画理解フレームワークです。このフレームワークは、適応型フォーカス機構を用いて計算リソースの割り当てを動的に調整することで、動画コンテンツの効率的な処理を可能にします。
AnyStoryは、アリババ傘下のTongyi Labが開発した革新的なテキスト画像生成フレームワークであり、単一または複数の被写体に対して高精度なパーソナライズ画像生成を可能にします。被写体のパーソナライズは、「エンコーディング・ルーティング」方式を用いてモデル化されています。
SHMT(Self-supervised Hierarchical Makeup Transfer)は、アリババDAMOアカデミーと武漢理工大学などが共同開発した高度な自己教師ありメイクアップ転送技術です。この技術は潜在拡散モデルを利用して、...
SmartEraserは、中国科学技術大学とマイクロソフトリサーチアジアが共同開発した画像編集技術で、画像からユーザーが指定したオブジェクトを削除するために特化して設計されています。SmartEraserは、革新的な「マスク領域誘導」に基づいています。
Zeroxは、GPT-4o-miniモデルに基づいたオープンソースのローカライズされた高精度OCRツールで、事前のトレーニングなしでゼロショット認識を実現します。ZeroxはPDF、DOCX、画像など様々なファイル形式をサポートし、スキャンされた文書や複雑な文書の処理に優れています。