OCRmyPDF - PDFファイルを検索可能でコピー可能な文書に変換するために特別に設計されたAIツール。
OCRmyPDFは、スキャンしたPDFファイルを検索・コピー可能な文書に変換するために設計されたオープンソースのコマンドラインツールです。OCRテキストレイヤーを追加することで、直接編集できないスキャン済みPDFファイルも検索・編集できるようになります。
OCRmyPDFは、スキャンしたPDFファイルを検索・コピー可能な文書に変換するために設計されたオープンソースのコマンドラインツールです。OCRテキストレイヤーを追加することで、直接編集できないスキャン済みPDFファイルも検索・編集できるようになります。
node-DeepResearchは、オープンソースのAIエージェントプロジェクトであり、Gemini言語モデルとJina Readerツールを使用してウェブページを継続的に検索・読み込み、複雑な質問に対して段階的に推論して回答を見つけ、あるいは期待を上回る結果を出すことを目指します。
OmniHumanは、ByteDanceが開発したエンドツーエンドのマルチモーダル条件付き人間動画生成フレームワークです。単一の人間画像とモーション信号(音声、映像、またはその両方の組み合わせなど)に基づいて、リアルな人間動画を生成できます。OmniHumanは…
DeepRAGは、中国科学院、中国科学技術大学、およびテンセントWeChat AI部門が共同で開発した、新しい検索拡張生成(RAG)フレームワークです。推論および検索タスクにおける大規模言語モデル(LLM)の性能向上を目指しています。これは、検索強化型推論を構築することによって実現されます。
MnnLlmAppは、MNN-LLMフレームワークをベースにAlibabaが開発したオープンソースのAndroidモバイルアプリケーションです。モバイルデバイス上で様々な大規模言語モデル(LLM)のオフライン実行をサポートしています。テキスト間変換、画像生成など、マルチモーダルな機能を備えています。
DynamicFaceは、Xiaohongshuチームが開発した新しい動画顔交換技術です。3D顔の事前知識に基づき、拡散モデルとプラグアンドプレイ式の時間レイヤーを組み合わせることで、高品質かつ一貫性のある動画顔交換効果を実現します。
Gemini 2.0 Proは、Googleが開発した高性能な実験的AIモデルで、プログラミングのパフォーマンスと複雑なヒントの処理に最適化されています。Gemini 2.0 Proは、200万トークンという巨大なコンテキストウィンドウを備え、膨大な量の情報を処理・分析することが可能です。
Open Deep Researchは、オープンソースのAIエージェントであり、Deep Researchオープンソースプロジェクトのレプリカです。大量のネットワークデータの推論に基づいて、複雑な多段階の研究タスクを実行します。Open Deep ResearchはFirecrawlを使用しています...
Chatbox AIは、Windows、Mac、Linux、iOS、Android、およびWeb版をサポートする、オープンソースのクロスプラットフォームAIクライアントアプリケーションおよびインテリジェントアシスタントです。ChatGPT、DeepSeek、Clauなどの複数の高度な言語モデルを統合しています。
RAG-FiT(旧称RAG Foundry)は、Intel Labsが開発したオープンソースのフレームワークで、検索拡張生成(RAG)タスクにおける大規模言語モデル(LLM)の微調整を目的としています。RAG-FiTは…
FluxSRは、上海交通大学、ハーバード大学、華南理工大学、およびファーウェイ・ノアズアーク・ラボが開発した、実世界の画像超解像(Real-ISR)タスクに特化した新しい単段階拡散モデルです。FluxSRは…
Meta社が開発したVideoJAMは、ビデオ生成モデルにおける動きの一貫性を向上させるためのフレームワークです。これは、外観と動きを統合した表現を導入することで、モデルがトレーニング中にピクセル情報と動き情報を同時に学習および予測することを可能にし、その後…
SynCD(Synthetic Customization Dataset)は、カーネギーメロン大学とMetaが公開した高品質の合成トレーニングデータセットで、テキストから画像への変換モデルのカスタマイズ機能を向上させるために使用されます。SynCDには、複数の同一のオブジェクトが含まれています。
南洋理工大学のS-LabとSenseTimeが開発したMatAnyoneは、複雑な背景に対して縦長の動画を合成するための高度なフレームワークであり、特定の動画合成タスクに特化しています。MatAnyoneは、一貫性のあるメモリ伝播モデルに基づいています。
JD Technologyと香港大学が開発したJoyGenは、音声駆動型の3D音声顔動画生成フレームワークであり、正確な口の動きと音声の同期、そして高品質な視覚効果の実現に重点を置いています。JoyGenは、音声機能と顔の深度を組み合わせています。
EMAGE(Expressive Masked Audio-condition Gesture Modeling)は、清華大学、東京大学、慶應義塾大学などの研究機関が開発した、全身を使ったコミュニケーションジェスチャーを生成するためのフレームワークです。EMAGEは音声に基づいてジェスチャーを生成することができます。
LIMO(Less Is More for Reasoning)は、上海交通大学の研究チームが提案した効率的な推論手法です。非常に少数の高品質な訓練サンプルを用いて、大規模言語モデル(LLM)の複雑な推論能力を活性化します。その中核となる仮定は…
SANA 1.5は、テキストから画像を生成するタスク向けにNVIDIAがMIT、清華大学、北京大学などの機関と共同開発した、新しい高効率リニア拡散トランスフォーマーです。SANA 1.0をベースに開発されています。
ASAP(Aligning Simulation and Real Physics)は、カーネギーメロン大学とNVIDIAが共同開発した2段階フレームワークで、ヒューマノイドロボットにおけるシミュレーションと現実世界のダイナミクスの不一致に対処することを目的としています。ASAPは…
MAETok(Masked Autoencoders Tokenizer)は、カーネギーメロン大学、香港大学、北京大学などの機関によって開発された新しい画像トークン化手法であり、拡散モデルで使用されています。MAETokはマスクモデリング(Mask Modeling)に基づいています。
Einoは、ByteDanceが開発した大規模AIアプリケーション開発のためのオープンソースフレームワークです。開発者が大規模モデルに基づいたAIアプリケーションを効率的に構築できるよう支援します。EinoはGoプログラミング言語をベースとしており、安定したカーネル、柔軟な拡張性、そして包括的なツールキットを備えています。
NutWorldは、シンガポール国立大学、南洋理工大学、およびSkywork AIによって開発されたビデオ処理フレームワークです。日常的な単眼ビデオを効率的に動的な3Dガウススプラッティングに変換します。NutWorldは…
AstrBotは、さまざまな大規模言語モデル(OpenAI GPT、Google Gemini、Llamaなど)と複数のメッセージングプラットフォーム(QQ、Telegram、WeChatなど)をサポートするマルチプラットフォームのチャットボットおよび開発フレームワークです。AstrBotは…
Lumina-Image 2.0は、拡散モデルとTransformerアーキテクチャに基づいた、26億個のパラメータを持つオープンソースの高効率統合画像生成モデルです。画像生成品質、複雑な手がかりの理解、およびリソース効率に優れています。