Resume Matcherは、履歴書と職務内容を分析して改善案を提示する、オープンソースのAI履歴書最適化ツールです。
Resume Matcherは、求職者が履歴書が自動選考システム(ATS)を通過する可能性を高めるのに役立つ、オープンソースのAI履歴書最適化ツールです。Resume Matcherは、履歴書と職務内容を分析し、重要なスキルや経験などを抽出します。
Resume Matcherは、求職者が履歴書が自動選考システム(ATS)を通過する可能性を高めるのに役立つ、オープンソースのAI履歴書最適化ツールです。Resume Matcherは、履歴書と職務内容を分析し、重要なスキルや経験などを抽出します。
OpenManusは、MetaGPTチームがリリースしたManusのオープンソース版で、招待コードを必要としないAIエージェントを提供します。OpenManusはモジュール設計に基づいており、複数の言語モデルとツールチェーンをサポートし、コードの実行やファイルの処理などを行うことができます。
NEXUS-Oは、HiThink Research Institute、インペリアル・カレッジ・ロンドン、浙江大学、復旦大学、マイクロソフト、Meta AIなどの機関によって開発されたマルチモーダルAIモデルです。言語、音声、視覚情報の包括的な認識と相互作用を可能にします。
OWL(Optimized Workforce Learning)は、CAMEL-AIフレームワークに基づいて開発されたマルチエージェント協調システムです。エージェント間の動的な相互作用を通じて、効率的なタスク自動化を実現します。これは、役割割り当てとタスク分解によって達成されます。
TicVoice 7.0は、Mobvoiの第7世代高品質TTS(テキスト読み上げ)エンジンで、次世代音声生成モデルであるSpark-TTSをベースにしています。TicVoice 7.0は、革新的なBiCodecエンコーディング方式を使用して音声をセグメント化します。
GEN3Cは、NVIDIA、トロント大学、およびVector Instituteによって開発された新しい生成型ビデオモデルです。高精度なカメラ制御と時空間の一貫性に基づいて、高品質の3Dビデオコンテンツを生成します。GEN3Cは、点群ベースの3Dキャッシュを構築します...
Mercury Coderは、Inception Labs初の拡散型大規模言語モデル(dLLM)であり、コード生成専用に設計されたMercuryシリーズのモデルです。Mercury Coderは、粗密生成アプローチに基づいています。
GCDance(Genre-Controlled 3D Full Body Dance Generation Driven by Music)は、英国のサリー大学と江南大学が開発した3Dダンス生成フレームワークです。音楽やテキストプロンプトに合わせたダンスを生成することができます。
LaWGPTは、南京大学が開発した大規模な中国語法律言語モデルです。LLaMAモデルをベースに、二次事前学習を経て、大量の中国語法律知識を組み込んでいます。法律分野に特化しており、法律関連のテキストを理解・生成することができ、以下のような用途に適用可能です。
autoMateは、AIとRPAをベースとしたローカル自動化ツールで、自然言語を使用して複雑なタスクを自動化します。大規模な言語モデルに基づいているため、autoMateを使用すると、プログラミングの知識がなくても自然言語でタスクを記述でき、タスクを完了できます。
URO-Benchは、エンドツーエンドの音声対話モデル(SDM)のための包括的なベンチマークツールです。多言語対応、複数ターン対話、パラ言語情報など、多次元的なタスクを網羅し、音声対話モデルのパフォーマンスを総合的に評価します。
Nanobrowserは、AIを活用したウェブページ自動化に特化したオープンソースのChrome拡張機能です。Nanobrowserはマルチエージェントシステムを利用して、情報抽出や自動操作などの複雑なウェブページタスクを実行します。ユーザーは…
DINO-XSeekは、IDEA Researchが開発したマルチモーダル物体検出モデルであり、視覚認識と自然言語理解の機能を組み合わせています。DINO-XSeekは、複雑な言語記述に基づいて画像内の物体を正確に特定し、物体の属性を識別します。
AppAgentXは、ウエストレイク大学が開発した新しい自己進化型GUI(グラフィカルユーザーインターフェース)エージェントフレームワークです。実行履歴から高レベルのアクションを抽象化することで、スマートフォンとのインタラクションにおけるエージェントの効率とインテリジェンスを向上させます。AppAgent...
GO-1(Genie Operator-1)は、Zhiyuan Roboticsが発表した初の汎用型具現化ベースモデルです。このモデルは、Vision-Language-Latent-Action(ViLLA)アーキテクチャを採用しており、VLM(Vision-Language-Latent-Action)と...で構成されています。
Gemini Embeddingは、Googleが開発した高度なテキスト埋め込みモデルで、テキストを高次元の数値ベクトルに変換することで、その意味情報と文脈情報を捉えます。Gemini EmbeddingはGeminiモデルで学習されており、...
DoraCycleは、シンガポール国立大学のShow Labによって開発された、マルチモーダルなドメイン適応のための統一生成モデルです。これは、2つのマルチモーダルループ(テキスト→画像→テキスト、画像→テキスト→画像)を通じて、さまざまな機能を実現します。
IMAGPoseは、南京理工大学が開発した、人間のポーズをガイドとした画像生成のための統一的な条件付きフレームワークです。これは、複数の異なるポーズを同時に生成できないなど、従来のポーズガイド型人体画像生成手法の限界を克服するものです。
Heygemは、Silicon Intelligence社が開発したオープンソースのデジタルヒューマンモデルで、Windowsシステム向けに特化して設計されています。高度なAI技術に基づいており、わずか1秒の動画または1枚の写真から、30秒以内にデジタルヒューマンの画像と音声を複製できます。
LanDiffは、高品質なテキストからビデオへの変換(T2V)生成のための革新的なハイブリッドフレームワークです。自己回帰言語モデル(LLM)と拡散モデルの利点を組み合わせ、粗密生成アプローチを採用しています。
FoxBrainは、Foxconn Research Instituteが開発した大規模な繁体字中国語モデル(LLM)であり、強力な推論能力を誇ります。Meta Llama 3.1アーキテクチャに基づいており、70個のパラメータを持ち、数学的および論理的推論に重点を置いています。FoxB...
ByteDanceが開発したCOMETは、分散トレーニングにおける過剰な通信オーバーヘッドの問題に対処するために設計された、エキスパート混合モデル(MoE)向けの最適化システムです。きめ細かな計算・通信オーバーラップ技術に基づき、COMETは…
VideoPainterは、香港中文大学、テンセントARCラボ、東京大学、マカオ大学などの機関によって開発されたビデオ修復・編集フレームワークです。あらゆる長さのビデオコンテンツを処理するために特別に設計されています。VideoPainterは2つのブランチアーキテクチャに基づいています...
テンセントPCG ARCラボと香港中文大学が開発したTrajectoryCrafterは、単眼ビデオ用のカメラ軌道修正手法です。ポストプロダクションでカメラの位置と角度を自由に調整でき、ビデオの軌道を簡単に変更できます。