Stagehandは、AIを活用したウェブブラウジングフレームワークであり、シンプルで拡張性の高いウェブ自動化ソリューションを提供します。
Stagehandは、Playwrightの後継となる、シンプルで拡張性の高いAIウェブブラウジングフレームワークです。act、extract、observeという3つのシンプルなAPIを提供し、自然言語によるウェブページ操作をサポートしています。Stagehandは…
Stagehandは、Playwrightの後継となる、シンプルで拡張性の高いAIウェブブラウジングフレームワークです。act、extract、observeという3つのシンプルなAPIを提供し、自然言語によるウェブページ操作をサポートしています。Stagehandは…
VideoTunaは、複数のAIビデオ生成モデルを統合したコードライブラリで、テキストからビデオ、画像からビデオ、テキストから画像への変換をサポートしています。VideoTunaは、事前学習、継続学習、事後学習のアライメント、微調整など、包括的なビデオ処理機能を提供します。
ComfyUI-MochiEditは、ComfyUIとGenmo Mochiをベースにしたオープンソースの動画編集ツールです。動画をノイズに変換してリサンプリングすることで動画編集を実現し、部分編集や動画間の変換にも対応しています。ユーザーは、以下の設定を調整できます。
HiCoは、360 AI Research Instituteが開発した、拡散モデルに基づいた階層的で制御可能なレイアウトから画像への生成モデルです。HiCoは、マルチブランチ構造設計を採用することで、オブジェクトの位置決めとテキスト記述を正確に制御します。HiCoの主な特徴は以下のとおりです。
Ferret-UI 2は、Appleが開発したマルチモーダルな大規模言語モデルで、モバイルユーザーインターフェースの理解と操作に使用されます。Ferret-UI 2は、さまざまなモバイルデバイスの画面上のUI要素を認識・理解し、複雑なユーザーコマンドを実行できます。
MMBench-Videoは、浙江大学、上海人工知能研究所、上海交通大学、香港中文大学が共同開発した、長尺動画と複数質問への回答に関する新しいベンチマークです。MMBench-Videoは、大規模な視覚的処理を包括的に評価できます。
MiniMatesは、音声モードと表情モードの両方を備えた高性能かつ軽量なデジタルヒューマンドライビングアルゴリズムで、一般的なコンピュータ上でリアルタイム動作が可能です。高度な技術アーキテクチャに基づき、非常に高速な操作性とパーソナライズされたカスタマイズを実現します。
MotionCLRは、人間の動きを生成および編集するためのアテンションベースのモデルです。テキストプロンプトに基づいて動作を生成し、強調、弱化、置換、消去、スタイル転送などのユーザーによるインタラクティブな編集をサポートします。MotionCLRは…
Sima Yue氏が開発したDocMindは、Transformerアーキテクチャに基づいた大規模なインテリジェント文書モデルです。深層学習、自然言語処理(NLP)、コンピュータビジョン(CV)技術を統合し、リッチテキスト文書の複雑な構造と視覚情報を処理し、情報抽出精度を向上させます。DocM...
DistilQwen2は、知識蒸留技術を用いてQwen2大規模モデルを最適化した軽量言語モデルであり、計算効率の向上と導入コストの削減を実現します。DistilQwen2は、高度なモデル分析と強化された命令データ多様性を活用しています。
Hunyuan3D-1.0は、Tencentが開発した3D生成モデルです。テキストと画像の両方の入力をサポートし、高品質な3Dアセットを生成します。このモデルは2段階のアプローチを採用しており、まずマルチビュー拡散モデルを使用してマルチビューRGBを生成します...
Hunyuan-Largeは、Tencentが開発した大規模なハイブリッドエキスパート(MoE)モデルで、総パラメータ数3890億、活性化パラメータ数520億を誇り、パラメータ数において最大のオープンソースMoEモデルとなっています。Transformerアーキテクチャに基づいており、…をサポートしています。
Cofounderは、オープンソースのフルスタックAI開発エージェントであり、単一のプロンプトに基づいて、バックエンド、フロントエンド、データベース、ステートフルWebアプリケーションを含む完全なアプリケーションを開発者が自動的に生成するのを支援します。Cofounderは生成AI技術に基づいています。
MagicTailorは、コンポーネントの制御可能なパーソナライゼーションのために特別に設計された新しいフレームワークであり、パーソナライゼーションプロセス中にT2Iモデルを正確に制御できます。MagicTailorは、ダイナミックマスク劣化(DM-Deg)とデュアルストリームバランシング(...
Claude Computer Useは、AnthropicがClaude 3.5 SonnetおよびClaude 3.5 Haikuモデル向けに導入した新機能で、Claude AIモデルが画面の閲覧や照明の操作など、人間のようなコンピュータ操作を実行できるようにします。
Doclingは、さまざまな形式(PDF、DOCX、PPTX、画像、HTMLなど)のドキュメントを効率的に解析し、MarkdownまたはJSON形式にエクスポートするオープンソースのドキュメント解析・変換ツールです。Doclingは高度なPDF処理をサポートしています。
Cerebellumは、Claude 3.5 SonnetとSelenium WebDriverをベースに構築されたブラウザベースのAIアシスタントです。タスクの意図を理解し、データスクレイピングやウェブサイトの自動テストなどのウェブページタスクを自動化できます。Cerebellumは…
WebRLは、清華大学とZhipu AIが共同で開発した、自己進化型のオンラインコース強化学習フレームワークです。オープンな大規模言語モデル(LLM)を用いて高性能なネットワークエージェントを訓練します。WebRLはタスクを動的に生成し、結果を監視し、報酬を提供します。
GameGen-Xは、香港科技大学や中国科学技術大学などの研究者によって開発された拡散変換器モデルです。オープンワールドゲームの動画を生成し、インタラクティブに制御するために使用されます。このモデルは、革新的なキャラクターの作成など、ゲームエンジンの機能をシミュレートできます。
OuteTTSは、純粋な言語モデリングに基づいて音声を生成するオープンソースのテキスト音声合成(TTS)プロジェクトです。OuteTTSプロジェクトはLLaMaアーキテクチャに基づいており、3億5000万個のパラメータを持つOute3-350M-DEVベースモデルを使用しています。OuteTTSの特徴は…
GTA(汎用ツールエージェントのベンチマーク)は、上海交通大学と上海AI研究所が共同で立ち上げたベンチマークであり、大規模言語モデル(LLM)が現実世界のシナリオでツールを呼び出す能力を評価することを目的としています。
VQAScoreは、カーネギーメロン大学(CMU)とMetaが共同開発した評価手法で、視覚的質問応答(VQA)モデルに基づいてテキストプロンプトから生成された画像の品質を測定します。VQAScoreは、例えば「この図は{text}を示していますか?」といったテキストプロンプトから生成された画像の品質を評価するために計算モデルを使用します。
AndroidLabは、Android自律エージェントのトレーニングと評価のためのフレームワークであり、テキストと画像のモーダル操作環境、統一されたアクション空間、再現可能なベンチマークを統合しています。AndroidLabは、大規模な言語モデルとマルチモーダルモデルをサポートしています。
Recraft V3は、Recraftが開発したAIテキスト画像生成モデルです。Hugging Faceのテキスト画像ランキングでELOスコア1172を獲得し、1位にランクインしました。このモデルは、高品質な画像生成と高度な機能を備えています。