Lingua - Metaがリリースした軽量でスタンドアロンなコードベース
Linguaは、Meta AIが開発した軽量でスタンドアロンのコードベースであり、言語モデルの大規模トレーニングを容易にするように設計されています。容易に変更可能なPyTorchコンポーネントに基づいており、研究者は新しいモデルアーキテクチャ、損失関数などを試すことができます。
Linguaは、Meta AIが開発した軽量でスタンドアロンのコードベースであり、言語モデルの大規模トレーニングを容易にするように設計されています。容易に変更可能なPyTorchコンポーネントに基づいており、研究者は新しいモデルアーキテクチャ、損失関数などを試すことができます。
VideoAgentは、スタンフォード大学、ウォータールー大学、DeepMindなどの研究者によって開発された自己改善型のビデオ生成システムです。画像観察と音声指示に基づいてビデオプランを生成し、それをロボットの動きに変換します。
Llama Tutorは、Llama 3.1とTogether AIテクノロジーを搭載したAI駆動型のパーソナライズ学習プラットフォームです。完全なオープンソースプロジェクトであり、ユーザーは希望する学習トピックと教育レベルを入力すると、プラットフォームがパーソナライズされた学習プロファイルを生成します。
NVIDIAとテルアビブ大学の研究者によって開発されたComfyGenは、大規模言語モデル(LLM)に基づいてワークフローを自動的に作成し、ユーザーが入力したテキストプロンプトにマッチさせることで画像生成の品質を向上させるテキスト画像生成システムです。
restorePhotos.ioは、古くてぼやけた顔写真の復元に特化したオープンソースのAIプロジェクトです。Next.js APIルーティングを介してアップロードされた写真をGFPGAN機械学習モデルで処理し、復元された写真を返します。
PDFtoChatは、ユーザーが自然言語による対話を通じてPDFファイルとやり取りできる、革新的なオープンソースAIプロジェクトです。このツールは、Together AIやMixtralなどの最新のAI技術を活用して、ユーザーのクエリを理解します。
自己学習型評価器は、自己学習によって大規模言語モデル(LLM)の評価能力を向上させ、手動でラベル付けされたデータの必要性を排除する、新しいモデル評価手法です。ラベル付けされていない指示から始めて、反復的に...
TurboSeekはTogether.aiが提供するオープンソースのAI検索エンジンです。Next.js、Tailwind、Bing検索API、高度な言語モデルMixtral 8x7BおよびLlaなど、最新のテクノロジースタックに基づいています。
Napkins.devは、AI技術を用いてユーザーのスクリーンショットやワイヤーフレームを動作するWebアプリケーションに迅速に変換する革新的なオープンソースプロジェクトです。このプロジェクトは、MetaのLlama 3.1 405B大規模言語モデルを基盤としており、...
マトリョーシカ拡散モデル(MDM)は、高解像度画像や動画の生成における計算および最適化の課題に対処するためにAppleの研究者によって開発された新しい拡散モデルフレームワークです。MDMは…
mPLUG-DocOwl 1.5は、アリババグループが発表したマルチモーダル大規模言語モデルで、OCR(光学文字認識)不要の文書理解に重点を置いています。このモデルは統一構造学習に基づいており、テキスト画像などのリッチなテキストを理解する能力が向上しています。
Google DeepMindとMITが共同開発したテキストから画像への自己回帰生成モデルであるFluidは、連続的なラベル付けとランダムな生成順序に基づいて、視覚品質と評価性能において画期的な進歩を遂げました。このモデルは、…
SaRAは、上海交通大学とテンセントYouTu Labが共同開発した、事前学習済み拡散モデルのファインチューニング手法です。事前学習プロセスで効果がないと判断されたパラメータを再活性化することで、モデルを新しいタスクに適応させることができます。SaRAは…
Quanta Questは、個人ユーザー向けのオープンソースのAI時代対応型インテリジェントデータベース製品です。Gmail、Dropbox、Notionなどのソースからの個人データを単一のプラットフォームに統合し、RAGテクノロジーを使用してAI検索機能を提供することで、ユーザーを支援します。
BiGRは、生成トレーニングにコンパクトなバイナリ潜在コードを使用する新しい条件付き画像生成モデルであり、生成画像の品質と表現力を向上させます。生成タスクと識別タスクを同じフレームワーク内で統合した最初のモデルとして、BiGRは…
MoE++は、崑崙科技2050研究所と北京大学の袁力氏のチームが共同開発した、斬新なエキスパート混合アーキテクチャです。これは、計算コストがゼロのエキスパート、すなわちゼロエキスパート、レプリケーションエキスパート、および定数コストエキスパートの導入に基づいています。
Granite 3.0は、IBMが提供する高度なAIモデル群であり、数多くの学術および企業ベンチマークにおいて優れた性能を発揮します。企業向けアプリケーション向けに設計されたこれらのモデルは、テキスト生成、データセグメンテーションなど、さまざまなタスクを実行できます。
Project Turntableは、Adobeが2024年のMAXカンファレンスで発表した革新的なAIツールです。このツールを使うと、2Dベクター画像を3Dオブジェクトのように回転させることができ、画像の隠れた部分を瞬時に生成できます。AIモデルを使用して、隠れた部分を補完します。
OmniAIは、高度なOCR技術に基づいた強力なAI文書処理プラットフォームであり、PDF、DOCX、画像などの様々なファイル形式からの高速処理とデータ抽出をサポートします。このプラットフォームを使用すると、ユーザーは簡単に文書処理パイプラインを作成できます。
TaskWeaverは、Microsoftが開発したコードファーストのAIエージェントフレームワークで、データ分析タスクのシームレスな計画と実行に重点を置いています。コードスニペットに基づいてユーザーのリクエストを解釈し、さまざまなプラグイン(関数形式)の実行を効率的に調整します。
Stable Diffusion 3.5は、Stability AIが提供する最新の高度なAI画像生成モデルで、Stable Diffusion 3.5 Large、Stable Diffusion 3.5 Large Turbo、そして近日公開予定のバージョンが含まれます。
Mochi 1は、Genmoが開発したオープンソースの動画生成モデルで、優れたモーション品質とユーザーの指示への忠実性で知られています。Apache 2.0ライセンスでリリースされているMochi 1は、個人利用と商用利用の両方で無料で使用できます。このモデルは…
Claude 3.5 Haikuは、Anthropic社が発表した新しい人工知能モデルです。前モデルのClaude 3 Haikuと同等の速度とコストを維持しながら、以下のような様々な機能の向上を実現しています。
PUMAは、統合された多粒度視覚特徴に基づいて、視覚生成および理解タスクを統合・強化するために設計された、高度なマルチモーダル大規模言語モデル(MLLM)です。PUMAは、テキストから画像への生成、詳細な画像編集など、幅広いタスクに対応できます。