OpenR - ユニバーシティ・カレッジ・ロンドンは、他の複数の大学と協力して、大規模モデルの推論能力を向上させるためのフレームワークを発表しました。
OpenRは、ユニバーシティ・カレッジ・ロンドン(UCL)、上海交通大学、リバプール大学、香港科技大学(広州)、および西湖大学が共同でオープンソース化した、フルチェーンのトレーニングフレームワークです。大規模言語モデル(LLM)の性能向上を目指しています。
OpenRは、ユニバーシティ・カレッジ・ロンドン(UCL)、上海交通大学、リバプール大学、香港科技大学(広州)、および西湖大学が共同でオープンソース化した、フルチェーンのトレーニングフレームワークです。大規模言語モデル(LLM)の性能向上を目指しています。
Agent-Sは、グラフィカルユーザーインターフェース(GUI)に基づいて人間とコンピュータのインタラクションを自動化するために設計された革新的なエージェントフレームワークです。Agent-Sは人間の操作をシミュレートし、マウスとキーボードを使用してコンピュータと直接対話することで複雑なタスクを処理できるようにします。
Adobe Fireflyは、ユーザーが本来持っている創造性を拡張できるよう設計された、Adobeのクリエイティブ生成AIモデル群です。これらのモデルは、Adobeの主力アプリケーションやAdobe Stockに統合されており、…
拡張物理学は、統合された機械学習を用いて物理学の教科書にある静的な図を、インタラクティブで組み込み型の物理シミュレーションに変換する革新的な教育ツールです。このツールは、高度なコンピュータビジョン技術に基づいています。
podlm-publicは、NotebookLMの中国語版代替ツールとして設計されたオープンソースのAIポッドキャストツールです。特に、任意のURLをポッドキャストコンテンツに変換し、それを小魚洲プラットフォームに配信することを目的としています。このプロジェクトは、高度なAI技術に基づいています。
Zero-One-Way Technology Co., Ltd.がリリースした最新のフラッグシップモデルであるYi-Lightningは、国際的に権威のあるブラインドベンチマークリストLMSYSで目覚ましい成果を上げ、OpenAIのGPT-4o-2024-05-13やAnthropic Cを凌駕しました。
FunASRは、Alibaba DAMO Academyが提供するオープンソースの音声認識ツールキットで、音声認識(ASR)、音声活動検出(VAD)、句読点復元、言語モデリング、話者照合、話者セグメンテーション、複数話者ASRなどの機能を提供します。
CleanS2Sは、ストリーミング音声間通信(S2S)対話型インテリジェントエージェントのプロトタイプであり、高品質なリアルタイム音声対話体験を提供します。CleanS2Sプロジェクトは単一ファイルで実装されているため、設定と理解が容易で、ユーザーや研究者にとって使いやすいものとなっています。
Hallo2は、復旦大学、百度、南京大学が共同開発した音声駆動型動画生成モデルです。単一の参照画像と数分間の音声入力を組み合わせ、オプションのテキストプロンプトに基づいて人物の表情を調整します。
Model Judgeは、Next.js上に構築されたオンラインAIモデル評価プラットフォームです。ユーザーは質問を入力し、テストする複数のAIモデルを選択することで、ニーズに最適なAIモデルを迅速に特定できます。このプラットフォームのユニークな機能は、...
AgentStackは、開発者がAIエージェントプロジェクトを迅速に構築できるよう設計されたオープンソースツールです。事前設定済みのテンプレートを提供し、人気の高いエージェントフレームワークや大規模言語モデル(LLM)プロバイダーを統合することで、ゼロからの作成プロセスを簡素化します。
Marcoは、アリババインターナショナルが開発した最新の大規模商用翻訳モデルで、中国語、英語、日本語、韓国語、スペイン語、フランス語を含む15の主要言語に対応しています。BLEUベンチマークでは、Google翻訳、DeepL、GPT-4などの競合製品を凌駕しています。
Mistral 3Bと8Bは、Mistral AIが新たに発表した2つのAIミニモデルで、オンデバイスコンピューティングとエッジアプリケーション向けに特化して設計されています。これらは、10億個未満のパラメータを持つカテゴリにおいて、知識、常識、推論、関数呼び出し、効率性といった点で優れた性能を発揮します。
TANGOは、東京大学とサイバーエージェントAIラボが共同開発したオープンソースフレームワークで、対象者の発話と同期した全身ジェスチャー動画の生成に特化しています。階層型オーディオモーション埋め込みと拡散補間ネットワークに基づいて、対象者の発話を同期させ、…
Nemotron-70B-Instructは、NVIDIAがリリースした大規模言語モデルです。このモデルは、指示に従う際の応答品質と一貫性を向上させるために、斬新なハイブリッド学習手法を採用しています。このモデルは、Bradley-Ter...
SANAは、NVIDIA、MIT、清華大学が共同開発したテキストから画像を生成するフレームワークです。最大4096×4096の高解像度画像を効率的に生成できます。SANAは、ディープ圧縮オートエンコーダ、線形拡張に基づいています。
Chat2DBは、自然言語処理技術に基づいたAI駆動型のデータベース管理・分析ツールです。ユーザーは自然言語を使ってデータベースと対話できるため、SQLコードの記述やデータベース管理が簡素化されます。Chat2DBは様々なデータベースをサポートしています。
IterCompは、清華大学、北京大学、LibAI Lab、中国科学技術大学、オックスフォード大学、プリンストン大学の研究者らが共同開発したテキストから画像を生成するフレームワークです。反復的なフィードバック学習メカニズムに基づいています。
LayerSkipは、大規模言語モデル(LLM)の推論プロセスを高速化するために使用される手法です。トレーニング段階でレイヤードロップアウトと早期終了損失を適用することで、推論中にモデルがより正確に初期レイヤーから抜け出すことを可能にし、...
Spirit LMは、Meta AIチームが開発したマルチモーダル言語モデルで、テキストデータと音声データをシームレスに融合します。Spirit LMは、事前学習済みのテキスト言語モデルをベースに、テキストと音声のユニットで継続的に学習されています。
Story-Adapterは、長編ストーリーの視覚化のための斬新なフレームワークであり、意味的な一貫性を維持しながら、高品質で繊細なインタラクティブ性を備えたストーリー画像のシーケンスを生成します。これは、グローバル参照の相互注意に基づく反復的なアプローチによって実現されます。
LOKIは、中山大学と上海AI研究所が共同で提案した合成データ検出ベンチマークです。動画、画像、3D、テキスト、音声など、複数のモダリティにわたる合成データを認識する大規模マルチモーダルモデル(LMM)の能力を包括的に評価することを目的としています。
NotesGPTは、オープンソースのAI搭載音声メモツールで、ユーザーの音声メモを素早くテキストに変換し、アクションアイテムを自動的に生成します。このツールは、Convexデータベース、Next.jsフレームワーク、Together推論モデルなどの技術に基づいています。
Meta AIが開発したMEXMAは、新しい事前学習済みの多言語文エンコーダーです。文レベルと単語レベルの目標を組み合わせることで、文表現の質を向上させます。トレーニング中、MEXMAは…