DeerFlow - ByteDanceのオープンソース深層研究フレームワーク
DeerFlowはByteDanceが開発したオープンソースの深層研究フレームワークであり、ユーザーが複雑な研究タスクを効率的に完了できるようにします。DeerFlowは言語モデルと、Web検索、Webスクレイピング、Python実行などのさまざまなツールを組み合わせて、迅速に生成します。
DeerFlowはByteDanceが開発したオープンソースの深層研究フレームワークであり、ユーザーが複雑な研究タスクを効率的に完了できるようにします。DeerFlowは言語モデルと、Web検索、Webスクレイピング、Python実行などのさまざまなツールを組み合わせて、迅速に生成します。
WebThinkerは、中国人民大学、北京人工知能研究院、ファーウェイ・ポアソン研究所などが提案した深層研究エージェントです。WebThinkerは、大規模推論モデル(LRM)が推論プロセスを自律的に実行できるようにします。
Multiverseは、イスラエルのチームEnigma Labsが開発した、世界初のAI生成マルチプレイヤーゲームモデルです。プレイヤーは追い越し、ドリフト、加速を行うことができ、それぞれの行動がリアルタイムでゲーム世界に影響を与え、変化させます。このモデルは…
Open Code Reasoning (OCR) は、NVIDIA が開発したオープンソースのコード推論 AI モデルで、Nemotron アーキテクチャに基づいており、コード推論および生成機能の向上を目的として設計されています。OCR には、32B、14B、7B の 3 つのモデル バージョンがあり、それぞれが以下の用途に適しています。
KuaiModは、Kuaishouが開発した、マルチモーダルビッグデータモデルに基づくショートビデオ品質評価フレームワークです。有害コンテンツや低品質コンテンツを効率的に識別・フィルタリングできます。このフレームワークは、判例主導型のアプローチを採用し、コモンロー制度から着想を得ています。
VITA-Audioは、低遅延と高速な推論速度を特徴とするオープンソースのエンドツーエンドのマルチモーダル音声モデルです。軽量なマルチモーダルクロスラベル予測(MCTP)モジュールを介して、最初の順伝播で音声出力を生成できます。
Parakeet TDT 0.6Bは、NVIDIAがリリースしたオープンソースの自動音声認識(ASR)モデルです。FastConformerエンコーダとTDTデコーダのアーキテクチャを採用し、テキストタグとその継続時間を予測することで推論を高速化し、計算の複雑さを軽減します。
FunGPTは、感情調整のために特別に設計された大規模モデルであるInternLM2.5シリーズをベースにしたオープンソースプロジェクトです。主な機能は、甘い言葉モードと鋭い批判モードの2つです。甘い言葉モードでは、温かい言葉と独自の…
DMindは、DMind研究所が発表した大規模な言語モデルであり、Web3ドメイン向けに特化して最適化されています。ブロックチェーン、分散型金融、スマートコントラクトなどのシナリオに最適化されており、Web3データを用いて微調整され、RLHF技術を用いて整合されています。
Dolphinは、ByteDanceがオープンソース化した軽量かつ効率的な文書解析モデルです。構造を先に解析し、次に内容を解析するという2段階のアプローチに基づいており、第1段階では一連の文書レイアウト要素が生成され、第2段階ではこれらの要素がアンカーポイントとして使用されます。
Playwright MCP は、Microsoft が提供する軽量のブラウザ自動化ツールで、モデルコンテキストプロトコル (MCP) に基づいています。このツールは、Playwright のアクセシビリティツリーに基づいて Web ページとやり取りしますが、...
RelightVidは、上海AI研究所、復旦大学、上海交通大学、浙江大学、スタンフォード大学、香港中文大学が共同開発した、動画の再照明のための時間的一貫性拡散モデルです。テキストキューや背景画像などに基づくレンダリングをサポートしています。
HRAvatarは、清華大学がIDEAチームと共同開発した単眼ビデオ再構成技術です。通常の単眼ビデオから高品質でライティング調整された3Dアバターを生成することを可能にします。HRAvatarは、学習可能な変形ベースと線形スキニング技術を使用しています。
Pocket Flowは、わずか100行のコードで実装されたミニマルなLLM(大規模言語モデル)フレームワークです。軽量で依存関係がなく、ベンダーロックインもありません。Pocket Flowは、複数のエージェント、ワークフロー、検索機能の強化などをサポートしています。
Auroraは、Microsoft Researchが開発した13億個のパラメータを持つ大気モデルです。膨大な量の大気データから貴重な情報を抽出し、地球規模の気象パターン、大気汚染、海洋波などの大気プロセスを予測します。このモデルは、事前学習済みのデータを使用しています。
DeepWiki MCPは、Cognition Labsが開発したリモートサーバーで、オープンスタンダードであるModel Context Protocol(MCP)に基づいています。DeepWiki MCPは、AIアプリケーションがGitHubのコードベースドキュメントにアクセスし、検索できるようにします。
Gemini Diffusionは、Googleが開発した実験的なテキスト拡散モデルです。単語ごとにテキストを生成する従来の自己回帰モデルとは異なり、Gemini Diffusionはノイズを段階的に洗練させることで出力を生成し、迅速な反復エラー修正を可能にします。
3DTownは、コロンビア大学がCybever AIおよび他の機関と共同で開発したフレームワークで、単一の俯瞰図から3Dの街並みを生成します。このフレームワークは、領域ベースの生成と空間認識型3Dインペインティング技術に基づいており、入力画像を重なり合う領域に分解します。
Sparc3Dは、南洋理工大学がSensory Universeおよびインペリアル・カレッジ・ロンドンと共同で開発した高解像度3Dモデル生成フレームワークです。従来の3D生成手法におけるディテールの損失と非効率性の問題を解決します。このフレームワークは、スパースな...
LeVoは、Tencent AI Labsが開発したAI歌唱モデルです。強力な音色クローン機能を誇り、膨大な学習データを必要とせず、わずか3秒の音声データから、ピッチ、感情、リズムを含むターゲット音色を正確に再現します。LeVoはトラックごとの生成にも対応しています。
Hailuo 02は、MiniMaxが発表した全く新しいAI動画生成モデルで、Hailuo 01のアップグレード版です。このモデルは現在、画像生成動画とテキスト生成動画の両方のランキングで2位にランクインしており、KuaishouのKelingやGoogleのVを上回っています。
OmniFlowは、パナソニックがUCLAと共同開発したマルチモーダルAIモデルです。このモデルは、テキストを画像に変換するなど、テキスト、画像、音声を含むあらゆる形式の生成タスクを実行できます。
Bright Data MCPは、パブリックネットワークアクセス向けに設計された強力なモデルコンテキストプロトコル(MCP)サーバーです。Bright Data MCPを使用することで、大規模な言語モデル(LLM)、エージェント、アプリケーションがリアルタイムでモデルにアクセスし、発見することが可能になります。
SurveyForgeは、上海AIラボが復旦大学、上海交通大学、その他の機関と共同で開発した革新的なフレームワークです。高品質な学術レビューを自動生成するために使用されます。このフレームワークは、アウトライン生成とコンテンツ生成の2段階設計に基づいています。アウトライン生成では…