MeteoRA - 南京大学が、高効率で拡張性の高いマルチタスク組み込みフレームワークを発表
MeteoRAは、南京大学コンピュータ科学技術学部の研究チームが開発した、大規模言語モデル(LLM)向けのマルチタスク埋め込みフレームワークです。複数のタスク固有のLoRA(低ランクアダプタ)を単一のベースモデルに統合します。
MeteoRAは、南京大学コンピュータ科学技術学部の研究チームが開発した、大規模言語モデル(LLM)向けのマルチタスク埋め込みフレームワークです。複数のタスク固有のLoRA(低ランクアダプタ)を単一のベースモデルに統合します。
MME-CoTは、香港中文大学、深圳中文大学、ByteDance、南京大学、上海人工知能研究所、ペンシルベニア大学、清華大学などの機関が共同開発した、大規模なマルチモーダルモデルを評価するための技術です。
Anthropic社が開発したClaude 3.7 Sonnetは、世界初のハイブリッド推論モデルであり、「標準モード」と「拡張思考モード」の両方を備えています。標準モードでは、Claude 3.7 Sonnetは迅速に…
DeepEPは、DeepSeek初のオープンソースEP(Expert Parallel)通信ライブラリで、ハイブリッドエキスパートモデル(MoE)のトレーニングと推論のために特別に設計されています。高スループットかつ低遅延のフルツーフルGPUカーネルを提供し、ノード内通信をサポートします。
QwQ-Maxは、AlibabaがQwen2.5-Maxをベースに開発した深層推論モデルであり、Qwenシリーズの一部です。QwQ-Max-Previewはプレビュー版としてリリースされており、QwQ-Maxはまもなく正式リリースされ、完全なオープンソースとなる予定です。QwQ-Max...
FantasyIDは、アリババグループと北京郵電大学が開発した、新しいアイデンティティ保持型ビデオ生成(IPT2V)フレームワークです。強化された顔認識情報に基づいて、高品質でアイデンティティが一貫したビデオを生成します。FantasyIDは、拡散変換(D...)に基づいています。
SigStyleは、吉林大学、南京大学インテリジェント科学技術学院、およびAdobeが共同開発した新しい署名スタイル転送フレームワークです。単一のスタイル画像から、幾何学的構造、配色、筆致などの独自の視覚的特徴を転送することをサポートします。
VLM-R1は、Om AI Labが開発した強化学習技術に基づく視覚言語モデルです。自然言語コマンドを用いて画像内の対象物を正確に特定します。例えば、「写真の中の赤いカップ」という説明に基づいて、対応する画像領域を見つけます。
FacePokeは、AI技術に基づいたオープンソースのリアルタイム顔編集ツールです。ユーザーは、マウスのドラッグ&ドロップ操作だけで、写真の頭の向き(上向き、下向き、左右の首振りなど)や表情(目の開閉など)を簡単に編集できます。
BFS-Proverは、ByteDanceのDoubao Big Modelチームが開発した、大規模言語モデル(LLM)に基づく自動定理証明システムです。専門家による反復処理と直接的な選好最適化を取り入れることで、従来の幅優先探索(BFS)アルゴリズムを改良しています。
PySpurは、オープンソースで軽量なビジュアルAIエージェントワークフロービルダーであり、AIシステムの開発プロセスを簡素化します。ドラッグ&ドロップインターフェースにより、複雑なコードを記述することなく、AIワークフローを迅速に構築、テスト、反復できます。
Wan2.1は、Alibaba Cloudが提供するオープンソースのAI動画生成モデルで、強力な画像生成機能を備えています。Wan2.1はテキストベースと画像ベースの両方の動画タスクをサポートし、2種類のサイズのモデルが用意されています。14バイトのパラメータを持つプロフェッショナル版は、複雑な動きの生成に優れています。
AgentRefineは、北京郵電大学と美団が共同で提案したインテリジェントエージェント合成フレームワークです。大規模言語モデル(LLM)に基づくエージェントの汎用性を、「リファインメントチューニング」を通じて多様なタスクにおいて向上させます。
DeepGEMMは、DeepSeekが開発したオープンソースライブラリで、効率的かつ簡潔なFP8行列乗算(GEMM)を実現するように設計されています。現在はNVIDIA Hopperテンソルコアのみをサポートしています。DeepGEMMは、通常エキスパートグループと混合エキスパートグループ(MoE)の両方でGEMM演算をサポートしています。
TinyR1-Previewは、北京大学コンピュータサイエンス学部と360 Security Technology Inc.が共同開発した32バイトの推論モデルです。パラメータのわずか5%を使用するだけで、Deepseek-R1-671Bの性能に匹敵します。TinyR1-Previewは、数学分野において大きな利点を持っています。
SurveyXは、大規模言語モデル(LLM)に基づいて学術レビューを自動生成するシステムです。中国人民大学、シドニー大学、中国東北大学が共同開発しました。ユーザーが提供した論文タイトルとキーワードに基づいて、迅速にレビューを生成します。
Flameは、UIデザインのスクリーンショットを高品質で最新のフロントエンドコードに変換することをサポートする、オープンソースのマルチモーダルAIモデルです。ビジュアル言語モデリング、自動データ合成、構造化されたトレーニングプロセスに基づいて、FlameはReactなどの最新のフロントエンド技術に準拠したコードを生成します。
OctoToolsは、スタンフォード大学が開発したオープンソースのインテリジェントエージェントフレームワークです。スケーラブルなツールを使用して複雑な推論タスクを解決します。OctoToolsは、標準化されたツールカードを使用してツールの機能をカプセル化することで、追加のトレーニングを不要にします。
PhotoDoodleは、シンガポール国立大学、上海交通大学、北京郵電大学、ByteDance、およびTiamatチームが共同開発した芸術的な画像編集フレームワークです。少数のサンプルに基づいてアーティスト独自のスタイルを学習し、…
video-subtitle-masterは、動画や音声の字幕を一括生成するためのツールです。オープンソースプロジェクトVideoSubtitleGeneratorをベースに開発されており、動画や音声の字幕の一括生成、および字幕の他言語への翻訳をサポートしています。
DualPipeは、DeepSeekがオープンソース化した革新的な双方向パイプライン並列技術であり、主に大規模深層学習モデルのトレーニング効率を向上させるために使用されます。その核心となるアイデアは、モデルトレーニングプロセスを2つの独立したパイプライン(順方向計算と逆方向計算)に分割することです。
EPLB(Expert Parallelism Load Balancer)は、DeepSeekが開発したエキスパート並列ロードバランサーで、大規模モデルトレーニング中に異なるエキスパートモデル間で発生する負荷の不均一性という問題を解決するために設計されています。EPLBは、...
プロファイリングデータは、DeepSeekのオープンソースのトレーニングおよび推論フレームワークから得られるパフォーマンス分析データです。PyTorch Profilerによってプログラム実行中に取得された詳細な情報に基づいており、ソフトウェアのパフォーマンス分析と最適化に使用されます。
Phi-4-Multimodalは、Microsoftの最新のマルチモーダル言語モデルで、56億個のパラメータを持ち、音声、画像、テキスト処理を統合したアーキテクチャを採用しています。このモデルは、自動認識を含む複数のベンチマークで非常に優れた性能を発揮します。