R1-Onevision - Qwen2.5-VLをベースに高度に調整された、オープンソースのマルチモーダル視覚推論モデル。
R1-Onevisionは、複雑な視覚的推論タスクに特化したオープンソースのマルチモーダル言語モデルです。Qwen2.5-VLの改良版をベースに、視覚データとテキストデータを統合してマルチモーダル情報を正確に解釈します。数学的には…
R1-Onevisionは、複雑な視覚的推論タスクに特化したオープンソースのマルチモーダル言語モデルです。Qwen2.5-VLの改良版をベースに、視覚データとテキストデータを統合してマルチモーダル情報を正確に解釈します。数学的には…
Phi-4-Mini は、テキストタスクに特化した Microsoft の小型言語モデルである Phi-4 シリーズの最新版で、38 億個のパラメータを備えています。これは、密なデコーダのみの Transformer アーキテクチャと、グループ化されたクエリ アテンション (G...
IndexTTSは、Bilibiliが提供する産業グレードの制御可能なテキスト音声合成(TTS)システムです。XTTSとTortoiseモデルをベースに開発され、GPTスタイルの生成技術を取り入れることで、テキストを自然で流暢な音声に効率的に変換します。
ElevenLabsが開発したScribeは、多言語かつ複雑な音声環境向けに設計された高精度音声認識モデルです。99言語に対応し、英語では96.7%、イタリア語では98.7%の文字起こし精度を実現しています。あまり一般的でない言語では…
VideoGrainは、シドニー工科大学と浙江大学が開発した、ゼロショット、マルチグレインレベルのビデオ編集フレームワークです。カテゴリ、インスタンス、コンポーネントレベルでのきめ細かなビデオ編集を可能にします。VideoGrainは、時空間的な相互注意と自己調整に基づいています。
テンセントのHunyuan Turbo Sは、テンセントが発売した新世代の高速思考型モデルです。このモデルは革新的なHybrid-Mamba-Transformer融合アーキテクチャを採用し、従来のTransformerの計算複雑性を効果的に低減し、KVキャッシュを最小限に抑えています。
GPT-4.5はOpenAIの最新の大規模言語モデルであり、現在最大かつ最も強力なチャットボットモデルです。拡張された教師なし学習に基づいており、パターン認識、知識の幅、創造的な生成能力を向上させると同時に、錯覚を軽減します。
3FS(Fire-Flyer File System)は、DeepSeekが開発した高性能分散ファイルシステムで、AIのトレーニングおよび推論タスク向けに特別に設計されています。3FSは最新のSSDとRDMAネットワーク技術を使用し、独自のアーキテクチャに基づいて数千台のSSDを統合しています。
CorrDiffは、NVIDIAが開発した生成型AIモデルで、低解像度のグローバル気象データを高解像度データにダウンサンプリングすることで、気象予報の精度と効率を向上させます。2段階のデータ処理方法を採用しており、まず…
Smallpondは、DeepSeekが開発した軽量データ処理フレームワークで、DuckDBと3FSを基盤として構築されており、高性能かつ大規模なデータ処理向けに設計されています。Smallpondは、DuckDBの機能を活用し、ペタバイト規模のデータセットの処理をサポートしています。
SongGenは、上海AI研究所、北京航空航天大学、香港中文大学が共同開発した、テキストから楽曲を生成する単段自己回帰型Transformerモデルです。SongGenは、歌詞と説明文(楽器、スタイルなど)に基づいて楽曲を生成します。
VideoFusionは、効率的なビデオ編集のために設計されたオープンソースのショートビデオ編集・処理ソフトウェアです。ビデオから黒い枠線、透かし、字幕を自動的に削除する機能をサポートし、さまざまな再生シナリオに合わせてビデオを横向きまたは縦向きに自動的に回転させることができます。
Baichuan-Audioは、Baichuan Intelligenceが開発したエンドツーエンドの音声言語モデルです。音声理解機能と音声生成機能をシームレスに統合し、高品質で制御可能なリアルタイムの中国語・英語バイリンガル対話を実現します。Baichuan-Audioはマルチコードに基づいています...
AIMv2は、Appleが開発したオープンソースのマルチモーダル自己回帰型事前学習済みビジュアルモデルで、画像とテキストのディープフュージョンによってビジュアルモデルのパフォーマンスを向上させます。革新的な事前学習フレームワークを採用しており、画像を重複しない画像パッチに分割し、テキストを統合します。
VidSketchは、浙江大学CAD&CG国家重点実験室とソフトウェア学部が開発した革新的なビデオ生成フレームワークです。手描きのスケッチとシンプルなテキストプロンプトに基づいて、高品質のビデオアニメーションを生成します。VidSketchは階層構造に基づいています...
オハイオ州立大学が開発したHippoRAG 2は、人間の長期記憶の動態と連想性をシミュレートする上で既存のRAGシステムの限界に対処する、検索強化型生成(RAG)フレームワークです。HippoRAG 2は、パーソナライズされたPageRankに基づいています。
LDGenは、大規模言語モデル(LLM)と拡散モデルを組み合わせることで、テキストから画像への生成の品質と意味の一貫性を向上させる革新的なテキスト画像合成技術です。階層的なタイトル最適化と人間による指示技術を通じて、...
AI-Infra-Guardは、Tencentが開発した、オープンソースで効率的、軽量かつ使いやすいAIインフラストラクチャ向けセキュリティ評価ツールです。AIシステムにおける潜在的なセキュリティリスクを検出・特定できます。AI-Infra-Guardは28種類のAIフレームワークをサポートしています。
Mahiloは、人間と対話するマルチエージェントシステムの構築を支援する柔軟なマルチエージェントフレームワークです。Mahiloはリアルタイムの音声およびテキスト通信をサポートしており、エージェントが自律的にコンテキストや情報を共有しながら、人間による対話の監視を維持できます。
香港科技大学が開発したWorldCraftは、大規模言語モデル(LLM)エージェントに基づいた3D世界の作成およびカスタマイズシステムです。リアルな3D仮想世界の作成とカスタマイズに使用されます。自然言語による対話に基づいており、ユーザーは簡単に生成できます。
Mobiusは、人工知能アルゴリズムを用いてテキスト記述から無限ループ動画コンテンツを生成する、高度なシームレスループ動画生成技術です。その中核となるのは、動画内の重要な要素を自動的に識別し、滑らかな動画を生成する強力なAIモデルです。
WarriorCoderは、華南理工大学コンピュータ科学工学部とマイクロソフトが共同開発した、コード生成のための大規模言語モデル(LLM)です。専門家モデル間の敵対的相互作用をシミュレートすることで高品質な学習データを生成し、モデルのパフォーマンスを向上させます。
xARは、ByteDanceとジョンズ・ホプキンス大学が共同で提案した、斬新な自己回帰型ビジュアル生成フレームワークです。このフレームワークは、「Next-X Prediction」と「Noisy Context Learning」を利用しています。
Avat3rは、ミュンヘン工科大学とMeta Reality Labsが開発した、高精細で大規模なアニメーション可能な3D頭部画像生成のためのガウス再構成モデルです。わずか数枚の入力画像で、高品質でアニメーション可能な3D頭部画像を生成します。