Sky-T1は、カリフォルニア大学バークレー校スカイ・コンピューティング・ラボの研究チームであるNovaSkyがリリースしたオープンソースの推論AIモデルです。Sky-T1-32B-Previewという名称で、トレーニングデータセットとコードの両方が公開されている初のオープンソース推論モデルです。
Sky-T1は、カリフォルニア大学バークレー校スカイ・コンピューティング・ラボの研究チームであるNovaSkyがリリースしたオープンソースの推論AIモデルです。Sky-T1-32B-Previewという名称で、トレーニングデータセットとコードの両方が公開されている初のオープンソース推論モデルです。
FaceLiftは、Adobeとカリフォルニア大学マーセド校が開発した、単一画像から3D頭部モデルを作成する技術です。1枚の顔画像から360度の頭部モデルを再構築できます。FaceLiftは2段階のプロセスに基づいています。…
SVFR(Stable Video Face Restoration)は、テンセントユーチューラボと厦門大学が共同開発した、汎用的なビデオ顔復元のための統一フレームワークです。ビデオ顔復元(BFR)、カラー化、復元タスクを統合しています。
TimesFM 2.0は、Googleの研究チームが開発したオープンソースの時系列予測モデルです。最大2048時点の単変量時系列を扱い、任意の予測期間をサポートするなど、強力な予測機能を誇ります。このモデルは、解のみを求めるアプローチを採用しています。
NeuralSVGは、テキスト駆動型の革新的なベクターグラフィックス生成技術です。小さな多層パーセプトロンネットワークを用いて、テキスト情報を階層的なベクターグラフィックスに変換します。このネットワークは、形状インデックスを入力として受け取り、形状パラメータを出力します。
ViTPoseは、Transformerアーキテクチャに基づいた人体姿勢推定モデルです。標準的なビジュアルTransformerをバックボーンネットワークとして使用し、入力画像をセグメント化して特徴を抽出し、それをTransformerブロックに入力し、その後...
Nemotron-CCは、NVIDIAチームが公開した大規模な事前学習済みデータセットで、Common Crawlデータを長シーケンスの事前学習に適した高品質のコーパスに変換できます。Nemotron-CCデータセットは、分類器アンサンブル、合成データなどを組み合わせています。
NVIDIA Ingestは、複雑で整理されていない非構造化PDFやその他の企業文書を解析するための、NVIDIAが提供するオープンソースのマイクロサービス群です。NVIDIA Ingestは文書をメタデータとテキストに変換し、検索システムへの埋め込みを容易にします。
Ekoは、Fellou AIが開発した、実運用に対応したJavaScriptフレームワークです。自然言語に基づいており、開発者は簡単な指示から複雑なプロセスまで、信頼性の高いインテリジェントエージェントを容易に作成できます。Ekoは、以下のプラットフォームを含むすべてのプラットフォームをサポートしています。
Emotion-LLaMAは、音声、画像、テキスト入力を統合し、特定の感情エンコーダーを通して情報を組み合わせるマルチモーダルな感情認識・推論モデルです。このモデルは、LLaMAの改良版をベースに、感情認識能力を向上させるための指示を追加して調整されています。
GR00T-TeleopはNVIDIA Isaac GR00Tシリーズの一部であり、遠隔操作データの取得に重要な技術を活用しています。Apple Vision ProヘッドセットとのNVIDIA CloudXR接続をベースとし、特別に設計されたヒューマノイド遠隔操作システムを使用しています。
MiniRAGは、香港大学が開発した、検索機能を強化した新しい生成型言語生成(RAG)システムであり、リソース制約のあるシナリオで小型言語モデル(SLM)を効率的に展開するために設計されています。MiniRAGはこの目標を、以下の2つの主要技術に基づいて達成しています。...
Riona-AI-Agentは、Node.jsとTypeScriptで構築されたAI駆動型自動化ツールで、Instagram、Twitter、GitHubなどのソーシャルメディアプラットフォームと連携します。Riona-AI-Agentは、以下のようなものを生成できます。
Prometheusは、テキストから3Dシーンコンテンツを高速に生成するために特別に設計された、革新的な3D対応潜在拡散モデルです。オブジェクトレベルおよびシーンレベルの3D生成を数秒で完了させることができ、高品質な出力と優れた汎化性能を維持します。
MinMoは、アリババ傘下のTongyi LabのFunAudioLLMチームが開発したマルチモーダル大規模モデルで、シームレスな音声対話の実現に重点を置いています。MinMoは約80億個のパラメータを持ち、140万時間もの多様な音声データを用いた多段階学習によって訓練されています。
MiniMax-01は、MiniMaxが新たに発表したモデルシリーズで、基本言語大規模モデルMiniMax-Text-01と視覚マルチモーダル大規模モデルMiniMax-VL-01が含まれます。MiniMax-01は、大規模に線形アテンションメカニズムを実装した最初のモデルであり、…
iFlytek Spark X1は、2025年1月15日にiFlytek社から発売された、中国初の深層思考・推論能力を備えた大型モデルであり、完全国産のコンピューティングプラットフォーム上で訓練されている。問題解決プロセスにおいて、人間の「ゆっくりとした思考」方法に非常に近いアプローチを採用しており、…
iFlytekが2025年1月15日に発表したSpark同時音声通訳モデルは、エンドツーエンドの同時音声通訳機能を備えた中国初の大型モデルです。このモデルは、コンテンツの網羅性、情報の正確性、言語品質において業界をリードしています。
Titansは、Googleが開発した新しいニューラルネットワークアーキテクチャで、Transformerが長いデータシーケンスを処理する際に抱えるメモリのボトルネックを克服します。Titansは、人間の脳の記憶メカニズムをシミュレートするニューラル長期記憶モジュールを導入しており、特に予期せぬ事象への対応能力が強化されています。
moonshot-v1-vision-previewは、Dark Side of the Moonが開発したマルチモーダル画像理解モデルです。moonshot-v1モデルシリーズのマルチモーダル機能を強化し、強力な画像認識能力と複雑な画像を正確に識別する能力を備えています。
MiniCPM-o 2.6は、MiniCPM-oシリーズの最新かつ最高性能のマルチモーダル大規模モデルであり、80億個のパラメータを備えています。MiniCPM-o 2.6は、画像認識、音声認識、マルチモーダルライブストリーミングなど、複数の分野で優れた性能を発揮し、GPT-4oに匹敵するパフォーマンスを実現しています。
Flowiseは、オープンソースのローコード/ノーコードのドラッグ&ドロップツールで、ビジュアルコンポーネントをドラッグ&ドロップするだけで、カスタムLLMアプリケーションを迅速に構築できます。使いやすいツールとコンポーネントが豊富に用意されており、コーディングはほとんど、あるいは全く必要ありません。
LlamaV-o1は、アラブ首長国連邦のムハンマド・ビン・ザイード人工知能大学などの機関によって提案された、新しいマルチモーダル視覚推論モデルであり、大規模言語モデルの段階的な視覚推論能力を強化します。また、視覚推論チェーンのためのVRC-Bencベンチマークを導入しています。
Kokoro-TTSは、hexgradが開発した軽量テキスト音声合成(TTS)モデルで、8200万個のパラメータを備えています。StyleTTS 2とISTFTNetのハイブリッドアーキテクチャに基づいており、純粋なデコーダ設計を採用し、拡散モデルの使用を避けています。