OmniSearch - Alibaba Tongyiが発表したマルチモーダル検索強化および生成フレームワーク
OmniSearchは、アリババのTongyi Labが開発したマルチモーダル検索強化・生成フレームワークであり、適応型プランニング機能を備えています。OmniSearchは、複雑な問題を動的に分解し、検索結果と問題のコンテキストに基づいて検索戦略を調整することができます。
OmniSearchは、アリババのTongyi Labが開発したマルチモーダル検索強化・生成フレームワークであり、適応型プランニング機能を備えています。OmniSearchは、複雑な問題を動的に分解し、検索結果と問題のコンテキストに基づいて検索戦略を調整することができます。
Perplexicaは、オープンソースのAI駆動型検索エンジンであり、Perplexity AIのオープンソース代替品です。機械学習アルゴリズムと自然言語処理を用いてユーザーのクエリを理解し、正確な回答を提供します。Perplexicaは様々な検索方法をサポートしています。
Memoripyは、AIアプリケーション向けにコンテキスト認識型のメモリ管理を提供するPythonライブラリです。Memoripyは短期記憶と長期記憶の両方をサポートし、OpenAIおよびOllama APIと互換性があります。主な機能には、メモリの取得、概念の抽出、...
AnimateAnythingは、浙江大学と北京航空航天大学の研究者によって開発された、統合的で制御可能なビデオ生成技術です。AnimateAnythingは、カメラの軌道、テキストプロンプト、ユーザーのジェスチャーなど、ビデオを精密に操作できます。
RAG-Diffusionは、南京大学の研究チームが開発した、領域認識型のテキストから画像への生成手法です。ハード領域の結合とソフト領域の細線化という2つの段階に基づいて、画像内の各領域を正確に制御し、詳細を最適化することができます。RAG-Diffusionは…
FitDiTは、テンセントと復旦大学が共同開発した高精細なバーチャル試着技術です。拡散トランスフォーマー(DiT)をベースに、高解像度の特徴に焦点を当て、衣服のディテール表現を強化します。FitDiTは衣服のテクスチャを抽出し…
Documindは、PDF文書から構造化データを抽出できるオープンソースのAI文書処理ツールです。Documindは、PDFを画像に変換したり、OpenAI APIを使用して情報を抽出したり、ユーザー定義のパターンに従って出力をフォーマットしたりできます。
MARS(Make vAriance Reduction Shine)は、大規模モデルのトレーニング効率を向上させるためにByteDanceが開発した革新的な最適化フレームワークです。MARSは、スケーリングされた確率的再帰に基づく分散低減技術と前処理勾配法を統合しています。
検証エンジニアリングは、中国科学院、アリババ、小紅書が共同で立ち上げた、新しいポストトレーニングパラダイムです。これは、基本モデル設計における効果的な監視信号の提供という課題に取り組んでいます。検証エンジニアリング…
XiYan-SQLは、アリババが開発した自然言語からSQLへの変換(NL2SQL)フレームワークです。マルチジェネレータ統合戦略に基づき、提案型エンジニアリングと教師あり微調整を組み合わせることで、生成されるSQLクエリの品質を向上させています。XiYan-SQLは、Mスキーマ半構造化を導入しています。
KuaiFormerは、Kuaishouの技術チームが大規模コンテンツ推薦システム向けに開発したTransformerベースの検索フレームワークです。従来のスコア推定タスクからTransformer駆動型のアプローチへと移行することで、検索プロセスを再定義します。
EyeDiffは、自然言語によるプロンプトに基づいてマルチモーダルな眼科画像を生成するテキスト・トゥ・イメージ拡散モデルであり、一般的な眼疾患と希少な眼疾患の両方の診断精度を向上させます。このモデルは複数の大規模データセットでトレーニングされており、重要な病変を正確に捉えます。
BlueLM-V-3Bは、vivo AI Labと香港中文大学MMLabが共同開発したアルゴリズムとシステム協調設計手法です。モバイルデバイスへのマルチモーダル大規模言語モデル(MLLM)の効率的な展開をサポートします。モデルのサイズは小さく(2.7B)、...
AtomThinkは、中山大学、香港科技大学、上海交通大学、香港大学、およびファーウェイ・ノアズアーク・ラボの研究者らが共同開発したマルチモーダルな数学的推論フレームワークです。このフレームワークは、思考の長い連鎖(CoT)を構築するという概念に基づいています。
DeepSeek-R1-Liteは、DeepSeekの推論モデルのプレビュー版です。強化学習を用いてトレーニングされたDeepSeek-R1-Liteは、長連鎖推論能力を備え、推論プロセスをリアルタイムで表示できます。その性能は、複数のベンチマークテストで高い評価を得ています。
Samsung Gauss2は、Galaxy AI機能の性能と効率を向上させるために設計された、Samsungの第2世代マルチモーダル生成AIモデルです。Samsung Gauss2は、テキスト、コード、画像など、複数のデータタイプを同時に処理できます。
AlphaQubitは、Googleが開発したAIベースの量子エラーデコーダです。Transformersディープラーニングアーキテクチャを使用して、量子コンピューティングにおけるエラーを特定し、修正します。正確なエラー識別に基づいて、AlphaQubitは量子コンピュータの性能向上を支援します。
CAD-MLLMは、上海科技大学、Transcengram、DeepSeek AI、香港大学が共同開発したコンピュータ支援設計(CAD)モデル生成システムです。テキストによる説明や画像など、さまざまなユーザー入力に基づいてモデルを生成します。
LaTRO(潜在推論最適化)は、複雑な推論タスクにおける大規模言語モデル(LLM)の性能を向上させる高度なフレームワークです。これは、推論プロセスを潜在分布からのサンプリングに例え、変分推論を用いています。
ReCaptureは、Googleとシンガポール国立大学が開発した動画処理技術で、ユーザーが提供する単一の動画から、新しいカメラ軌跡を持つ新しい動画を生成できます。ReCaptureは、マルチビュー拡散モデルまたは深度ベースの点群レンダリングを使用します。
MagicClayはAdobeの3Dモデリングツールで、メッシュと指向性距離場(SDF)技術を組み合わせることで、アーティストはテキストプロンプトに基づいて3Dモデルの特定の部分を彫刻し、モデルの他の部分は変更せずに済みます。
StableV2Vは、中国科学技術大学が立ち上げたオープンソースの動画編集プロジェクトです。テキスト、スケッチ、画像などの入力に基づいて、動画内のオブジェクトを正確に編集・置換することができます。このプロジェクトは形状一貫性編集パラダイムを採用しており、主に3つのコンポーネントで構成されています。
Haloは、低価格のスマートリングとオープンソースソフトウェアをベースに、ユーザーが独自のパーソナライズされた健康モニタリングアプリケーションを構築できるオープンソースのDIY健康追跡プロジェクトです。Haloは、アクティビティ追跡、心拍数モニタリング、睡眠分析などの機能をサポートしており、完全に無料です。
JoyVASAは、JD Health Internationalが開発したオープンソースの音声駆動型デジタルヘッドプロジェクトです。拡散モデル技術に基づき、音声信号に同期した顔と頭の動きを生成します。JoyVASAは、唇の動きを同期させることができます。