LeviTor - 南京大学、アント・フィナンシャル、その他の機関によってオープンソース化された、3Dターゲット軌道制御ビデオ合成技術。
LeviTorは、南京大学、アントグループ、浙江大学などの機関によって開発された画像から動画への合成技術です。深度情報とK平均クラスタリングポイントを組み合わせて動画内の3Dオブジェクトの軌道を制御し、明示的な3D軌道追跡の必要性を排除します。LeviTorは…
LeviTorは、南京大学、アントグループ、浙江大学などの機関によって開発された画像から動画への合成技術です。深度情報とK平均クラスタリングポイントを組み合わせて動画内の3Dオブジェクトの軌道を制御し、明示的な3D軌道追跡の必要性を排除します。LeviTorは…
3D-Speakerは、アリババ同義研究所の音声チームが立ち上げたマルチモーダルなオープンソースプロジェクトです。音響情報、意味情報、視覚情報を組み合わせることで、高精度な話者認識と言語識別を実現します。3D-Speakerは産業グレードの…
ERA-42は、北京興東Eraが開発した大規模でエンドツーエンドのネイティブロボットモデルです。自社開発の5本指器用ハンドXingdong XHAND1と組み合わせることで、100種類以上の複雑かつ器用な動作タスクを実行できます。ERA-42は事前プログラミングを必要とせず、新しいタスクを迅速に学習する能力を備えています。
Baichuan4-Financeは、Baichuan Intelligenceが開発した金融分野向けのフルチェーン拡張モデルで、Baichuan4-Finance-BaseとBaichuan4-Financeが含まれます。Baichuan4-Turboをベースに、ドメイン固有の自己制約を用いて学習されています。
VSI-Bench(Visual-Spatial Intelligence Benchmark)は、Fei-Fei Li、Sai-Ning Xie、および彼らの研究チームによって開発された視覚空間知能ベンチマークセットです。研究者らは、大規模なマルチモーダル言語モデルを評価するためにこのベンチマークを構築しました。
Bamba-9Bは、IBM、プリンストン大学、カーネギーメロン大学、イリノイ大学アーバナ・シャンペーン校が共同開発したMamba2アーキテクチャに基づく、デコード専用の言語モデルです。このモデルは完全にオープンなデータセットで学習されており、…
Univerは、スプレッドシート、ドキュメント、プレゼンテーションの作成と編集をサポートするオープンソースのフルスタックフレームワークであり、ユーザーに統合された強力なオフィスソリューションを提供します。UniverはブラウザとNode.js環境で動作し、さまざまなアプリケーションに簡単に統合できます。
Kheishは、大規模言語モデル(LLM)に基づいたオープンソースのマルチエージェントオーケストレーションプラットフォームです。複数の専門的な役割(エージェント)と柔軟なワークフローを用いて、提案書の作成、レビュー、検証など、複雑なタスクのさまざまなステップを調整します。
HelloMemeは、最新の拡散生成技術に基づいたフレームワークであり、顔の表情やポーズの転送を可能にします。HelloMemeは、安定拡散に基づく空間的結合アテンション機構を統合しています。
InvSRは、拡散モデルの逆プロセスに基づいて高解像度画像を復元する革新的な画像超解像モデルです。大規模な事前学習済み拡散モデルからの豊富な画像事前情報を活用することで、超解像性能を向上させます。InvSRの中核は深層学習にあります...
CLEARは、シンガポール国立大学が開発した新しい線形アテンションメカニズムであり、高解像度画像を生成する際の事前学習済み拡散変換(DiT)の効率を向上させます。各クエリのアテンションをローカルウィンドウに限定することで、CLEARは…
DisPoseは、北京大学、中国科学技術大学、清華大学、香港科技大学の研究チームが共同開発した、キャラクターアニメーションの品質向上を目的とした制御技術です。骨格ポーズと参照画像から有効なデータを抽出することに基づいています。
OCTAVE(Omni-Capable Text and Voice Engine)は、Hume AIが開発した次世代の音声・言語モデルで、EVI 2モデルの機能とOpenAI、Elevenlab、Google DeepMindのシステムを組み合わせたものです。OCTAVEは…
Granite 3.1は、IBMの次世代言語モデルであり、強力なパフォーマンスと拡張されたコンテキスト処理機能を誇ります。Granite 3.1モデルファミリーには、4つの異なるサイズと2つのアーキテクチャ(高密度2Bモデルと8Bパラメトリックモデル)が含まれています。
Sketch2Soundは、Adobe Researchとノースウェスタン大学が開発したAI音声生成技術です。音の模倣とテキストプロンプトに基づいて、高品質な効果音を生成します。Sketch2Soundは、音の模倣から音量、明るさ、ピッチを抽出します。
OmniAudio-2.6Bは、Nexa AIが開発した音声言語モデルで、エッジ環境への展開を想定して設計されており、高速かつ効率的な音声テキスト変換処理を実現します。OmniAudio-2.6Bは、2億6000万個のパラメータを持つマルチモーダルモデルで、Gemma-2-2と融合されています。
DreamOmniは、香港中文大学、ByteDance、香港科技大学が共同開発した、画像生成と編集を統合したモデルです。このモデルは、テキストから画像への変換(T2I)生成と、必須編集、復元など、さまざまな編集タスクを統合しています。
QVQは、AlibabaがQwen2-VL-72Bをベースに開発したオープンソースのマルチモーダル推論モデルです。視覚理解と複雑な問題解決能力を組み合わせることで、人工知能の認知能力を向上させます。QVQは、特に視覚推論タスクにおいて優れた能力を発揮します。
Open Notebookは、Google NotebookLMに代わる、プライバシーを重視したオープンソースのツールです。研究ワークフローの管理、AIを活用したノートの作成、コンテンツとのインタラクションなどを支援します。Open Notebookは、複数のノートブックと複数のモデルをサポートしています。
PC Agentは、上海交通大学と生成AI研究室(GAIR)が共同開発した高度なAIシステムです。人間の認知プロセスをシミュレートすることで、研究資料の整理、レポートの作成、プレゼンテーション資料の作成といったタスクを実行します。
Midscene.jsは、大規模言語モデル(LLM)を使用してUI自動化テストを簡素化するAIベースの自動化SDKです。ユーザーは操作手順や期待されるデータ形式を自然言語で記述し、Midscene.jsがそれを実行します。
ASAL(Automated Search for Artificial Life)は、基本的なモデルを用いて人工生命(ALife)を自動的に探索するシステムです。ASALは、Sakana AI、MIT、OpenAIなどの機関が共同で開発したもので、主に3つの要素に基づいています。
Browser Use は、大規模な言語モデル向けに特別に設計されたインテリジェントなブラウザツールです。この革新的な Python ライブラリを使用すると、AI エージェントは人間のように自然に Web ページを閲覧および操作できます。Browser Use は、マルチタブ管理、ビジュアル...
TRELLISは、清華大学、中国科学技術大学、およびマイクロソフトリサーチによって開発された3D生成モデルです。構造化潜在(SLAT)表現に基づいて、テキストや画像などの手がかりから高品質で多様な3Dアセットを生成します。