Doubao Large Model 1.5 - ByteDanceがリリースした最新の大型モデル。
Doubao Big Model 1.5は、ByteDanceがリリースした最新版のビッグモデルです。大規模なスパースMoEアーキテクチャを採用し、活性化パラメータが7倍のDenseモデルと同等の性能を実現しています。知識、コード、推論、中国語性能など、複数の評価基準において高い総合スコアを達成しています。
Doubao Big Model 1.5は、ByteDanceがリリースした最新版のビッグモデルです。大規模なスパースMoEアーキテクチャを採用し、活性化パラメータが7倍のDenseモデルと同等の性能を実現しています。知識、コード、推論、中国語性能など、複数の評価基準において高い総合スコアを達成しています。
OmniManipは、北京大学とZhiyuan Roboticsの共同研究室が開発した汎用ロボットマニピュレーションフレームワークです。視覚言語モデル(VLM)の高度な推論機能と高精度な3Dマニピュレーション機能を組み合わせることで、ロボットが非線形な動作を実行できるようになります。
WebWalkerは、Alibabaの自然言語処理チームが開発したツールで、Webブラウジングタスクにおける大規模言語モデル(LLM)の性能を評価・改善することを目的としています。Webナビゲーションタスクをシミュレートすることで、モデルが長いWebページをより適切に処理できるようになります。
VideoChat-Flashは、上海人工知能研究所と南京大学などが共同開発した、長尺動画モデリングのためのマルチモーダル大規模言語モデル(MLLM)です。このモデルは、階層型圧縮技術(HiCo)を用いて長尺動画を効率的に処理します。
EmoLLMは、メンタルヘルス支援に特化した大規模言語モデルであり、マルチモーダルな感情理解を通して、ユーザーに感情的なガイダンスと心理的なサポートを提供します。高度なマルチビュー視点に基づき、テキスト、画像、動画など様々なデータ形式を組み合わせています。
Step-Video V2は、上海傑岳星辰智能科技がリリースしたアップグレード版ビデオ生成モデルです。このバージョンでは、いくつかのコア技術分野で最適化と革新が行われ、より高い圧縮率のVAEモデルと高度に最適化されたDiTを採用しています。
UI-TARSは、ByteDanceが開発した次世代ネイティブグラフィカルユーザーインターフェース(GUI)プロキシモデルであり、自然言語によるデスクトップ、モバイルデバイス、Webインターフェースとの自動的なインタラクションを可能にします。強力な知覚、推論、行動、そして…
EMO2(End-Effector Guided Audio-Driven Avatar Video Generation)は、アリババインテリジェントコンピューティング研究所が開発した音声駆動型アバター動画生成技術です。正式名称は「End-Effector Guided Audio-Driven Avatar Video Generation...」です。
PaSaは、ByteDance Researchが開発した、強化学習に基づく学術論文検索用AIエージェントです。人間の研究者の行動を模倣し、検索エンジンを自動的に呼び出し、関連論文を閲覧し、引用文献を追跡することができます。
白川知能が発表した中国初のフルシナリオ深層思考モデル「Baichuan-M1-preview」は、言語、画像認識、検索という3つの主要領域における推論能力を備え、数学、プログラミング、その他の分野における複数の権威ある評価で優れた性能を発揮しています。
TokenVerseは、事前学習済みのテキストから画像への拡散モデルに基づいた、マルチコンセプトのパーソナライズされた画像生成手法です。複雑な視覚要素や属性を単一の画像から分離し、複数の画像から抽出された概念をシームレスに組み合わせて新しい画像を生成することができます。
Baichuan-M1-14Bは、Baichuan Intelligentが発表した業界初のオープンソース医療拡張モデルです。その医療機能は、より大規模でパラメータが豊富なQwen2.5-72Bを凌駕し、o1-miniに匹敵します。医療シナリオに特化して最適化されており、強力な機能を備えています。
CogVideoX-2は、Zhipu AIが開発したオープンソースのテキストからビデオへの生成モデルです。高度な3D変分オートエンコーダー(VAE)に基づいており、ビデオデータを元のサイズの2%に圧縮することで、リソース使用量を削減しながら、ビデオフレーム間の整合性を確保します。
CogView-4は、Zhipu AIが開発したテキストから画像を生成するモデルです。Transformerアーキテクチャに基づいており、高品質な画像を生成するための拡散モデルです。パラメータのスケーリングを最適化し、高品質な画像を使用してデータセットを微調整することで、高品質な画像を生成することができます。
LLMwareは、エンタープライズアプリケーション向けに設計された統合フレームワークであり、小規模で特殊なモデルに基づいたRAG(検索拡張生成)プロセスの構築に適しています。LLMwareはプライベート環境への導入をサポートし、エンタープライズシステムとの安全な統合が可能です。
FilmAgentは、ハルビン工業大学(深圳)の研究チームがマルチエージェント協調フレームワークに基づいて開発した仮想映画制作ツールです。仮想3D空間でエンドツーエンドの映画制作プロセスを自動化し、従来の映画制作をシミュレートします。
Whisper Inputは、PythonとOpenAIのWhisperモデルを使用して開発されたオープンソースの音声入力ツールです。録音開始のためにOptionキーを押し、録音停止のためにキーを離すなど、簡単なキーボードショートカットを使用できます。
Fast3Rは、Metaとミシガン大学の研究者によって提案された、新しいマルチビュー3D再構成手法です。Transformerアーキテクチャに基づいており、1回の順伝播処理で1000枚以上の画像を処理できるため、効率的かつスケーラブルな3D再構成を実現します。
Tarsier2は、ByteDanceが開発した高度な大規模視覚言語モデル(LVLM)です。詳細かつ正確な動画説明を生成し、様々な動画理解タスクにおいて卓越した性能を発揮します。このモデルは、3つの主要なアップグレードによって性能向上を実現しています。
VideoLLaMA3は、アリババがオープンソース化した最先端のマルチモーダル基盤モデルであり、画像と動画の理解に重点を置いています。Qwen 2.5アーキテクチャをベースとし、高度なビジュアルエンコーダ(SigLipなど)と強力な言語生成機能を組み合わせています。
Baichuan-Omni-1.5は、Baichuan Intelligenceが開発したオープンソースのフルモーダルモデルです。テキスト、画像、音声、動画のフルモーダル理解をサポートし、テキストと音声の両方でバイモーダル生成機能を備えています。このモデルは、視覚、音声、マルチモーダルストリーミングにおいて優れた性能を発揮します。
TeleAI-t1-previewは、中国電信人工知能研究所が公開した「複雑推論モデル」であり、強力な論理推論能力と数学的導出能力を備えています。強化学習トレーニング手法と、探究や考察といった思考パラダイムの導入により、…
Qwen2.5-1Mは、アリババ同義千文チームが公開したオープンソースモデルで、100万トークンのコンテキスト長をサポートしています。このモデルには、Qwen2.5-7B-Instruct-1MとQwen2.5-14B-Instruct-1Mの2つのバージョンがあります。(文章がここで突然終わっていますが、おそらく文が不完全か情報が欠落しているためです。)
DiffuEraserは、安定した拡散モデルに基づいたビデオインペインティングモデルで、ビデオ内のマスクされた領域をより詳細かつ一貫性のある構造で塗りつぶします。このモデルは、事前情報を組み込むことで初期化と弱い条件を提供し、これにより...