Lynx - ByteDanceの高精度パーソナライズド動画生成モデル
Lynxは、ByteDanceが開発した高精細なパーソナライズド動画生成モデルです。1枚のポートレート写真だけで、ユーザーのアイデンティティに合致した動画を生成できます。Diffusion Transformer(DiT)基本モデルをベースに、IDアダプタなどを導入しています。
Lynxは、ByteDanceが開発した高精細なパーソナライズド動画生成モデルです。1枚のポートレート写真だけで、ユーザーのアイデンティティに合致した動画を生成できます。Diffusion Transformer(DiT)基本モデルをベースに、IDアダプタなどを導入しています。
DeepSeek-V3.2-Expは、DeepSeek-AIが発表した実験的な人工知能モデルです。DeepSeek Sparse Attention(DSA)メカニズムを導入することで、長文テキスト処理の効率を大幅に向上させています。このモデルはDeepSeek-V3をベースにしています。
OpenPPTはオープンソースのPowerPointツールです。ChatPPTをベースとしたコアサービスは、効率的で便利なPowerPoint作成体験を提供します。このツールはWindows、macOS、Linuxなど複数のプラットフォームをサポートしており、ユーザーはさまざまなデバイスでプレゼンテーションを作成できます。
Claude Sonnet 4.5は、Anthropic社が開発した最新かつ最も強力なプログラミングモデルです。このモデルは、プログラミング、コンピュータ操作、推論、数学など、複数の分野で優れた性能を発揮し、SWE-bench検証テストでトップの成績を収め、様々な分野でその能力を実証しています。
Ring-1Tは、Ant Groupがオープンソース化した、1兆パラメータの思考モデルです。Ling 2.0 MoEアーキテクチャに基づいており、20TBのコーパスで事前学習され、独自開発の強化学習システムASystemを使用して推論用に学習されています。128k回の反復をサポートしています。
GLM-4.6は、Zhipuが発表した新世代の大規模基盤モデルであり、パラメータ総数は355バイト、活性化パラメータは32バイトです。このモデルは、実世界のプログラミング、長文コンテキスト処理、推論能力、情報検索、記述能力、インテリジェントエージェントアプリケーションにおいて優れた性能を発揮します。
Doubao Big Model 1.6-visionは、Volcano Engineによって開発された視覚的深層思考モデルであり、ツール呼び出し機能を備えています。このモデルは、強力な汎用マルチモーダル理解および推論能力を誇り、Responses APIをサポートし、次のようなツールを自律的に呼び出すことができます。
RoboBrain-X0は、北京人工知能研究院が開発した世界初のオープンソースの具現化モデルであり、ゼロショットのクロスオントロジー汎化をサポートしています。これにより、異なるアーキテクチャを持つ様々な実機ロボットを駆動し、微調整なしで基本的な操作を実行できます。
EchoCareは、中国科学院香港イノベーション研究所の人工知能・ロボットイノベーションセンター(CAIR)が開発した大規模超音波モデルです。このモデルは、450万枚の超音波画像を含むEchoAtlasデータセットで学習されています。
Sora 2は、OpenAIが開発した次世代AI音声・動画生成モデルです。ウェブ上では、最大25秒の動画生成に対応しています(Sora Proメンバーシップが必要です)。技術的には、マルチモーダルな共同トレーニングを通じて初めて3つの画期的な成果を達成しました。
Logics-Parsingは、Alibabaが開発したオープンソースのエンドツーエンド文書解析モデルで、Qwen2.5-VL-7Bをベースとしています。強化学習を通じて文書レイアウト解析と読み上げ順序推論を最適化し、PDF画像を構造化されたHTMLに変換することを可能にします。
Thinking Machines Labが最初にリリースした製品であるTinker APIは、言語モデルの微調整に特化して設計されています。言語モデルの微調整プロセスを簡素化することで、研究者や開発者はアルゴリズムとデータに集中でき、微調整に関する心配をする必要がなくなります。
LONGLIVEは、NVIDIAをはじめとする主要機関が共同開発した、リアルタイムのインタラクティブな長尺動画生成フレームワークです。このフレームワークは、フレームレベルの自己回帰(AR)モデルと、キーバリュー(KV)キャッシュメカニズム、ストリーミング長尺動画の微調整、およびショートウィンドウアテンションを組み合わせて利用しています。
Dreamer 4は、DeepMindが開発した新しいタイプのインテリジェントエージェントで、高速かつ正確な世界モデル上で想像力豊かなトレーニングを行うことで複雑な制御タスクを解決します。ゲーム「Minecraft」では、Dreamer 4は…
Manoは、MindLamp Technologyが開発した独自の大型モデルで、グラフィカルユーザーインターフェース(GUI)のインテリジェントな操作に重点を置いています。マルチモーダルな基盤モデルに基づき、このモデルは、Mind2W内でのオンライン強化学習や自動トレーニングデータ収集などの革新的な技術を活用しています。
SciToolAgentは、浙江大学イノベーションセンター(HICAI-ZJU)が研究効率向上を目的として開発したオープンソースのツールプラットフォームです。生物学、化学、材料科学などの分野を網羅する500以上の科学ツールを統合し、データ処理が可能です。
xLLMは、JD.comがオープンソース化した高効率なインテリジェント推論フレームワークであり、国内生産チップ向けに最適化され、統合エッジクラウド展開をサポートしています。このフレームワークはサービス・エンジン分離アーキテクチャを採用しており、サービス層はリクエストスケジューリングとフォールトトレランスを処理し、エンジン層は計算最適化に特化しています。
Meta ARE(Agents Research Environments)は、Meta社が開発したAIエージェントのトレーニングと評価のための動的シミュレーション研究プラットフォームです。このプラットフォームは、時間とともに変化する環境を作り出すことで、現実世界の複雑な多段階プロセスをシミュレートします。
FireRedChatは、小紅書インテリジェントオーディオチームが開発した全二重音声対話システムです。リアルタイムの双方向対話機能を備え、制御された割り込みをサポートしています。文字起こし制御モジュール、対話モジュール、対話モジュールなどを含むモジュール設計を採用しています。
TRUEBench(Trustworthy Real-world Usage Evaluation Benchmark)は、サムスン電子が開発したAIベンチマークツールです。実際の業務シナリオにおける人工知能の生産性を評価し、既存のAI課題に対処するために使用されます。
AIMangaStudioは、オープンソースのAIコミック制作ツールであり、プロット生成、ストーリーボードデザイン、キャラクターデザインなどの機能を含む、完全なコミック制作パイプラインをクリエイターに提供し、脚本からコミックページまでの制作プロセスを簡素化します。
OpenLens AIは、清華大学自動化学部が開発した完全自律型のAI研究アシスタントであり、特に医療研究向けに設計されています。マルチエージェントによる協働を通じて、文献調査や実験計画からデータ分析、論文作成まで、シームレスなワークフローを実現します。
ReceiptHeroは、レシートを写真に撮るだけで簡単にデジタル請求書に変換できる、オープンソースのAI搭載経費追跡ツールです。高度なAI画像認識技術に基づき、レシートから日付、金額、その他の情報を最大95%の精度で抽出します。
Ming-UniAudioは、Ant Groupが開発したオープンソースのマルチモーダル音声モデルで、音声理解、音声生成、音声編集のタスクを統合しています。その中核となるのは、VAEフレームワークと因果的Transformerアーキテクチャに基づいた連続音声処理モデルであるMingTok-Audioです。