Ideogram 4は、Ideogram初のオープンソースのテキストから画像への生成モデルであり、93億個のパラメータを誇り、既存モデルの微調整ではなく、ゼロから学習されています。このモデルは、特にデザイン、マーケティングなどの分野で高品質な画像を生成するために設計されています。
Ideogram 4は、Ideogram初のオープンソースのテキストから画像への生成モデルであり、93億個のパラメータを誇り、既存モデルの微調整ではなく、ゼロから学習されています。このモデルは、特にデザイン、マーケティングなどの分野で高品質な画像を生成するために設計されています。
MAI-Transcribe-1.5は、マイクロソフトのAIチームが開発した音声認識モデルです。43言語に対応し、文脈を考慮したキーワードバイアス機能を備え、FLEURSベンチマークテストにおいて最低の単語誤り率を達成しています。
MAI-Voice-2は、マイクロソフトの次世代テキスト読み上げ(TTS)モデルであり、マイクロソフト史上最も表現力豊かで自然な音声合成モデルです。従来モデルと比較して、忠実度、対応言語、話者の一貫性、感情表現の幅広さにおいて優れています。
MAI-Code-1-Flashは、Microsoftが開発者ワークフロー向けに開発した軽量コード生成モデルで、GitHub Copilotと緊密に統合されています。このモデルは、適応型出力長制御技術を採用し、高い精度を維持しながら最大限の効率を実現します。
Odysseusは、ChatGPT/Claudeに似たチャットインターフェースを提供する、オープンソースのセルフホスト型AIワークスペースです。ツールは完全にローカルで動作し、データはローカルマシン上に保持されるため、プライバシーの漏洩は一切ありません。
PaddleOCR-VL-1.6は、Baidu PaddlePaddleチームが開発した文書解析用ビジュアル言語モデル(VLM)であり、PaddleOCR-VLシリーズの最新アップグレード版です。
BerniniはByteDanceが開発したオープンソースの統合ビデオ生成・編集フレームワークで、MLLMセマンティックプランニングとDiTビジュアルレンダリングの2段階分離アーキテクチャを採用しています。マルチモーダル大規模モデルが指示を理解し、セマンティックスケッチを計画する一方、拡散...
Science Skillsは、Google DeepMindが開発したオープンソースの科学スキル集で、AIエージェント主導の科学研究ワークフローを加速するように設計されています。このツールは、AlphaGenome、AlphaFold Database、UniProなどを統合しています。
MAI-Thinking-1は、マイクロソフトが独自開発した初の高度な推論モデルです。このモデルは、350億個のアクティブパラメータと約1兆個の総パラメータを持つスパースMoEアーキテクチャを採用しており、クリーンな商用ライセンスデータのみを使用して、外部ライブラリを一切使用せずにゼロから完全にトレーニングされています。
OpenClackyは、李亜飛氏のチームが開発したオープンソースのAIエージェントで、ワンクリックインストールとクロスプラットフォーム運用に対応しています。このツールは、合理化されたツールセット、インテリジェントなコンテキスト圧縮、モデルルーティングにより、使用コストを大幅に削減し、プロフェッショナルが24時間体制で運用することを可能にします。
Mellum2は、JetBrainsが開発したソフトウェアエンジニアリングシステム向けの新しいオープンソース機械学習モデルです。このモデルはトークンあたりわずか25億個のパラメータしか使用せず、ソフトウェアエンジニアリングにおけるAIワークフローに最適化されており、コード生成、インテリジェントルーティングなどをサポートしています。
ECC(Everything Claude Code)は、クロスプラットフォーム対応のAIエージェントパフォーマンス最適化システムです。このシステムは、Claude Code、Codex、Cursorなど7種類以上のAIプログラミングツールに対応した、63種類のプロフェッショナルエージェントと249種類のオンデマンドエージェントを提供します。
Polarは、NVIDIAが開発したオープンソースのエージェント強化学習(ARL)トレーニングフレームワークです。その最大の特長は、既存のエージェントフレームワークの内部コードを変更することなく、GRPOなどの強化学習アルゴリズムと統合してトレーニングできる点にあります。
Qwen3.7-Plusは、同義千文が開発した新世代のマルチモーダル大規模モデルであり、視覚と言語を統合したインテリジェントエージェント基盤を構築しています。このモデルは、現実世界のシーンを認識し、画面を読み取ってGUIを操作したり、視覚的な参照に基づいてモデルを生成したりすることができます。
Hermes Desktopは、sir1stによって開発されたHermes Agent用のコミュニティ版デスクトップアプリケーションです。Pythonランタイム、hermes-agentコア、およびhermes-web-uiビジュアルインターフェースを単一の実行ファイルにパッケージ化しています。
Gamma-Worldは、NVIDIAが開発したマルチエージェント世界モデルであり、複数のエージェントが同じシミュレーション世界内で平等かつグローバルに相互作用するという問題を解決できる。
Dubbing v2は、ElevenLabsが開発したAI吹き替えモデルで、29言語の自動翻訳と吹き替えをサポートし、元の話者の音色と感情を保持します。このモデルは、プレビューを素早く生成するAuto Dubと、Dub...という2つのワークフローモードを提供します。
Cosmos 3は、NVIDIA初の完全オープンソースのマルチモーダル物理AI基盤モデルであり、ハイブリッドTransformerアーキテクチャを使用して、視覚的推論、世界生成、および行動予測機能を統合しています。
MiniMax M3は、MiniMaxが開発した最新のAIモデルで、優れたプログラミング、エージェント機能、長文処理能力を誇ります。革新的なMSAスパースアテンションアーキテクチャを採用し、最大1MBの超長文テキストをサポートすることで、20倍の効率向上を実現しています。
Qwen-VLAは、Tongyi Labsが開発した汎用的な視覚・言語・行動モデルです。視覚・言語の基盤としてQwen3.5-4Bを使用し、1.15B個のパラメータを持つDiTアクションデコーダと組み合わせています。このモデルは、統一された行動軌跡予測フレームワークを使用して、...
Webwrightは、Microsoft Researchが開発したオープンソースのターミナルネイティブなWebベースのインテリジェントエージェントフレームワークです。わずか約1000行のコードで、AIモデルがPlaywrightコードを記述したり、bashコマンドを実行したり、ログを表示したり、ターミナル内でエラーを繰り返し修正したりすることを可能にします。
ControlFoleyは、Xiaomiが開発したオープンソースの制御可能なビデオオーディオ生成モデルであり、V2A(ビデオ・トゥ・アクション)分野における制御性の課題に取り組んでいます。このモデルは、独自開発の時空間オーディオ技術を活用し、テキスト誘導型、テキスト制御型、リファレンスオーディオ制御型の3種類のビデオ吹き替えタスクを統一的にサポートしています。
Meituan GEOマーケティングポータルは、MeituanがAI検索時代向けに特別に設計した生成エンジン最適化(GEO)プラットフォームです。Doubao、DeepSeek、Wenxin Yiyanといった主要検索エンジンにおけるブランドの露出度と推奨頻度を高めるのに役立ちます。
SenseNova-U1-8B-MoT-Infographicは、SenseTime社が開発したオープンソースの8Bパラメトリック情報グラフ拡張モデルです。SenseNova-U1-8B-MoTの統一アーキテクチャに基づき、特殊なデータトレーニングと強化学習(RL)によってパフォーマンスを大幅に向上させています。