Hunyuan 3D World Model 1.0 - テンセントのオープンソース3Dワールド生成モデル
テンセントが世界人工知能会議で正式にリリースし、オープンソース化したHunyuan World 1.0は、業界初の没入型、インタラクティブ、シミュレーション型の世界生成モデルです。このモデルは、パノラマビジョンを統合し…
テンセントが世界人工知能会議で正式にリリースし、オープンソース化したHunyuan World 1.0は、業界初の没入型、インタラクティブ、シミュレーション型の世界生成モデルです。このモデルは、パノラマビジョンを統合し…
RiRiXin V6.5は、SenseTime社が発表した新しいマルチモーダル推論モデルです。このモデルは、画像とテキストが織り交ぜられた独自の思考連鎖を特徴としており、画像がオントロジーの形で推論に参加することで、クロスモーダル推論の精度を大幅に向上させ、Gemini 2.5 Proを凌駕しています。
GLM-4.5は、Zhipuの次世代フラッグシップモデルであり、エージェントアプリケーション向けに特別に設計されています。これは、推論、コード、およびエージェント機能をネイティブに統合した初のオープンソースの最先端(SOTA)モデルです。ハイブリッドエキスパート(MoE)アーキテクチャを採用しており、2つのバージョンがあります。...
Wan2.2は、アリババがオープンソース化した高度なAI動画生成モデルです。テキストベースの動画(Wan2.2-T2V-A14B)、画像ベースの動画(Wan2.2-I2V-A14B)、および統合動画生成(Wan2.2-IT2V-...)の3つのオープンソースバージョンがあります。
WebShaperは、アリババ同義研究所が開発した革新的なAIトレーニングデータ合成システムです。形式モデリングとエージェント拡張メカニズムを通じて、AIエージェントのトレーニングに高品質でスケーラブルなデータを提供します。
Skywork UniPicは、Kunlun Wanweiが開発したオープンソースのマルチモーダル統合型事前学習済みモデルで、画像理解、テキストから画像への変換、画像編集という3つの主要機能を備えています。このモデルは自己回帰パラダイムに基づいており、MARエンコーダーとSigLIPを統合しています。
Qwen3-30B-A3B-Instruct-2507は、アリババ同義が開発したオープンソースのQwen3-30B-A3B非思考モード言語モデルです。パラメータ総数は305億、活性化パラメータは33億、構造は48層、コンテキスト長は262,144です。
SeedEdit 3.0は、ByteDanceのSeedチームが開発した画像編集モデルです。自然言語コマンドを使用して、高速かつ高品質な画像編集をサポートします。このモデルは、強力なテキストから画像への変換モデルであるSeedream 3.0を基盤としており、高精度な処理を実現しています。
Agent Lightningは、マイクロソフトの研究チームが開発した、柔軟で拡張性の高いインテリジェントエージェント最適化フレームワークです。このフレームワークは、既存のエージェントフレームワーク(OpenAI Agents SDK、LangChainなど)にシームレスに統合できます。
HYPIR(Harnessing Diffusion-Yielded Score Priors for Image Restoration)は、中国科学院深圳先進技術研究院の董超教授の研究チームによって開発された、高度な大規模画像復元モジュールです。
Qwen3-30B-A3B-Thinking-2507は、Alibaba Tongyiが開発したオープンソースの推論モデルで、複雑な推論タスク向けに特別に設計されています。このモデルは305億個のパラメータを持ち、そのうち33億個が有効になっています。ネイティブコンテキスト長は256Kで、1Mまで拡張可能です。
Abogenは、ePub、PDF、またはテキストファイルを高音質の音声に高速変換し、同期字幕を生成できる強力なテキスト読み上げツールです。Kokoro-82Mモデルをベースにしたabogenは、複数の言語と音声スタイルに対応しています。
FLUX.1 Krea [dev]は、Black Forest LabsがKrea AIと共同開発した最新のテキスト画像生成モデルです。よりリアルで多様な画像の生成をサポートし、写真のようなリアルなレベルを実現します。
Qwen3-Coder-Flashは、アリババ同義千文チームが開発した高性能プログラミングモデルです。正式名称はQwen3-Coder-30B-A3B-Instructです。このモデルは優れたエージェント機能を備え、プロキシプログラミングやツール呼び出しなどに優れています。
Seed Diffusionは、ByteDanceのSeedチームが開発した実験的な拡散言語モデルで、コード生成タスクに焦点を当てています。このモデルは、2段階拡散トレーニング、制約付き逐次学習、強化学習に基づく効率的な並列デコーディングなどの主要技術を利用して、...
DispatchMailは、AI技術を用いて受信トレイ管理を自動化する、オープンソースのローカル実行型AIメールアシスタントです。このツールはメールをリアルタイムで監視し、OpenAIのAIエージェントを使用して、ユーザーが定義したプロンプトに基づいてメールを処理します。
iFlow CLIは、Flow AIチームが開発したエッジで動作するAIエージェントで、開発者やハイパフォーマンスワーカー向けに設計されています。iFlow CLIは自然言語による対話をサポートし、コードの迅速な分析、ドキュメントの生成、プログラムのデバッグ、管理などを行うことができます。
Gemini 2.5 Deep Thinkは、複雑なタスクを解決するために設計されたGoogleのAIモデルです。これは、並列思考技術を活用し、2025年の国際数学オリンピック(IMO)で金メダルを獲得したモデルの派生版です。
InteriorGSは、Quncore Technologyが発表した高品質な3Dガウスセマンティックデータセットです。住宅、コンビニエンスストア、結婚式場、美術館など、80種類以上の屋内環境を網羅した1000の3Dガウスセマンティックシーンが含まれています。データセットには755の...
FastDeployは、BaiduがPaddlePaddleフレームワークに基づいて開発した高性能な推論およびデプロイツールで、特に大規模言語モデル(LLM)とビジュアル言語モデル(VLM)向けに設計されています。FastDeployは様々なハードウェアをサポートしています。
DragonV2.1(DragonV2.1Neural)は、マイクロソフトの最新のゼロショット音声合成(TTS)モデルです。Transformerアーキテクチャに基づいており、複数の言語とゼロショット音声クローニングをサポートし、わずか5~90秒の音声データで音声合成が可能です。
Wuhr AI Opsは、AI技術を活用して複雑な運用保守作業を簡素化するインテリジェントな運用保守管理プラットフォームです。このプラットフォームは、マルチモーダルAIアシスタントを統合し、運用保守コマンドの実行における自然言語による対話をサポートし、KubernetesクラスタとLinuxシステムコマンドをワンクリックで切り替えることができます。
Skywork MindLinkは、Kunlun Wanweiが開発したオープンソースの推論モデルです。適応型推論メカニズムを備え、タスクの複雑さに応じて推論モードを柔軟に切り替えます。単純なタスクには迅速に推論モデルを生成し、複雑なタスクには高度な推論を実行することで、効率と性能のバランスを取っています。
ScreenCoderは、オープンソースのインテリジェントなUIスクリーンショット・コード変換システムで、あらゆるデザインのスクリーンショットを、クリーンで編集可能なHTML/CSSコードに素早く変換できます。ScreenCoderは、モジュール式のマルチエージェントアーキテクチャと視覚理解を組み合わせています。