Hy4プレビュー - 渾源オープンソースによるテンセントの次世代フラッグシップ大型モデル
Hy4プレビューは、Tencentの主力オープンソースモデルであり、Hunyuanによって開発されました。パラメータの総数は770バイト、アクティベーションパラメータは49バイト、コンテキスト長は1MBです。このモデルは、Tencentのソフトウェアエンジニアリング、ゲーム、金融、セキュリティ分野の専門家との綿密な協力によって開発されました。
Hy4プレビューは、Tencentの主力オープンソースモデルであり、Hunyuanによって開発されました。パラメータの総数は770バイト、アクティベーションパラメータは49バイト、コンテキスト長は1MBです。このモデルは、Tencentのソフトウェアエンジニアリング、ゲーム、金融、セキュリティ分野の専門家との綿密な協力によって開発されました。
shuohao-skillsは、Claude CodeやCodexといったエージェント向けに特別に設計された、AIを活用した短編ドラマ制作スキルを集めたオープンソースのツールです。このツールは、小説の脚色概要作成、キャラクターデザイン、美術監督、脚本執筆、絵コンテ作成など、幅広いサービスを提供します。
Prime Agentは、Prime Intellect社が提供するオープンソースの長期ライフサイクルAIエージェントランタイムフレームワークです。RLM(再帰言語モデル)を使用してコンテキストを可変化し、サブエージェントを機能化し、Continual Harnessを活用して…
Gemini Omni 1.1 Flashは、Googleが発表したAIビデオ生成モデルで、開発者やプロのクリエイターを対象としており、360pのクイックプレビューから4Kの超高解像度まで、マルチレベルの出力に対応しています。
Hy-MT2-1.8Bは、テンセント・フンユアンが開発した大規模エッジ翻訳モデルです。わずか18億個のパラメータで33言語間の相互翻訳をサポートし、FLORES-200などのベンチマークにおいて、MicrosoftやDoubaoといった商用APIを凌駕する翻訳品質を実現しています。
Gemini 3.5 Transcribeは、Googleの最新の音声認識モデルであり、リアルタイムストリーミングと事前録音音声処理モードの両方をサポートしています。前者はLive APIを通じて1秒未満の低遅延を実現し、後者は話者識別機能をサポートしています。
Omarchyは、Ruby on Railsの作者であるDHHによって作成されたLinuxディストリビューションです。Arch LinuxとHyprlandタイル型ウィンドウマネージャーをベースにしています。Omarchyのコアコンセプトは「柔軟なコンピュータ」であり、デスクトップがユーザーの状況に合わせて変化します。
Qwen3.8-Flashは、アリババクラウド同義千文が開発したマルチモーダルなMoEモデルです。合計1250億個のパラメータを持ち、トークンごとに60億個のみが有効化され、26万2千個のコンテキストをネイティブにサポートしています。
GLM-5.3-Flashは、Zhipuがリリースした最新のオープンソース大規模モデルで、総パラメータ数は320億個、活性化パラメータはわずか18億個です。GLM-5シリーズ初のネイティブマルチモーダルモデルです。モデルの総合的な知能指数は57ポイントに達し、Claud...に匹敵します。
QuickDeskは、Google Chromium Remotingをベースに構築された、世界初のオープンソースAIネイティブリモートデスクトップで、MCPサーバーを内蔵しています。このツールを使用すると、ClaudeやCursorなどのAIエージェントがリモートデスクトップを直接操作できます。
Breeze TTS 2は、BreezeBlueが開発した新世代の音声合成モデルです。自然言語によるゼロサンプル設計でキャラクターの音色を再現し、自然言語コマンドを用いて感情、話速、アクセントといったパフォーマンスの詳細を精密に制御できます。
PixVerse R2は、Aishike Technologyが開発したリアルタイムのマルチモーダル世界モデルであり、PixVerse R1のアップグレード版です。このモデルは、テキスト、画像、音声、モーション信号などのマルチモーダル入力をサポートし、動作中にユーザー制御信号を継続的に受信できます。
EgoSuite-Open100Kは、Lightwheel Intelligenceが発表した、10万時間分のフルモーダルな人間の行動を収録した世界初のオープンソースデータセットです。物理AIと身体化された知能を対象としています。このデータセットには、現実世界のシナリオを一人称視点で撮影した15,000本以上の動画が含まれており、さまざまな側面を網羅しています。
OpenStoryは、スクリプトをワンクリックで短くスタイリッシュな動画に変換することに特化したオープンソースのAI動画制作プラットフォームです。このプラットフォームは、シーンの自動分解、ショットのデザイン、感情分析、そしてFal.aiのような成熟したモデルを利用したグラフィック生成などが可能です。
Agnes 2.5 Pro Alphaは、Agnes AIが開発したオープンソースのマルチモーダル推論モデルで、Apache 2.0ライセンスの下で提供され、重みデータはHugging Faceでホストされています。このモデルはテキストと画像の入力をサポートし、コンテキストウィンドウには最大100万トークンを格納できます。
Huashu-excelは、Huashuが開発したオープンソースのAIデータ分析スキルです。物理検査、クリーニング、アライメント、分析、照合、配信、画像検証、品質管理という8段階のプロセスを通じて、AIによる計算ミスを防止し、エラーを報告するという根本的な問題を解決します。
ScienceClawは、中国科学院自動化研究所がインキュベートしたZidong Taichuが開発した、研究に特化したインテリジェントエージェントプラットフォームです。Zidong Taichuのマルチモーダル大規模モデルを基盤とし、生命科学、材料科学、化学、物理学、天文学などの分野を網羅しています。
ファラデーは、ロンドンを拠点とするAI研究所Inherentが開発したAI科学者エージェントです。270億個のパラメータを持つQwen 3.6モデルをベースに、強化学習によって訓練されています。ファラデーは、事前の知識がなくても人間の博士課程学生のようなタスクを実行できます。
OpenBotは、CopilotKitをベースとしたオープンソースのエンタープライズグレードAIエージェントプラットフォームであり、「現実世界のタスクを任せられるデジタル同僚」として位置づけられています。各エージェントには専用の「コンピュータ」が搭載されています。これは、Chromiumブラウザを含む独立したDockerコンテナです。
TabTinは、フルスタックのオープンソースAIエージェントチームコラボレーションプラットフォームです。このプラットフォームは、エージェントをチームのワークフローに完全に統合します。タスクはデスクトップで開始でき、モバイルデバイスで表示でき、サーバーエージェントによって実行され、完全なコンテキストとともに引き継ぐことができます。
FreeTokenは、UCバークレー校、MIT、およびその他の機関が共同開発した、大規模モデル向けのオープンソースのエッジサイドMoE(モデルベース推論)システムです。このシステムは、フルレイヤーダブルバッファリング、帯域幅適応型ハイブリッドスケジューリング、エージェント状態の再利用、弾性メモリのホットスケーリング/スケーリングなどの機能を活用しています。
CoinVE-200Kは、テンセントビデオのインテリジェントクリエーションチームがオープンソース化した、大規模な組み合わせ命令による動画編集データセットです。20万組の1080p動画編集サンプルが含まれており、各サンプルには追加、削除、変更などを含む2~5個の基本編集命令が含まれています。
LLM-as-a-Verifierは、スタンフォード大学、カリフォルニア大学バークレー校、NVIDIA Researchが共同でオープンソース化した汎用検証フレームワークです。このフレームワークは追加のトレーニングを必要とせず、LLMスコア付きトークンの完全なロジット分布を使用して、継続的にきめ細かい検証を生成します。
SenseNova U1.5 Liteは、SenseTimeがオープンソース化した軽量でネイティブな統合マルチモーダル大規模モデルであり、実世界のビジュアル制作ワークフロー向けに特別に設計されています。このモデルは、3~4k文字の超長文命令をネイティブにサポートし、高品質なビジュアル生成機能を備えています。