AudioStory - Tencent ARCが立ち上げた音声生成モデル
AudioStoryは、Tencent ARC Labsが開発した音声生成技術で、自然言語による説明に基づいて高品質な長編ナラティブ音声を生成できます。複雑なナラティブ要求を順序付けられたサブタスクに分割し、その後…という分割統治戦略を採用しています。
AudioStoryは、Tencent ARC Labsが開発した音声生成技術で、自然言語による説明に基づいて高品質な長編ナラティブ音声を生成できます。複雑なナラティブ要求を順序付けられたサブタスクに分割し、その後…という分割統治戦略を採用しています。
Open-Fiestaは、Next.js 14をベースに構築されたオープンソースのマルチモデルAIチャットプラットフォームです。このプラットフォームは、GeminiやOpenRouterなどの様々なAIプロバイダーと複数のモデルをサポートしており、ユーザーは最大5つのモデルを同時に選択できます。
AgentScope 1.0は、アリババ同義が開発したオープンソースのマルチエージェント開発フレームワークです。AgentScopeコアフレームワーク、AgentScopeランタイム、AgentScope Studioという3層構造の技術アーキテクチャにより、包括的な開発およびデプロイメントソリューションを提供します。
HunyuanWorld-Voyager(略称:HunyuanVoyager)は、Tencent初のネイティブ3D再構築をサポートする超長距離移動型ワールドモデルです。これは、単一の画像からユーザー定義のカメラパスを生成できる革新的なビデオ配信フレームワークです。
USO(Unified Style-Subject Optimized)は、ByteDanceのUXOチームが開発した、コンテンツとスタイルを分離・再結合するための統合フレームワークです。あらゆるシナリオであらゆるテーマとスタイルを自由に組み合わせることで、高品質なコンテンツを生成できます。
Prompt Toolsは、AIが生成するプロンプトを効率的に管理できるオープンソースのデスクトップアプリケーションです。このツールは、Windows、macOS、Linuxといった複数のプラットフォームに対応し、高速かつ安全な操作性を提供します。
コーディング面接問題解決ツールは、中国語圏のユーザー向けプログラミング支援ツールです。キーボードショートカットを使って画面上のプログラミング問題をキャプチャし、AIの助けを借りてリアルタイムで解答とコードを生成します。
RealDevWorldは、MetaGPTチームが開発した次世代の自動テストツールです。マルチエージェントフレームワークに基づいて、要件分析、テストケース生成、コードデバッグ、最終テストなど、実際の開発チームのワークフローをシミュレートします。
Kimi K2-0905は、Moonlit Dark Side Technology Co., Ltd.の最新AIモデルです。強力なプログラミング支援機能を誇り、コード生成とフロントエンド開発に優れています。コンテキスト長は256Kに拡張され、複雑な…
Apertusは、スイス初の本格的なオープンな多言語言語モデルであり、EPFL、チューリッヒ工科大学、スイス国立スーパーコンピューティングセンター(CSCS)が共同開発しました。パラメータバージョンは70Bと8Bの2種類があります。
Super Agent Partyは、デスクトップペット、インテリジェントアシスタント、知識ベース、ロボット制御など、複数の機能を統合したオープンソースの3D AIデスクトップコンパニオンソフトウェアです。Dockerまたはソースコードを介して、Windows、macOSなどに簡単にデプロイできます。
InfinityHumanは、ByteDanceと浙江大学の共同チームが開発した、商用グレードの長尺音声駆動型人間動画生成モデルであり、AIデジタルヒューマンの実用化における新たな章を開くものです。
mobile-useは、AndroidおよびiOSデバイスの自然言語制御をサポートするモバイルAIエージェントツールで、ユーザーがスマートフォンを操作するのを支援します。ユーザーは日常的な言葉でコマンドを入力するだけで、アプリの起動やフォームへの入力などのタスクをツールが自動的に実行します。
EmbeddingGemmaは、Googleが開発したオープンソースの多言語テキスト埋め込みモデルで、エッジAI向けに特化して設計されており、ノートパソコンや携帯電話などのデバイスへの展開をサポートしています。このモデルは3億800万個のパラメータを持ち、Gemma 3アーキテクチャに基づいて構築されており、100以上の言語をサポートしています。
OneCATは、美団が発表した新しい統合型マルチモーダルモデルです。純粋なデコーダーアーキテクチャを採用し、マルチモーダル理解、テキストから画像への変換、画像編集機能をシームレスに統合しています。このモデルは、従来のマルチモーダルモデルにおける外部視覚への依存を解消しています。
Qwen3-Max-Previewは、アリババの同義千文チームがリリースした最新のフラッグシップ大規模言語モデルです。Qwen3シリーズの中で最大のパラメータ数を誇り、1兆を超えています。このモデルは推論、命令追従、…において優れた性能を発揮します。
ClaudableはNext.jsをベースにしたオープンソースのWebアプリケーションビルダーです。Claude CodeとCursor CLIの高度なAIエージェント機能と、Lovableのシンプルで直感的なアプリケーション構築体験を組み合わせています。ユーザーは、アプリケーションについて記述するだけで済みます。
FineVisionは、Hugging Faceが公開したオープンソースの視覚言語データセットで、高度な視覚言語モデルの学習に使用されます。1,730万枚の画像、2,430万のサンプル、8,890万の対話ラウンド、95億の応答タグが含まれています。
Flowistは、最高レベルの大規模モデルを基盤としており、Grok4、GPT-5、Claudeなどの高度なAIモデルや、Veo 3、Midjourney、SDXLなどのマルチモーダル画像・動画モデルをサポートしています。Flowistは、テキスト作成、画像編集など、幅広い機能を提供します。
Parlantは、開発者がビジネス要件を満たす対話型エージェントを迅速に作成できるよう支援する、オープンソースのLLM(大規模言語モデル)エージェント動作モデリングエンジンです。自然言語ルール定義を通じて、AIエージェントの動作がビジネスロジックに準拠することを保証します。
rStar2-Agentは、Microsoftが開発したオープンソースの数学的推論モデルで、パラメータ数はわずか140億個です。エージェントベースの強化学習を用いてトレーニングされており、AIME24の数学的推論テストで80.6%の精度を達成し、6710億個のパラメータを持つDeepSeek-R1を凌駕しています。
MiniCPM 4.1は、Wallfacerによって開発されたハイブリッド思考モデルです。InfLLM v2スパースアテンションアーキテクチャを採用しており、各単語が5%未満の単語と相関していることを要求することで、長文処理のオーバーヘッドを大幅に削減します。128Kの長文テキストでは…
AI Video Transcriberは、YouTubeやTikTokを含む30以上のプラットフォームをサポートするオープンソースの動画文字起こし・要約ツールです。このツールは、高精度な音声テキスト変換にFaster-Whisperを使用し、AIを活用してテキストを最適化し、スペルミスを修正します。
DeepDocは、ローカル知識ベースの詳細な調査に特化したオープンソースの深層調査ツールです。このツールは、調査ベースのワークフローを使用して、ローカルリソース(PDF、DOCX、JPG、TXTなど)からテキストを抽出し、保存されているデータをセグメント化します。