ビジュアルストーリーライティング - 視覚的にストーリーを構築するためのAIライティングツール。
ビジュアルストーリーライティングは、ユーザーがビジュアルインターフェースを通して物語を構築・編集できる革新的なAIライティングツールです。このツールはGPT-40テクノロジーを用いてテキストを自動的に解析し、出来事、登場人物、行動などの視覚的な構造へと変換します。
ビジュアルストーリーライティングは、ユーザーがビジュアルインターフェースを通して物語を構築・編集できる革新的なAIライティングツールです。このツールはGPT-40テクノロジーを用いてテキストを自動的に解析し、出来事、登場人物、行動などの視覚的な構造へと変換します。
Qwen3-ASR-Flashは、同義千文シリーズの最新音声認識モデルです。Qwen3プラットフォームをベースに、膨大な量のマルチモーダルデータとASRデータを用いて学習されています。11言語と複数のアクセントに対応し、高い精度と優れたパフォーマンスを誇ります。
AntSK FileChunkは、PDFおよびWord文書の処理に特化して設計された、意味論に基づいたインテリジェントなテキスト分割ツールです。高度な意味解析技術に基づき、長い文書を意味的に完全で一貫性のある断片に分割するため、従来のテキスト分割手法は不要です。
XTuner V1は、上海人工知能研究所がオープンソース化した次世代の大規模モデル学習エンジンです。PyTorch FSDPをベースに開発され、1TBの超大規模モデルの学習におけるメモリ、通信、負荷の問題を体系的に最適化します。
REFRAGは、Meta Super Intelligence Labが開発した、検索強化生成(RAG)タスク向けの高効率デコードフレームワークです。「圧縮、感知、拡張」プロセスを通じて、大規模な言語処理を最適化します。
LMDeployは、上海人工知能研究所が開発した大規模モデル推論デプロイメントツールです。大規模モデルの推論性能を大幅に向上させ、NVIDIAのHopperおよびAmpereシリーズGPUを含む様々なハードウェアアーキテクチャをサポートし、さらに…
Wenxin Big Model X1.1は、Baiduが開発した深層思考モデルです。反復型ハイブリッド強化学習フレームワークに基づき、事実性、指示遵守、エージェントの知能といった能力を大幅に向上させ、それぞれ34.8%、12.5%、9.6%向上させています。重み付けの観点から見ると…
SpikingBrain-1.0は、中国科学院自動化研究所が開発した大規模な脳型スパイクモデルです。このモデルは、固有の複雑性に基づいて、Transformerアーキテクチャとは異なる新しいアーキテクチャを採用しており、超高密度ニューラルネットワークを扱う際のTransformerアーキテクチャの限界を克服しています。
HunyuanImage 2.1は、テンセントが開発したオープンソースのテキスト画像変換モデルです。ネイティブ2K解像度に対応し、高度な複雑な意味理解能力を備え、シーンの詳細、人物の表情や動作を正確に生成できます。
K2-Thinkは、アラブ首長国連邦のムハンマド・ビン・ザイード人工知能大学(MBZUAI)とG42が共同開発したオープンソースの推論モデルです。320億個のパラメータを持ち、数学的推論、コード生成、科学的知識など、複数の分野で優れた性能を発揮します。
SRPO(Semantic Relative Preference Optimization)は、テンセント渾源が開発したテキストから画像を生成するモデルです。報酬信号をテキスト条件信号として設計することで、報酬のオンライン調整を可能にし、外部要因への依存度を低減します。
Qwen3-Nextは、アリババ同義がオープンソース化した新世代のハイブリッドアーキテクチャモデルであり、指示バージョン(Qwen3-Next-80B-A3B-Instruct)と思考バージョン(Qwen3-Next-80B-A3B-Thinking)の2つのバージョンが含まれています。
AutoDocsは、TrySitaが開発したオープンソースのコードドキュメント自動化ツールで、開発者がコードベースのドキュメントを効率的に生成および保守するのに役立ちます。コードベースの抽象構文木(AST)を詳細に分析し、依存関係グラフを構築することで、正確で...
AnyI2Vは、復旦大学、アリババDAMOアカデミー、レイクサイドラボが共同開発した革新的な画像・アニメーション生成フレームワークです。このフレームワークは大量の学習データを必要とせず、静的な条件付き画像(メッシュ、点群など)を動的な動画に変換できます。
MiniMax Music 1.5は、最大4分間の楽曲制作に対応した高度なAI音楽生成モデルです。ユーザーが入力するスタイル、ムード、シーンなどの自然言語による説明に基づいて、高品質な楽曲を生成できます。
FireRedTTS-2は、マルチスピーカー対話生成に特化した、高度な長尺ストリーミングテキスト音声合成(TTS)システムです。12.5Hzのストリーミング音声セグメンテーションとデュアルTransformerアーキテクチャを採用することで、低遅延、高忠実度、マルチスピーカー対話生成を実現しています。
HuMoは、清華大学とByteDanceのインテリジェントクリエーションラボが共同で提案した、人間中心の動画生成に焦点を当てたマルチモーダル動画生成フレームワークです。テキスト、画像、音声など、複数のモーダル入力から高品質で詳細な動画を生成できます。
Stand-Inは、TencentのWeChat Visionチームが開発した軽量な動画生成フレームワークで、本人確認済みの動画生成に特化しています。基本モデルのパラメータのわずか1%を学習させるだけで、高精細で本人確認が可能な動画を生成でき、さらに…
ST-Raptorは、半構造化された表形式の質問応答ツールです。入力としてExcelスプレッドシートと自然言語による質問のみを必要とし、正確な回答を生成します。
Strixは、オープンソースのAI駆動型セキュリティテストツールであり、開発者やセキュリティチームがアプリケーションの脆弱性を迅速に発見・検証するのに役立ちます。このツールは、コードを動的に実行し、実際のハッカー攻撃をシミュレートすることで、誤検知を削減します。
Bilibiliの音声チームが開発した新しいテキスト音声合成(TTS)モデル「IndexTTS2」が正式にオープンソース化されました。このモデルは感情表現と音声再生時間の制御において大きな進歩を遂げており、正確な音声再生時間制御をサポートする初の自己回帰型TTSモデルです。
AgentCLUE-ICabinは、自動車のスマートコックピットシナリオに焦点を当てたAIエージェントベンチマークであり、スマートコックピット内の大規模言語モデルのツール呼び出し機能を包括的に評価します。このベンチマークは、日常的な使用からあらゆる使用までを網羅する12の一般的な車両使用シナリオに基づいて構築されています。
MobileLLM-R1は、Meta社が提供する高性能推論モデルシリーズで、数学、プログラミング、科学的推論に特化して設計されています。このシリーズには、基本モデルと最終モデルがあり、それぞれ1億4000万、3億6000万、9億5000万のパラメータを持つバージョンが用意されています。これらのモデルは、あらゆる状況に普遍的に適用できるものではありません。
veCLIは、ByteDanceのVolcano Engineによって開発されたコマンドラインAIツールで、開発効率を向上させます。Doubao大規模モデル1.6を含む複数のモデルとシームレスに統合されており、開発者は自然言語による対話を通じて、コードを迅速に生成し、ローカル環境でのデプロイメントを完了できます。