TokenSwift - 超長文テキストの生成を高速化するためのフレームワーク。90分以内に10万個のトークンテキストを生成できます。
TokenSwiftは、北京総合人工知能研究所のチームが開発した、超長文テキスト生成を高速化するフレームワークです。10万トークンを含むテキストを90分以内に生成でき、従来の自己回帰モデルで必要だった約5時間と比較して3倍の速度向上を実現しています。
TokenSwiftは、北京総合人工知能研究所のチームが開発した、超長文テキスト生成を高速化するフレームワークです。10万トークンを含むテキストを90分以内に生成でき、従来の自己回帰モデルで必要だった約5時間と比較して3倍の速度向上を実現しています。
MIDI(Multi-Instance Diffusion for Single Image to 3D Scene Generation)は、1枚の画像を短時間で高精細な3Dシーンに変換できる高度な3Dシーン生成技術です。
Evolving Agentsは、AIエージェントの作成、管理、進化のための実用レベルのフレームワークです。Evolving Agentsは、インテリジェントエージェント間のコミュニケーションとコラボレーションをサポートし、意味理解のニーズと過去の経験に基づいて進化することで、効果的に問題を解決します。
MT-MegatronLMは、Moore's Threadsが開発したオープンソースのハイブリッド並列トレーニングフレームワークで、フル機能のGPU向けに開発され、主に大規模言語モデルの効率的なトレーニングに使用されます。密なモデル、マルチモーダルモデル、MoE(ハイブリッドエキスパート)をサポートしています。
APB(Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUs)は、清華大学をはじめとする複数の機関によって提案された、分散型ロングコンテキスト推論プロトコルです。
Botgroup.chatは、ReactとCloudflare Pagesをベースに構築されたマルチユーザーAIチャットアプリケーションです。複数のAIキャラクターが同時に会話に参加でき、グループチャットのようなインタラクティブな体験を提供します。ユーザーはAIキャラクターの性格をカスタマイズできます。
MT-TransformerEngineは、Moore's Threadsがオープンソース化した、Transformerモデル向けに特別に設計された高効率なトレーニングおよび推論最適化フレームワークです。このフレームワークは、演算子融合、並列処理による高速化、その他の技術を通じて、Moore's Threadsのフル機能GPを最大限に活用します。
Chituは、清華大学高性能計算研究所と清華大学紀智が共同でオープンソース化した高性能大規模モデル推論エンジンです。推論段階における大規模モデルの高コストと低効率の問題を解決するために特別に設計されており、強力なハードウェア適応性を備えています。
Open-LLM-VTuberは、オープンソースのクロスプラットフォーム音声対話型AIコンパニオンプロジェクトです。リアルタイムの音声対話と視覚認識をサポートし、鮮やかなLive2Dアニメーションアバターを備え、完全オフラインで動作し、プライバシーを保護します。ユーザーはこれを次のように使用できます...
MetaStone-L1-7B は、MetaStone シリーズの軽量推論モデルで、複雑な下流タスクのパフォーマンスを向上させるように設計されています。数学やコード (SO...) などのコア推論ベンチマークにおいて、並列モデルの中で最先端のパフォーマンスを実現しています。
Wenxin Big Model 4.5は、Baiduの最新世代かつ初のネイティブマルチモーダルビッグモデルとして正式にリリースされました。マルチモーダル理解、テキスト処理、論理推論において大幅な改善を実現し、複数のテストでGPT4.5を凌駕しています。このモデルは現在、Baidu AIで利用可能です。
Wenxin Big Model X1は、Baiduが開発した深層思考モデルです。「長い思考連鎖」を持ち、中国語の知識ベースの質問応答、文学作品の創作、論理的推論に優れています。X1はマルチモーダル機能を追加し、画像の理解と生成、ツールの呼び出しによる生成などを可能にしています。
MM-Eurekaは、上海人工知能研究所、上海イノベーション研究所、上海交通大学、香港大学の研究者らが共同開発したマルチモーダル推論モデルです。このモデルは、ルールベースの大規模強化学習(RL)を利用して、
Command Aは、Cohereがエンタープライズアプリケーション向けに特別に設計した最新の生成型AIモデルです。Command Aの主な利点は、他の類似モデルと比較して、高いパフォーマンスと低いハードウェアコストにあり、2つのGPU上で効率的に展開できます。
AudioXは、香港科技大学とDark Side of the Moonが共同で提案した、任意のコンテンツから音声や音楽を生成するために特別に設計された統一拡散トランスフォーマーモデルです。このモデルは、テキスト、ビデオ、画像、音楽など、さまざまな入力形式に対応できます。
MedRAGは、南洋理工大学の研究チームが提案した医療診断モデルです。知識グラフ推論を組み合わせることで、大規模言語モデル(LLM)の診断能力を向上させます。このモデルは、4層のきめ細かい診断知識グラフを構築し、正確な分類を可能にします。
I2V3Dは、香港城市大学とMicrosoft GenAIが開発した革新的な画像から動画への生成フレームワークです。静止画像を動的な動画に変換することをサポートし、3Dジオメトリガイダンスに基づいて正確なアニメーション制御を実現します。I2V3Dは、従来のコンピュータグラフィックスと…
OpenBioMedは、清華大学インテリジェント産業研究所(AIR)とSMTH Blogが共同で立ち上げたオープンソースプラットフォームで、AIを活用した生物医学研究に焦点を当てています。分子、タンパク質、...を処理できるマルチモーダル表現学習ツールキットです。
AMISSはBaiduが開発したオープンソースのローコードフロントエンドフレームワークです。シンプルなJSON設定に基づいて様々なバックエンドページを迅速に生成し、複雑なフロントエンドコードの必要性を排除します。AMISSはフォーム、テーブル、グラフ、CRUD操作をサポートし、豊富な機能を提供します。
Mistral Small 3.1は、Mistral AIが開発したオープンソースのマルチモーダルAIモデルで、240億個のパラメータを持ち、Apache 2.0ライセンスでリリースされています。テキストおよびマルチモーダルタスクに優れ、最大128kバイトのデータセットをサポートします。
Hunyuan3D 2.0は、Tencentが開発した大規模3Dアセット生成システムで、テキストや画像から高解像度3Dモデルを生成することに重点を置いています。このシステムは2段階の生成プロセスを採用しており、まずテクスチャのない幾何学的モデルを生成し、次に…
Claude 3.7 Maxは、複雑なコーディング作業に特化して設計されたCursorの最新AIモデルであり、これまでで最も強力なコードアシスタントとして宣伝されています。Claude 3.7の思考モデルに基づいており、200KBの巨大なコンテキストウィンドウを備え、処理をサポートしています。
Skywork R1Vは、Kunlun Tech初のオープンソース産業用マルチモーダル思考連鎖推論モデルであり、強力な視覚連鎖推論機能を備えています。Skywork R1Vは、視覚入力に対して多段階の論理推論を実行し、複雑な視覚タスクを解決できます。
Chirp 3は、Google Cloudが提供する高精細音声合成モデルで、自然で生き生きとした音声を生成するように設計されています。248種類の音声と31の言語に対応し、人間のイントネーションの微妙な違いを捉えることで、よりリアルな音声出力を実現します。