KTransformers - 清華大学が開発した、大規模言語モデル推論を最適化するためのオープンソースフレームワーク
KTransformersは、清華大学のKVCache.AIチームが曲靖科技と共同で立ち上げたオープンソースプロジェクトです。大規模言語モデルの推論性能を最適化し、ハードウェア要件を低減します。KTransformersは、GPU/CPUヘテロジニアスコンピューティング戦略に基づいており、…
KTransformersは、清華大学のKVCache.AIチームが曲靖科技と共同で立ち上げたオープンソースプロジェクトです。大規模言語モデルの推論性能を最適化し、ハードウェア要件を低減します。KTransformersは、GPU/CPUヘテロジニアスコンピューティング戦略に基づいており、…
DragAnythingは、エンティティ表現に基づいた制御可能なビデオ生成手法であり、Kuaishouが浙江大学およびシンガポール国立大学Show Labと共同で開発しました。シンプルな軌跡入力に基づいて、ビデオ内のあらゆるオブジェクトの正確なモーション制御を実現します。
GENERatorは、Alibaba CloudのApsara LabのAI for Scienceチームが開発した生成型ゲノムモデルで、DNA配列の設計と生成に重点を置いています。このモデルはTransformerデコーダーアーキテクチャに基づいており、98kの…
FoloUpは、企業が採用面接を効率的に実施できるよう支援する、オープンソースのAI搭載音声面接プラットフォームです。FoloUpは、求人情報に基づいてカスタマイズされた面接質問を自動的に生成し、AI技術を用いて候補者と自然で会話的な音声インタラクションを行うことができます。
ConsistentDreamerは、ファーウェイのミュンヘン研究センターが提案した、画像から3Dアセットを生成する革新的な技術です。単一の画像から、視点に一貫性のある3Dメッシュを生成します。この手法は、複数の視点からの事前画像に基づいてガウス最適化を行います。
Clineは、VS Codeに統合されたAI搭載のプログラミングアシスタントで、インテリジェントな手法によって開発効率を向上させます。強力なコード生成・編集機能を備え、ユーザーのニーズに基づいてコードファイルを迅速に作成・変更し、リアルタイムの構文チェックを提供します。
T1(Thinker)は、テンセント渾源が発表した最新の深層思考モデルで、テンセント元宝に正式に統合されました。このモデルは論理的推論と深層思考に重点を置いており、オンライン検索機能をサポートし、インターネットソース、WeChat公式アカウントなどから情報を取得できます。
ImageRAGは、検索拡張生成(RAG)に基づく画像生成技術です。テキストから画像への変換(T2I)モデルにおいて、関連画像を動的に検索することで、まれな概念や未知の概念の生成精度を向上させます。
X-R1は、強化学習に基づく低コストのトレーニングフレームワークであり、大規模言語モデルのトレーニング後の開発を加速します。X-R1は、5億パラメータ(0.5B)のR1-Zeroモデルを極めて低コストでトレーニングします。
Step-Video-T2V は、Step-Stars チームによって開発されたオープンソースのテキストからビデオへの事前学習済みモデルです。300 億個のパラメータを持ち、最大 204 フレームの高品質なビデオを生成できます。このモデルは、ディープ圧縮された変分オートエンコーダ (Video-...
Unslothは、大規模言語モデル(LLM)のファインチューニングを行うためのオープンソースツールです。計算ステップとGPUカーネルを最適化することで、モデルのトレーニング速度を大幅に向上させ、メモリ使用量を削減します。Unslothは、Llama-3やMistなど、いくつかの主要なLLMをサポートしています。
Matrix3Dは、南京大学、Apple社、香港科技大学の共同開発によって生まれた、革新的な統合型フォトグラメトリモデルです。姿勢推定、深度予測、新しい視点の統合など、複数のフォトグラメトリサブタスクを単一のモデル内で実行できます。
Light-A-Videoは、上海交通大学、中国科学技術大学、香港中文大学、香港科技大学、スタンフォード大学、上海AIラボが共同開発した、トレーニング不要のビデオ照明再調整手法です。これは、プログレッシブな...
北京大学の彭玉新教授の研究チームが開発したFinedeficsは、きめ細かいマルチモーダル大規模モデルであり、きめ細かい視覚認識(FGVR)タスクにおけるマルチモーダル大規模言語モデル(MLLM)の性能を向上させます。このモデルは、オブジェクト固有の情報を組み込むことで、これらのモデルの性能を向上させます。
Step-Audioは、Step-Leap Starチームが発表した初の製品レベルのオープンソース音声対話モデルです。さまざまなシナリオのニーズに応じて、感情表現、方言、言語、歌唱スタイル、パーソナライズされたスタイルを生成し、ユーザーとの自然で高品質な対話を実現します。
SkyReels-V1は、Kunlun Wanweiが開発したAIを活用した短編ドラマ制作のための初のオープンソース動画生成モデルです。数千万件に及ぶ高品質な映画・テレビ番組のデータセットを綿密に調整することで、映画レベルの微細な表情や身体の動きを生成し、33段階のディテールレベルに対応しています。
LangFlowは、LangChainパイプラインを迅速に構築・実験するための、ローコードのビジュアルAIアプリケーション構築ツールです。ドラッグ&ドロップインターフェースにより、ユーザーは大量のコードを記述することなく、複雑なAIワークフローを簡単に作成できます。
SkyReels-A1は、Kunlun Wanweiが開発したオープンソースの、中国初の最先端(SOTA)顔表情・動作制御アルゴリズムで、ビデオ台座モデルに基づいています。SkyReels-A1は、より正確で制御可能な人物動画の生成を可能にし、さらに…
Mistral Sabaは、フランスの企業Mistral AIが開発した地域特化型AIモデルで、中東と南アジアの言語と文化に焦点を当てています。パラメータ数は240億と小規模ながら、アラビア語やインド系の言語の処理に優れています。
Grok 3は、イーロン・マスク氏が設立したxAI社が発表した最新世代の人工知能モデルです。マスク氏はこれを「地球上で最も賢いAI」と称しており、その推論能力は複数のベンチマークテストでChatGPTやDeepWorksを凌駕しています。
Kimi Latestは、Kimiが提供するリアルタイム更新型AIモデルで、Kimiインテリジェントアシスタントと同期したモデル体験をユーザーに提供します。128kのコンテキスト長をサポートし、入力に基づいて8k、32k、または128kのモデルを自動的に選択できます。
Omnitoolは、さまざまなAIモデルに素早くアクセスして使用できる統一インターフェースをユーザーに提供するオープンソースのAIデスクトップ環境です。Omnitoolはローカル動作をサポートしており、Mac、Windows、Linuxデバイスにインストールできます。データストレージ…
Qihoo-T2Xは、360 AI研究所と中山大学が開発した、プロキシラベル拡散トランスフォーマー(PT-DiT)に基づく高効率マルチモーダル生成モデルです。Qihoo-T2Xは、疎なプロキシラベル注意機構を導入することで、計算量を大幅に削減します。
MakeAnythingは、シンガポール国立大学のShow Labチームが開発した、Diffusion Transformerをベースとしたマルチドメインの手続き型シーケンス生成フレームワークです。テキスト記述や画像入力から高品質なシーケンスを生成します。