Octofriend - LLMモデルを自由に切り替えることができるオープンソースのAIプログラミングアシスタント。
Octofriendは、GPT-5やClaudeなどの大規模言語モデル(LLM)間を親しい仲間のように自由に切り替え、タスクの要件に応じて最適なモデルを選択できる、インテリジェントなプログラミングアシスタントです。
Octofriendは、GPT-5やClaudeなどの大規模言語モデル(LLM)間を親しい仲間のように自由に切り替え、タスクの要件に応じて最適なモデルを選択できる、インテリジェントなプログラミングアシスタントです。
VoxCPMは、Wallfacerと清華大学深圳国際大学院が共同開発した0.5Bパラメータの音声生成モデルです。音声合成の自然さ、音色の類似性、韻律表現力において業界トップレベルを達成しています。VoxC...
InternVLA-A1は、上海人工知能研究所と国家・地方共同建設ヒューマノイドロボットイノベーションセンターが共同で発表した大型の具現化マニピュレーションモデルです。理解、想像、実行の統合された能力を備え、タスクを正確に完了することができます。このモデルは…
Ling-V2は、Ant Financialチームが立ち上げたMoEアーキテクチャに基づいた大規模言語モデル群です。最初のバージョンであるLing-mini-2.0は、合計160億個のパラメータを持ち、各入力トークンに対して有効化されているパラメータはわずか14億個です。
FastMTPは、テンセントが独自開発した大規模言語モデル(LLM)推論高速化技術です。マルチラベル予測(MTP)技術を最適化し、従来の複数の独立したモジュールを重みを共有する単一のMTPヘッドに置き換え、言語認識型語彙圧縮と自己調整を組み合わせています。
Xiaomi-MiMo-Audioは、Xiaomiがオープンソース化した、Xiaomi初のネイティブなエンドツーエンドの大規模音声モデルです。革新的な事前学習アーキテクチャと数億時間に及ぶ学習データに基づき、このモデルは音声分野で初めてコンテキスト内学習(ICL)を実現しました。
Lucy Edit Devは、Decart AIチームが開発したオープンソースのテキストベースの動画編集モデルです。簡単なテキストプロンプトに基づいて、衣服の変更、キャラクターの置き換え、オブジェクトの挿入、シーンの切り替えなど、動画に対する様々な編集操作を実行できます。
Wan2.2-Animateは、Alitongyiチームが開発したモーション生成モデルです。このモデルは、モーション模倣モードとロールプレイングモードの両方をサポートしており、パフォーマーのビデオから顔の表情や動きを正確に再現し、非常にリアルなモーションを生成します。
Lego-Editは、Xiaomiが開発したオープンソースの命令型画像編集フレームワークです。マルチモーダル大規模言語モデル(MLLM)の汎化能力を活用することで、柔軟な画像編集を実現します。効率的に学習された様々なモデルを含む、モデルレベルのツールキットを採用しています。
Codexiaは、OpenAI Codex CLI用のグラフィカルインターフェースとツールセットをサポートする、強力なクロスプラットフォームAIコーディングデスクトップアプリケーションであり、開発エクスペリエンスを向上させます。
Kronosは、金融市場向け初のローソク足チャートモデルであり、清華大学とマイクロソフトリサーチアジアが共同でオープンソース化しました。株式や仮想通貨などの資産のローソク足データ(始値、最高値、最安値など)を分析します。
OneSearchは、Kuaishouが開発したeコマース検索向けのエンドツーエンド生成フレームワークです。従来のeコマース検索のカスケードアーキテクチャを最適化し、検索精度とユーザーエクスペリエンスを向上させます。主なイノベーションは、キーワード強化、階層型量子化コーディング(KHQ)などです。
LSP(Language Self-Play)は、大規模言語モデルが大量の高品質トレーニングデータに依存するという問題を解決するためにMetaによって提案された強化学習手法です。LSPの核心的なアイデアは、自己対戦メカニズムを利用することで、同じモデルを持つモデル同士が互いに学習し、学習を進めることを可能にすることです。
TrafficVLMは、AutoNaviが大規模モデル技術に基づいて開発した交通視覚言語モデルです。トラフィックツイン再構築機能により、膨大な量のリアルタイム交通データを動的なツインビデオストリームに変換し、現実世界と同期した「デジタル…」を構築します。
DeepSeek-R1-Safeは、浙江大学サイバーセキュリティ学部とファーウェイが共同開発した、DeepSeekから派生した大規模セキュリティモデルです。ファーウェイのAscendチップとMindSpeedLLMフレームワークに基づいて、このモデルはセキュリティコーパスを構築します。
Granite-Docling-258Mは、IBMが開発した軽量なビジュアル言語モデルで、効率的な文書変換のために設計されています。このモデルは、レイアウト、表、数式などの要素を完全に保持しながら、文書を機械可読形式に変換できます。
LongCat-Flash-Thinkingは、Meituanチームが開発した5600億個のパラメータを持つ大規模推論モデルです。ハイブリッドエキスパート(MoE)アーキテクチャに基づいており、需要に応じて186億個から313億個のパラメータを動的にアクティブ化し、計算負荷のバランスを取ることができます。
LatticeWorldは、NetEase、香港城市大学、北京航空航天大学、清華大学などの機関によって開発されたソフトウェアです。大規模な言語モデルと産業グレードの3DレンダリングエンジンであるUnreal Engine 5(UE5)を組み合わせています。
DeepSeek-V3.1-Terminusは、DeepSeekチームが開発したAI言語モデルです。DeepSeek-V3.1のアップグレード版であり、主に言語の一貫性とエージェントの機能を最適化し、中国語と英語が混在するテキストや異常文字に関する問題に対処しています。
Qwen3-Omniは、アリババ傘下のTongyiチームが開発した業界初のネイティブエンドツーエンドマルチモーダルAIモデルで、テキスト、画像、音声、動画などのマルチモーダルデータをシームレスに処理できます。このモデルは、音声および動画ベンチマークテストで36点満点中22点を獲得しました。
Qwen3-TTS-Flashは、Alitongyiが発表したフラッグシップ音声合成モデルで、複数の音色、言語、方言に対応しています。このモデルは、中国語と英語の発音において優れた安定性、卓越した多言語性能、そして非常に表現力豊かな人間らしい音色を誇ります。
Qianfan-VLは、Baidu AI Cloud Qianfanが開発した大規模な画像認識モデルで、企業レベルのマルチモーダルアプリケーション向けに設計されています。このモデルは3B、8B、70Bのサイズで提供され、OCRや教育などの垂直アプリケーション向けに優れた汎用性と特化した機能を備えています。
Doubao-Seed-Translationは、ByteDanceチームが開発した高度な多言語翻訳モデルで、中国語、英語、日本語、韓国語、ドイツ語、フランス語など、よく使われる28言語間の相互翻訳をサポートしています。
presentation-aiは、ALLWEONEチームが開発したオープンソースのAIプレゼンテーション生成ツールです。ユーザーが入力したトピックに基づいて、完全なPPTアウトラインと美しいスライドを自動的に生成でき、複数の言語、テーマ、カスタマイズ可能なフォーマットをサポートしています。