SenseNova V6 - SenseTime社が発売したマルチモーダル融合モデルシリーズ
SenseNova V6は、SenseTimeの第6世代マルチモーダル融合モデルシリーズであり、6000億パラメータのマルチモーダルMoEアーキテクチャに基づいており、テキスト、画像、ビデオのネイティブ融合を可能にします。SenseNova V6...
SenseNova V6は、SenseTimeの第6世代マルチモーダル融合モデルシリーズであり、6000億パラメータのマルチモーダルMoEアーキテクチャに基づいており、テキスト、画像、ビデオのネイティブ融合を可能にします。SenseNova V6...
Mingqiは、上海交通大学コンピュータサイエンス学部LoCCS研究室が開発した、希少疾患の精密診断のための初の大規模医療マルチモーダルモデルです。「大規模モデル能力マトリックス+専門家ルーティングコラボレーション」のデュアルエンジンアーキテクチャに基づき、医用画像処理と…を統合しています。
Fourier N1は、ゼネラル・ロボティクス社のフーリエ・ロボティクス部門が発表した初のオープンソース人型ロボットです。身長1.3メートル、体重38キログラムで、23自由度を持ち、アルミニウム合金とエンジニアリングプラスチックの複合構造を採用することで、強度と柔軟性を兼ね備えています。
ScholarCopilotは、カナダのウォータールー大学とカーネギーメロン大学の研究チームによって開発された、学術論文執筆に特化したAIツールです。Qwen-2.5-7Bモデルに基づいて、引用文献を動的に取得し、共同最適化を実行します。
AgentPruneは、大規模言語モデル(LLM)によって駆動されるマルチエージェントシステム向けの通信最適化フレームワークであり、同済大学、香港中文大学、およびその他の機関によって共同で提案されました。冗長または有害な通信内容を除去するために「プルーニング」技術を使用します。
HeartShadow Big Modelは、HeartShadow Follows AIチームが開発したAIビッグモデルで、国家生成型人工知能サービス申請を正式に通過しました。このモデルはゲーム分野に特化しており、ゲーム戦略とキャラクターのコンパニオンシナリオを深く統合し、「面白い…」に幅広く応用されています。
FlexIPは、テンセントが提案する、画像合成のための柔軟な被写体属性編集フレームワークであり、画像生成におけるアイデンティティ保護とパーソナライズされた編集のバランスを取るものです。このフレームワークは、デュアルアダプタアーキテクチャを採用することで、アイデンティティ保護とパーソナライズされた編集を分離し、…
UNOはByteDanceが開発した革新的なAI画像生成フレームワークであり、従来のモデルの複数被写体生成における限界を打破します。「少数から多数へ」の汎化手法により、高品質な単一被写体画像と複数被写体画像を生成し、複数被写体シーンにおける問題を解決します。
Skywork-OR1(Open Reasoner 1)は、Kunlun Techが発表したオープンソースの高性能推論モデルシリーズです。これらのモデルは、論理推論や複雑なタスクの解決において、大規模モデルの限界を克服します。Skywork-OR1には3つのモデルが含まれています。
Seed-Thinking-v1.5は、ByteDanceが発表した推論型インテリジェンスモデルです。ハイブリッドエキスパート(MoE)アーキテクチャを採用し、合計200個のパラメータを持ち、イテレーションごとに20個のパラメータを有効化します。このモデルは、AIなどの複数のベンチマークテストで優れた性能を発揮します。
HoloPartは、香港大学とVASTチームが開発した革新的な拡散モデルです。3Dオブジェクトを、たとえパーツが遮蔽されていても、完全で編集可能な意味的なパーツに分解することを可能にします。
UniRigは、清華大学コンピュータサイエンス学部とVASTが共同開発した革新的な自動スケルトンリギングフレームワークで、複雑で多様な3Dモデルの処理に使用されます。大規模な自己回帰モデルとボーンポイントのクロスアテンションメカニズムに基づいて、高品質なスケルトンリギングを生成します。
AI Scientist-v2は、Sakana AI、ブリティッシュコロンビア大学、Vector Institute、およびその他の機関が共同開発した、完全自動化されたエンドツーエンドの人工知能システムです。科学的仮説の自律的な生成をサポートします。
PixelFlowは、香港大学とAdobeが共同開発した画像生成モデルで、ピクセル空間での画像生成を直接サポートします。PixelFlowは効率的なカスケードフローモデリングに基づいており、低解像度から高解像度へと段階的に改善され、大幅に向上します。
GPT-4.1はOpenAIの最新の次世代言語モデルであり、GPT-4.1、GPT-4.1 mini、GPT-4.1 nanoの3つのバージョンで構成されています。この一連のモデルは、エンコーディング能力、命令への準拠性、長文処理において大幅な改善を示しています。
エージェント開発キット(ADK)は、Google初のオープンソースAIエージェント開発ツールキットです。コードファーストのPythonツールキットであり、複雑なAIエージェントの構築、評価、および展開を簡素化します。ADKは複数のエージェントをサポートしています...
MiniMax MCPサーバーは、MiniMax Technologyが開発したモデルコンテキストプロトコル(MCP)に基づくマルチモーダル生成サーバーです。簡単なテキスト入力により、ビデオ生成、画像生成、音声生成、オーディオ生成などを実行できます。
BiliNoteは、オープンソースのAIビデオノート作成アシスタントで、BilibiliやYouTubeなどのビデオリンクからビデオコンテンツを自動的に抽出し、構造化された簡潔なMarkdown形式のノートを生成します。
Keling 2.0は、Kuaishouの次世代AI動画生成モデルで、Keling AI動画プラットフォームで利用可能になりました。プラットフォームのアップデートには、Keling 2.0(マスターエディション)とKetu 2.0の2つの基本モデルが含まれています。Ketu 2.0は、画像生成品質を大幅に向上させています。
MedReasonは、カリフォルニア大学サンタクルーズ校、ブリティッシュコロンビア大学、シンガポールの南洋理工大学などの機関によって開発された医療推論フレームワークです。知識グラフを活用して、医療分野における大規模言語モデル(LLM)の応用を強化します。
Seaweed-7Bは、ByteDanceが開発した動画生成モデルで、約70億個のパラメータを誇ります。Seaweed-7Bは強力な動画生成機能を備えており、テキスト、画像、音声などから高品質な動画コンテンツを生成することができます。
Jiaojiaoは、上海交通大学聴覚認知・計算音響学研究所が開発した、世界初の純粋に学術的な独自開発音声対話感情モデルです。Jiaojiaoは、複数人対話、多言語コミュニケーション、方言理解、ロールプレイング、感情的な相互作用といった機能を備えています。
GLM-Z1-32Bは、Zhipu Technologyがオープンソース化した新世代推論モデルであり、具体的にはバージョンGLM-Z1-32B-0414です。GLM-Z1-32Bは、GLM-4-32B-0414ベースモデルに基づいて開発され、深層最適化トレーニングを活用しており、数学、代数、その他の分野で優れた性能を発揮します。
GLM-4-32Bは、Zhipu Technologyがオープンソース化した新世代の台座モデルで、パラメータバージョンはGLM-4-32B-0414です。GLM-4-32Bは15TBの高品質データで事前学習されており、コード生成、推論、エンジニアリングタスクの能力が強化されています。また、HTML、CS...をサポートしています。