Muse Imageは、Meta Super Intelligence Labが独自開発した初のAI画像生成モデルです。エージェントアーキテクチャを採用し、Muse Sparkと連携して多段階の計画と自己改善を行います。
Muse Imageは、Meta Super Intelligence Labが独自開発した初のAI画像生成モデルです。エージェントアーキテクチャを採用し、Muse Sparkと連携して多段階の計画と自己改善を行います。
SayItは、Rustをベースに構築されたオープンソースのAI音声入力方式で、Windowsデスクトップに対応しています。ユーザーはショートカットキーを長押しして話すことができ、話した言葉はリアルタイムで使用可能なテキストに変換されます。
LingBot-Depth 2.0は、Antminer Technologyがオープンソースの視覚基盤モデルLingBot-Visionとともに発表した、実世界のシナリオに対応した空間認識モデルです。トレーニングデータは300万件から1億5000万件に拡張され、16種類の深層学習アルゴリズムが含まれています。
OpenScienceは、Synthetic Sciences社が立ち上げたオープンソースのAI研究ワークベンチで、機械学習、生物学、物理学、化学の研究を対象としています。このプラットフォームは、文献レビュー、仮説生成、コード作成、実験実行などのプロセスをサポートします。
GenEvolveは、香港科技大学(広州)、美団、シンガポール国立大学が共同開発した自己進化型画像生成エージェントです。GenEvolveは、ツールによってオーケストレーションされる視覚的軌跡として、オープンエンドな画像生成を形式化します。エージェントは…
GPT-Realtime-2.1は、OpenAIが開発した次世代リアルタイム音声モデルです。フラッグシップバージョンである2.1では、英数字認識、無音/ノイズ処理、割り込み応答機能が大幅に向上し、音声、テキスト、画像入力に対応、さらに強力なプッシュ機能も備えています。
MemGUI-Agentは、浙江大学と快手(Kuaishou)が共同開発した長距離モバイルGUIインテリジェントエージェントです。アプリ間連携、複数ステップ、長鎖といったモバイル自動化タスク向けに設計されています。
InternAgentSは、上海AIラボが開発したオープンソースの国内開発研究用インテリジェントエージェントワークベンチであり、科学のためのAIシナリオ向けに設計されています。論文読解、実験分析、コード反復、リモートコンピューティング、研究論文執筆といった多様なプロセスを単一のプラットフォームに統合します。
Fun-ASR-Realtimeは、アリババの千文プラットフォームが開発した大規模ストリーミングリアルタイム音声認識モデルです。このモデルはWebSocketストリーミングプロトコルを使用し、音声と単語の同時出力を実現しています。最初の単語の遅延は数百ミリ秒、最後の単語の遅延は極めて低くなっています。
Hy3は、テンセントのHunyuanプラットフォームがオープンソース化した、295個のパラメータを持つハイブリッドエキスパート(MoE)モデルです。このモデルは、エージェントの能力、推論、および長期コンテキストタスクにおいて大幅な改善を示し、複数のベンチマークにおいて、パラメータ数が2~5倍のフラッグシップモデルに匹敵するベンチマーク性能を達成しています。
FuckClaudeは、軽量でSEOに強く、英語と中国語の二言語対応のシングルページアプリケーション(SPA)検出ツールです。ユーザーのブラウザ環境をスキャンし、Claude Codeによって「中国人ユーザー」としてフラグ付けされるかどうかを判断します。実行ボタンをクリックすると、ツールは...
ElementsClawは、アリババDAMOアカデミー、中国人民大学、中国科学院大学が共同で開発した、超伝導材料発見のための業界初のAIエージェントです。10億個のパラメータを持つ原子の基本モデルElementsを統合した、特化型から汎用型への融合アーキテクチャを採用しています。
ComAct(COM-as-Action)は、Jiaxin Aiらが提唱した、プロフェッショナルなソフトウェア操作の自動化を再定義する研究パラダイムです。このパラダイムは、Windowsのコンポーネントオブジェクトモデル(COM)を統一された実行可能ファイルとして認識します。
Page Agentは、Alibabaが開発したオープンソースの純粋なフロントエンドJavaScriptインテリジェントエージェントライブラリです。たった1行のコードでウェブページに組み込むことができ、ユーザーは自然言語を使ってページのDOM要素を操作できます。
EdgeBenchは、ByteDanceのSeedチームが開発したベンチマークフレームワークで、現実世界の環境における自律型AIエージェントの長期的な学習能力を評価するために用いられます。
Shengshu Technologyが発表したVidu S1は、世界をリードするリアルタイムインタラクティブビデオ基盤モデルであり、AIビデオがオフライン生成からリアルタイム双方向インタラクションの時代へと移行することを示しています。自己回帰拡散アーキテクチャに基づいており、540P解像度と25FPS(最大...
AReaL 2.0は、Ant Financialが香港科技大学および清華大学と共同で開発した、オープンソースのエージェントベースのオンライン強化学習インフラストラクチャです。これにより、展開されたエージェントは現実世界の相互作用の軌跡に基づいて継続的に進化することができます。
Ego Liteは、人間とAIエージェント間の並行的な協働を可能にするChromiumベースのブラウザです。Ego Liteは、AIエージェントの基盤となるブラウザ動作機能を提供するインフラストラクチャとして機能します。
Video-useは、Browser Useチームが開発したオープンソースのAIビデオ編集エージェントで、従来のタイムライン操作を自然言語による対話に置き換えます。ユーザーは、元の映像をフォルダに配置し、必要な内容を説明するだけで、エージェントが自動的に編集を完了します。
Cloudwise社が開発したViiTorVoiceは、部分編集をサポートする世界初のAI音声合成モデルであり、Seed-TTSの権威ある評価リストでトップに輝いています。NAR(非自己回帰型)アーキテクチャを採用することで、Word文書を編集するのと同じくらい簡単に音声編集が可能です。
Octoは、Minglue Technologyが開発したオープンソースのAIネイティブなチームコラボレーションプラットフォームです。分散したAIエージェントを統合された空間に集約し、インスタントメッセージ(IM)形式を通じて、人とエージェント、そしてエージェント同士の効率的な連携を可能にします。
SemanticAudioは、香港中文大学、LIGHTSPEED、上海交通大学が共同開発した音声生成・編集フレームワークです。このフレームワークは、テキストから音声への生成を「意味計画」と「音響合成」の2つの段階に分け、より高レベルでは…
GeneBench-ProはOpenAIが提供する研究グレードのベンチマークであり、計算生物学における判断集約型の分析をAIモデルが処理する能力を評価するために使用されます。GeneBench-Proには、129のクロスゲノミクス、定量的生物学のデータセットが含まれています。
WorldCupVoiceは、オープンソースのAI搭載リアルタイムスポーツ解説システムです。Agora RTCのライブストリームに接続することで、ビジュアルモデルを用いて試合映像を分析し、リアルタイムの音声解説を生成します。生成された音声解説はライブストリーム配信ルームに送信され、視聴者は同時に聞くことができます。