DeepEyes - 西安交通大学と共同でXiaohongshuが開発した、マルチモーダルな深層思考モデル。
DeepEyesは、小紅書チームと西安交通大学が共同開発したマルチモーダル深層思考モデルです。エンドツーエンドの強化学習に基づき、教師ありファインチューニング(SFT)に頼ることなく、OpenAI o3と同様の「グラフ思考」能力を実現しています。
DeepEyesは、小紅書チームと西安交通大学が共同開発したマルチモーダル深層思考モデルです。エンドツーエンドの強化学習に基づき、教師ありファインチューニング(SFT)に頼ることなく、OpenAI o3と同様の「グラフ思考」能力を実現しています。
TrackVLAは、Galaxy Generalが開発した製品レベルのエンドツーエンドナビゲーションモデルです。このモデルは、純粋な視覚環境認識、言語コマンド駆動型操作、自律推論、ゼロショット汎化機能を備え、視覚認識からアクション出力までのエンドツーエンド処理を可能にします。
TEN VADは、エンタープライズアプリケーション向けに設計された高性能リアルタイム音声活動検出システムです。TEN VADは、低遅延、軽量設計、高精度を特長とし、オーディオストリーム内の音声活動を正確に検出します。TEN VADは、以下の技術に基づいています。
Google AI Edge Galleryは、Googleが公開した実験的なアプリケーションで、ユーザーは自分のデバイス上で機械学習(ML)や生成型人工知能(GenAI)モデルを体験・利用できます。このアプリケーションは現在Androidをサポートしています。
VRAG-RLは、アリババのTongyi Big Modelチームが開発した、視覚知覚に基づいたマルチモーダルRAG推論フレームワークです。豊富な視覚情報を処理する際の、視覚言語モデル(VLM)の検索、推論、理解能力の向上に重点を置いています。
JaazはオープンソースのAIデザインエージェントで、Lovartの無料代替サービスです。強力なAIデザイン機能を備え、デザインのヒントをインテリジェントに生成したり、画像、ポスター、ストーリーボードなどを一括で作成したりできます。
OCodeは、モバイルデバイス向けのネイティブAIプログラミングアシスタントであり、開発者に高度なコードベース分析機能と自動化されたタスク実行機能を提供します。ローカルのOllamaモデルとシームレスに統合し、エンタープライズグレードのAI支援を開発プロセスに直接組み込みます。
Firesearchは、Mendable AIチームが開発したAI駆動型の深層調査ツールです。Firecrawlのマルチソースネットワークコンテンツ抽出技術をベースに、OpenAI GPT-4oの検索計画およびコンテンツ生成機能を組み合わせることで、複雑な情報を抽出できます。
PlayDiffusionは、PlayAIが発表した新しい音声編集モデルで、拡散モデル技術に基づいており、特にきめ細かな音声編集と修復のために設計されています。このモデルは音声を離散的なトークンシーケンスにエンコードし、変更が必要な部分をマスクします。
Auto Thinkは、KuaishouのKwaipilotプラットフォームのKwaiCoder-AutoThink-previewチームによって開発されたオープンソースの自動思考モデルです。このモデルは、綿密な調査を行い、提案を行うことで、深層思考モデルに内在する「考え過ぎ」の問題に対処します。
OmniAudioは、アリババ同義研究所の音声チームが開発した、360°動画から空間オーディオ(FOA)を生成する技術です。仮想現実や没入型エンターテインメントにおいて、よりリアルなオーディオ体験を提供することを目指しています。これは、大規模なデータセットを構築することによって実現されます。
OpenAudio S1は、Fish Audio社が開発したテキスト音声合成(TTS)モデルで、200万時間以上の音声データで学習されており、13言語に対応しています。デュアル自己回帰(Dual-AR)アーキテクチャを採用し、強化学習と人間のフィードバックを組み合わせています。
MoonCastは、プレーンテキストソースから自然なポッドキャストスタイルの音声を合成する、ゼロショットAIポッドキャスト生成プロジェクトです。長文コンテキスト言語モデルと大規模な音声データを使用してトレーニングされており、中国語と英語の両方をサポートし、数分間のポッドキャスト音声クリップを生成できます。
Gemini Fullstack LangGraph Quickstartは、Google DeepMindが立ち上げたオープンソースプロジェクトで、開発者がGoogle Gemini 2.5とLangGraphをベースにしたフルスタックのインテリジェントな研究アシスタントを迅速に構築できるように支援することを目的としています。
DecipherItは、AIを活用した研究支援ツールで、インテリジェントな手法を用いて研究プロセスを簡素化・最適化します。このツールは、様々なトピック、リンク、ファイルをAI生成の研究ノートブックに変換する機能をサポートし、包括的な要約、インタラクティブな機能などを提供します。
Qwen3 Embeddingは、Qwen3基本モデルに基づいて開発された、テキスト表現、検索、ランキング専用のモデルです。Grouped Query AttentionやSwiGLU活性化関数など、Qwen3の高度なアーキテクチャを継承し、さらに…
Qwen3 Rerankerは、アリババの同義千文チームがリリースしたテキスト再ランキングモデルで、Qwen3モデルファミリーに属します。シングルタワークロスエンコーダーアーキテクチャを採用し、テキストペアを入力として関連性スコアを出力します。このモデルは多段階のトレーニングを受けます。
Eleven v3は、ElevenLabsが開発した高度なテキスト読み上げモデルです。インラインオーディオタグによって感情やイントネーションを正確に制御し、複数話者による対話にも対応し、より自然な会話を実現します。70以上の言語に対応し、高度なテキスト理解能力を誇ります。
MiniCPM 4.0は、Wallfacer社が開発した大規模なエッジサイドモデルです。このモデルは、8Bと0.5Bの2つのパラメータスケールで提供されます。8Bのライトニングスパースバージョンは革新的なスパースアーキテクチャを採用し、長文テキスト処理を効率的に行うことができます。一方、0.5Bバージョンは少ない計算リソースで動作します。
dots.llm1は、Xiaohongshu氏のhi labがオープンソース化した中規模のエキスパート混合モデル(MoE)テキストモデルで、1420億個のパラメータと140億個の活性化パラメータを持つ。このモデルは、11.2TBの高品質トークンデータでテストされた。
MonkeyOCRは、華中科技大学とKingsoft Officeが共同開発した文書解析モデルです。このモデルは、非構造化文書コンテンツを構造化情報に効率的に変換することをサポートします。正確なレイアウト分析に基づき、…
Playmateは、広州Quwan Technologyチームが開発した顔アニメーション生成フレームワークです。3D暗黙的空間誘導拡散モデルに基づき、このフレームワークは2段階のトレーニングプロセスを使用して、音声とコマンドに基づいて顔の表情と頭の姿勢を正確に制御し、アニメーションを生成します。
Time-R1は、イリノイ大学アーバナ・シャンペーン校の研究チームが開発した3Bパラメータに基づく言語モデルです。独自の3段階強化学習トレーニング手法により、時間推論能力において大きな飛躍を遂げました。
MiniMax-Removerは、既存の技術における錯覚オブジェクト、視覚的アーティファクト、推論速度の遅さといった一般的な問題に対処する、斬新なビデオターゲット除去手法です。この手法は2段階のアプローチを採用しており、第1段階は簡略化されたDiTフレームワークに基づいています。