Step-R1-V-Mini - Step-R1の最新マルチモーダル推論モデル
Step-R1-V-Miniは、StepStarの最新のマルチモーダル推論モデルです。画像とテキストの入力および出力に対応し、優れた命令準拠性と汎用性を備え、高精度な画像認識による複雑な推論タスクを実行できます。このモデルは…
Step-R1-V-Miniは、StepStarの最新のマルチモーダル推論モデルです。画像とテキストの入力および出力に対応し、優れた命令準拠性と汎用性を備え、高精度な画像認識による複雑な推論タスクを実行できます。このモデルは…
SeniorTalkは、南開大学人工知能技術研究院(AIAI)と同大学コンピュータサイエンス学部人間言語技術研究所(HLT Lab)が共同開発した、世界初の超高齢者向け中国語対話音声データセットです。このデータセットには、75歳以上の202人の音声データが含まれています。
HiDream-I1は、HiDream.aiチームによって開発されたオープンソースのAI画像生成モデルです。17億個のパラメータを持ち、MITライセンスで提供されています。このモデルは、画像生成の品質とキューワードへの適合性に優れており、リアルな画像から漫画風の画像まで幅広く対応しています。
GitHub MCP Serverは、モデルコンテキストプロトコル(MCP)に基づいたGitHub公式サーバーツールです。GitHub MCP ServerはGitHub APIとシームレスに統合され、開発者に高度な自動化機能を提供します。
Nova Sonicは、Amazonが開発した新しい生成型AI音声モデルです。音声理解と音声生成機能を単一のモデルに統合し、話者のイントネーション、スタイル、その他の音響的コンテキストに基づいて生成される音声応答を調整することで、対話を実現します。
DeepCoder-14B-Previewは、AgenticaとTogether AIが共同でオープンソース化した大規模コード生成モデルで、Deepseek-R1-Distilled-Qwen-14Bをベースに微調整されています。DeepCoder-14B-Previewは、...
Dream-7Bは、香港大学とファーウェイ・ノアズアーク・ラボが共同開発した拡散ベースの推論モデルです。現在、最も強力なオープンソースの拡散ベースの大規模言語モデルです。Dream-7Bのトレーニングデータには、テキスト、数式データ、コードが含まれており、事前トレーニングには5つのデータが使用されます。
Llama Nemotronは、NVIDIAが提供する推論モデルシリーズで、推論と様々なインテリジェントエージェント(エージェント型AI)タスクに重点を置いています。これらのモデルは、NVIDIAが事後学習を行ったオープンソースのLlamaモデルをベースにしており、推論機能を組み込んでいます。
Miracle F1は、Meitu WHEEが発表した全く新しいAI画像生成モデルです。写真家、建築家、画家のように光、影、空間、素材効果を正確に処理できる強力な画像生成能力を誇り、リアルな画像を生成します。
Lipsync-2は、Sync Labsが開発した世界初のゼロショット・リップシンクモデルです。特定の話し手に対する事前学習は不要で、独自の話し方に合わせたリップシンク効果を瞬時に生成できます。
EasyControlは、Tiamat AIのDiffusion Transformer(DiT)アーキテクチャに基づいた、オープンソースで高効率かつ柔軟な制御フレームワークです。軽量な条件付き注入LoRaモジュールを介して、条件付き信号を独立して処理します。
OmniSVGは、復旦大学とStepFunが共同開発した、世界初のエンドツーエンドのマルチモーダルSVG(スケーラブルベクターグラフィックス)生成モデルです。事前学習済みのビジュアル言語モデル(VLM)に基づき、革新的なSVGトークン化手法を採用しています。
A2A(Agent2Agent)は、Google初のオープンソース標準インテリジェントエージェントインタラクションプロトコルであり、異なるフレームワークやベンダーで構築されたAIエージェント間の連携を可能にします。A2Aは標準化された通信方法に基づいてシステム間の壁を取り払い、インテリジェントエージェントが安全に連携できるようにします。
DCEditは、北京交通大学と美図2MT研究所が共同開発した、斬新な2層制御画像編集手法です。DCEditは、精密意味局所化(PSL)戦略に基づいており、視覚的およびテキスト的自己注意機構を用いて相互注意を最適化します。
LocAgentは、スタンフォード大学、イェール大学、南カリフォルニア大学が共同開発したフレームワークで、コード位置特定タスクに特化しています。開発者がコードベースの中で修正が必要な部分を迅速かつ正確に見つけるのに役立ちます。LocAgentは…
Multi-SWE-benchは、ByteDanceのDoubao Big Modelチームがオープンソース化した、初のマルチ言語対応コード修正ベンチマークです。SWE-benchをベースに、Pythonに加え、Java、TypeScriptなど7つの主要プログラミング言語を網羅した初のベンチマークです。
Gemini 2.5 Flashは、Googleが開発した高効率・低遅延のAIモデルであり、Gemini 2.5モデルをベースに構築されています。Gemini 2.5 Flashは、低遅延とコスト効率を維持しながら、思考能力を導入しています。
DevDocsは、プログラマーや開発者向けに設計されたオープンソースの技術文書クロールおよび処理ツールです。インテリジェントなWebクロール技術に基づいており、技術文書を迅速にクロールして整理し、理解に必要な時間を数週間から数時間に短縮します。DevDocsは…
AutoRAGは、Cloudflareが提供する完全マネージド型の検索拡張生成(RAG)パイプラインであり、開発者がインフラストラクチャを管理することなく、コンテキスト認識型AIをアプリケーションに簡単に統合できるように支援します。
MoLingは、コンピュータやブラウザで使用されるMCPサーバーをベースとした、依存関係のないローカルオフィスオートメーションアシスタントです。MoLingはオペレーティングシステムのAPIを使用してシステムと連携し、ファイルシステム操作(読み書き、マージなど)をサポートします。
Versatile-OCR-Programは、教育現場や機械学習トレーニング向けに開発されたオープンソースのマルチモーダルOCRツールです。DocLayout-YOLO、Google Vision、MathPixなどの技術を組み合わせることで、テキスト、数式などを正確に認識します。
Kimi-VLは、Dark Side of the Moonがオープンソース化した軽量マルチモーダル視覚言語モデルです。軽量MoEモデルMoonlight(総パラメータ数160億、アクティベーションパラメータ数28億)とネイティブ解像度MoonViTビジュアルエンコーダ(パラメータ数4億)をベースにしています。
FantasyTalkingは、アリババのAMAPチームと北京郵電大学が共同で提案した、単一の静止画像からリアルでアニメーション可能な仮想アバターを生成するための新しいフレームワークです。事前学習済みのビデオ拡散変換モデルに基づいて、...
BrowseCompは、OpenAIが開発したオープンソースのベンチマークツールで、AIエージェントのウェブブラウジング能力を評価するために使用されます。映画、科学技術、芸術、歴史、スポーツ、音楽など、幅広い分野を網羅した1266問の非常に難易度の高い問題が含まれています。