Playwriter - 人間と機械のシームレスな協働を可能にする、オープンソースのAIブラウザ自動化ツール。
Playwriterは、Microsoft Playwrightをベースに構築されたオープンソースのChrome拡張機能で、AIを活用したブラウザ操作に特化して設計されています。このツールはChrome拡張機能としてシームレスに統合され、AI機能をユーザーのブラウジング体験に直接組み込みます。
Playwriterは、Microsoft Playwrightをベースに構築されたオープンソースのChrome拡張機能で、AIを活用したブラウザ操作に特化して設計されています。このツールはChrome拡張機能としてシームレスに統合され、AI機能をユーザーのブラウジング体験に直接組み込みます。
Prompt Manager (PromptX) は、AI プロンプトを効率的に管理するためのツールで、AI ワークフローの効率化を目的として設計されています。このツールは、個人用プロンプトの作成、編集、分類、バージョン管理をサポートします。インテリジェントな分類とグローバルな機能により、...
FrogBossは、Microsoft Researchが開発した一連のプログラミングモデルです。これらのモデルは、革新的で高度な脆弱性生成手法(BugPilot)を用いてトレーニングされます。この手法では、言語モデルエージェント(LLM)がコードベースに新しい機能を追加します。
OpenWorkは、知識労働者向けにClaude Coworkスタイルのワークフローを提供するオープンソースのデスクトップアプリケーションです。OpenCodeをベースに構築されたOpenWorkは、分かりやすくガイド付きのユーザーインターフェースを提供します。
TranslateGemmaは、Googleが開発したGemma 3をベースとした次世代のオープンソース翻訳モデルです。このモデルは、教師ありファインチューニングと強化学習を組み合わせることで、55言語の高品質な翻訳をサポートし、翻訳品質を大幅に向上させます。
FLUX.2 [klein] は、Black Forest Labs が開発したオープンソースの高効率画像生成・編集モデルです。このモデルは、1秒未満の推論速度を誇り、0.5秒以内に高品質な画像を生成・編集でき、テキストから画像への変換や画像から画像への変換処理をサポートしています。
AgentCPM-Exploreは、清華大学、中国人民大学、Wallfacer Intelligence、およびOpenBMBオープンソースコミュニティが共同開発したオープンソースのエージェントモデルです。わずか40億個のパラメータに基づいて、このモデルは複数の長期タスクベンチマークにおいて類似モデルを凌駕する性能を発揮します。
ArenaRLは、Tongyi DeepResearchチームがAutoNaviと共同開発した、オープン領域エージェント向けのオープンソースの対照的強化学習手法です。ArenaRLはトーナメントメカニズムを導入し、従来の絶対スコアリングをグループ内での相対ランキングに変換します。
Step-Audio-R1.1は、Step-Audioが開発した世界初のオープンソースネイティブ音声推論モデルです。このモデルは、96.4%の精度で世界の権威ある音声推論ランキングのトップに立ち、多くの主要モデルを凌駕しました。このモデルは、高度な音声推論機能を備えています。
Sinon(Sinon Large Language Model)は、南京農業大学が立ち上げた農業分野向けの大規模な垂直統合型モデルです。南京農業大学の学際的な強みを活かし、書籍や論文など、複数の農業分野を網羅する40億トークン以上のデータを収集しています。
OctoCodingBenchは、MiniMax社が提供するオープンソースのベンチマークスイートで、コーディングエージェントの命令遵守能力を評価するために使用されます。OctoCodingBenchは、実際のソフトウェア開発シナリオをシミュレートし、システム制約、ユーザー指示、プロジェクト仕様、スキルなどに基づいてパフォーマンスを評価します。
MedGemma 1.5は、Googleが開発したオープンソースのマルチモーダルAI医療モデルで、医療画像とテキストデータの処理に特化して設計されています。このモデルは、高次元の医療画像(CTやMRIなど)、全スライス病理画像、縦断的画像解析、解剖学的局在化などをサポートしています。
GLM-Imageは、ZhipuがHuaweiと共同でオープンソース化した、新世代のマルチモーダル画像生成モデルです。Ascend Atlas 800T A2デバイスとAscend MindSporeフレームワーク上で学習されており、国内生産チップのみで完全に学習された初の最先端モデルです。
VidBeeは、強力なyt-dlpエンジンをベースにしたオープンソースの動画ダウンローダーです。YouTubeやBilibiliといった人気サイトはもちろん、あまり知られていないサイトも含め、世界中の1000以上のウェブサイトから音声や動画コンテンツを簡単にダウンロードできます。
BabyVisionは、UniPat AIチームが立ち上げたマルチモーダル理解評価データセットで、マルチモーダル言語モデル(MLLM)と画像生成モデルの視覚推論タスクにおける性能を評価します。主なトラックは、MLLM評価と画像生成の2つです。
PixVerseが発表したPixVerse R1は、世界初の汎用リアルタイムワールドモデルであり、AIビデオ生成における「事前録画」から「リアルタイム動的生成」への大きなブレークスルーとなるものです。R1は、3つのコアテクノロジーによってこれを実現しています。
DeepSeekチームが北京大学と共同開発した条件付きメモリモジュールであるEngramは、大規模言語モデル(LLM)のパフォーマンスを向上させます。Engramは、最新のグラム埋め込みテーブルを導入することで、静的な知識を専用メモリに格納します。
Baichuan-M3は、Baichuan Intelligenceが公式にリリースした新世代のオープンソース医療拡張言語モデルです。このモデルは、診断能力、医療錯覚制御、HealthbenchおよびHealthbench Hardベンチマークで1位を獲得し、…
Nuwax Agent OSは、世界初の製品グレードのオープンソース汎用インテリジェントエージェントオペレーティングシステムです。Nuwax Agent OSは、AIを単なる対話ツールから企業向けのインテリジェントな実行ツールへと変革し、自律的な実行を可能にします。
Oh My OpenCodeは、AIプログラミングアシスタント向けに設計されたオープンソースの拡張プラグインで、AI(OpenCodeなど)が実際の開発チームと同じように効率的に連携できるようにすることで、プログラミング体験を向上させます。このツールは、さまざまなAIモデル(例:...)を統合します。
Spirit-v1.5 は、Qianxun Intelligence が発表した具現化された知能の基盤モデルです。このモデルは、多様でオープンなデータ収集方法を採用し、従来の「クリーンデータ」の制約を克服することで、モデルがより豊富なアクションに触れることができるようにし、事前学習フェーズでそれを実現しています。
Obsidian-skillsは、Obsidianチームが開発したオープンソースツールのセットで、ユーザーがAIツール(Claude Codeなど)をObsidianノートシステムにうまく統合できるように支援します。これには、obsidian
DeepTutorは、香港大学データサイエンス研究所が開発したオープンソースのAI学習アシスタントです。マルチエージェントアーキテクチャと知識グラフ技術を通して、複雑な知識システムを効率的な学習体験へと変革します。
Nemotron Speech ASRは、NVIDIAが開発したオープンソースの音声認識モデルで、低遅延かつリアルタイムのストリーミング音声認識に特化しています。キャッシュ対応アーキテクチャを採用し、処理済みの音声特徴量をキャッシュすることで、新しい音声フレームに対してのみ計算を実行し、単一文の文字起こしを実現します。