Agent Kit - OpenAIが提供するAIエージェント開発ツール
Agent Kitは、OpenAIがリリースした包括的なインテリジェントエージェント開発ツールキットであり、開発者がAIエージェントをプロトタイプから本番環境へと迅速に発展させるのに役立ちます。これには、Agent Builderビジュアルキャンバスツール、...という3つの主要コンポーネントが含まれています。
Agent Kitは、OpenAIがリリースした包括的なインテリジェントエージェント開発ツールキットであり、開発者がAIエージェントをプロトタイプから本番環境へと迅速に発展させるのに役立ちます。これには、Agent Builderビジュアルキャンバスツール、...という3つの主要コンポーネントが含まれています。
Code2Videoは、シンガポール国立大学のShow Labチームが開発したAI搭載の教育ビデオ生成フレームワークです。Pythonコードを使用して高品質の教育ビデオを自動生成します。その中核となるイノベーションは、3つのエージェントによる協調モデルにあります。プランナーは、...
SceneGenは、上海交通大学の研究チームによって開発された、高効率なオープンソースの3Dシーン生成フレームワークです。単一のシーン画像とその対応するオブジェクトセグメンテーションマスクから、単一の順伝播によって完全な幾何学的構造を持つシーンを直接生成できます。
DeepScientistは、ウェストレイク大学をはじめとする複数の機関が提案する自律型研究システムであり、仮説生成から実験検証、結果分析、論文執筆に至るまでの研究プロセス全体を自動化します。マルチエージェントアーキテクチャと強化学習戦略を通じて、...
Ling-1Tは、Ant Groupがオープンソース化した1兆パラメータの言語モデルであり、「フラッグシップの非思考モデル」として位置づけられています。MoE(Mixture of Experts)アーキテクチャに基づいており、1兆パラメータを誇り、推論ごとに約510億パラメータをアクティブ化します。
Gemini 2.5 Computer Useは、Google DeepMindが発表したGemini 2.5をベースとしたコンピュータ利用モデルです。このモデルにより、AIがブラウザを直接制御し、クリック、スクロール、タイピングなどの操作を実行できます。
OpenAgentsは、AIエージェントネットワークを構築するためのオープンソースフレームワークであり、エージェントをネットワークに接続してオープンなコラボレーションを実現します。永続的なエージェントネットワークを構築することで、このフレームワークはエージェントが長期間オンライン状態を維持し、人間のように互いにコラボレーションすることを可能にします。
Imagine v0.9は、xAIが開発した最新の動画生成モデルです。このモデルは、モーションコントロール、ダイナミックなカメラ効果、自然な会話の追加などの機能をサポートし、約6秒の動画を20秒以内に生成できます。また、音声優先処理機能も搭載しています。
Androidifyは、開発者がAndroid上でAI駆動型アプリケーションを構築する方法を学ぶのに役立つ、Googleが立ち上げたオープンソースプロジェクトです。このプロジェクトは、Jetpack ComposeやGemini API(...
Jamba Reasoning 3Bは、AI21 Labsが開発した軽量かつ効率的な推論モデルで、30億個のパラメータと256Kという超長コンテキスト処理能力を誇ります。このモデルは、TransformerとMambaを組み合わせたハイブリッドアーキテクチャを採用し、アテンション機構と連携しています。
UserLM-8bは、マイクロソフトが導入したユーザー言語モデルであり、一般的な「アシスタント」の役割ではなく、シミュレーション会話における「ユーザー」の役割のために特別に設計されています。
KAT-Dev-72B-Expは、Kuaishouが開発したオープンソースの大規模プログラミング言語モデルで、720億個のパラメータを持ちます。これは、ソフトウェアエンジニアリングのタスク向けに特別に設計された、KAT-Coderの強化学習版です。
Paper2Videoは、シンガポール国立大学のShow Labが開発したプロジェクトで、学術論文からプレゼンテーション動画を自動生成します。PaperTalkerマルチエージェントフレームワークを使用し、スライド、字幕、音声、プレゼンテーションなどを含むプレゼンテーションへと論文を変換します。
NeuTTS Airは、Neuphonicが開発した、非常にリアルなオフライン対応のTTS(テキスト読み上げ)モデルです。非常にリアルな音声合成機能を誇り、実際の音声とほとんど区別がつかないほど自然で流暢な音声を生成します。ローカルでの動作をサポートし、…
MineContextは、ByteDanceが開発したオープンソースのプロアクティブ型コンテキスト認識AIツールです。ユーザーのデジタルライフにおける「ブロック」を明らかにすることで、知識や情報を効率的に管理できるよう支援します。5秒ごとにスクリーンショットをキャプチャし、処理した後、バッチ処理を行います。
LLaVA-OneVision-1.5は、効率的なトレーニングと高品質のデータによって、高性能、低コスト、高い再現性を実現するオープンソースのマルチモーダルモデルです。視覚エンコーダーとして独自開発のRICE-ViTを採用し、2D回転位置と組み合わせることで、...
SAIL-VL2は、Douyinチームとシンガポール国立大学が共同開発したオープンソースの視覚言語モデルで、マルチモーダルな理解と推論に重点を置いています。視覚エンコーダSAIL-ViT、視覚言語アダプタ、大規模言語モデルで構成されています。
nanochatは、AI専門家のAndrej Karpathy氏が公開したオープンソースプロジェクトです。非常に低コストかつ高効率で小型言語モデルを学習させ、ChatGPTと同様の会話機能を実現します。費用は約100ドル(H100 GPUを8基使用した場合)です。
Get Jobsは、オープンソースの自動履歴書提出ツールで、ユーザーが複数の採用プラットフォーム(Boss Zhipin、Liepin、Lagou、51job、Zhaopinなど)に効率的に履歴書を提出できるよう支援します。
SongBloomは、Tencent AI Labが開発したフルレングスの楽曲生成フレームワークです。自己回帰スケッチングと拡散ベースの洗練技術を組み合わせ、インターリーブ生成パラダイムを通じて意味コンテンツを交互に生成します。
MAI-Image-1は、マイクロソフトが独自開発した初の画像生成AIモデルです。「クリエイター重視」の設計思想に基づき、自然光の効果をリアルに再現し、雷や風景などの複雑なシーン画像を生成することに優れています。他のAIと比較すると…
Youtu-Embeddingは、Tencent YouTu Labsが開発したオープンソースのエンタープライズグレードのテキスト表現モデルです。大規模なコーパスで学習され、革新的なファインチューニングフレームワークを使用しているため、強力な意味理解能力を備え、テキスト処理に最適です。
Kandinsky 5.0は、ロシアのAI研究機関AI-Foreverが開発したテキストから動画への生成モデルで、強力な生成機能と高いパフォーマンスを誇ります。コアバージョンであるKandinsky 5.0 Video Liteは…
FS-DFM(Few-Step Discrete Flow-Matching)は、Appleがオハイオ州立大学と共同で開発した、長文テキストを迅速に生成するための拡散言語モデルです。