Granite 4.0 Tiny Preview - IBMの言語モデル
Granite 4.0 Tiny Preview は、IBM の Granite 4.0 言語モデルファミリーの中で最小のモデルのプレビュー版です。Granite 4.0 Tiny Preview は、非常に高い計算効率とコンパクトなモデル構造を提供し、...
Granite 4.0 Tiny Preview は、IBM の Granite 4.0 言語モデルファミリーの中で最小のモデルのプレビュー版です。Granite 4.0 Tiny Preview は、非常に高い計算効率とコンパクトなモデル構造を提供し、...
Gemini 2.5 Pro(I/Oバージョン)は、GoogleがリリースしたマルチモーダルAIモデルGemini 2.5 Proのアップグレード版であり、具体的にはバージョン番号Gemini 2.5 Pro Preview 05-06に相当します。このモデルは、プログラミング機能において大きな飛躍を遂げました。
VPP(Video Prediction Policy)は、清華大学と興東時代が共同開発した初の大規模AIGCロボットモデルです。事前学習済みの動画拡散モデルに基づき、インターネット上の膨大な動画データから学習し、将来のシーンを直接予測します。
Amazon Nova Premierは、テキスト、画像、動画(音声を除く)の入力を処理できる、Amazonで最も強力なマルチモーダルAIモデルです。深い文脈理解、複数ステップの計画、クロスプラットフォーム処理を必要とするタスクの処理に優れています。
ICEdit(In-Context Edit)は、浙江大学とハーバード大学が共同開発した、命令ベースの画像編集フレームワークです。Massive Diffusion Transformerの強力な生成機能とコンテキスト認識機能を活用しています。
FlexiActは、清華大学とテンセントARCラボが共同開発した革新的な動作転送モデルです。FlexiActは、対象画像が与えられると、空間構造に大きな違いがある状況でも、参照動画から対象人物へ動作を転送することができます。
Klavis AIは、AIアプリケーションが本番環境レベルのMCPサーバーおよびクライアントに迅速に接続できるようにするオープンソースのMCP(マルチモーダル通信プロトコル)統合プラットフォームです。このプラットフォームは、以下の機能を提供します。
Oliは、開発者向けに強力なプログラミング支援を提供するオープンソースのインテリジェントなコードアシスタントです。最新のハイブリッドアーキテクチャに基づいており、Rustバックエンドの高いパフォーマンスとReact/Inkフロントエンドのインタラクティブなターミナルインターフェースを組み合わせています。Oliは複数の言語をサポートしています...
Mistral Medium 3 は、Mistral AI が開発したマルチモーダル言語モデルです。このモデルは、パフォーマンスとコストのバランスが取れており、Claude Sonnet 3.7 モデルのパフォーマンスレベルに匹敵するか、あるいはそれに達する一方で、コストは後者の 1/8 (1 回あたり...) に抑えられています。
Open Computer Agentは、Hugging Faceが提供する無料のクラウドベースのAIエージェントツールです。Linux仮想マシン上で動作し、プリインストールされたプログラム(Firefoxなど)に基づいてユーザーが指定したタスクを実行します。
Absolute Zeroは、清華大学LeapLabチームが北京総合人工知能研究所(NLCo)およびペンシルベニア州立大学と共同で開発した、新しい言語モデル推論トレーニング手法です。Absolute Zeroは、モデルに基づいています...
Avatar IVは、HeyGenが開発した最新のAIデジタルヒューマンモデルで、リアルな動画を素早く作成できます。ユーザーは写真とスクリプトまたは音声クリップをアップロードするだけで、自然で滑らかな動画を生成できます。このモデルは、音声に基づいて顔の表情を捉えるように設計されています。
Insert Anythingは、浙江大学、ハーバード大学、南洋理工大学の研究者らが共同開発した、コンテキスト編集に基づく画像挿入フレームワークです。このフレームワークは、参照画像からターゲットシーンにオブジェクトをシームレスに挿入します。
QLIP(Quantized Language-Image Pretraining)は、NVIDIAなどが開発したビジュアルトークン化手法で、高品質な画像再構成とゼロショット画像理解機能を組み合わせたものです。QLIPのバイナリ球面量子化(BSQ)は…
ZeroSearchは、アリババ傘下のTongyi Labがオープンソース化した革新的な大規模モデル検索エンジンフレームワークです。強化学習を活用することで、実際の検索エンジンと直接やり取りすることなく、大規模モデルの検索能力を向上させます。このフレームワークは、大規模モデルから事前に学習された知識に依存しています。
Chatlogは、WeChat、QQ、Telegramなどの主要なチャットツールからのチャットログを効率的に解析、視覚化、マイニングできるオープンソースのチャットログ分析ツールです。このツールは、ローカルデータベースファイルからのデータ取得をサポートし、インテリジェントな分析機能を提供します。
SuperEditは、ByteDanceのインテリジェントクリエーションチームとセントラルフロリダ大学コンピュータビジョン研究センターが共同開発した、コマンド誘導型画像編集手法です。監視信号を最適化することで、画像編集の精度と効率性を向上させます。SuperEditは…
FlowGramは、ByteDanceが開発したオープンソースのノードベースのビジュアルワークフロー構築エンジンです。開発者は、固定レイアウトまたは自由に接続されたレイアウトでワークフローを迅速に構築できます。2つのレイアウトモードをサポートしており、固定レイアウトはシーケンシャルなワークフローに適しています。
Mogaoは、ByteDanceのSeedチームが開発した本格的なインターリーブ型マルチモーダル生成モデルです。そのアーキテクチャは、変分オートエンコーダー(VAE)とビジュアルトランスフォーマー(ViT)を組み合わせたデュアルビジュアルエンコーダーを採用しており、より優れた視覚理解を可能にします。
Scenethesisは、NVIDIAが開発した、テキストからインタラクティブな3Dシーンを生成するための革新的なフレームワークです。このフレームワークは、大規模言語モデル(LLM)と視覚認識技術を組み合わせ、LLMを用いた多段階プロセスを通じて効率的な生成を実現します。
Seed-Coderは、ByteDanceが開発したオープンソースの8Bスケールコードモデルシリーズで、コード生成と理解能力の向上を目的としています。Base、Instruct、Reasoningの3つのバージョンがあり、それぞれコード補完、命令追跡、複雑な推論に適しています。
カーネギーメロン大学が開発したLegoGPTは、テキストプロンプトに基づいて物理的に安定し、組み立て可能なLEGOブロックモデルを生成するLEGOブロック設計ツールです。LegoGPTは、自己回帰言語モデルと大規模なLEGO設計データに基づいて構築されています。
BILIVEは、AI技術に基づいたオープンソースツールで、Bilibiliのライブ配信の録画と処理に特化して設計されています。このツールは、ライブ配信の自動録画、箇条書きコメントと字幕のレンダリング、音声認識、魅力的なクリップの自動セグメンテーション、興味深いコンテンツの生成などをサポートしています。
LTXV-13Bは、Lightricks社が開発したオープンソースのAI動画生成モデルで、130億ものパラメータを誇ります。生成速度は非常に速く、類似製品の30倍もの速さを誇り、一般的なコンシューマー向けグラフィックカード(例えば4090/5090など)でも動作します。