Nemotron-Labs-TwoTower - NVIDIAのオープンソースデュアルタワーアーキテクチャ普及言語モデル
NVIDIA Nemotron-Labs-TwoTowerは、NVIDIAが開発したオープンソースのデュアルタワーアーキテクチャ拡散言語モデルで、合計約60バイトのパラメータと3バイトのアクティブパラメータを備えています。このモデルは、コンテキスト理解とノイズ除去生成を2つの独立したタワーに分離し、ARコンテキストを固定します。
NVIDIA Nemotron-Labs-TwoTowerは、NVIDIAが開発したオープンソースのデュアルタワーアーキテクチャ拡散言語モデルで、合計約60バイトのパラメータと3バイトのアクティブパラメータを備えています。このモデルは、コンテキスト理解とノイズ除去生成を2つの独立したタワーに分離し、ARコンテキストを固定します。
LiveWorldは、アデレード大学、オーストラリア国立大学、その他の機関が共同開発した生成型ビデオワールドモデルです。その中核機能は、視野外ダイナミクスの問題を解決することです。従来のモデルでは、オブジェクトがカメラの視野から外れると、その状態が固定されてしまいます。
Miraworkは、macOS、Windows、Linuxに対応した、セキュリティを最優先とするデスクトップAIオフィスアシスタントです。ユーザーは自然言語でタスクを発行し、Miraworkは要件を自動的に分解し、組み込みのスキルチェーンを呼び出して実行を完了します。ドキュメントの処理も含まれています。
Nano Banana 2 Liteは、Googleが開発した軽量AI画像生成モデルです。ローカライズを優先した高速化バージョンで、1枚の画像を4秒で生成でき、価格は1,000枚あたりわずか0.034ドルです。
LocateAnythingは、NVIDIAが開発したビジュアル言語ローカライズモデルです。並列バウンディングボックスデコード技術に基づいており、自然言語を入力することで画像内のターゲットを正確に選択できます。このモデルは、マルチターゲット検出、GUIローカライズ、OCRテキスト検出などをサポートしています。
Claude Sonnet 5は、Anthropic社が発表したSonnetシリーズの中で最も高性能なエージェントモデルであり、計画の作成、ブラウザや端末などのツールの呼び出し、自律的な動作をサポートしています。
yuxinlu1 Gemma4-12Bは、Google Gemma 4 12B命令モデルをベースに、個人開発者であるLu Yu氏が開発したオープンソースのプログラミングおよびエージェントモデルシリーズです。V1コードバージョンとV2エージェントバージョンが含まれています。
RedKnotは、Xiaohongshuが開発したオープンソースの長文テキストLLM推論高速化エンジンです。アテンションヘッダーの次元に基づいてKVキャッシュを分離し、オフラインでグローバルに再計算が必要なグローバルヘッダーとローカルで再利用できるローカルヘッダーに分類します。SegPagedAttenと組み合わせることで、...
Huya VAM 1.0(Vivid Avatar Model)は、HuyaがDiTアーキテクチャに基づいて開発した、リアルタイムのマルチモーダルデジタルヒューマン基本モデルです。1枚の写真から、話したり、歌ったり、踊ったりできるAIデジタルヒューマンを生成できます。
Wan-Streamerは、Alibaba DAMO Academyが開発したオープンソースのエンドツーエンド、リアルタイム、全二重、マルチモーダルな基盤モデルです。テキスト、音声、動画の入力トークンと出力トークンを、統一された因果的Transformerアーキテクチャを通じて単一の因果シーケンスに統合します。
LongCat-2.0は、美団がオープンソース化した大規模な文法モデルであり、パラメータの総数は1兆6000億個に及ぶ。各トークンは約480億個のパラメータを有効化し、トレーニングと展開はAI ASICスーパーコンピューティングクラスタに基づいて行われる。
VibeThinker-3Bは、Sina Weiboチームがオープンソース化した、30億個のパラメータを持つ推論モデルです。Qwen2.5-Coder-3Bをベースに構築されており、改良されたスペクトル・信号変換後処理を採用することで、検証可能な数学的およびプログラミング的タスクにおいて優れた性能を発揮します。
Agent-Reachは、無料のオープンソースAIエージェント向けインターネット機能構築ツールです。このツールを使えば、Claude Code、Cursor、OpenClawといった主要なエージェントに、たった1つのコマンドでインターネット接続機能をインストールでき、Twitterにも対応しています。
BrowserBCは、Einsia AI傘下のNavers Labがリリースしたオープンソースプロジェクトです。その主な目的は、ブラウザ上での人間の操作を再利用可能な自然言語スキルに変換し、Webエージェントが様々な課題を克服できるようにすることです。
FastContextは、Microsoftがオープンソース化した軽量なコードリポジトリ探索モデルで、プログラミングエージェント向けに特化して設計されています。このモデルは、リポジトリの閲覧とタスクの解決を分離しており、メインエージェントは自然言語クエリを介してFastContextにタスクを委任します。
Krea 2は、Krea AIがゼロからトレーニングした初のベース画像生成モデルであり、「美的感覚を最優先する」クリエイティブ・コラボレーターとして位置づけられています。単にキーワードを洗練させるのではなく、視覚的な美的一貫性、スタイルの伝達、そしてクリエイティブなコントロールに重点を置いています。
HTML Anythingは、nexu-ioチームが開発したエージェント時代向けのオープンソースHTMLエディタです。雑誌、プレゼンテーション、ポスター、小紅書カードなど9種類の配信形式に対応した75種類のスキルテンプレートが内蔵されており、ローカルの18歳以上向けコンテンツを自動的に認識できます。
DSparkは、DeepSeekが北京大学と共同開発したオープンソースの投機的デコーディング高速化フレームワークです。大規模モデルの低速かつ漸進的な自己回帰生成という課題に特化して取り組んでいます。半自己回帰生成アーキテクチャを採用し、軽量なマルコフヘッダーを利用しています。
Penpotは、SVG、CSS、HTMLなどのオープンスタンダードに基づいて構築されたオープンソースのデザインおよびコードコラボレーションプラットフォームです。ブラウザ内でUIデザインやインタラクティブなプロトタイピングを可能にします。このプラットフォームは、リアルタイムのマルチユーザーコラボレーション、W3C Design Tokなどをサポートしています。
GPT-5.6はOpenAIの最新世代の大規模言語モデルであり、米国政府の規制要件のため、現在は限られた信頼できるパートナーのみに「限定プレビュー」形式で提供されています。このシリーズは、天文学的な命名システムを採用した最初のモデルであり、3つの階層を提供します...
PhoneBuddyは、テンセントのHunyuanチームが開発したオープンソースの4Bパラメータモバイルエージェントモデルです。その中核となる研究は、現実世界のモバイル環境で実用的なAIエージェントを訓練する方法に焦点を当てています。
Mistral OCR 4は、Mistral AIが開発した最新世代の文書理解モデルです。このモデルは、PDF、画像、プレゼンテーションなどの複雑な文書からテキストを抽出することをサポートしており、境界ボックスの位置特定、領域タイプの分類、信頼度スコアなどを返すことができます。
SkillOptは、Microsoftが提供するオープンソースのエージェントベースのスキル文書最適化ツールです。このツールは、テキスト空間に深層学習の学習ロジックを導入し、skill.mdを学習可能なパラメータとして扱い、軌跡分析によって編集方向を生成し、テキスト学習率でそれらを制約します。
Confucius4-TTSは、NetEase Youdaoが開発したオープンソースの13億パラメータ多言語音声合成エンジンです。このモデルは、参照テキストを必要とせず、わずか3秒の参照音声のみを使用してサンプル数ゼロの音声を複製でき、中国語、英語、日本語、韓国語など14言語のクロス言語処理をサポートしています。