Uni-1.1 - Luma AIによる新世代画像生成モデル
Uni-1.1は、Luma AIが発表した新世代の画像生成モデルおよびAPIサービスです。デコーダーのみの自己回帰型Transformerアーキテクチャを採用し、テキスト推論とピクセル生成を統合した単一のプロセスを実現しています。
Uni-1.1は、Luma AIが発表した新世代の画像生成モデルおよびAPIサービスです。デコーダーのみの自己回帰型Transformerアーキテクチャを採用し、テキスト推論とピクセル生成を統合した単一のプロセスを実現しています。
DeepSeek-TUIは、Hayden Brown氏がRustを用いて開発した、完全にターミナルベースのプログラミングエージェントです。特にDeepSeek V4シリーズモデル(deepseek-v4-pro / deepseek-v4-flash)とのネイティブな使用を想定して設計されています。
GPT-5.5 Instantは、OpenAIがリリースしたChatGPTの次世代デフォルトモデルであり、GPT-5.3 Instantに代わるもので、すべてのユーザーが無料で利用できます。このモデルは、GPT-5.5の基本的な知能と迅速な応答性を兼ね備え、高リスク領域における誤認識を52%削減します。
OpenWhipは、Electronをベースにしたオープンソースのデスクトップユーティリティで、Claude Codeユーザー向けに特別に設計されています。AIが無限ループに陥ったり、同じコード行を繰り返し変更したり、長時間応答しなくなったりした場合、ユーザーはシステムトレイの鞭アイコンをクリックすることで対処できます。
Cube Sandboxは、Tencent Cloudが提供するオープンソースのAIエージェントサンドボックス実行環境プラットフォームで、RustVMMとKVMを基盤としており、ハードウェアレベルのセキュリティ分離とミリ秒以下の起動速度の両方を提供します。各エージェントは独立したカーネルで実行されます。
OfficeCLIは、iOfficeAIチームによって開発された、AIエージェント向けに特別に設計された世界初のオープンソースのコマンドライン型Officeスイートです。たった1行のコードで、あらゆるAIエージェントがWord、Excel、PowerPointを完全に制御できるようになります。
Career-Opsは、Claude Codeをベースに構築されたオープンソースのAI駆動型求人検索システムです。従来の「大量応募ツール」とは異なり、構造化された評価を用いて、求職者が膨大な求人の中から真に価値のある候補者を見つけ出すためのインテリジェントなフィルターです。
Flipbookは、元OpenAIエンジニアのZain Shah氏とYC出身者チームによって開発された、AI搭載の無限ビジュアルブラウザです。すべてのページはリアルタイムでオンデマンドで生成されます。FlipbookはHTML、CSS、JavaScriptを一切使用していません。
gnhf(Good Night, Have Funの略)は、オープンソースのAIエージェント自動オーケストレーターです。その核となるコンセプトは、開発者が就寝前にAIの目標を設定し、開発者が休息している間もAIが継続的に反復作業を行うことを可能にすることです。一度に実行できるタスクは1つだけです。
LongCat-2.0-Previewは、美団が発表した1兆パラメータ規模の大規模モデルのプレビュー版です。MoEアーキテクチャを採用し、合計1.6T個のパラメータと約48B個の活性化パラメータを持ち、1Mの超長文コンテキストをサポートしています。
Vibe-Tradingは、香港大学データサイエンスラボ(HKUDS)が開発した、オープンソースのAI駆動型マルチエージェント金融ワークスペースです。自然言語による指示を実行可能な取引戦略、調査結果、ポートフォリオ分析に変換します。このプロジェクトは、A...
Qwen-Scopeは、アリババ同義千文チームが開発した、解釈可能な大規模モデルのためのオープンソースツールキットです。スパースオートエンコーダー(SAE)技術に基づき、Qwen3/Qwen3.5シリーズモデルの隠れ層から解釈可能な特徴量を抽出します。
MindDR 1.5は、Li Auto Information Agent Teamが開発したマルチエージェント深層学習フレームワークです。わずか約300億個のパラメータで、DeepResearch Benchにおいて52.54というスコアを達成し、業界トップレベルに達しました。
Hy-MT1.5-1.8B-1.25bitは、TencentのHunyuanチームが開発した、モバイルデバイス向けの超量子化・圧縮オフライン翻訳モデルです。このモデルは、Hunyuan翻訳モデルHy-MT1.5-1.8B(18億パラメータ)をベースに、革新的なShear...技術を採用しています。
FlashQLAは、TileLangをベースとした高性能な線形アテンション演算子ライブラリであり、Tongyi Labsによってオープンソース化されています。FlashQLAは、演算子融合、ゲート駆動型カード内シーケンス並列処理、およびHopにおけるWarp特化型最適化によって高いパフォーマンスを実現しています。
Ling-2.6-1Tは、InclusionAIの最新のオープンソース主力モデルで、数兆個のパラメータを持ち、エージェント、コーディング、複雑なワークフロー向けに特別に設計されています。このモデルは、MLAと線形アテンションのハイブリッドフレームワークを採用しています。
One-Evalは、北京大学のOpenDCAIチームによって開発された、オープンソースのエージェント駆動型大規模モデル評価フレームワークです。DataFlowとLangGraphを基盤としており、NL2Eval(自然言語から評価へ)機能に重点を置いています。
Step Image Edit 2は、StepStarが開発した新世代の軽量画像生成・編集モデルです。わずか35億個のパラメータで、120億~200億個のパラメータを持つ大規模なオープンソースモデルを実用面で凌駕します。このモデルは、1回の処理で0.5~2秒で画像を生成します。
Spark X2-Flashは、iFlytekがリリースしたMoEアーキテクチャに基づく大規模言語モデルです。パラメータ数は合計300億個、25万6千語の超長文コンテキストをサポートし、Huawei Ascend 910Bをベースとした国内のコンピューティング能力クラスタで学習されています。
SenseNova U1は、SenseTimeがNEO-Unifyアーキテクチャに基づいて開発したネイティブな統合マルチモーダルモデルであり、単一のアーキテクチャ内で理解、推論、生成を実現します。このモデルは、従来のビジュアルエンコーダーやVAEを廃止し、統一された表現空間を構築します。
Nemotron 3 Nano Omniは、NVIDIA Nemotron 3モデルファミリーの一部であり、エージェントシステム向けに特別に設計されたオープンソースの高効率マルチモーダル推論モデルです。このモデルは、30B-A3BハイブリッドMoEアーキテクチャを採用し、視覚、音声、テキストを統合しています。
Agent Skillsは、GoogleのGeminiチームの責任者であるAddy Osmani氏によって開発されたオープンソースのAIプログラミングエージェントスキルセットです。Agent Skillsは、Googleのシニアエンジニアのワークフローとエンジニアリング標準を20のスキルにカプセル化しています。
EAPOは、アリババ同義研究所が開発した長文推論強化学習フレームワークです。「証拠報酬」メカニズムを導入することで、監視信号が最終的な解答から証拠抽出プロセスへと移行します。
Tolariaは、AI時代に向けたオープンソースのローカルノート作成ツールです。Refactoringの著者であるLucaが、5年間のフルタイムの執筆経験と9000以上のノート管理の経験に基づいて作成しました。このツールは、Notionのブロック編集機能とObsi...