PokeClaw - オープンソースで、完全ローカル、オフラインで動作するモバイルAIエージェントアプリケーション。
PokeClaw(正式名称:PocketClaw)は、Nicole氏が独自に開発したオープンソースのAndroid AI自動化アプリケーションです。Google Gemma 4モジュールをベースに、完全なローカルオフライン動作を実現した初のモバイルAIエージェントです。
PokeClaw(正式名称:PocketClaw)は、Nicole氏が独自に開発したオープンソースのAndroid AI自動化アプリケーションです。Google Gemma 4モジュールをベースに、完全なローカルオフライン動作を実現した初のモバイルAIエージェントです。
LPM 1.0(Large Performance Model)は、Anuttacon(蔡浩宇AI社)が発表した17Bパラメータのビデオキャラクターパフォーマンス生成モデルで、リアルタイムの全二重音声およびビデオ対話に対応しています。
FIPO(Future-KL Influenced Policy Optimization)は、Alibaba Tongyi Labsが開発した強化学習アルゴリズムです。Future-KLメカニズムを通じて各トークンが後続の推論軌跡に与える影響を定量化し、トークン...
claude-code-best-practiceは、Claude Codeを使用するためのオープンソースの体系的なガイドです。このプロジェクトは、「claudeプログラミング」から「エージェントエンジニアリング」へと進み、エージェント、コマンド、スキッドなどに関する86以上の実践的なヒントが含まれています。
MiniMax Music 2.6は、MiniMaxによる全く新しいAI音楽生成モデルであり、基盤となるアーキテクチャからクリエイティブな体験まで、包括的な進化を遂げています。このバージョンでは、初期パッケージのレイテンシを20秒未満に短縮し、「ブラインドボックス」ダウンロードの問題点を根本的に解決し、さらに…
VimRAGは、アリババ傘下のTongyi Labsが開発したオープンソースのフルモーダルRAGフレームワークで、テキスト、グラフ、ビデオの混合知識ベースをサポートしています。このフレームワークは、線形コンテキストの代わりにマルチモーダルメモリグラフ(DAG)を革新的に使用し、推論を動的な有向非巡回グラフとしてモデル化することで、パスファインディングを実現しています。
GO-2(Genie Operator-2)は、Zhiyuan Roboticsが発表した第2世代の具現化型インテリジェンスプラットフォームモデルです。「理解-計画-実行」プロセスを効率化することで、意味と行動の間のギャップを埋めます。このモデルは、直接的に「行動-思考連鎖」を先駆的に導入しました。
OmniVoiceは、Xiaomi AI Labsの次世代Kaldiチームがオープンソース化した、大規模な多言語TTSモデルです。600以上の言語でゼロショット音声クローニングをサポートしています。このモデルは、最小限の非自己回帰拡散アーキテクチャと、フルコードブックランダム化マスキングを組み合わせています。
CutClawは、グレーターベイエリア大学のGVCラボと北京交通大学のチームが開発したオープンソースのAIビデオ編集ツールです。このツールはマルチエージェントアーキテクチャを採用し、「音楽主導型」のアプローチを用いて、数時間にも及ぶ動画を短く、リズミカルに正確なクリップに自動的に編集します。
Muse Sparkは、Meta AI Labsが発表した初のネイティブマルチモーダル大規模モデルです。Meta AIの再編における主力製品として、このモデルは人工知能分析ベンチマークで18ポイントから52ポイントに飛躍的に向上し、そのマルチモーダル性能を実証しました。
MMX-CLIは、MiniMaxがAIエージェント向けに開発したフルモーダルなコマンドラインツールで、テキスト、画像、動画、音声、音楽生成、視覚理解などの機能をサポートしています。エージェントは、Claude Code、OpenClawなどと連携して使用できます。
ListenHub CLIは、Node.jsをベースにした、AIコンテンツ作成のためのオープンソースのコマンドラインツールです。ターミナル上でワンクリックで音楽、ポッドキャスト、PPT、音声、AI描画を生成できます。このツールは、ローカルファイルのアップロード、JSON出力、非同期モードをサポートしています。
Seeduplexは、ByteDanceのSeedチームが開発したネイティブの全二重音声モデルで、同時音声認識によるリアルタイムの対話を可能にします。このモデルは、ノイズの多い環境下でも、高精度な干渉防止機能(誤割り込み率を50%削減)と動的な停止検出機能(割り込み率を40%削減)を備えています。
HappyHorseは、突如として人工分析動画生成ブラインドテストのリーダーボードのトップに現れた謎のAIモデルであり、Eloスコア1347でSeedance 2.0を大きく引き離し、テキスト生成動画と画像生成動画の両方で優勝を果たした。
LifeSimは、復旦大学と上海創新起研究所が共同開発した、パーソナライズされたAIアシスタントを評価するための初の長期ユーザーライフシミュレーションフレームワークです。このフレームワークはBDI認知モデルに基づいており、ユーザーの内的認知(信念、欲求、意図)もモデル化しています。
Anthropic社の最新AIモデルであるClaude Mythosは、プログラミングやサイバーセキュリティなどの分野で、前モデルのOpus 4.6をはるかに凌駕しています。このモデルは、ゼロデイ脆弱性を自律的に発見し、複雑な攻撃チェーンを構築することができ、運用痕跡を隠蔽する能力も実証しています。
PixVerse C1は、PixVerse Technologyが発売した世界初の大型ビデオモデルで、テキストベース、画像ベース、リファレンスベース、および最初/最後のフレームのビデオ生成をサポートし、最大15秒間の1080P同期音声・映像を出力できます。このモデルは、革新的なマルチグリッドインテリジェントストーリーボード機能を備えています。
GLM-5.1は、Zhipuが発表した世界で最も強力なオープンソースモデルであり、8時間にも及ぶ長時間のタスクを実行できます。そのモデルコードの性能は、SWE-Bench Proベンチマークテストで世界第1位にランクされ、GPT-5.4とClaude Opus 4.6を凌駕しています。GLM-5.1は…
OpenHarnessは、香港大学のデータインテリジェンス研究所(HKUDS)がオープンソース化した軽量AIエージェントフレームワークです。完全にPythonで実装されており、わずか11,733行のコード(Claude Codeの44分の1のサイズ)で構成され、…
LLM Wikiは、Karpathyが立ち上げた自己運用型の個人知識ベースであり、クエリごとにデータをゼロから取得する従来のRAGの限界を打破します。LLM Wikiは、スキーマファイルを通じて構造化されたMarkdown Wikiを積極的に維持し、元のデータを変換することで、LLMをガイドします。
EmDashはCloudflareが開発したAIネイティブのコンテンツ管理システムで、WordPressの後継として位置づけられています。EmDashはTypeScriptとサーバーレスアーキテクチャを採用し、AIエージェントによるウェブサイトの直接操作をサポートし、データ処理には構造化されたJSONを使用します。
OmniWeavingは、浙江大学、テンセント渾源、南洋理工大学が共同開発した統合ビデオ生成フレームワークです。このフレームワークは、従来のオープンソースモデルの単一タスクの制約を打破し、マルチモーダルデータの自由な組み合わせと高度な推論生成を可能にし、インターリーブされた...
MAI-Transcribe-1は、Microsoft Azure AI Foundryが開発したエンタープライズグレードの音声認識モデルです。中国語、英語、日本語、フランス語を含む25言語に対応しており、FLEURSベンチマークテストではWhisper-large-v3を上回る性能を発揮します。
Wan2.7-Videoは、アリババ傘下のTongyi Labが開発したAI動画作成モデルで、テキスト、画像、動画、音声など、あらゆる形式の入力に対応しています。このモデルは従来の動画生成の制約を打ち破り、写真編集のように動画のローカル編集を可能にします。