GroqのMathtutorは、音声による数学の質問をサポートする、AI搭載の数学個別指導ツールです。
GroqのMathtutorは、Groqアーキテクチャに基づいて構築されたAI搭載の数学個別指導ツールです。音声認識に基づいており、ユーザーは音声で数学の質問をすることができます。このツールには、リアルタイム計算やLaTeXの使用が可能な強力な数学エンジンが内蔵されています。
GroqのMathtutorは、Groqアーキテクチャに基づいて構築されたAI搭載の数学個別指導ツールです。音声認識に基づいており、ユーザーは音声で数学の質問をすることができます。このツールには、リアルタイム計算やLaTeXの使用が可能な強力な数学エンジンが内蔵されています。
北京大学のMMCAL研究チームが最近発表したVE-Benchは、動画編集の品質評価のために特別に設計された初の指標です。VE-Benchは人間の知覚に非常に近いように設計されており、動画編集の効果をより正確に評価できます。
EDTalkは、上海交通大学とNetEaseが共同開発した音声駆動型リップシンクモデルで、唇の動き、頭の姿勢、感情表現を個別に制御できます。画像、音声クリップ、参考動画をアップロードするだけで、EDTalkが動作します。
Video-analyzerは、Llamaの11BビジョンモデルとOpenAIのWhisperモデルを組み合わせたオープンソースのビデオ分析ツールで、ビデオからキーフレームを抽出し、音声コンテンツを文字起こしし、詳細なビデオ説明を生成します。このツールは、完全な...
SPARは、Zhipuチームが開発した自己再生型フレームワークであり、大規模言語モデルが指示に従う能力を向上させます。このフレームワークは、内部ジェネレーターとパーフェクターという2つの役割の相互作用に基づいています。ジェネレーターは指示を実行して応答を生成し、パーフェクターは…
LowCodeEngineは、アリババが提供するオープンソースのローコード開発フレームワークです。シンプルなドラッグ&ドロップと設定方法に基づいており、開発者は複雑なシステムページを迅速に構築できます。このフレームワークは、強力なカスタマイズ機能、洗練された開発体験、そして豊富な機能を誇ります。
Qwen-Agentは、Qwenモデルに基づいたオープンソースのエージェント開発フレームワークです。Qwenモデルの命令追従、ツール使用、プランニング、メモリ機能を活用して、インテリジェントなエージェントアプリケーションを構築する際に開発者をサポートします。Qwen-Agentは、以下の機能をサポートしています。
Mind GPT-3oは、Li Autoが開発したマルチモーダルなエンドツーエンドの大規模モデルであり、音声、画像、言語理解技術を統合して効率的なリアルタイム対話を実現します。Mind GPT-3oは、記憶力、計画力、ツール使用能力、表現力を備えており、…
Langyaは、中国科学院海洋研究所が独自に開発した次世代大規模海洋人工知能モデルのバージョン1.0であり、海洋状態変数の予測に重点を置いています。このモデルは、高度な人工知能アルゴリズムと専門的な海洋科学の知識を組み合わせることで、…
DynamicControlは、Tencent YouTuが南洋理工大学や浙江大学などの研究機関と共同で開発した新しいテキストから画像への変換(T2I)タスクフレームワークです。マルチモーダル大規模言語モデル(MLLM)推論機能を統合しています。DynamicControlは…
UCLAとGoogle Researchが共同開発したVideoPhyは、動画生成モデルの物理法則に基づく推論能力を評価する初のベンチマークです。これは、モデルによって生成された動画が現実世界の物理法則に準拠しているかどうかを測定します。VideoPhyベンチマークは…
Large Motion Model (LMM) は、シンガポールの南洋理工大学 S-Lab と SenseTime 研究チームが共同開発した、統合されたマルチモーダルモーション生成モデルです。LMM は、テキストからモーション、音楽からダンスなど、さまざまなモーション生成シナリオに対応できます。
StereoCrafterは、Tencent AI LabとARC Labが共同開発した革新的なフレームワークです。単眼ビデオ(2Dビデオ)を立体視3Dビデオに変換し、3Dコンテンツに対する高まる需要に応えます。StereoCrafterは深度推定に基づいており、...
AgiBot Worldは、Zhiyuan Robotics社が提供する数百万件の実機データを含むオープンソースのデータセットで、身体化された知能の開発促進を目的としています。このデータセットには、家庭、食事、産業など5つの主要シナリオを網羅する80種類以上の日常スキルが含まれています。データの規模と品質は目覚ましいものです。
GraphAgentは、香港大学と香港科技大学(広州)が共同開発したインテリジェントなグラフィカル言語アシスタントです。グラフ接続などの構造化データと、テキストや視覚情報などの非構造化データの両方を現実世界から処理できます。
DeepSeek Engineerは、DeepSeek APIを統合したAIプログラミングアシスタントです。コマンドラインインターフェースにより、ローカルファイルの読み込み、新規ファイルの作成、既存ファイルに対するリアルタイム差分編集が可能です。DeepSeek Engineerは…
Psi R0は、Lingchu Intelligence初の強化学習に基づくエンドツーエンドの具現化モデルです。2つの器用な手の連携によって複雑な操作をサポートし、複数のスキルを連鎖的に組み合わせたトレーニングを行うことで、推論能力を備えたインテリジェントエージェントを生成し、ループを完了して閉じることができます。
FireCrawlは、ウェブデータを抽出してMarkdownなどの構造化データに変換するために特別に設計されたオープンソースのAIウェブクローラーツールです。FireCrawlは強力なクロール機能を備え、動的なウェブページコンテンツの処理をサポートし、インテリジェントなクロールステータス更新を提供します。
VideoVAE+(VideoVAE Plus)は、香港科技大学の研究チームが開発した高度なクロスモーダルビデオ変分オートエンコーダー(Video VAE)です。新しい時空間分離圧縮メカニズムとテキストガイダンスを導入することで、大規模なモーションデータの大幅な圧縮を実現します。
Languineは、開発者がアプリケーション開発プロセスを効率化できるよう支援するAI搭載の翻訳ツールです。インテリジェントな検出、AI翻訳、自動化されたワークフロー、そして開発者に優しい設計に基づき、Languineは翻訳管理を簡素化します。
Figma-Low-Codeは、Luisaフレームワークをベースにしたオープンソースプロジェクトで、開発者がFigmaのデザインをVue.jsアプリケーションに直接変換できるようにします。これにより、デザイナーと開発者間の引き継ぎ時間が大幅に短縮され、フロントエンドのコーディング作業負荷も軽減されます。
AI Dev Galleryは、Microsoftが提供するオープンソースのAIツールキットおよびサンプルライブラリで、Visual Studioに統合されており、Windows開発者がエッジAI機能を簡単に統合できるように支援します。AI Dev Galleryには25以上のインタラクティブなサンプルが用意されています。
OpenEMMAは、テキサスA&M大学、ミシガン大学、トロント大学が共同開発した、自動運転のためのオープンソースのエンドツーエンド・マルチモーダルモデルフレームワークです。事前学習済みの大規模マルチモーダル言語モデル(MLLM)を利用して、視覚データや複雑な運転シナリオを処理します。
RAG Loggerは、Retrieval Enhanced Generation(RAG)アプリケーション向けに特別に設計されたオープンソースのログツールです。LangSmithの軽量な代替ツールとして、RAGアプリケーションのログ記録ニーズを満たすことに重点を置いています。RAG Loggerはクエリと...