project
AI-Media2Doc - オープンソースのAI搭載テキスト・画像作成アシスタント。音声や動画コンテンツをワンクリックでドキュメントに変換します。
AI-Media2Docは、オープンソースの音声・動画からドキュメントへの変換ツールです。AI大規模モデル技術に基づき、音声・動画コンテンツを小紅書ノート、WeChat公式アカウント記事、知識ノート、マインドマップ、動画字幕など、さまざまなドキュメント形式にインテリジェントに変換します。
AI-Media2Docとは何ですか?
AI-Media2Docは、オープンソースの音声・動画からドキュメントへの変換ツールです。AI大規模モデル技術に基づき、音声・動画コンテンツを小紅書ノート、WeChat公式アカウント記事、知識ノート、マインドマップ、動画字幕など、さまざまなドキュメント形式にインテリジェントに変換します。このツールは純粋なフロントエンド処理をサポートしており、ローカルでのffmpegのインストールは不要です。また、タスク記録はローカルに保存されるため、ユーザーデータのセキュリティが確保されます。AI-Media2Docは、コンテンツクリエイター、学生、研究者など、さまざまなユーザーに適しており、情報の効率的な抽出と整理を支援します。
AI-Media2Docの主な機能
- 音声/動画からドキュメントへの変換音声や動画コンテンツを、小紅書メモ、WeChat公式アカウント記事、知識メモ、マインドマップ、動画字幕など、さまざまなドキュメント形式にワンクリックで変換できます。
- AIインテリジェント処理大規模モデル技術に基づき、コンテンツの要約や多様なスタイルの文書生成を可能にし、動画コンテンツに基づいたAIによる質問応答や二次対話もサポートします。
- 純粋なフロントエンド処理ffmpeg wasm技術に基づいているため、ffmpegのローカルインストールは不要で、ブラウザ上での直接処理をサポートしています。
- プライバシー保護ログインや登録は不要です。タスク記録はローカルに保存されるため、ユーザーデータのセキュリティが確保されます。
- ローカル展開Dockerをベースとしたローカル操作とワンクリックデプロイをサポートしているため、ユーザーはローカル環境で便利に利用できます。
- 複数のエクスポート形式生成されたドキュメントやマインドマップは、サードパーティのプラットフォームにエクスポートして、さらに編集したり共有したりできます。
AI-Media2Docの使い方
- ローカル展開:
- プロジェクトコードのクローン作成ターミナルまたはコマンドラインツールを開き、以下のコマンドを実行してプロジェクトコードをクローンします。
git clone https://github.com/hanshuaikang/AI-Media2Doc.git
cd AI-Media2Doc
-
- Pythonの依存関係(バックエンド)をインストールします。プロジェクトに必要な Python の依存関係をインストールします。
pip install
-r backend/requirements.txt
-
- 環境変数を設定するバックエンドディレクトリに.envファイルを作成し、APIキーを入力してください。
OPENAI_API_KEY=your_openai_api_key
GROK_API_KEY=your_grok_api_key
DEEPSEEK_API_KEY=your_deepseek_api_key
-
- FastAPIサービスを開始しますバックエンドサービスを開始します。
uvicorn backend.main:app --reload
-
- フロントエンドの依存関係をインストールし、サービスを開始します。フロントエンドの依存関係をインストールし、フロントエンドサービスを開始します。
cd frontend
npm
install
npm run serve
-
- ローカルサーバーにアクセス使用を開始するには、ブラウザを開いて http://localhost:8080 にアクセスしてください。
- 使用方法:
- 新しいタスクを作成するページ上で新しいタスクを作成するか、音声ファイルまたは動画ファイルをアップロードするか、外部リンクのアドレスを入力してください。
- 出力スタイルを選択してください小紅書、WeChat公式アカウント、知識ノート、マインドマップなど、希望するドキュメントスタイルを選択してください。
- 画像とテキストを生成する「生成」ボタンをクリックすると、システムが音声および動画コンテンツを自動的に処理し、対応するドキュメントを生成します。
- 2番目の対話画面右側に質問(例えば「この動画の主な内容は?」)を入力すると、AIが内容に基づいて回答します。
- 結果のエクスポート生成されたドキュメントやマインドマップは、MubuやProcessOnなどのサードパーティプラットフォームにエクスポートして、さらに編集や利用を行うことができます。
AI-Media2Docプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/hanshuaikang/AI-Media2Doc
AI-Media2Docの応用シナリオ
- 学生の学習オンラインコースのノートやマインドマップを抽出して、簡単に復習できるようにしましょう。
- 教師の授業準備動画を授業計画に変換することで、コースコンテンツを素早く整理できます。
- セルフメディア制作動画を分解して画像、テキスト、スクリプト、脚本などを生成し、創造的なインスピレーションを提供する。
- 知識管理動画を構造化されたノートに変換することで、管理や復習が容易になります。
- コンテンツ作成コンテンツ制作の効率を高めるために、動画をWeChat公式アカウントまたは小紅書(Xiaohongshu)に共有してください。