short-video-generator-AI - 把 YouTube 长视频自动剪成竖屏短片的开源工具
short-video-generator-AI 是维护者 yukitorido 发布的开源项目,目标是把 YouTube 长视频自动处理成可直接发布的 9:16 竖屏短片。据项目自述,它集成了高光片段检测、字幕转写、翻译与配音等环节,并提供 CLI、本地网页界面和 API 三种入口。项目采用 MIT 许可证,截至 2026-09-26 星标数为 714,尚无正式 release。
short-video-generator-AI 是一个开源项目,目标是把 YouTube 长视频自动处理成可以直接发布的竖屏短片。按照项目自述,它面向的是希望免费获得短视频剪辑能力的内容创作者,作为对 OpusClip、Vidyo.ai 这类短视频 SaaS 工具的替代方案,处理结果不带水印,也不需要预先购买剪辑额度。它适合两类人:一类是手里有长视频素材、想批量产出竖屏切片的创作者;另一类是想把「长转短」流程接进自己程序的开发者,因为项目同时提供了命令行、本地网页界面和 API 三种使用方式。
维护者与状态
项目由 yukitorido 维护,仓库地址为 yukitorido/short-video-generator-AI。仓库创建时间为 2026-09-23,最后一次提交同样在 2026-09-23,也就是说这是一个刚刚建立、代码历史还很短的项目。截至 2026-09-26,项目星标数为 714。需要说明的是,项目目前尚无正式 release,仓库里没有发布过带版本号的发行包,使用者只能直接克隆仓库代码运行。
许可证方面,项目采用 MIT 许可证,属于宽松型开源许可,具体条款以仓库中的 LICENSE 文件为准。
主要能力
以下能力均来自项目自述,本文未做实际运行验证。
- 智能高光选取:据项目说明,它会基于一套算法自动找出视频中最具传播潜力的片段,而不是随机截取。
- 便捷输入:粘贴一个 YouTube 链接即可,项目自述对视频长度没有限制,输出为可直接发布的 9:16 竖屏短片;也支持直接传入本地视频文件路径。
- 钩子选项:开启后会在片段开头加入一段由 AI 生成的、与上下文相关的开场钩子,用于抓住观众注意力;也可以通过
--no-hook关闭。 - 网页版本:除命令行外,项目自述还提供一个本地网页界面,可以一次排队处理多个视频,并以可视化方式调整参数。
- API:项目自述可以在自己的项目中通过 API 调用这套生成能力。
- 字幕与翻译、配音:项目在功能列表中提到了字幕、翻译与配音,但 README 的流程说明中只详细描述了转写环节,其余环节的具体实现方式未在素材中展开。
关于处理流程,项目自述分为若干步骤:先从 YouTube 下载源视频或直接使用本地文件;然后用 faster-whisper 在本地生成带时间戳的转写文本,这一步与选择哪家 LLM 无关;接着由所选 LLM 判断视频内容类型(播客、访谈、教程、Vlog 等)与节奏,以便针对不同内容风格调整高光提示词;随后 LLM 依据一套传播性框架扫描转写文本,识别钩子时刻、情绪峰值、观点爆点、反转、冲突、金句、故事高潮、实用价值等要素,输出 0 到 100 分的候选片段排序;再对重叠候选按分数去重,选出前 N 个;最后按指定比例渲染成竖屏短片,并在未设置 --no-hook 时在开头加入 AI 生成的钩子。
使用入口
仓库地址:yukitorido/short-video-generator-AI。
据项目说明,运行前需要满足几个前置条件:Python 3.10 及以上版本;任意一家受支持 LLM 服务的 API key(OpenAI、Gemini 或 MuAPI);以及安装 requirements.txt 中的依赖。
命令行方式的基本流程是:克隆仓库、创建并激活虚拟环境、安装依赖、配置 .env 文件,然后运行主程序。项目给出的基础调用形式如下:
python main.py "https://www.youtube.com/watch?v=video_id"
渲染结果会保存到 output 目录。也可以附加参数,例如指定生成数量、画面比例与分辨率:
python main.py "https://www.youtube.com/watch?v=video_id" \ --n 3 \ --ratio 9:16 \ --resolution 1080
传入本地文件时同样可用,并可强制指定语言:
python main.py "/Users/Admin/Folder/video.mp4" \ --n 4 \ --ratio 9:16 \ --resolution 720 \ --language zh
项目自述的命令行参数包括:--n 控制渲染片段数量,默认 3;--ratio 控制画面比例,默认 9:16,也可用 1:1 等比例;--resolution 控制源视频下载分辨率,可选 360、480、720、1080,默认 720;--language 用于强制指定 Whisper 的语言代码,默认自动识别;--no-hook 用于去掉片段开头的 AI 钩子。
网页版本方面,项目说明需要先运行 python3 server.py 启动后端,再在 web 目录下用 python3 -m http.server 8000 提供前端页面,然后在浏览器中打开对应地址。LLM 服务商与 API key 仍然在 .env 中配置,网页界面只负责视频输入与渲染参数调整。
配置文件中涉及的变量包括 LLM_PROVIDER(可选 openai、gemini、MuAPI)、各服务商对应的 API key 与模型名,以及 Whisper 相关设置 LOCAL_WHISPER_MODEL(tiny、base、small、medium、large-v3)和 LOCAL_WHISPER_DEVICE(auto、cpu、cuda)。项目自述中还提示,Gemini 有免费额度但存在每日限制,OpenAI 与 MuAPI 为付费服务,其中 MuAPI 按使用量计费、无需订阅。
许可与限制
项目采用 MIT 许可证,具体条款以仓库 LICENSE 文件为准。
关于已知限制与适用边界,素材中明确写出的部分包括:运行环境需要 Python 3.10 及以上;必须自备 LLM 服务商的 API key,也就是说高光检测环节依赖外部付费或限额服务,并非完全离线;转写环节使用 faster-whisper 在本地完成,模型大小与运行设备(CPU 或 CUDA)需要使用者自行权衡。项目自述中未给出处理速度、显存占用、并发能力等具体指标,也未列出经过验证的硬件清单,这些信息需要使用者自行在目标环境中确认。
此外,项目创建与最后提交时间均为 2026-09-23,且尚无正式 release,意味着代码可能仍在快速变动,接口与参数存在调整的可能。项目自述欢迎使用者提交 issue 或 fork 仓库用于自己的项目。