AB
AiBoss站
教程

Pika

教程

Pika 快速上手:从文本提示到成片的完整操作指南

Pika 是一款在浏览器中运行的 AI 视频生成工具,支持文本生成视频、图片生成视频、局部重绘、口型同步、音效生成与画布扩展等功能。本文按功能模块拆解操作流程,给出每一步的参数设置与提示词写法,并附一个从零到导出的完整示例。

Pika 是一款在浏览器中运行的 AI 视频生成工具,把文本生成视频、图片生成视频、局部重绘、口型同步、音效生成、画布扩展等能力放在同一个工作区里。它的典型用法是:输入一句描述,得到一段短视频,再用内置的编辑工具对画面局部、时长、画幅和声音做二次处理。适合需要快速产出短视频素材的创作者、社媒运营者和做概念验证的设计人员。如果你只是想先看看这个工具能做什么,可以从 Pika 的工具页进入,再对照本文的步骤逐项操作。

需要说明的是,Pika 的功能名称、可用范围、生成时长上限和订阅档位会随时间调整,本文提到的具体数值只作为操作时的参照,实际以官网当前信息为准。

准备工作

Pika 完全在浏览器里运行,不需要下载安装客户端,因此准备工作主要是账号和几个默认设置。

账号注册

打开 Pika 的官方网站,点击注册入口。可以用邮箱注册,也可以直接用 Google 账号登录,后者通常更快。注册完成后到邮箱里确认一下验证邮件,否则部分功能可能无法使用。

如果更习惯在聊天工具里操作,也可以把 Discord 账号关联进来,加入对应的生成频道,用对话的方式提交生成请求。两种入口对应的是同一套生成能力,选自己顺手的即可。

认识工作区布局

登录后进入的是一个网页工作区,主要区域有三块:

  • 提示词输入框:位于界面底部,所有文本生成视频的请求都从这里提交。
  • 素材库:位于界面左侧,生成完成的视频会自动归档到这里,不需要手动保存。
  • 编辑画布:从素材库里点开任意一段视频后进入,局部重绘、画布扩展等工具都在这个界面里调用。

第一次进入时素材库是空的,看到提示词输入框和一个空的网格区域,就说明工作区已经正常加载。

设置默认参数

建议在第一次生成之前就把画幅比例和帧率定下来,避免后面反复重做。

  • 画幅比例:竖屏内容用 9:16,横屏的长视频平台用 16:9,方形信息流用 1:1。
  • 帧率:基础生成通常按 24 帧每秒输出,这是多数短视频平台的常规标准。

这些默认值会应用到后续的每一次生成,改一次比每次单独设置省事。

操作步骤

下面按功能模块拆开讲。每个模块都是独立可用的,可以只挑自己需要的部分。

第一步:用文本生成第一段视频

在底部的提示词输入框里写一句描述,说明画面里有什么、在做什么、镜头怎么运动,然后提交生成。Pika 会返回一段基于该描述的短视频。

提示词写得越具体,结果越可控。与其写「一个城市」,不如写清楚时间、天气、视角和主体动作。生成完成后视频会自动进入左侧素材库。

第二步:局部重绘(Modify Region)

局部重绘的作用是在不改变画面其余部分的前提下,替换掉镜头里的某一个元素——可以是一个物体、一套服装,也可以是一块背景。

  1. 从素材库里打开一段已生成的视频,点击局部重绘工具。编辑画布加载后,左侧会出现画笔工具。
  2. 用画笔涂抹想要替换的区域。涂抹完成后,只有被涂到的部分会被高亮,画面其余区域保持锁定状态。
  3. 在输入框里描述希望替换成什么,然后提交生成。

结果是画面中只有一个元素被替换,周围的画面内容不受影响。

实用技巧:涂抹范围比目标物体稍微宽一点。遮罩卡得太紧,旧像素和新像素交界处会留下明显的硬边。

第三步:口型同步(Lip Sync)

口型同步让画面里的人脸按照给定的音频说话,嘴部动作与声音对齐。

  1. 选一段人脸清晰可见的素材。正脸、在画面中占比大的镜头效果最好;侧脸和过小的人脸同步质量会明显下降。
  2. 输入要说的台词,或者上传一段语音文件。音频挂载成功后,时间轴下方会出现波形图。
  3. 选择一个音色预设,然后渲染这一条。

渲染完成后,画面中的人物会按照音频的节奏开口说话。

实用技巧:单条台词控制在八秒以内。时间太长,后半段容易出现口型漂移。

第四步:音效生成(Sound Effects)

音效生成用一段简短的文字描述来产出匹配的音频。没有声音的画面是最容易显得业余的地方,这一步值得单独做。

  1. 点击视频下方的扬声器图标,打开音频面板。
  2. 用简短的文字描述需要的声音,例如「雨点打在铁皮屋顶上」「远处的车流声」。
  3. 生成两到三条,然后调整各自的音量做混音。每一条生成的音轨都会作为独立图层显示在视频下方。

结果是这段画面拥有了由纯文本构建出来的环境音。

实用技巧:描述里带上材质,而不只是声音本身。「碎石上的脚步声」比单写「脚步声」效果好得多。

第五步:画布扩展(Canvas Expander)

画布扩展把画面加宽,新增的边缘区域由模型补画,从而在不裁切画面的前提下改变画幅。

  1. 载入素材,选择画布扩展工具。
  2. 设定目标画幅比例,可选 16:9、9:16 或 1:1,取决于这段视频最终要投放到哪里。设定后会出现一个虚线框,标示原始画面在新画幅中的位置。
  3. 描述新增区域里应该出现什么内容,然后渲染。

结果是同一段镜头可以适配到另一个平台的画幅要求。

实用技巧:只扩展一次。连续叠加两次扩展,外侧那条补画出来的边缘会糊得很明显。

第六步:时长延长(Video Length Extender)

基础生成出来的片段时长有限,通常在四秒左右、24 帧每秒。时长延长工具用来把短片段拉长。

  1. 打开需要延长的片段,点击播放器下方的延长按钮。
  2. 设定要增加的秒数。
  3. 提交后模型会在原片段基础上续写后续画面。

延长适合把一段动作补完整,或者给镜头留出更多呼吸空间。每次延长的幅度不宜过大,否则画面连贯性会下降。

第七步:特效(Effects)

特效是一组预设的视觉变换,包括挤压、融化、膨胀、爆炸等效果。它的特点是不需要写提示词,选一个效果直接套用到素材上即可。适合在成片节奏里插入一个夸张的转场或视觉冲击点。

第八步:素材库管理(Pika Library)

所有生成出来的视频都会自动进入素材库,不需要手动保存或下载后再上传。素材库既是归档区,也是后续所有编辑操作的入口——局部重绘、画布扩展、时长延长都要先从素材库里打开目标片段。

第九步:镜头运动控制

镜头运动的可控程度与订阅档位相关。在较高的档位下,镜头推拉、平移、旋转等运动参数可以更精细地调节;基础档位下可调范围相对有限。具体每个档位开放哪些控制项,以官网当前的说明为准。

一个完整示例

下面走一遍从零到导出的最小流程,把上面几个模块串起来。假设目标是做一段竖屏的产品展示短片。

第一步:设定默认参数。把画幅比例设为 9:16,帧率保持 24 帧每秒。

第二步:生成基础片段。在底部提示词框里提交描述,例如:

一只白色陶瓷咖啡杯放在木质桌面上,清晨侧光从左侧照入,
镜头缓慢向前推进,背景虚化,画面安静

提交后等待生成,结果会自动出现在左侧素材库。

第三步:替换背景。从素材库打开这段视频,选择局部重绘,用画笔涂抹杯子后方的背景区域,涂抹范围比背景边缘略宽一些,然后描述替换内容:

浅灰色水泥墙面,柔和阴影

提交生成。杯子本身和桌面保持不变,只有背景被替换。

第四步:补音效。点击扬声器图标打开音频面板,生成一条环境音:

清晨安静的室内环境音,远处偶尔有鸟叫

再生成一条细节音:

陶瓷杯底轻放在木桌上的声音

两条音轨分别调整音量,环境音压低作为底噪,杯底声稍微抬高作为重点。

第五步:延长时长。如果四秒不够用,点击播放器下方的延长按钮,增加两到三秒,让镜头推进的动作更完整。

第六步:适配其他画幅。如果这段素材还要投放到横屏平台,用画布扩展把画幅改成 16:9,并描述新增区域的内容:

延伸的木质桌面和虚化的室内背景

渲染完成后,同一段镜头就有了竖屏和横屏两个版本。

第七步:导出。确认画面、时长和声音都符合预期后,从素材库导出成片。

整个流程走下来,核心思路是:先用文本生成一段可用的基础画面,再用局部重绘修正画面细节,用音效补齐声音层,最后用画布扩展和时长延长适配投放需求。每一步都是独立的,可以随时回到素材库重新调整。

注意事项

关于生成时长

基础生成出来的片段时长有限,通常在四秒左右、24 帧每秒。需要更长的镜头,必须用时长延长工具续写,而不是指望一次生成出长视频。

关于口型同步的素材要求

口型同步对素材质量敏感。正脸、人脸在画面中占比较大的镜头效果最好;侧脸角度和过小的人脸同步质量会明显下降。单条台词建议控制在八秒以内,时间越长,后半段越容易出现口型漂移。

关于局部重绘的遮罩

涂抹范围要略大于目标物体。遮罩卡得太紧,替换后的新旧像素交界处会留下硬边,一眼就能看出修图痕迹。

关于画布扩展的次数

画布扩展只做一次。连续叠加两次扩展,外侧补画出来的那条边缘会严重模糊,画质下降明显。

关于音效描述

音效提示词里带上材质和场景,比只写声音本身效果好。描述越具体,生成结果越接近预期。

关于功能与价格

Pika 的功能开放范围、镜头运动控制项、生成时长上限和订阅档位都会调整。本文提到的参数和档位差异只作为操作参照,实际可用范围、配额和价格请以官网当前信息为准。

关于账号与登录

邮箱注册后需要完成邮件确认。如果选择用 Discord 入口操作,需要先关联账号并加入对应的生成频道,两种入口对应同一套生成能力。