AB
AiBoss
Tutorials

即梦AI

Tutorials

即梦AI 快速上手教程:文生图、图生视频、数字人与智能画布全流程

即梦AI 是字节跳动剪映团队推出的生成式创作平台,整合文生图、图生图、文生视频、图生视频、数字人与智能画布等能力,中文提示词理解较好,并与剪映、抖音生态打通。本教程从账号准备讲起,逐步拆解图片生成、视频生成、数字人制作的操作步骤与参数设置,附一个从提示词到成片的完整示例,并整理提示词长度、审核拦截、排队、面部一致性等常见问题的排查思路。

即梦AI 是字节跳动剪映团队推出的生成式人工智能创作平台,早期以剪映 Dreamina 的名称内测,后定名为「即梦」。它把文生图、图生图、文生视频、图生视频、数字人、智能画布等功能整合在同一套界面里,底层依托自研的 Seedream 与 Seedance 模型架构,目标是让创作者在一个平台内完成从图片到视频的素材生产。它的两个突出特点是中文语义理解较为到位,以及与剪映、抖音生态的素材互通——生成的图片和视频可以直接进入剪辑流程,省去反复导出的麻烦。它适合做中文短视频、广告片、短剧分镜、教学课件与产品介绍视频的创作者,也适合需要批量生产素材的团队。如果你还没用过,可以先从站内的 即梦AI 工具页了解入口,再按下面的步骤动手。

需要先说明一点:即梦AI 的版本迭代节奏很快,模型能力、界面按钮位置、会员档位与积分规则都可能变化。本文涉及的价格、配额、时长上限等信息,请以官网当前公布的信息为准。

准备工作

在开始生成之前,把下面几件事准备好,能省掉后面很多返工。

  • 账号:即梦AI 有网页版和移动端 App 两个入口,两端账号互通,作品与资产可以同步。网页版适合精细操作和批量处理,App 端适合随手创作和快速预览。注册登录后即可使用每日免费生成额度。
  • 浏览器:建议使用较新版本的桌面浏览器,网页端在生成失败或卡住时需要强制刷新(Windows 下 Ctrl+R,macOS 下 Cmd+R),旧版本浏览器可能影响状态同步。
  • 素材准备:如果打算做图生图、图生视频或数字人,提前把参考图整理好。参考图越清晰、元素越明确,模型提取的信息越准确。数字人功能建议把人物图片尺寸提前调整为 16:9,避免生成视频时角色缺失。
  • 提示词草稿:把想描述的画面先写成一段完整的中文,按后文的结构化模板整理一遍。写不好也没关系,平台内置的 Agent 模式可以用对话方式帮你逐步细化需求。
  • 时间安排:高峰时段排队时间可能明显拉长,不着急的项目建议安排在上午或凌晨提交。

操作步骤

第一步:选择生成模式

登录后,在首页顶部选择「图片生成」进入文生图界面。对话框左下角可以在 Agent 模式与普通图片生成模式之间切换。

  • Agent 模式:集成了对话式交互能力,适合还不确定自己要什么、需要逐步细化需求的初学者。你可以先给一个粗略方向,再根据返回结果一轮轮补充条件。
  • 普通模式:适合已经能写出完整提示词的用户,直接输入、直接生成,路径更短。

如果后续要做视频或数字人,通常都需要先生成图片素材,所以先把文生图这条链路走通,后面会顺畅很多。

第二步:编写结构化提示词

提示词是决定生成效果的核心变量。推荐的结构是:

主体描述 + 动作/行为 + 环境/场景 + 光照/氛围 + 风格调性 + 镜头语言

对比一下两种写法的差距:

  • 模糊写法:「一个女孩在森林里」
  • 结构化写法:「一位身穿白色连衣裙的长发少女,赤脚走在苔藓覆盖的林间小径上,清晨薄雾弥漫,阳光透过树冠洒下斑驳光影,宫崎骏动画风格,中景镜头」

结构化写法的价值在于,它把创作意图拆成了模型可以逐项理解的模块。Seedance 2.0 支持多维度提示词输入,可以同时识别画面元素、动态效果与叙事逻辑等信息。

关于长度,一线创作者归纳出的经验值是:提示词控制在 1200 至 1400 字符区间通过率最高,超过 1500 字符后通过率会明显下降。这不是官方公布的硬性限制,但值得作为写作时的参考区间。

除了正向描述,还可以添加负面提示词,例如「模糊、畸形手」,用来排除不想要的元素。

第三步:选择风格与画幅

即梦AI 提供写实、二次元、水墨、油画、赛博朋克等多种风格选项。画幅方面支持 1:1、4:3、3:4、16:9 等比例,按最终投放渠道选择即可——竖屏短视频选 9:16 类竖版,横屏内容选 16:9。

第四步:生成与迭代

点击生成后等待几秒到几十秒,系统会一次性输出多张图片供挑选。不满意可以重新生成,或调整提示词后再次尝试。

迭代时有一条重要原则:每次只调整一个变量。同时改风格、改画幅、改提示词,你无法判断到底是哪个变化带来了效果提升。

第五步:图生图做二次创作

图生图支持两种玩法:

  • 一图加文本:上传一张图片,再输入描述文字。例如上传一张穿着休闲服饰的人物照片,输入「把人物的服装换成职业女性主持人服装」,即可实现换装效果。
  • 多图加文本:上传多张参考图,模型会智能提取各张图中的不同元素——人物、风格、场景、构图——融合成一张全新的和谐图片。例如要生成「穿着休闲服饰的女生在海边、烟霞紫色调、有茅草屋」的画面,可以分别上传人物参考图、色调参考图和场景参考图。

实操建议:如果参考图中包含多个元素,但你只想让模型参考其中一个,用文字明确说明,不要指望模型自己猜。

第六步:文生视频

在首页顶部选择「视频生成」进入文生视频模式。输入提示词后,系统会生成 4 至 15 秒的视频片段。

视频提示词比图片多了一个「动态」维度:除了描述画面内容,还要说明镜头怎么运动、主体做什么动作。例如:

一个木质老年木偶坐在街头长凳上缓慢弹奏吉他,他看向手中的吉他,动作僵硬但有节奏感,手指抬起时带有轻微卡顿感

这段描述同时包含了主体、动作细节和氛围,模型能据此生成一段有叙事感的画面。

第七步:图生视频的三种模式

图生视频是实用性最强的技能之一,它有三种模式,适用场景不同:

  • 单图延展模式:上传一张图片,输入动作描述,让图中元素动起来。动作描述必须以动词开头,避免「看起来」「仿佛」这类模糊词;保留「缓缓」「轻微」「短暂」等程度副词来约束动作幅度,否则模型容易做出过大的动作导致画面失真。
  • 首尾帧模式:上传起始帧和结束帧两张图片,在中间输入过渡描述,模型会生成两帧之间的自然过渡。这个模式特别适合镜头切换和场景转换,即梦的首尾帧控制精度在同类工具中表现较为突出。
  • 图文结合模式:上传图片的同时输入详细文字描述,模型综合两者信息生成视频。适合对画面有明确设想、但需要文字来精确约束动作和镜头的场景。

第八步:运镜控制与故事创作

视频生成 3.0 支持多样化的运镜选择,包括希区柯克变焦、动感环绕和机械臂等运镜方式,通过固定参数输入确保全程精准可控。

对于需要更强叙事控制的项目,「故事创作」功能可以把多个分镜图片串联起来,配合提示词生成连贯的多镜头视频。后续推出的 Octo 功能进一步升级了这一体验,支持对话加多模态混合的同屏共创方式,可以拖入文档、图片、视频或音频素材进行创作,构建从故事大纲到成片输出的链路。

进阶技巧:在短剧类创作中,同一角色的所有镜头必须使用同一张参考图作为一致性锚点,否则后续图生视频会出现人物面部变化的问题。这个细节很多新手会忽略,但它直接决定成片质量。

第九步:数字人制作

数字人功能让静态的人物图片「开口说话」。操作流程如下:

  1. 在首页选择「数字人」功能。
  2. 上传人物图片。
  3. 选择音色。音色库涵盖温柔女声、活泼童声、沉稳男声等多种类型。
  4. 输入说话内容。
  5. 添加动作描述。
  6. 点击生成,得到一段对口型视频。

勾选「大师模式」可以提升口型与动作的同步精准度。这个功能在教学课件制作、产品介绍视频等场景中尤其好用。

需要注意,平台对真人素材的使用有明确限制,引入了数字人分身认证机制,用户需要完成认证后才能使用自己的真人形象。

第十步:智能画布与故事创作

智能画布允许用户在一张无限画布上自由组合和编辑图片与视频元素,支持选择画幅比例、生图模型和视频清晰度。故事创作模式则更接近「AI 导演」的雏形:上传多个分镜图片后,输入提示词或让模型自主创作,系统会让图片中的元素动起来,生成连贯的分镜视频。目前的连续性和角色一致性还在持续优化中,但对于短片段落和概念预演来说已经足够可用。

一个完整示例

下面走一遍从零到成片的最小流程,做一条 8 秒左右的竖屏短片。

第 1 步:确定主题与提示词。主题是「雨夜便利店门口的猫」。按结构化模板写成:

一只橘色短毛猫蹲在便利店门口的台阶上,抬头看着玻璃门内的灯光,
雨水顺着屋檐滴落,地面有积水倒影,夜晚冷蓝色调与店内暖黄灯光对比,
写实摄影风格,低角度近景镜头

第 2 步:生成图片。在「图片生成」中选择普通模式,粘贴上面的提示词,风格选写实,画幅选 9:16,负面提示词填「模糊、畸形手、多余肢体」。点击生成,从输出的多张图中挑一张构图最满意的。

第 3 步:迭代优化。如果猫的姿态不理想,只改动作那一句,例如把「抬头看着玻璃门内的灯光」改成「低头舔舐前爪」,其余保持不变,重新生成。这样你能明确知道是动作描述带来了变化。

第 4 步:图生视频。把选中的图片下载后进入「视频生成」,选择图生视频的单图延展模式,上传这张图,动作描述写成:

雨滴缓缓落下,猫的耳朵轻微抖动,尾巴缓慢摆动,
镜头缓慢向前推进,画面保持稳定

注意动词开头,并用「缓缓」「轻微」「缓慢」约束幅度。

第 5 步:导出与后期。生成完成后下载视频,导入剪映做剪辑、配乐、字幕和节奏调整。两者同属字节跳动生态,素材格式兼容,这是当前比较高效的工作流。

如果这条片子需要多个镜头,就为同一只猫建立一张统一的参考图,所有镜头都基于这张参考图生成视频,避免面部或毛色在镜头之间跳变。

注意事项

生成失败的三种类型

即梦AI 的生成失败要区分处理,不要一律当成网络问题:

  • 提示词超长:如果返回错误代码 ret=1046 或 InvalidNode,通常是提示词字数超过了处理上限。把提示词压缩到 1400 字符以内,理想区间是 1200 至 1400 字符。
  • 内容审核拦截:如果返回「generation failed」,且提示词中包含敏感词、暧昧描述或反派相关词汇,需要修改提示词规避审核。
  • 网络或并发限流:如果没有返回错误信息但也没有生成结果,通常是网络不稳定或并发请求过多。建议单跑串行、避免同时提交多个任务,稳定后再逐步恢复并发。

排队时间过长

算力承压是平台目前面临的一个现实问题。Seedance 2.0 发布后用户量激增,基础会员排队时间一度长达 10 小时。虽然平台在持续扩容,但高峰时段等待时间仍可能较长。应对策略包括:避开晚间高峰,选择上午或凌晨提交任务;升级会员等级可以缩短排队时间;不着急的项目可以利用超长生成模式在非高峰时段批量提交。

视频生成卡在 99%

这是用户反馈较多的一个现象,通常是因为后端任务调度未完成或状态同步中断。可以尝试:强制刷新页面(Ctrl+R 或 Cmd+R)、登出后重新登录、清除浏览器缓存,或者把分辨率参数降低后重新生成。

人物面部不一致

这个问题主要出现在多镜头视频创作中。核心解决方法是:为同一角色建立统一的参考图,所有镜头都基于同一张参考图生成视频。如果项目涉及多个角色,建议为每个角色单独建立参考图库。

手部细节处理

手部细节目前还有提升空间,偶现手指数量不对、手部动作僵硬、复杂手势变形等问题。规避策略:在提示词中明确描述手部动作,避免复杂手势场景,或者用道具遮挡手部。后期也可以用局部重绘功能对手部区域进行修正。

免费额度与会员

即梦AI 提供每日免费生成额度,注册登录后即可使用。免费用户的图片生成和视频生成都有次数限制,超出后需要等待次日额度刷新,或选择订阅会员。不同档位的会员每月积分额度不同,具体价格与权益请以官网当前信息为准。

商业使用与 API

根据平台的用户协议,用户对自己生成的内容享有版权,但涉及真人素材时需要完成数字人分身认证。企业级使用可以通过火山引擎 API 接入,涵盖文生图、视频生成、数字人生成等多种模型能力,适合有稳定内容需求、需要流程标准化和规模化的团队,例如电商团队批量生成产品展示视频、教育机构批量制作用于课件的人物讲解视频。此外平台也上线了 Maya 和 Blender 插件,把 AI 创作能力延伸到专业三维制作流程中。具体的接入方式、配额与计费规则请以官网当前信息为准。

版本迭代与学习重点

平台的更新节奏相当快,模型版本、功能按钮位置、参数名称都可能变化。建议把精力集中在不变的核心能力上:提示词的结构化写作、角色一致性的控制方法、多镜头叙事的节奏把握。这些能力不会因为模型版本更新而过时。同时也要有心理预期:AI 提升了效率,但并没有实现「一键成片」。实际项目中,为筛选出可用的镜头,前期往往需要生成大量图片并反复筛选,创意判断、审美选择和流程设计仍然需要人来主导。