用 HyperFrames,一句话就能做出真视频
用 HyperFrames 做视频、剪视频有十几种玩法:从一行字生成的十秒讲解,到精心设计的绿幕反应视频,都行。这是一整条进阶路线,从入门一路到高级,中间嵌了六支我自己做的成片,你能看到每条提示词到底产出了什么。下面每一条提示词都能直接复制粘贴。
从这里开始
HyperFrames 是 HeyGen 出的一个免费开源工具,它让 AI 智能体用跟做网站一样的 HTML、CSS 和 JavaScript 来生成视频。官方的说法叫"用氛围编程剪视频"(edit videos by vibe-coding)。你根本不用打开时间轴,也不用碰特效面板。你用大白话把视频描述出来,智能体写代码,然后你自己的电脑把成片渲染出来。它在本地运行,所以不消耗任何 HeyGen 额度,渲染也完全免费。
这为什么重要:以前一段动态图形意味着要请一个剪辑师、花上一周,现在一条消息就出来了。下面是我给 Melda 做的一支 25 秒产品发布视频。总共三条提示词,没用任何素材,也没请剪辑师。
下面就是教程。它从最开头讲起,一行字丢给 AI 智能体,一路爬到绿幕反应视频和 B-roll 剪辑,这些以前我得手动折腾好几个小时。哪一级对你有用你就停在哪,回头再来看下一级就行。
1. 安装配置
你是通过一个 AI 编程智能体来驱动 HyperFrames 的。你不用写代码,也不用最贵的模型。我平时看手头开着什么,用两种方式跑它。
用 Claude Code 跑 Sonnet。 Sonnet 又快又便宜,做视频完全够用,所以没必要在这上面烧 Opus。新建一个空文件夹,起个名字比如 my-videos,在里面打开 Claude Code(桌面版或终端都行)。然后对 Claude 输入:
install hyperframes video editor 它会把这个技能拉下来,第一次还会让你装几个辅助工具,比如 Homebrew 和 ffmpeg。同意就行。如果你想自己跑那条确切的命令,是这条:
npx skills add heygen-com/hyperframes 用 Codex 跑 ChatGPT 5.5。 HyperFrames 在 Codex(OpenAI 的编程智能体)里跑得一样好。思路一样:在一个空文件夹里打开 Codex,让它安装 HyperFrames 编辑器。在 Codex 里,你的消息开头加上 /hyperframes 就能启动一支视频,这样智能体在动手前会先加载对应技能。这份指南里其他内容完全一样;两边的提示词一字不差。
安装就这些。从这里开始,你只是在给一个智能体发消息,告诉它你想看到什么。
2. 你的第一支视频
从小处起步,好把整个流程走一遍。第一条提示词的诀窍是说清三件事就打住:讲什么、多长和什么画幅、一个视觉点子。下面是我用的那条原话:
我想让你做一支 10 秒的竖屏(9:16)讲解视频,讲每天到户外走走对健康的好处。选一个有力的动画视觉隐喻,让人一看就懂。渲染要快。
智能体会写一个简短的方案,搭出画面,然后渲染。"渲染要快"这句在提示词里是真起作用的:它告诉智能体多用扁平图形加一个干净的动画,别整那些重的,这样你几秒就能拿到成片,而不是几分钟。下面是它返回的原始结果,没动过:
做好之后,你让智能体 launch preview 就能预览,它会在浏览器里打开。喜欢的话就从那里导出,或者直接让智能体把 MP4 存下来。这就是完整的流程。往后所有内容都是同一个流程,只是提示词里塞的东西更多。
3. 把网站变成产品演示
基础上手之后,把 HyperFrames 对准一个真实网址,让它用你自己的品牌做一支发布视频。正好有一个专门干这个的工作流 /website-to-video,它会访问网站,读取它的配色、字体和界面,然后照着还原。下面是我做 Melda 演示的第一版:
我想让你用 /website-to-video,从 www.melda.co 做一支 25 秒的电影感产品发布视频。抓取网站真实的配色、字体排印、界面和品牌质感,然后把它做成一场高级的、苹果发布会风格的揭幕:节奏有张力、界面动画式放大、3 张大的利益点卡片、干净的旁白、克制的音效,以及结尾的行动号召。让它感觉像这个小小的网站在宣告未来。
第一版渲染出来不错,但没到很好。节奏对了,品牌也认得出是 Melda,但开头没说出我真正想说的话,而且我想要一个竖版用来发快拍和 Reels。于是我回头给的是具体指令,不是感觉。我把开头卡片上想要的确切文案给了它,把要突出的具体界面截了图,还要了一个 9:16 版本。第二版就是这个:
这个教训值得多琢磨,因为比入门片子更难的东西都适用。这不是那种一条提示词每次都吐给你一支成片的老虎机。第一版智能体帮你把大部分路走完;最后那一段,得靠你把确切文案、真实截图和具体批注交给它。剪辑越复杂,要微调的次数越多,这很正常,不是失败。输入模糊,出来就通用。输入具体,出来才是你的。
每周一份用 AI 来做的新指南
每周一篇关于提示词、智能体和内容系统的实操手册,免费。
已加入。第一封邮件很快就到。
4. 导入更多工作流
凡是比纯讲解更复杂的东西,配一个专门的工作流都会跑得更好。HyperFrames 自带一整套,每个都为某一类视频调过,你一行字就能全部拉进来:
install all the hyperframes workflows 我用得最多的几个:
/product-launch-video和/website-to-video,用来做基于真实网站的宣传片和演示。/faceless-explainer,用来做没有任何素材、每个场景都现造画面的主题视频。/motion-graphics,用来做短的、以动效为主的小单元:数字滚动、logo 定版、动态图示。/embedded-captions和/talking-head-recut,用来给你已经拍好的素材做包装。
在提示词开头点名对的工作流,是你能做的最大的一次质量跃升,因为它会加载一整套默认设置,否则这些都得靠智能体猜。这份指南接下来都靠它们。
5. 带动态图形的绿幕反应视频
好玩的地方来了。我最喜欢的格式之一是反应视频:我读到点有意思的东西,对着镜头做出反应,我读的那个东西满屏铺在我身后,同时标题和卡片在上面动。这是我做的所有形式里数据最好的一种,以前它可是个真剪辑活儿。下面这支,是对一位创作者发的一个研究方法做的反应:
做这种视频最省事的办法是按这个顺序来:
- 先写脚本。 把你要说的话写下来,精炼点。心里先有那三个点,反应视频会更好看。
- 录主镜头(a-roll)。 拍你自己做反应,有绿幕就用绿幕,没有就对着一面白墙。别担心卡壳;智能体会清掉那些。
- 把背景抓下来。 把你要反应的那篇文章、帖子或论文截图。如果你想让身后放动态画面,那就也录下来。
- 一条提示词全部上传。 把你的主镜头、截图和下面这条提示词交给智能体。它会把你抠出来、清理你的原片、加上标题和动态图形、对齐字幕,再把文章铺到你身后。
下面是一条可复制粘贴的提示词。方括号里的是占位符;换成你自己的素材名、标题和文案。清理主镜头那段话,是直接从最擅长干这个的工作流里借来的:
/greenscreen 做一支 [时长] 秒的竖屏(1080×1920)绿幕反应视频。
附上的素材:
- aroll.mp4:我对着镜头做反应。把我干净地抠出来,让我以剪影方式待在画面下三分之一处。
- background-1.png, background-2.png:我正在反应的那两样东西(比如原始论文和把它带火的那条帖子)。把它们满屏铺在我身后。
- [可选] screen-recording.mp4:[它展示了什么]。在我指向它的地方把它放在我身后。
先清理主镜头:转录出逐字时间轴,然后清理原片:剪掉重新开口、结巴、重复和废话,并修掉所有超过 0.1 秒的停顿,全部基于转录定位、无缝衔接、音画一起处理。
标题卡(0–2 秒):"[你的标题,比如 这个免费方法能把 Claude 变成博士级研究员]" 用粗体展示字体,然后切给我。
节拍:每当我讲到一个点,就在我身后满屏切一篇文章或截图,点与点之间回到干净背景。我点到某个工具或某个数字时,在旁边弹出一张带标注的小卡片。[可在此列出你的 3 个节拍。]
屏幕文案,带引号:"[数据或短语 1]"、"[短语 2]"。
字幕:逐词、白色、句首大写(如为英文),放在下方安全区,绝不压在我脸上。
行动号召(最后 3 秒):"[评论 关键词,我就发给你]"(在评论那行加一个小标签"仅限 FB / IG")外加 "[关注 @账号 / yoursite.co/resources]"。
不用版权素材。背景音乐压到我声音之下、轻到几乎听不见。
这个格式的全部精髓就在这:你拍下自己对读到的东西做反应的素材,把它放在身后,让智能体去做标题、清理、字幕和抠像。之所以要提前写脚本、截好图,是因为一旦所有上下文一起上传,第一版就会离成品近得多。
6. 六要素提示词(进阶)
当你想要一个具体的观感、而不是碰运气时,最好的指引来自 HeyGen 官方。他们那篇 《一条提示词的解剖》(Anatomy of a Prompt) 把一条好的视频提示词拆成六个决定。六个都做到,智能体就搭出你脑子里想的那样。漏掉一个,智能体就替你做主。框架归功于他们;下面是精简版。
- 路线(Route)。 从对的工作流开始:
/motion-graphics、/product-launch-video,哪个合适用哪个。这是你提示词的第一个词。 - 规格(Spec)。 多长、什么画幅。"6 秒、方形",甚至只说"给 TikTok 用",都够了。
- 节拍(Beats)。 屏幕上一秒一秒发生什么。
- 文案(Copy)。 你的原话,带引号。
- 手法(Technique)。 点名你想要的动作:挤压回弹、柔和阴影、数字滚轮式跳动。
- 排除项(Negatives)。 说清楚不要什么:不要旁白、不要版权素材、不要媒体文件。
一条接一条写下来,这六项就压成一段大白话,你用手机就能发出去。路线是第一个词,规格是第一句,节拍在中间,你的引号保持带引号,排除项收尾。
要描述屏幕上任何东西,HeyGen 的"节拍公式"能让你不含糊。每个元素,用一句话快速交代五点:是什么("一个超大的黑色 Mac 光标")、做什么("滑进来停在文件夹上")、在哪("从右下方")、什么样("超大、黑色、macOS 风格")、什么时候("节拍 1,0 到 2 秒")。五点交代清楚,不用行话,智能体就不再瞎猜。
三条起步提示词,都在十秒以内
这些都遵循六要素结构,而且故意做得短,因为这正是 HyperFrames 一次成片最擅长的地方。复制一条,换掉里面的字,跑起来。
/motion-graphics 做一支 6 秒 1080×1920 的视频,深藏青背景,带一层淡淡的蓝色辉光。节拍 1(0–2 秒):数字 "0" 用粗体无衬线居中,然后快速跳到 "700K" 停住。节拍 2(2–4 秒):下方淡入标签 "一个习惯带来的粉丝"。节拍 3(4–6 秒):一条细蓝线在数字下方从左扫到右。文案,带引号:"700K"、"一个习惯带来的粉丝"。手法:快速数字滚轮跳动、缓出停住、最终数字上一次轻微辉光脉冲。不要旁白、不要图片、不要版权素材。
/motion-graphics 做一支 5 秒 1080×1080 的视频,暖米色纸质背景。节拍 1(0–2 秒):等宽字体逐字打出 "提示词" 三个字。节拍 2(2–3 秒):一个紫色光标滑到末尾并点击。节拍 3(3–5 秒):"提示词" 向上翻走,换成粗体展示字体的 "视频。",旁边一个紫色播放三角带着柔和的挤压回弹缩放出现。文案,带引号:"提示词"、"视频。"。手法:等宽字体打字、光标点击、竖直翻转、播放按钮上的挤压回弹。不要旁白、不要媒体文件。
/motion-graphics 做一支 8 秒 1080×1920 的讲解,柔和白色背景,带几团淡蓝色斑块。节拍 1(0–3 秒):三张分别标着 "选题"、"钩子"、"脚本" 的卡片升起并淡入,叠成竖排,每张带柔和阴影。节拍 2(3–6 秒):一条发光的线自上而下画出来,把它们从头连到尾。节拍 3(6–8 秒):这一叠滑进一个圆角的 "发布" 按钮,按钮脉动一次。文案,带引号:"选题"、"钩子"、"脚本"、"发布"。手法:错峰升起停住、动画连线绘制、按钮脉动一次、强调色 #2563eb。不要旁白、不要照片、不要实拍。
它的边界在哪
两个实在的限制,都是 HeyGen 说的,也都跟我的经验相符。第一,手绘角色和绘画质感光靠文字撑不起来;文字没法把一幅画说死。要么转向扁平几何图形("圆角几何人物、圆脑袋、没有五官"),要么先把美术素材生成出来、再当成文件交给它。第二,真实的素材和照片必须以文件形式给到,并在提示词里写上路径;智能体变不出你本人或你产品的照片。而且片子越是层层叠叠、越长,要来回的轮数就越多。又短、又以图形为主的东西,才是一条消息第一版就命中的地方。
7. 在主镜头上叠加 B-roll
最后、也最费工的格式,是一段真正的口播剪辑:你的脸是基础轨,B-roll 和截图叠在上面来给每个点撑腰。下面这支是我把"四年副业故事"从头到尾用 HyperFrames 跑出来的成片。
让它成立的关键,是一个阶段一个阶段地做,每往下走一步之前先审一遍,而不是一口气把整个剪辑要出来。每个阶段都是它自己的一个决定,先把基础弄对再去装饰,能省掉你全部返工。下面是我跑的流水线。
阶段 1:清理主镜头
所有东西都对着清理后的原片来计时,所以这一步排在最前,并且单独审一遍。智能体把你的素材转录出逐字时间轴,然后剪掉重拍、重新开口、废话词和空白,把大约十分之一秒及以上的每个间隙都修掉,再对结果重新转录一遍。那份新的转录,就是后面每个阶段读时间的那口钟。这版基础剪辑没通过之前,一个图形都别加。
阶段 2:按含义匹配 B-roll
这是见功夫的阶段,最要紧的一条规则:按台词的含义挑 B-roll,不是按关键词。"凌晨两点熬夜剪辑的苦"应该拉出一段深夜剪辑的片子,而不是随便哪个文件名里带"苦"字的。我坚持的几条规则:
- 你的脸是大本营。 只有当 B-roll 配得上那个时刻时才切过去:证据、过程或情绪。你的核心观点句和转折句留在你脸上,观众在那里读你。
- 截图是叠层,素材是替换。 一张截图或一段录屏居中叠在你露脸的画面上,不是满屏,这样才有"我刚把这个调出来"的感觉。生活类 B-roll 可以占满整个画面撑一个节拍。
- 短、静音、竖屏。 生活片段 2 到 3 秒,一律静音,从片子开头往后几秒开始、跳过起手那段。优先用竖屏素材,这样它填满 9:16 画面时不会被拉伸。
- 节奏。 每 2.5 到 6 秒画面就有点变化,静止绝不超过 7 秒。别把 B-roll 全堆在前面,然后后半段留一堵光说话的墙。
- 卡在词上。 你点到某个工具、某个品牌或某个数字时,把对应画面正好落在那个词上。这一支里,Claude 和 OpenAI 的 logo 精准砸在 "Anthropic" 和 "ChatGPT" 上。
让智能体找得到 B-roll 的命名系统
只有当你的素材库是按每段片子含义命名、而不是叫 "IMG_4021.mov" 时,智能体才拉得出对的片段。我给每个文件按 subject-context_take_orientation 命名,扫一眼就知道是哪个瞬间、什么画幅:
typing-keyboard_take-01_v.mov
speaking-stage_contentlab-take-01_v.mov
reacting-frustrated_take-01_v.mov
desk-workspace_topdown_v.mov _v、_h 或 _sq 后缀标出竖屏、横屏还是方形,好让智能体知道什么能填满画面。然后在这些片段旁边放一个小小的 manifest.json,每段一条,写清这段片子的含义并打上标签。智能体查这个文件,而不是去翻文件夹:
[
{
"file": "reacting-frustrated_take-01_v.mov",
"orientation": "v",
"duration_s": 6,
"desc": "在桌前精疲力尽,双手抱头,受够了",
"tags": ["情绪", "崩溃", "转折点"]
}
] 有了这个,"我差点放弃的那一刻"就能靠它的 desc 解析到对的片段,你永远不用记文件名。
阶段 3:先字幕,再音乐
字幕来自剪好后的那份转录,绝不是原始的,这样它才跟成片严丝合缝。让字幕保持白色、句首大写(如为英文)、每次大约两个词、放在画面下方的安全区、绝不压在你脸上。然后是背景音乐。我把它压到我声音之下大约 1%,一层你更多是"感觉到"而不是"听到"的垫底音,并在每张截图出现的那一帧打出一声轻轻的鼠标点击,做出"我刚打开这个"的感觉。免版税的音乐和音效,我从 pixabay.com 这个免费库里取;如果你需要一段自己没拍的 B-roll,它也有免费的版权素材。
B-roll 环节的提示词
等你的主镜头清理好、素材库也命名并做好清单之后,下面这条就是 B-roll 环节的提示词。把清理好的成片、转录和文件夹交给它:
这是我清理好的主镜头(aroll-clean.mp4)和它的逐字转录(transcript.json)。我的 B-roll 在 /b-roll 里,配了一个 manifest.json,每段片子都有 desc 和 tags。做一个 9:16 的剪辑。
顺序与时机:
- 口播是大本营。只有当 B-roll 或截图配得上那个时刻时才切过去:证据、过程或情绪。我的核心观点句和转折句留在我脸上。
- 按台词的含义挑 B-roll,匹配 manifest 里的 desc 和 tags,不是按文件名。匹配得勉强就跳过;一个强插入胜过两个平庸的。
- 生活和过程类 B-roll:2–3 秒、静音、从片子开头往后几秒开始。截图和录屏:居中叠在我露脸的画面上,不是满屏,并在每个出现的那一帧打一声轻轻的鼠标点击。
- 节奏:每 2.5–6 秒画面有点变化,静止绝不超过 7 秒。别把 B-roll 全堆在前面。
- 卡紧词:我点到某个工具、品牌或数字时,把对应画面正好落在那个词上。
然后从转录加上字幕(白色、每次约 2 个词、下方安全区、绝不压在我脸上),再加一层压到我声音之下约 1% 的背景音乐垫底。渲染前先给我看一版预览。
按顺序跑这些阶段,每一步都设一道关卡,这样后面才改动的东西只会重跑它之后的部分。清理原片,通过它。匹配 B-roll,通过它。然后字幕,然后音乐。正是这个顺序,决定了一个剪辑是感觉像精心设计的,还是感觉像提示词碰了运气。
去做一支吧
从第一级开始。装上它,敲那条十秒讲解提示词,看着一支真视频从一句话里冒出来。然后往上爬:把它对准你自己的网站、对你读到的东西做反应、剪一段口播。工具是免费的,跑在你自己的电脑上,所以唯一的成本就是你做第一支时花的那十分钟。去做吧。