SkillCast 首批精选 Skill 正在整理中 查看市场 →
人工核验

video-talkcraft:口播视频动效制作 Agent Skill

一个让 Claude Code / Codex 变身口播视频动效工作室的 AI Agent 技能:输入口播稿和配音,自动完成字级同步、分镜设计、动效渲染,产出电影感解说视频。

口播视频动效设计RemotionClaude CodeCodexAI Agent视频制作

这是什么

video-talkcraft 是一个开源的 AI Agent 技能包,由作者 vincentwei1021 开发,专门用于把 Claude Code / Codex 变成口播视频动效工作室。它不是一个剪辑软件,也不是模板站,而是一套完整的方法论 + 代码库:Agent 会读取设计规范、选择动效配方、编写 Remotion 渲染代码,并自动完成质量验收,最终产出可直接发布的解说视频。

仓库目前获得 332 颗 Star、29 个 Fork,最新版本为 gallery-media。它属于 video-shotcraft 系列的口播视频篇,核心能力包括字级配音同步、78 张动效配方卡、七层反 PPT 镜头系统,以及三重验收机制。

在线画廊:78 张动效预览一页全览 »

适合谁

适合需要批量制作口播/解说视频的创作者,包括知识科普、产品评测、新闻解读、观点锐评等横屏视频。无论你是自媒体博主、课程制作人,还是企业内容运营,只要你有口播稿和配音,就能用这个技能自动生成带动态字卡、运镜、转场和音效的成片。

它优先为中文口播设计,中英混排完全支持。如果你完全不懂代码也没关系——你只需要把仓库链接丢给 Claude Code 或 Codex,Agent 会按需配置环境并完成后续工作。

能做什么

  • 字级配音同步:通过本地 CPU 脚本把口播稿对齐到音频,每个动效节拍都锚定在确切的字上。
  • 78 张动效配方卡:每张卡包含意图、参数、已知坑、可直接复制的 Remotion 源码和可运行的 HTML 预览,覆盖动态字卡、数据镜头、证据巡游、转场、长镜头等。
  • 七层反 PPT 镜头系统:连续相机曲线、视差平面、idle/让位生命周期、呼吸环境层,从结构上避免静止帧。
  • 排版纪律:语义拍分镜、同屏元素预算、留白锚、人脸安全区检测,保证画面专业。
  • 三重验收:自动静止检测、音效逐 cue 能量验证、独立 subagent 评审,确保成片质量。

使用前准备

你需要准备:

  • 口播稿(文本,每句一个信息点)
  • 成品配音(任何 TTS 或真人录音,wav/mp3)
  • 可选:人物出镜素材(普通实拍视频即可)和 B-roll / 截图

环境要求:Node 18+(Remotion 渲染)、Python 3.10+(时间戳管线)、ffmpeg。Agent 会按需自动配置,首次使用时间戳功能时会下载一次约 767MB 的语音识别模型(FireRedASR2-CTC),也可以切换 faster-whisper 后端免手动下载。

安装方法

最直接的方式是把仓库链接丢给 Agent,在 Claude Code / Codex 中说:

帮我安装这个 skill:https://github.com/Vincentwei1021/video-talkcraft

或者使用 skills CLI 安装:

npx skills add Vincentwei1021/video-talkcraft

也可以手动克隆并建立软链接:

git clone https://github.com/Vincentwei1021/video-talkcraft.git
cd video-talkcraft
ln -s "$(pwd)" ~/.claude/skills/video-talkcraft   # Claude Code
# 或
ln -s "$(pwd)" ~/.codex/skills/video-talkcraft    # Codex

使用示例

安装完成后,你可以这样下需求:

用 video-talkcraft 把这份口播稿 + voiceover.wav 做成视频。
做一条 100 秒的 <话题> 解说,稿子和音频在这里。

Skill 会执行八步管线:文案调研 → 配音输入与时间戳 → 素材准备 → SHOTBOOK 分镜 → Remotion 实现 → 渲染 → 三重验收循环 → 交付。最终你会得到一条响度归一、带字幕和动效的 MP4 成片。

风险与注意事项

  • 许可限制:采用 PolyForm Noncommercial 1.0.0 许可,个人、教育、研究用途免费;将工具用于任何商业用途需事先获得作者授权。用本 skill 做出的视频归你所有。
  • 本地资源占用:时间戳模型首次下载约 767MB,渲染需要一定的 CPU/内存资源。
  • 素材版权:内置音效采样有授权说明;B-roll 素材源指南只收录免署名源(Pexels、Pixabay、Mixkit Free、Coverr、NASA),注意避开有授权陷阱的素材源。
  • 人物素材:demo 中的主持人素材是 AI 生成的演示占位,生产时请替换为你自己的人物素材。
  • 依赖第三方框架:渲染依赖 Remotion,注意其自身许可。
INSTALLATION

安装命令

TERMINAL
npx skills add Vincentwei1021/video-talkcraft
兼容平台Claude Code、Codex
运行环境需要 Node 18+、Python 3.10+、ffmpeg;准备口播稿和成品配音(TTS 或真人录音);人物出镜素材与 B-roll 可选。
API Key不需要
本地环境需要
费用免费