Whiteboard:输入一个主题,自动做成手绘信息图讲解视频
https://github.com/zkbys/whiteboard
最近看到一个挺有意思的开源项目:Whiteboard。
你只要给它一个主题、观点或者粗略脚本,它就会尝试生成一条 30~60 秒的手绘白板信息图讲解视频。口播文案、画面规划、AI 生图、动画校准、配音、字幕和最终渲染都被串在一条流水线上,最后输出一个可以直接预览的 preview.mp4。
比如输入:
AI 工具越多,普通人反而越低效。
它会先把这个观点整理成适合短视频的口播结构,再拆成几个视觉节拍,规划一到两块手绘信息图。随后生成白板图、确定需要标注和强调的元素,配上旁白与字幕,再让箭头、方框、镜头和讲解节奏同步出现。
最后得到的不是单纯的图片轮播,而是一条边讲、边画、边强调重点的信息图视频。
它把几个原本分散的步骤接起来了
这类视频以前也能用 AI 做,但通常需要来回切换好几个工具。
先让大模型写口播,再让生图模型画信息图;图片回来以后,还要判断箭头应该画在哪里、镜头应该放大哪个区域;然后生成配音、字幕,最后回到剪辑或动画工具里把时间轴对齐。
Whiteboard 把这些步骤拆成了几个内部模块:
- 整理口播文案和六段式讲解节奏;
- 根据内容规划手绘信息图和生图提示词;
- 生成或接收最终 PNG;
- 识别图片中真实元素的位置,建立动画控制层;
- 用 Edge TTS 生成配音和字幕时间轴;
- 通过 HyperFrames 渲染视频,并检查动作、镜头和音画同步。
对普通用户来说,不需要分别理解这些模块。安装后对外只暴露一个 whiteboard-video Skill,Codex 或 Claude Code 会按照固定顺序调用内部流水线。
自动校准是这个项目比较特别的地方
AI 生图有一个常见问题:提示词里要求某个图标在左边,最终生成时它可能跑到了中间。假如动画仍然按照模板坐标画红框和箭头,标注就会指错位置。
Whiteboard 会在制作动画前读取实际生成的 PNG,重新识别关键元素的边界框,再根据真实位置调整红线、方框和镜头焦点。
校准可以使用 Agent 的视觉能力、OpenAI 兼容视觉模型或者本地 OCR。如果自动识别没有覆盖全部元素,项目还会生成一个本地校准网页,让用户手动拖动和修正位置,然后重新运行后面的动画与渲染阶段。
这一步不能保证每次都完全正确,但至少解决了“图是模型画的,动画却还死守模板坐标”的问题。
所谓全自动,需要先配置图片模式
项目默认采用 interactive 图片模式,不需要 API Key。AI 助手生成信息图预览后会暂停一次,等用户把图片保存到指定路径,再继续校准、配音和渲染。
如果希望真正从主题一路自动跑到 MP4,需要配置自动图片 Provider。目前项目支持 OpenAI GPT Image 2,也支持符合约定的自定义命令。只有同时设置 WHITEBOARD_IMAGE_MODE=auto、Provider 和 API Key,才会自动发起可能计费的生图请求。
所以,它确实可以做到全流程自动化,但默认状态下仍保留一次人工图片确认。这种设计反而比较稳妥,既避免意外扣费,也防止一张明显画错的信息图直接进入后续视频。
最终交付的不只是一个 MP4
一次完整运行会在当前目录建立独立工程,里面除了 video/preview.mp4,还会保留:
- 口播文案和视觉节拍;
- 信息图规划和生图提示词;
- 生成图片及校准数据;
- 配音、字幕和时间轴;
- 可继续修改的 HyperFrames 工程;
- 关键帧、动作与镜头 QA 报告;
- 最终验收报告。
项目甚至会检查图片在生图、动画控制层和最终渲染之间是否保持一致,防止中途误用了旧素材或占位图。只有发布候选验收通过,流水线才应该把视频标记为完成。
如何安装
最简单的方式,是把下面这段话交给 Codex 或 Claude Code:
请安装这个项目:https://github.com/zkbys/whiteboard.git
阅读 README 后运行:
python3 scripts/install.py --target codex
Claude Code 把参数换成 --target claude,也可以使用 --target both 同时安装到两边。
运行环境需要 Python 3.10 以上、Node.js 20 以上、FFmpeg、Edge TTS、npx 和指定版本的 HyperFrames。仓库提供了 doctor.py,可以分别检查 Skill 安装、视频渲染、输出目录和图片模式是否就绪。
这个项目目前更像一条工程化的视频生产流水线,而不是面向所有人的一键 App。环境依赖不少,AI 生成的中文也不能保证每个字都正确,自动校准偶尔还需要人工微调。
但它展示了一个很有意思的方向:以后制作解释型短视频,可能不再是“让 AI 写稿、让另一个 AI 生图”,而是把脚本、画面、语音、动画和验收全部交给一个 Agent 流程统一推进。
输入一个观点,过一会儿拿到一条带口播、字幕和手绘动画的视频。这个目标,现在已经越来越接近真正可用了。