跳至正文
东倒西歪玩AI
东倒西歪玩AI
  • 首页
  • 首页
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
未分类

Whiteboard:输入一个主题,自动做成手绘信息图讲解视频

作者 ddxw
2026年7月20日 1 分钟阅读
0

https://github.com/zkbys/whiteboard

最近看到一个挺有意思的开源项目:Whiteboard。

你只要给它一个主题、观点或者粗略脚本,它就会尝试生成一条 30~60 秒的手绘白板信息图讲解视频。口播文案、画面规划、AI 生图、动画校准、配音、字幕和最终渲染都被串在一条流水线上,最后输出一个可以直接预览的 preview.mp4。

比如输入:

AI 工具越多,普通人反而越低效。

它会先把这个观点整理成适合短视频的口播结构,再拆成几个视觉节拍,规划一到两块手绘信息图。随后生成白板图、确定需要标注和强调的元素,配上旁白与字幕,再让箭头、方框、镜头和讲解节奏同步出现。

最后得到的不是单纯的图片轮播,而是一条边讲、边画、边强调重点的信息图视频。

它把几个原本分散的步骤接起来了

这类视频以前也能用 AI 做,但通常需要来回切换好几个工具。

先让大模型写口播,再让生图模型画信息图;图片回来以后,还要判断箭头应该画在哪里、镜头应该放大哪个区域;然后生成配音、字幕,最后回到剪辑或动画工具里把时间轴对齐。

Whiteboard 把这些步骤拆成了几个内部模块:

  • 整理口播文案和六段式讲解节奏;
  • 根据内容规划手绘信息图和生图提示词;
  • 生成或接收最终 PNG;
  • 识别图片中真实元素的位置,建立动画控制层;
  • 用 Edge TTS 生成配音和字幕时间轴;
  • 通过 HyperFrames 渲染视频,并检查动作、镜头和音画同步。

对普通用户来说,不需要分别理解这些模块。安装后对外只暴露一个 whiteboard-video Skill,Codex 或 Claude Code 会按照固定顺序调用内部流水线。

自动校准是这个项目比较特别的地方

AI 生图有一个常见问题:提示词里要求某个图标在左边,最终生成时它可能跑到了中间。假如动画仍然按照模板坐标画红框和箭头,标注就会指错位置。

Whiteboard 会在制作动画前读取实际生成的 PNG,重新识别关键元素的边界框,再根据真实位置调整红线、方框和镜头焦点。

校准可以使用 Agent 的视觉能力、OpenAI 兼容视觉模型或者本地 OCR。如果自动识别没有覆盖全部元素,项目还会生成一个本地校准网页,让用户手动拖动和修正位置,然后重新运行后面的动画与渲染阶段。

这一步不能保证每次都完全正确,但至少解决了“图是模型画的,动画却还死守模板坐标”的问题。

所谓全自动,需要先配置图片模式

项目默认采用 interactive 图片模式,不需要 API Key。AI 助手生成信息图预览后会暂停一次,等用户把图片保存到指定路径,再继续校准、配音和渲染。

如果希望真正从主题一路自动跑到 MP4,需要配置自动图片 Provider。目前项目支持 OpenAI GPT Image 2,也支持符合约定的自定义命令。只有同时设置 WHITEBOARD_IMAGE_MODE=auto、Provider 和 API Key,才会自动发起可能计费的生图请求。

所以,它确实可以做到全流程自动化,但默认状态下仍保留一次人工图片确认。这种设计反而比较稳妥,既避免意外扣费,也防止一张明显画错的信息图直接进入后续视频。

最终交付的不只是一个 MP4

一次完整运行会在当前目录建立独立工程,里面除了 video/preview.mp4,还会保留:

  • 口播文案和视觉节拍;
  • 信息图规划和生图提示词;
  • 生成图片及校准数据;
  • 配音、字幕和时间轴;
  • 可继续修改的 HyperFrames 工程;
  • 关键帧、动作与镜头 QA 报告;
  • 最终验收报告。

项目甚至会检查图片在生图、动画控制层和最终渲染之间是否保持一致,防止中途误用了旧素材或占位图。只有发布候选验收通过,流水线才应该把视频标记为完成。

如何安装

最简单的方式,是把下面这段话交给 Codex 或 Claude Code:

请安装这个项目:https://github.com/zkbys/whiteboard.git

阅读 README 后运行:
python3 scripts/install.py --target codex

Claude Code 把参数换成 --target claude,也可以使用 --target both 同时安装到两边。

运行环境需要 Python 3.10 以上、Node.js 20 以上、FFmpeg、Edge TTS、npx 和指定版本的 HyperFrames。仓库提供了 doctor.py,可以分别检查 Skill 安装、视频渲染、输出目录和图片模式是否就绪。

这个项目目前更像一条工程化的视频生产流水线,而不是面向所有人的一键 App。环境依赖不少,AI 生成的中文也不能保证每个字都正确,自动校准偶尔还需要人工微调。

但它展示了一个很有意思的方向:以后制作解释型短视频,可能不再是“让 AI 写稿、让另一个 AI 生图”,而是把脚本、画面、语音、动画和验收全部交给一个 Agent 流程统一推进。

输入一个观点,过一会儿拿到一条带口播、字幕和手绘动画的视频。这个目标,现在已经越来越接近真正可用了。

标签:

Design视频
作者

ddxw

关注我
其他文章
上一个

Things 接上 MCP 很方便,但第三方服务真的安全吗?

下一个

Matt Pocock 的 22 个 Skills:不是 Vibe Coding,而是把软件工程流程交给 Agent

暂无评论!成为第一个。

发表回复 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Copyright 2026 — 东倒西歪玩AI. All rights reserved. Blogsy WordPress Theme