OPEN SOURCE DEEP DIVE
PPT Master:把文档生成原生 PowerPoint(不是套模板)
把 PDF/DOCX/网页或一句主题交给任意 agent 工具,在本机生成原生可编辑的 PPTX:真幻灯片母版、原生形状、数据图表与可编辑公式,还能填充已有 pptx 的设计。
PPT Master 是一个跑在 AI agent 里的「做 PPT」工作流:把一个 PDF、一份 DOCX、一个网页链接,甚至只是一句主题交给它,它在你自己的机器上生成一份原生可编辑的 .pptx —— 不是一叠文本框,也不是往现成模板里填空。
它生成的到底是什么
「可编辑」如今只是及格线,真正的问题是:你到底拿到了多少 PowerPoint。PPT Master 交付的是 PowerPoint 自己的对象模型,而且做得比较深:
- 原生形状与连接线,带可用的调整手柄,点中任何一个元素都能当作 PowerPoint 原生对象继续改;
- 数据驱动的图表与表格,按需生成 —— 默认是形状版,加
--native-charts-and-tables则输出带「编辑数据」的 PowerPoint Chart / Table 对象; - 完整的文本 / 图片 / 填充 / 效果模型;
- 走模板或结构化路线时,输出带真实幻灯片母版与版式的演示稿(
p:sldMaster/p:sldLayout继承); - 公式编译成可编辑的 OMML,PowerPoint 2010+ 打开即可改。
官方把这件事的进度写成了逐条对照的《PowerPoint ↔ SVG 映射指南》—— 现在覆盖到哪、哪些做不到,都摆在台面上。SmartArt 是有意不做,不是「还没做」。
不止一条路线
从素材生成新演示稿是主线,但不是唯一一条。它还能:
- 从你给的参考里提炼可复用的品牌 / 风格 / 版式 / 演示稿模板;
- 填充已有的
.pptx:保留原设计与未改动页面(逐字节不动),只改你指定的页,支持挑选与重排,并可补备注或旁白; - 给做好的稿子加原生转场、动画与旁白。
每条路线都写明了「哪些东西会被保住」这个契约,不是含糊的「尽力保留」。
工作方式:一个 skill,跑在任何能跑 agent 的工具里
形态上它是 agent 的一个 workflow。你做的事情只有三件:装 Python(3.10+ 即可,依赖一行 pip install -r requirements.txt)、装一个 AI 工具、把素材丢进去。之后在对话框里说「用这份 PDF 做个 PPT」,内容分析、视觉设计、SVG 生成与 PPTX 导出都由 agent 完成,产物落在 exports/<name>_<timestamp>.pptx,默认还会把自包含的逐页预览写到 svg_final/。
默认流程会先跟你确认设计规格(模板 / 画幅 / 页数);说一句「快速生成、不用确认」,它就跳过这一轮直接出稿。配图有两条路且可逐张混用:用宿主 agent 自带的生图能力,或走 image_gen.py 接第三方生图后端;也可以走 image_search.py 联网搜图 —— 无 key 也能用(Openverse / Wikimedia Commons),配上免费的 Pexels / Pixabay key 后现代素材明显变好,授权(CC0、公有领域、CC BY、CC BY-SA 等)自动判断,需要署名的图会就地补一行出处。
三个承诺,和一条明确的边界
在原生深度之外,这个项目把话说得很直:
- 成本透明:免费开源,唯一开销是你的模型用量,不再叠一层 PPT 订阅;
- 数据留在本地:除了与模型通信,整条流水线跑在你自己的机器上;
- 不锁平台:任何能跑 agent 的 AI IDE 都能驱动,Claude、GPT、Gemini、Kimi 等模型都能用。
它同时明确写下自己的边界:「这是一个工具,不是许愿池」。项目只拥有工作流,上限由模型决定 —— 官方推荐大上下文窗口(约 100 万 token)的模型配生图能力;别指望一次就得到终稿,这个工具的价值是把手上的苦活拿走大半,剩下的打磨归你 —— 而正因为出的稿是原生可编辑的,你才打磨得下去。模型越便宜,剩下的活越多;结果不满意,先换模型,再回头对照使用说明。
上手
- 装 Python 3.10+(Windows 有专门的逐步安装指南);
- 把
ppt-master目录在任意 agent 工具里打开,或cd进去启动 CLI agent; - 把 PDF / DOCX / 图片放进
projects/,在对话框里指名要用的文件 —— 或者直接把文字粘进去。
许可证 MIT(PDF 转换用到的 PyMuPDF 是 AGPL-3.0,仅在需要处理 PDF 素材时涉及,重新分发前需留意)。