GPT / Codex 做 PPT:选型与评测方法

不绑版本的通用方法。模型会一直更新(GPT 已到 5.5),但”怎么选路线、怎么评一版 PPT 好不好”是不变的。


一、两条路线怎么选(版本无关)

你的需求走哪条
快速出一个能看、能改的框架,不折腾网页版 GPT 直接生成(见入门篇)
像素级对标参考图 + 原生可编辑Codex + 四层结构 gen-ppt(见进阶篇)
综合省心、第一版就能用带”自检/验证”能力的 agent + PPT Skill

选路线看的是”你要能看还是要像参考图”,不是看模型版本号。

二、6 个维度,评任何一版 AI 做的 PPT

不管哪个模型、哪个版本,出来一版 PPT 就从这 6 个维度打分,横向对比:

  1. 大纲质量 —— 逻辑是否完整、有无额外洞察
  2. 单页信息密度 —— 卡片框架搭得起来吗、内容填充够吗(最容易”好看但空”)
  3. 图表和数据 —— 能否出柱状图/关系图/时间线、数据是真实还是编的
  4. 中文表达和标题感 —— 标题简洁有力吗、正文有无翻译腔
  5. 页面一致性 —— 配色/页码/分类标签/字体间距全程统一吗
  6. 生成速度

用法:固定同一套提示词、同一主题,只换模型/工具,逐项打分。变量只留一个,对比才公平。这套方法测 GPT、Codex、Claude、Gemini 都通用。

三、评测时会看到的两类”工作方式”(通用观察)

  • “先告诉你我打算怎么做” —— 开做前给一个计划预览,可中途喊停换方向。省得白等。
  • “做完自己检查一遍” —— 起子进程/验证步骤,专门核对内容和数据。数据通常更靠谱。

能”自检/验证”的,产出的数据可信度往往更高——这条不挑版本。

四、通病(所有 AI 都有,必须自己兜底)

  • 图表能画,数据靠编 —— 数字”太整”多半是占位假数据。关键数据一律自己复核再交付。
  • 配色要写进提示词 —— AI 不会自己思考统一配色,不写就容易花。
  • “好看”≠“好用” —— 框架漂亮但内容空是常见陷阱,按维度 2(信息密度)卡一下。

五、选模型的心法

不追”哪个版本最强”——版本一个月一变,追不过来。追的是”这条路线 + 这套评测维度”。新模型出来,用同一套提示词 + 6 维度一测,自己就知道值不值得换。

(想追新版本热点发笔记是另一回事——那恰恰要追最新的 5.5,见 AI做PPT知识库-关键词矩阵 趋势词。产品库里留通用方法,笔记里追最新版本。)