Blog

模板页面应向读者提供什么

我们的 3,926 个模板页面每个大约呈现 90 个不同的词。我们在添加更多内容前测量了什么,为什么样本是加权的,以及发现了什么。

发布于

PPT AI 发布了 3,926 个演示文稿模板,每个模板在 ppt.sophoninc.com 上都有自己的页面。一个旨在展示设计的页面,仍然需要能被那些还看不到设计,或正在两个设计之间抉择的人所阅读。这意味着至少要说明:幻灯片的用途、每张幻灯片的内容、幻灯片的数量和尺寸、哪些内容可以更改,以及如何开始。这篇文章是关于我们如何发现自己的页面与此相差多远,以及在添加任何内容之前我们测量了什么。

如今一个模板页面呈现的内容

2026 年 9 月 16 日,我们获取并统计了四个模板页面。统计方法:移除 scriptstyle 元素,移除剩余的标签,对 HTML 实体进行反转义,提取匹配 [A-Za-z0-9][A-Za-z0-9’'&-]* 的单词词元,并在统计不同单词前将其转换为小写。之所以说明分词器,是因为不同单词的计数会因分词器而有几个词的差异。

页面总词数不同单词数共享框架外的不同单词数
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

“Shared chrome”是四个页面共有的 60 个不同词语,包括导航、页脚、面包屑导航和两个号召性用语。去掉这些之后,每个页面上关于该模板的词语在 19 到 31 个之间。页面的其余部分在 3,926 个页面上都是相同的。

作为背景信息,在截至 2026 年 9 月 16 日的三个月里,这些页面在 187 个不同页面和 12 个不同查询中获得了 484 次展示和 7 次点击,平均排名为 20.2。该数据来自 Google Search Console,查询域为 sc-domain:sophoninc.com,并筛选至 ppt.sophoninc.com/templates/。Search Console 仅对网站资源所有者可见;提供网站资源、筛选条件和日期范围是为了让任何有权限的人都能复现此结果,这是该来源所能提供的最高可核查性。

审计需要回答的问题

每个模板的幻灯片都带有文本:为填充设计而编写的标题、标签和正文。这些内容通过 /api/v2/templates/<slug>/slides/<n> 公开提供,将其放在页面上是显而易见的选择。但在这样做之前,必须回答一个反对意见:3,926 个页面的生成演示文稿副本可能会变成 3,926 个近乎相同的页面,这比 3,926 个内容贫乏的页面更糟糕。

所以问题是:一个模板与其最相似的模板共享多少文本?

为什么均匀抽样会得出错误答案

最直接的方法是随机抽取模板并进行配对比较。这种方法无法在这个语料库中发现重复内容,其原因值得我们精确说明。

该资料库按类别、方案和风格系列进行组织。从 3,926 个项目中随机抽取的一对,绝大多数情况下是来自不同类别、关于不同主题的一对。无论语料库的重复度有多高,这些项目对几乎没有任何共同之处。我们对此进行了测量:392 个随机的跨风格系列项目对的 5-gram 包含度的中位数为 0.00%,最大值为 0.3%。均匀抽样会返回 “the corpus is unique” 这个结果,但这只是抽样过程的产物,而不是一个发现。

能够揭示重复内容的配对是那些最邻近的配对,而它们在所有配对中只占极小部分。因此,样本被加权以偏向这些配对。模板按类别、配方 slug 和样式族进行分组,并从四种类型中抽取了 33 个组:

  • 编号孪生组,其 slug 仅在末尾有 -2-3 的差异(8 组)
  • 相同配方和相同样式族(4 组)
  • 相同样式族,不同配方(13 组)
  • 覆盖组,每个类别一个,以确保没有类别未经测量(8 组)

随后,在 2026 年 9 月 16 日,我们获取了每个组中每个成员的幻灯片文本:共 232 个模板,1,034 张幻灯片,0 次获取错误。这占语料库的 5.9%,并且是特意挑选的最难处理的 5.9%。

决定性的一轮

仅仅对样本进行加权仍然不够,因为一个模板真正的最近邻可能并未被获取,这会低估重叠程度。因此,第二轮将比较范围限制在所有成员都已被获取的集群中:46 个完整集群,117 个模板。在这些集群内部,可以保证一个模板在整个 3,926 个模板的语料库中的最近邻一定在被测集合中。

衡量指标是 5-gram 包含度:一个模板的独特五词序列中,同时出现在其最近邻模板中的序列所占的比例。我们使用包含度而非 Jaccard 系数,因为它是非对称的——一个完全包含在长模板中的短模板应被视为完全重复,而 Jaccard 系数会报告其为部分独特。

这 117 个模板与其在语料库中真正的最近邻的比较结果如下:

衡量指标
5-gram 包含度中位数0.00%
平均值0.50%
第 95 百分位数3.46%
最大值8.82%
超过 10% 的模板0
3-gram 包含度,中位数 / 最大值0.31% / 13.89%

3-gram 检查旨在捕捉那些经过改写而非直接重用的副本;它改变了数字,但没有改变结论。语料库中最差的一对是 poster-quote-typography-modern-gradientposter-bold-text-modern-gradient,相似度为 8.82%。

在所有 232 个模板中:在 3,448 个包含六个或更多单词的不同句子中,有 2 个出现在多个模板中——“the results relate only to the items tested”和“no other graphic elements should intrude into this zone”。按幻灯片计,在 992 张包含 20 个或更多单词的幻灯片中,与任何其他模板中最近似的幻灯片的包含度中位数为 0.0%;有 8 张超过 20%,没有一张超过 50%。通过忽略措辞的词袋余弦相似度测量的专题相似性更高,对于两个简历模板来说理应如此:与最接近的同系列模板相比,中位数为 12.7%,最大值为 35.3%。

诚实的局限:这是 3,926 个模板中的 232 个,以及保证最相近集合中的 117 个。这是关于语料库中最困难部分的证据,而不是关于其全部的证明。

我们的决定

这次审计消除了发布幻灯片文本会造成内容重复的反对意见。我们没有发布幻灯片正文。我们发布了幻灯片标题,这些标题本已存在于模板记录中,只是之前被获取后又被丢弃了。

在发布之前,我们检查了所有 3,926 个模板:14,969 个标题,没有一个是空的,没有一个是单纯的“Slide N”或“Page N”,并且每个模板的 slide_titles.length 都等于 slide_count。有两个限制被记录下来而不是被忽略:156 个标题(1.0%)以“… Page N”结尾,并且在 77 个模板(2%)上每个标题都是如此。1,321 个模板(34%)只有一个幻灯片,根本不显示列表。

因此,这一更改影响了 2,605 个页面,为每个页面平均增加了 15 个单词,整个语料库中每个页面平均增加 10.4 个单词。这是真实的,但也很小。它本身并不能让一个页面摆脱内容贫乏的境地,而更有用的部分可能是标题是可点击的:以前跳转到第 7 张幻灯片需要按六次“下一步”。

同一个分支链接了那些没有被链接到的模板。浏览界面将宽高比固定为 16:9,这大约占模板库的 45%,因此其余部分没有出现在任何中心页面或相关区块中:/templates?category=document?category=poster 返回了一个显示“coming soon”的页面,上面没有任何模板链接。一个没有任何内部链接指向的页面对读者没有任何亏欠,因为根本没有读者会到达那里。

尚未部署,以及一个悬而未决的问题

这些都还没有上线。它位于 Sophon-LLC/ppt-ai 上的拉取请求 10,于 2026 年 9 月 15 日开启,到 2026 年 9 月 16 日仍处于开放状态,包含三个提交,通过了类型检查、代码风格检查和针对实时数据存储库的生产构建验证。在它合并之前,这些页面的情况就如本文开头所测量的那样。

悬而未决的问题是审计无法回答的那个。被测量的集合每个模板平均包含 288 个单词的正文文本,而如今一个页面渲染的模板特定单词为 19 到 31 个。审计表明该文本不是重复的。但它并没有说明,为填充布局而写的文本在人们看来是内容还是仅仅是填充物,而且没有人对此进行过测量。仅凭一个关于重复性的结果就发布 3,926 个这样的页面,将是在回答一个我们没有问过的问题。

所有文章