Blog

範本頁面該為讀者提供什麼

我們的 3,926 個範本頁面,每個呈現約 90 個不同的詞。我們在增加更多內容前測量了什麼、為何樣本經過加權,以及發現了什麼。

發布於

PPT AI 發布了 3,926 個簡報範本,每個範本在 ppt.sophoninc.com 上都有自己的頁面。一個旨在展示設計的頁面,仍然必須讓還沒看到設計,或正在兩個設計之間做決定的人能夠閱讀。這至少意味著:這份簡報的用途、每張投影片的內容、投影片的數量與尺寸、哪些部分可以修改,以及如何開始。這篇文章是關於我們發現自己的頁面與此目標相差多遠,以及在新增任何內容之前我們測量了什麼。

現今範本頁面呈現的內容

我們在 2026 年 9 月 16 日擷取並計算了四個範本頁面。計算方法:移除 scriptstyle 元素,移除剩餘的標籤,將 HTML 實體轉義回來,取出符合 [A-Za-z0-9][A-Za-z0-9’'&-]* 的單詞 token,並在計算相異詞前將其轉為小寫。之所以說明分詞器,是因為相異詞的計數會因此有幾個詞的差異。

頁面總詞數相異詞數共享介面外的相異詞數
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

「Shared chrome」是在所有四個頁面中共通的 60 個不同詞彙:導覽列、頁尾、麵包屑,以及兩個行動呼籲。去除這些之後,每個頁面上關於該範本的詞彙介於 19 到 31 個之間。頁面的其餘部分在 3,926 個頁面上都是相同的。

作為參考,在截至 2026 年 9 月 16 日的三個月內,這些頁面在 187 個不同頁面和 12 個不同查詢中,獲得了 484 次曝光和 7 次點擊,平均排名為 20.2。此數據來自 Google Search Console 的 sc-domain:sophoninc.com,並篩選至 ppt.sophoninc.com/templates/。Search Console 僅對資源所有者可見;提供資源、篩選條件和日期範圍是為了讓任何有權限的人都能重現結果,這是該來源所能達到的最高可查證性。

這次審核必須回答的問題

每個範本的投影片都帶有文字:標題、標籤、為填充設計而寫的內文。它透過 /api/v2/templates/<slug>/slides/<n> 公開提供,而將其放在頁面上是顯而易見的做法。在這麼做之前,必須回答一個反對意見:3,926 個由簡報文案生成的頁面,可能會變成 3,926 個幾乎相同的頁面,這比 3,926 個內容貧乏的頁面更糟。

所以問題是:一個範本與其最相似的範本共享多少文字?

為什麼均勻抽樣會得到錯誤的答案

最直觀的方法是隨機抽樣範本並比較配對。該方法無法在這個語料庫中找到重複之處,而其原因值得我們確切說明。

該資料庫依類別、配方與風格系列組織。從 3,926 個項目中隨機抽取的一對,絕大多數是來自不同類別、關於不同主題的一對。無論語料庫的重複性有多高,這些配對幾乎沒有共通之處。我們測量過:392 個隨機的跨系列配對,其 5-gram 包含度的中位數為 0.00%,最大值為 0.3%。一個均勻的樣本會回傳「the corpus is unique」,這是抽樣的人為結果,而非一項發現。

最能揭示重複性的配對是最近鄰,但它們在所有配對中只佔極小一部分。因此,樣本加權偏向它們。範本依類別、配方代稱和風格系列分組,並從四種類型中抽取了 33 組:

  • 編號雙胞胎,其代稱僅在結尾的 -2-3 有所不同(8 組)
  • 相同配方和相同風格系列(4 組)
  • 相同風格系列,不同配方(13 組)
  • 涵蓋組,每個類別一組,確保沒有類別未被測量(8 組)

接著,我們在 2026 年 9 月 16 日擷取了每個群組中所有成員的投影片文字:共 232 個範本、1,034 張投影片,0 次擷取錯誤。這佔了語料庫的 5.9%,且是特意挑選最困難的 5.9%。

決定性的一輪

僅僅對樣本加權仍然不夠,因為一個範本真正的最近鄰可能未被擷取,這會低估重疊程度。因此,第二輪將比較範圍限制在所有成員都已被擷取的叢集:46 個完整叢集,117 個範本。在這些叢集中,一個範本在整個 3,926 個範本的語料庫中的最近鄰,保證會出現在被測量的集合中。

測量指標是 5-gram 包含度:一個範本中獨特的五詞序列同時也出現在其最近鄰中的比例。我們使用包含度而非 Jaccard 係數,因為它是非對稱的——一個完全包含在長範本中的短範本應被視為完全重複,而 Jaccard 係數會將其回報為部分獨特。

這 117 個範本與其在語料庫中真正最近鄰的比較結果:

測量指標數值
5-gram 包含度中位數0.00%
平均值0.50%
第 95 百分位數3.46%
最大值8.82%
高於 10% 的範本數0
3-gram 包含度,中位數/最大值0.31% / 13.89%

進行 3-gram 比較是為了捕捉被改寫而非直接重用的文案;它改變了數字,但沒有改變結論。語料庫中最糟的一對是 poster-quote-typography-modern-gradientposter-bold-text-modern-gradient,為 8.82%。

在所有 232 個範本中:3,448 個六個詞以上的獨特句子裡,有 2 個出現在超過一個範本中——「the results relate only to the items tested」和「no other graphic elements should intrude into this zone」。就每張投影片而言,在 992 張含有 20 個詞以上的投影片中,與任何其他範本中最近鄰投影片的包含度中位數為 0.0%;8 張高於 20%,沒有一張高於 50%。以詞袋餘弦相似度(忽略措辭)測量的 topical similarity 則較高,這對於兩個履歷範本來說是正常的:與同風格系列最近鄰的中位數為 12.7%,最大值為 35.3%。

坦白說有限制:這是 3,926 個範本中的 232 個,以及保證最接近集合中的 117 個。這是關於語料庫中最困難部分的佐證,而非關於其全體的證明。

我們的決定

這次審核消除了發布投影片內文的重複性疑慮。我們沒有發布投影片的內文。我們發布了投影片標題,這些標題早已存在於範本紀錄中,只是被擷取後又捨棄。

在發布所有 3,926 個範本前已檢查過:共 14,969 個標題,沒有一個是空的,也沒有一個是單純的「Slide N」或「Page N」,且每個範本的 slide_titles.length 都等於 slide_count。有兩項限制被記錄下來,而非加以修飾:156 個標題(1.0%)以「… Page N」結尾,且在 77 個範本(2%)中,每個標題都是如此。1,321 個範本(34%)只有一張投影片,因此完全沒有列表。

因此,這項變更觸及 2,605 個頁面,為每個頁面平均增加 15 個字,整個語料庫中每頁平均增加 10.4 個字。這雖是事實,但增幅很小。這本身並不能讓一個頁面脫離內容貧乏的範疇,而更有用的部分或許是標題可以點擊:以前要跳到第 7 張投影片需要按六次「下一步」。

同一個分支連結了沒有任何東西連結過去的範本。瀏覽頁面將釘選的 aspect_ratio 設為 16:9,這大約是資料庫的 45%,所以剩下的範本沒有出現在任何中心頁面或相關區塊中:/templates?category=document?category=poster 都回傳一個「coming soon」頁面,上面沒有任何範本連結。一個沒有內部連結連入的頁面不欠讀者任何東西,因為沒有讀者會到達。

尚未部署,且一個問題仍待解決

這些都還沒上線。這是 Sophon-LLC/ppt-ai 上的 pull request 10,於 2026 年 9 月 15 日開啟,至 2026 年 9 月 16 日仍開啟中,有三個 commit,已透過型別檢查、程式碼風格檢查以及對著線上資料庫提供服務的生產建置進行驗證。在它合併之前,頁面狀態就如本文章開頭所測量的那樣。

待解的問題是審核無法回答的那個。被測量的集合中,每個範本的內文平均有 288 個字,而現今頁面呈現的範本特定文字只有 19 到 31 個字。審核報告說這些文字不具重複性,但它沒說為了填滿版面而寫的文字,在人們眼中讀起來是內容還是填充物,而這一點沒有人測量過。僅憑一個關於重複性的結果就發布 3,926 頁這樣的內容,將會是回答一個我們沒問過的問題。

所有文章