Blog

Một trang mẫu nợ người đọc điều gì

3.926 trang mẫu của chúng tôi hiển thị khoảng 90 từ riêng biệt mỗi trang. Những gì chúng tôi đã đo lường trước khi thêm nhiều hơn, tại sao mẫu được lấy có trọng số, và những gì nó đã tìm thấy.

Đăng ngày

PPT AI công bố 3.926 mẫu bản trình bày, mỗi mẫu có một trang riêng tại ppt.sophoninc.com. Một trang có nhiệm vụ hiển thị một thiết kế vẫn phải dễ đọc đối với người chưa thể xem thiết kế, hoặc đang quyết định giữa hai thiết kế. Điều đó có nghĩa là ít nhất: bộ slide dùng để làm gì, có gì trên mỗi slide, bao nhiêu slide và kích thước nào, có thể thay đổi những gì, và làm thế nào để bắt đầu. Bài đăng này nói về việc tìm ra các trang của chúng tôi còn cách đó bao xa, và chúng tôi đã đo lường những gì trước khi thêm bất cứ thứ gì.

Một trang mẫu hiển thị những gì hôm nay

Bốn trang mẫu đã được lấy về và đếm vào ngày 16 tháng 9 năm 2026. Phương pháp đếm: xóa các phần tử script và style, xóa các thẻ còn lại, chuyển ngược các thực thể HTML, lấy các token từ khớp với [A-Za-z0-9][A-Za-z0-9’'&-]*, và chuyển chúng thành chữ thường trước khi đếm các từ riêng biệt. Chúng tôi nêu rõ trình token hóa vì số lượng từ riêng biệt thay đổi một vài từ tùy thuộc vào nó.

TrangTổng số từSố từ riêng biệtSố từ riêng biệt ngoài phần chung
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

“Shared chrome” là 60 từ riêng biệt chung cho cả bốn trang: thanh điều hướng, chân trang, đường dẫn breadcrumb và hai lời kêu gọi hành động. Loại bỏ những từ đó và mỗi trang có từ 19 đến 31 từ riêng biệt nói về mẫu đó. Phần còn lại của trang giống nhau trên 3.926 trang.

Để bạn dễ hình dung, trong ba tháng tính đến ngày 16 tháng 9 năm 2026, các trang đó đã có 484 lượt hiển thị và 7 lượt nhấp với vị trí trung bình là 20,2, trên 187 trang riêng biệt và 12 truy vấn riêng biệt. Con số này lấy từ Google Search Console cho sc-domain:sophoninc.com, được lọc theo ppt.sophoninc.com/templates/. Chỉ chủ sở hữu thuộc tính mới có thể xem Search Console; chúng tôi cung cấp thuộc tính, bộ lọc và khoảng thời gian để bất kỳ ai có quyền truy cập đều có thể tái tạo lại, đây là mức độ có thể kiểm chứng được của nguồn đó.

Câu hỏi mà cuộc kiểm tra phải trả lời

Các slide của mỗi mẫu đều chứa văn bản: tiêu đề, nhãn, nội dung thân bài được viết để lấp đầy thiết kế. Nội dung này được cung cấp công khai tại /api/v2/templates/<slug>/slides/<n>, và đây là điều hiển nhiên nên đưa lên trang. Trước khi làm điều đó, chúng tôi phải trả lời một phản đối: 3.926 trang chứa nội dung slide được tạo ra có thể là 3.926 trang gần như giống hệt nhau, điều này còn tệ hơn 3.926 trang có nội dung sơ sài.

Vậy: một mẫu có bao nhiêu phần trăm văn bản chung với mẫu mà nó giống nhất?

Tại sao lấy mẫu đồng nhất lại cho ra câu trả lời sai

Phương pháp ngây thơ là lấy mẫu ngẫu nhiên các mẫu và so sánh các cặp. Phương pháp đó không thể tìm thấy sự trùng lặp trong kho dữ liệu này, và chúng tôi sẽ giải thích chính xác tại sao.

Thư viện được sắp xếp theo danh mục, theo công thức và theo họ kiểu. Một cặp ngẫu nhiên được rút ra từ 3.926 mục hầu hết là một cặp từ các danh mục khác nhau về các chủ đề khác nhau. Những cặp đó gần như không có điểm chung nào bất kể kho dữ liệu có bị trùng lặp đến đâu. Chúng tôi đã đo lường điều đó: 392 cặp ngẫu nhiên giữa các họ kiểu có độ chứa 5-gram trung vị là 0,00% và tối đa là 0,3%. Một mẫu đồng nhất trả về “the corpus is unique” như một sản phẩm phụ của việc lấy mẫu, chứ không phải là một phát hiện.

Các cặp có thể tiết lộ sự trùng lặp là các cặp gần nhất, và chúng chiếm một phần rất nhỏ trong tất cả các cặp. Vì vậy, mẫu đã được điều chỉnh trọng số nghiêng về chúng. Các mẫu được nhóm theo danh mục, slug công thức và họ kiểu, và 33 nhóm đã được chọn ra thuộc bốn loại:

  • các cặp song sinh được đánh số, trong đó các slug chỉ khác nhau ở hậu tố -2 hoặc -3 (8 nhóm)
  • cùng công thức và cùng họ kiểu (4 nhóm)
  • cùng họ kiểu, khác công thức (13 nhóm)
  • các nhóm bao phủ, mỗi danh mục một nhóm, để không danh mục nào không được đo lường (8 nhóm)

Sau đó, văn bản slide đã được lấy cho mọi thành viên của mọi nhóm: 232 mẫu, 1.034 slide, 0 lỗi truy xuất, vào ngày 16 tháng 9 năm 2026. Đó là 5,9% của kho dữ liệu, được chọn là 5,9% khó nhất.

Lượt kiểm tra quyết định

Chỉ trọng số hóa mẫu thôi thì chưa đủ, vì hàng xóm gần nhất thực sự của một mẫu có thể là một mẫu chưa được lấy về, điều này sẽ đánh giá thấp sự trùng lặp. Vì vậy, một lượt thứ hai đã giới hạn so sánh trong các cụm mà mọi thành viên đều đã được lấy về: 46 cụm hoàn chỉnh, 117 mẫu. Bên trong các cụm đó, hàng xóm gần nhất của một mẫu trong toàn bộ kho 3.926 mẫu được đảm bảo nằm trong tập hợp được đo lường.

Số liệu là mức độ chứa 5-gram: phần trăm các chuỗi năm từ riêng biệt của một mẫu cũng xuất hiện trong mẫu tương tự gần nhất. Chúng tôi dùng mức độ chứa thay vì chỉ số Jaccard vì nó không đối xứng — một mẫu ngắn được chứa hoàn toàn trong một mẫu dài nên được coi là trùng lặp hoàn toàn, trong khi chỉ số Jaccard sẽ báo cáo nó là một phần độc nhất.

Kết quả cho 117 mẫu đó, so với hàng xóm gần nhất thực sự trong kho văn bản:

Chỉ sốGiá trị
Mức độ chứa 5-gram trung vị0,00%
Trung bình0,50%
Phân vị thứ 953,46%
Tối đa8,82%
Các mẫu trên 10%0
Mức độ chứa 3-gram, trung vị / tối đa0,31% / 13,89%

Lượt 3-gram được dùng để phát hiện bản sao đã được diễn giải lại thay vì tái sử dụng; nó làm thay đổi các con số nhưng không thay đổi kết luận. Cặp tệ nhất trong kho văn bản là poster-quote-typography-modern-gradient so với poster-bold-text-modern-gradient, ở mức 8,82%.

Trên tất cả 232 mẫu: trong số 3.448 câu riêng biệt có sáu từ trở lên, có 2 câu xuất hiện trong nhiều hơn một mẫu — “the results relate only to the items tested” và “no other graphic elements should intrude into this zone”. Trên mỗi slide, trong số 992 slide có 20 từ trở lên, mức độ chứa trung vị so với slide gần nhất trong bất kỳ mẫu nào khác là 0,0%; 8 slide trên 20% và không có slide nào trên 50%. Độ tương đồng về chủ đề được đo bằng cosin túi từ, vốn bỏ qua cách diễn đạt, thì cao hơn, đúng như mong đợi đối với hai mẫu sơ yếu lý lịch: trung vị 12,7% so với mẫu cùng loại gần nhất, tối đa 35,3%.

Giới hạn trung thực: đây là 232 trong số 3.926 mẫu và 117 mẫu trong tập hợp được đảm bảo gần nhất. Đây là bằng chứng về phần khó nhất của kho văn bản, không phải là bằng chứng về toàn bộ.

Điều chúng tôi đã quyết định

Cuộc kiểm tra đã loại bỏ phản đối về sự trùng lặp đối với việc công bố văn bản slide. Chúng tôi không công bố phần thân của slide. Chúng tôi đã công bố tiêu đề slide, vốn đã tồn tại trong bản ghi mẫu và đang được lấy về rồi loại bỏ.

Chúng tôi đã kiểm tra trên tất cả 3.926 mẫu trước khi công bố: 14.969 tiêu đề, không có tiêu đề nào trống, không có tiêu đề nào chỉ là “Slide N” hoặc “Page N”, và slide_titles.length bằng slide_count trên mọi mẫu. Hai giới hạn đã được ghi nhận thay vì bỏ qua: 156 tiêu đề (1,0%) kết thúc bằng “… Page N”, và trên 77 mẫu (2%) mọi tiêu đề đều như vậy. 1.321 mẫu (34%) có một slide duy nhất và không có danh sách nào cả.

Do đó, thay đổi này ảnh hưởng đến 2.605 trang và thêm trung bình 15 từ vào mỗi trang, tức trung bình 10,4 từ mỗi trang trên toàn bộ kho văn bản. Con số này là có thật và nhỏ. Nó không tự mình đưa một trang ra khỏi vùng nội dung nghèo nàn, và phần hữu ích hơn có thể là các tiêu đề có thể nhấp được: trước đây để chuyển đến slide 7 cần phải nhấn nút Tiếp theo sáu lần.

Nhánh đó cũng liên kết đến các mẫu không có liên kết nào trỏ tới. Các trang duyệt đã ghim aspect_ratio ở tỷ lệ 16:9, chiếm khoảng 45% thư viện, vì vậy phần còn lại không xuất hiện trên trang trung tâm nào và trong khối liên quan nào: /templates?category=document và ?category=poster trả về một trang “coming soon” không có liên kết mẫu nào. Một trang không có liên kết nội bộ nào trỏ đến nó thì không nợ người đọc điều gì, vì không có người đọc nào đến được.

Chưa được triển khai, và một câu hỏi vẫn còn bỏ ngỏ

Chưa có thay đổi nào trong số này được đưa lên. Nó nằm trong pull request 10 trên Sophon-LLC/ppt-ai, được mở vào ngày 15 tháng 9 năm 2026 và vẫn còn mở vào ngày 16 tháng 9 năm 2026, gồm ba commit, đã được xác minh bằng kiểm tra kiểu, chạy lint và bản dựng sản phẩm phục vụ trên kho dữ liệu trực tiếp. Cho đến khi nó được hợp nhất, các trang vẫn như được đo lường ở đầu bài đăng này.

Câu hỏi còn bỏ ngỏ là câu hỏi mà cuộc kiểm tra không trả lời được. Tập hợp được đo lường chứa trung bình 288 từ văn bản nội dung cho mỗi mẫu, so với 19 đến 31 từ dành riêng cho mẫu mà một trang hiển thị ngày nay. Cuộc kiểm tra cho biết văn bản đó không trùng lặp. Nó không cho biết liệu văn bản được viết để lấp đầy bố cục có được người đọc xem là nội dung thay vì là văn bản điền vào chỗ trống hay không, và chưa có ai đo lường điều đó. Việc công bố 3.926 trang như vậy chỉ dựa trên kết quả về sự trùng lặp sẽ là trả lời một câu hỏi mà chúng tôi không đặt ra.

Tất cả bài đăng