Tập này kể bước gom và bước phân cụm của dự án maxmin.vn. Kết quả chính: trong 1.626.728 từ khoá, 810.008 từ (gần một nửa) có dưới 10 lượt tìm mỗi tháng, còn 8.942 từ từ 10.000 lượt trở lên gánh 71,5% tổng lượt tìm cộng dồn. Phân cụm theo nhu cầu cho ra hai phát hiện mà bản định hướng đầu tiên bỏ sót, và bốn kiểu nhiễu phải bóc trước khi dùng con số nào.
Toàn bộ phần đọc dữ liệu do máy làm. Máy gom (gom.py) và máy phân cụm (cum.py, cum-v3.py) là các tệp Python ngắn nằm trong hồ sơ nghiên cứu; ai có cùng kho đều chạy lại được và ra cùng con số. Con người chỉ đọc bảng tổng hợp cuối và các từ khoá đứng đầu mỗi cụm.
Máy gom: đọc mọi tệp, gộp trùng, giữ lượt tìm lớn nhất
Dữ liệu rút từ Semrush trong ba ngày có nhiều dạng: tệp TSV và CSV của công cụ tìm từ khoá, tệp vị trí từ khoá của đối thủ, tệp trang có traffic cao. Tên cột cũng khác nhau giữa các lần xuất. Máy gom làm bốn việc: đi qua mọi tệp trong bốn thư mục dữ liệu; tìm dòng tiêu đề có cột từ khoá và cột lượt tìm trong mười dòng đầu; đọc lượt tìm, KD, CPC của từng dòng (kể cả dạng viết tắt như 1.2K); và gộp các dòng trùng từ khoá, giữ dòng có lượt tìm lớn nhất.
Chạy ngày 27/09/2026, máy đọc được 1.439 tệp có đủ cột, trả về 1.626.728 từ khoá khác nhau và 762.793 dòng vị trí của đối thủ (dùng ở tập 5). Thời gian chạy khoảng 35 giây trên máy tính văn phòng.
Một nửa kho gần như không ai tìm. Khi chia từ khoá theo dải lượt tìm, phần lớn kho nằm ở đuôi rất dài: đó là những biến thể chữ, câu hỏi dài, lỗi gõ mà công cụ vẫn liệt kê. Phần đầu mỏng lại gánh gần hết lượt tìm.

| Dải lượt tìm | Số từ khoá | Tổng lượt tìm của dải |
|---|---|---|
| Dưới 10 | 810.008 | gần 0 |
| 10 đến 99 | 535.359 | 14.912.711 |
| 100 đến 999 | 211.080 | 65.267.508 |
| 1.000 đến 9.999 | 61.339 | 188.851.410 |
| Từ 10.000 | 8.942 | 675.246.120 |
Đọc bảng theo góc làm sản phẩm: đếm số từ khoá không nói gì về nhu cầu. Một cụm có 20.000 từ có thể nhỏ hơn một cụm 200 từ. Mọi so sánh phía sau dùng tổng lượt tìm và luôn đọc kèm từ khoá đứng đầu.
Máy phân cụm: 30 cụm nhu cầu viết bằng biểu thức
Phân cụm ở đây không dùng mô hình học máy. Mỗi cụm là một biểu thức chính quy viết tay mô tả một nhu cầu công cụ, ví dụ cụm tra cứu mã số thuế bắt các từ có "tra cứu" hoặc "kiểm tra" đi cùng "mã số thuế", "mst", "doanh nghiệp". Cách này thô nhưng có ba ưu điểm với một dự án nhỏ: đọc được, sửa được trong vài giây, và khi một từ lọt nhầm cụm thì biết ngay vì sao.
Với mỗi cụm, máy cộng tổng lượt tìm, đếm số từ, tính KD bình quân theo lượt tìm, cộng riêng phần lượt tìm có KD từ 20 trở xuống (dễ lên top), tính CPC trung bình, và in 8 từ khoá đứng đầu. Bản đầu có 30 cụm; bản v3 ngày 27/09 thêm 14 lát cắt mới, trong đó có cột lượt tìm "có ý định mua" (tập 6).
Kết quả của 30 cụm cho thấy nhu cầu công cụ lớn nhất trong kho thuộc về những việc rất đời thường: mẫu hợp đồng, đơn, biên bản; tra cứu mã số thuế; tra cứu BHXH; hàm Excel. Các cụm gần với phần mềm doanh nghiệp đứng ở nửa dưới của mười cụm lớn nhất.

| Cụm | Tổng lượt tìm | KD bình quân | Từ khoá đầu |
|---|---|---|---|
| Mẫu hợp đồng, đơn, biên bản | 1.512.661 | 17 | mẫu đơn ly hôn 22.200 (KD 14) |
| Tra cứu mã số thuế, doanh nghiệp | 820.130 | 38 | tra cứu MST 246.000 (KD 46) |
| Tra cứu BHXH, BHYT | 478.560 | 33 | tra cứu BHYT 110.000 (KD 37) |
| Hàm Excel, Google Sheets | 359.910 | 42 | google sheets 60.500 (KD 89) |
| Ngành nghề, đăng ký kinh doanh | 258.040 | 19 | đăng ký HKD online 9.900 (KD 19) |
Hai phát hiện mà bản định hướng đầu bỏ sót
Phát hiện thứ nhất: cụm mẫu tin nhắn gửi khách (tri ân, cảm ơn, nhắc học phí, nhắc nợ) có 215.360 lượt tìm mỗi tháng và gần như toàn bộ (215.110 lượt) nằm ở KD từ 20 trở xuống. "Mẫu tin nhắn tri ân khách hàng" một mình có 60.500 lượt, KD 12; "tin nhắn thông báo đóng học phí" 49.500 lượt, KD 13. Người tìm là chủ shop, trung tâm, nhân viên bán hàng. Cụm này không hiện ra ở bản định hướng đầu vì bản đó chỉ đọc các hạt giống đã chọn; nó chỉ nổi lên khi quét toàn kho.
Phát hiện thứ hai: tiền nằm ở dịch vụ. CPC cao nhất trong các cụm liên quan tới doanh nghiệp thuộc về "dịch vụ kế toán" và "dịch vụ báo cáo thuế" (1,09 tới 1,60 USD) và "thành lập công ty" (1,27 USD), gấp 10 tới 100 lần các cụm tính và tra (0,01 tới 0,09 USD). Nhà quảng cáo trả nhiều tiền nhất để gặp người đang muốn thuê ai đó làm hộ. Phát hiện này bị chính dự án hiểu sai một lần (tập 4) trước khi được đọc đúng (tập 6).
Bốn kiểu nhiễu, và vì sao tổng cụm không được đọc một mình
Tổng cụm không được đọc một mình, vì biểu thức nào cũng bắt nhầm. Bốn kiểu nhiễu dưới đây đều gặp thật trong dự án, và mỗi kiểu có một cách phát hiện rẻ.

- Trùng chữ: cụm mẫu văn bản bắt cả "hoa mẫu đơn" vì có chữ "mẫu đơn". Cách phát hiện: đọc 20 từ đầu cụm trước khi tin tổng.
- Nhu cầu xám: cụm phần mềm SEO có 120.050 lượt tìm thuộc về công cụ tăng traffic ảo (xseo, tăng traffic website). Cách phát hiện: lọc riêng các tên công cụ và cụm "traffic".
- Người tìm khác người mua: từ "bảng lương" có 33.100 lượt, nhưng xu hướng 12 tháng đạt đỉnh đúng các tháng có tin cải cách lương công chức và hiện chỉ còn khoảng 7% đỉnh. Cách phát hiện: đọc cột xu hướng cùng lịch tin tức.
- Điều hướng thương hiệu: trong cụm phiếu lương, 2.160 lượt là tên một công ty tuyển dụng đi kèm chữ "phiếu lương". Cách phát hiện: tách các từ có tên riêng.
Sau khi bóc nhiễu, nhiều cụm nhỏ đi đáng kể. Cụm phiếu lương từ 7.860 lượt còn khoảng 5.700. Cụm GEO (hiện diện của thương hiệu trong câu trả lời của AI) có 14.120 lượt trên giấy, nhưng từ đứng đầu là "geo" và "tây ban nha vs geo" (một trận bóng đá); phần đúng nghĩa chỉ còn "ai overview" 1.300 và "ai seo" 590 lượt.
Người sáng lập kể lại lý do bắt đầu lại từ đầu với maxmin.vn, và vì sao giữ tên miền mà bỏ sản phẩm cũ, trong bài Giữ tên miền, bỏ sản phẩm cũ trên blog cá nhân. Tập trước của series: bắt đầu từ dữ liệu.
Giới hạn của cách làm này
Lượt tìm là ước tính của Semrush, không phải số của Google, và nhiều từ khoá theo mùa bị làm phẳng thành bình quân năm. KD là thang của riêng Semrush. Biểu thức viết tay chỉ bắt được những gì người viết nghĩ tới. Và kho bị lệch hạt giống như tập 1 đã nói. Vì vậy dự án chỉ dùng kết quả phân cụm để so các nhu cầu với nhau và để chọn chỗ đi đo tiếp; không dùng nó như quy mô thị trường.
Câu hỏi thường gặp
Phân cụm từ khoá là gì?
Là gom các từ khoá cùng một nhu cầu thành một nhóm để cộng lượt tìm, thay vì đọc từng từ. Dự án maxmin.vn phân cụm bằng biểu thức viết tay vì đọc được và sửa được nhanh.
Vì sao không đọc tay kho từ khoá?
Vì kho có 1.626.728 từ khoá; đọc tay vừa chậm vừa không lặp lại được. Máy gom chạy khoảng 35 giây và ai có cùng kho đều ra cùng con số.
KD bao nhiêu thì coi là dễ?
Dự án dùng mốc KD từ 20 trở xuống cho website có Authority thấp. Mốc này chỉ để so các cụm với nhau, không phải lời hứa lên top.
CPC nói gì về nhu cầu?
CPC cao cho thấy nhà quảng cáo sẵn lòng trả tiền để gặp người tìm từ đó, tức là có tiền quanh nhu cầu. Trong kho, CPC cao nhất ở nhóm dịch vụ làm hộ như dịch vụ kế toán và thành lập công ty.
Làm sao biết một cụm bị nhiễu?
Đọc 20 từ khoá đầu cụm, xem cột xu hướng 12 tháng, và tách các từ có tên riêng. Bốn kiểu nhiễu trong bài đều bắt được bằng ba việc đó.


