Seo · ⏱ 18 phút đọc · 3,568 từ

Site Audit: Công Cụ Crawl Kiểm Tra Được Gì Và Bỏ Sót Gì

Site audit thường bị hiểu sai là chạy crawler, xuất danh sách lỗi rồi sửa cho đến khi màn hình hiện “0 lỗi”. Cách làm đó chỉ kiểm tra được những gì công cụ crawl nhìn thấy trong mã nguồn và phản hồi HTTP, không chứng minh website tốt về nội dung, ý định tìm kiếm hay hiệu quả kinh doanh.

Crawler chỉ bắt được thứ nó crawl được: link gãy, redirect chain, thiếu meta, nội dung trùng lặp ở mức kỹ thuật, schema hỏng và nhiều tín hiệu máy đọc khác. Phần còn lại vẫn cần người làm SEO, biên tập viên, chủ doanh nghiệp và dữ liệu hành vi cùng kiểm tra.

Site audit thực sự đang kiểm tra điều gì?

Site audit là quy trình đánh giá website theo nhiều lớp: khả năng truy cập, khả năng crawl và index, cấu trúc liên kết, tín hiệu on-page, dữ liệu có cấu trúc, hiệu suất, nội dung và mức độ đáp ứng mục tiêu tìm kiếm. Trong đó, crawler chỉ là một lớp kiểm tra tự động.

Một crawler gửi request đến các URL, đọc mã HTML, theo các liên kết được phép, phân tích mã phản hồi HTTP và ghi nhận những mẫu bất thường. Nếu URL trả về mã 404, công cụ có thể đánh dấu lỗi. Nếu một trang có thẻ title trống hoặc trùng với hàng trăm URL khác, công cụ có thể báo vấn đề. Nếu chuỗi chuyển hướng đi qua nhiều bước, crawler có thể mô tả đường đi đó.

Nhưng crawler không hiểu đầy đủ doanh nghiệp đang bán gì, khách hàng ở giai đoạn nào của hành trình, câu trả lời trên trang có đáng tin hay không, hoặc một bài viết có thực sự giải quyết truy vấn hay chỉ lặp lại vài đoạn văn được tối ưu từ khóa. Nó phân tích dấu hiệu; không thay thế phán đoán chuyên môn.

Những lỗi crawler thường bắt được

Link gãy và URL không truy cập được

Crawler có thể phát hiện liên kết nội bộ trỏ đến URL trả về 404, 410, lỗi máy chủ 5xx, lỗi phân giải tên miền hoặc bị chặn trong quá trình crawl. Đây là lỗi khá rõ nếu URL xuất hiện trong HTML, XML sitemap hoặc các nguồn liên kết mà công cụ đang đọc.

Tuy nhiên, cần phân biệt link gãy với trang không còn phù hợp. Một URL trả về 200 nhưng hiển thị thông báo “sản phẩm đã ngừng bán” không phải lỗi link gãy theo nghĩa kỹ thuật. Nó có thể vẫn là trải nghiệm kém hoặc trang cần chuyển hướng, hợp nhất, cập nhật hay giữ lại để phục vụ người dùng.

Redirect chain và redirect loop

Crawler theo được chuỗi chuyển hướng như A → B → C và phát hiện vòng lặp như A → B → A. Về vận hành, nên ưu tiên chuyển hướng trực tiếp từ URL cũ đến URL đích cuối cùng, thay vì để nhiều bước nối tiếp nhau. Đây là một ngưỡng kiểm tra kỹ thuật thực tế: nếu một URL cần từ 2 lần chuyển hướng trở lên mới tới đích, hãy xem xét rút gọn.

Không nên biến mọi redirect thành lỗi bắt buộc phải xóa. Chuyển hướng vĩnh viễn cho URL đã đổi hợp lý có thể là chủ đích. Điều cần kiểm tra là mã phản hồi, đích đến, tính liên quan giữa URL cũ và mới, cùng việc các liên kết nội bộ đã trỏ thẳng đến URL cuối hay chưa.

Thiếu hoặc trùng thẻ meta

Crawler thường kiểm tra được title, meta description, thẻ canonical, robots meta, heading và thuộc tính alt. Nó có thể nhóm các trang bị thiếu, quá dài, trùng lặp hoặc chứa biến mẫu chưa được thay thế.

Các con số như 50–60 ký tự cho tiêu đề và khoảng 150–160 ký tự cho mô tả chỉ nên dùng làm mốc biên tập ban đầu, không phải luật xếp hạng cố định. Độ dài hiển thị còn phụ thuộc thiết bị, font, pixel và cách công cụ tìm kiếm tạo snippet. Tiêu đề dài hơn chưa chắc sai nếu nó rõ nghĩa; tiêu đề nằm trong ngưỡng chưa chắc tốt nếu không phản ánh nội dung trang.

Nội dung trùng lặp ở mức URL và mẫu trang

Tool crawl có thể phát hiện nhiều URL có HTML giống hoặc gần giống nhau, tiêu đề và mô tả trùng nhau, trang phân trang tạo biến thể URL, tham số lọc hoặc bản in khiến một nội dung xuất hiện ở nhiều địa chỉ. Nó cũng nhận ra các trang gần như chỉ khác một mã sản phẩm hoặc tên thành phố.

Nhưng “trùng lặp” không đồng nghĩa tự động phải xóa. Hai trang có mẫu bố cục giống nhau vẫn có thể cần tồn tại nếu dữ liệu, nhu cầu và mục tiêu tìm kiếm khác nhau. Ngược lại, hai bài viết dùng câu chữ khác nhau nhưng cùng trả lời một intent có thể cạnh tranh nội bộ mà crawler không kết luận chính xác được.

Schema hỏng hoặc khai báo không khớp

Crawler hoặc công cụ kiểm tra structured data có thể phát hiện JSON-LD sai cú pháp, trường bắt buộc bị thiếu theo loại dữ liệu, giá trị không đúng định dạng hoặc schema khai báo thông tin không tìm thấy trên giao diện trang. Một đoạn JSON-LD lỗi dấu phẩy, ngoặc hoặc kiểu dữ liệu có thể bị vô hiệu hóa hoàn toàn.

Schema hợp lệ về cú pháp cũng chưa chắc đủ điều kiện tạo kết quả nâng cao. Người làm SEO vẫn phải đối chiếu nội dung hiển thị, chính sách áp dụng và loại schema phù hợp. Không nên thêm đánh giá, giá, câu hỏi hoặc thông tin tổ chức chỉ để làm dữ liệu có cấu trúc “đẹp” hơn thực tế.

Bảng phân biệt: crawler bắt được gì và bỏ sót gì?

Nhóm lỗi Crawler bắt được không? Nếu không hoặc chưa đủ, phải kiểm tra bằng gì?
Link gãy, mã 4xx và lỗi máy chủ 5xx Có, nếu URL được crawl hoặc nằm trong nguồn dữ liệu được nạp Kiểm tra thủ công trang đích, log máy chủ, Search Console và đường dẫn người dùng thực tế
Redirect chain, redirect loop, sai mã chuyển hướng Có, crawler theo được chuỗi phản hồi HTTP Kiểm tra mục tiêu kinh doanh của URL cũ, độ liên quan trang đích và lịch sử thay đổi URL
Thiếu hoặc trùng title, meta description, canonical, heading Có, ở mức hiện diện, cấu trúc và so sánh mẫu Đọc trang như người tìm kiếm, đối chiếu SERP, CTR, truy vấn và thông điệp thương hiệu
HTML hoặc JSON-LD schema hỏng Có, ở mức cú pháp và trường dữ liệu Đối chiếu dữ liệu hiển thị, tính chính xác, điều kiện áp dụng và loại schema phù hợp
Nội dung trùng lặp hoặc gần trùng Có thể phát hiện mẫu giống nhau, nhưng không hiểu đầy đủ intent Phân tích intent, nhóm từ khóa, cannibalization, chất lượng biên tập và quyết định hợp nhất
Nội dung đúng hay sai, đáng tin hay không Không Chuyên gia chủ đề, biên tập viên, nguồn chứng minh, quy trình fact-check và phản hồi người dùng
Trang có tồn tại về mặt giá trị kinh doanh hay không Không; crawler chỉ thấy URL và phản hồi kỹ thuật Đối chiếu sản phẩm, tồn kho, quy trình bán hàng, dữ liệu chuyển đổi và chủ sở hữu nội dung

Những thứ crawler không thể kết luận thay con người

Nội dung đúng hay sai

Một trang có 200 OK, title đầy đủ, canonical đúng và không có link gãy vẫn có thể chứa thông tin sai. Crawler không xác minh được giá, điều kiện bảo hành, quy định pháp lý, số liệu kỹ thuật hay tuyên bố y tế. Với các chủ đề có rủi ro cao, cần chuyên gia kiểm tra nguồn, ngày cập nhật, người chịu trách nhiệm và bằng chứng đi kèm.

Quy trình thực tế nên có mốc thời gian rõ ràng. Ví dụ, nội dung có giá, chính sách hoặc thông tin sản phẩm cần được kiểm tra lại ngay khi dữ liệu nguồn thay đổi; nội dung evergreen có thể lập lịch rà soát mỗi 3–6 tháng tùy mức độ rủi ro. Đây là quy trình quản trị, không phải lỗi mà crawler tự phát hiện được.

Intent có bị lệch hay không

Crawler thấy từ khóa xuất hiện nhưng không hiểu người tìm kiếm muốn làm gì. Truy vấn “máy lọc nước loại nào tốt” có thể cần bài so sánh; truy vấn chứa tên sản phẩm thường cần trang sản phẩm; truy vấn “cách thay lõi lọc” cần hướng dẫn thao tác. Một bài viết nhồi đủ cụm từ nhưng trả lời sai định dạng hoặc sai giai đoạn ra quyết định vẫn thất bại.

Để kiểm tra intent, hãy lấy nhóm truy vấn và so sánh các kết quả đang được ưu tiên: dạng bài, độ sâu, góc tiếp cận, yếu tố thương mại và câu hỏi người dùng. Sau đó đọc ít nhất phần mở đầu, tiêu đề phụ và lời kêu gọi hành động của trang. Search Console có thể cung cấp truy vấn, lượt hiển thị và CTR; dữ liệu đó hỗ trợ chẩn đoán nhưng không tự giải thích nguyên nhân.

Trang có thực sự “tồn tại” hay không

Ở góc nhìn crawler, trang tồn tại khi URL trả về phản hồi có thể đọc. Ở góc nhìn doanh nghiệp, trang chỉ thực sự tồn tại khi nó có chủ sở hữu, mục đích, dữ liệu được duy trì và lý do phục vụ người dùng. Một trang danh mục không có sản phẩm, landing page hết chương trình hoặc bài viết không còn ai chịu trách nhiệm cập nhật đều có thể trả 200 nhưng không còn giá trị.

Ngược lại, một tài liệu nằm sau đăng nhập, nội dung được tải bằng thao tác tương tác hoặc trang chưa liên kết nội bộ có thể bị crawler bỏ qua dù vẫn quan trọng với khách hàng. Vì vậy, danh sách URL phải được đối chiếu với CMS, cơ sở dữ liệu sản phẩm, sitemap, log máy chủ và các quy trình vận hành thực tế.

Cách chạy site audit mà không nhầm báo cáo với chẩn đoán

  1. Xác định phạm vi: chốt domain, subdomain, thư mục, môi trường staging hay production, loại URL cần loại trừ và mục tiêu của đợt audit. Không nên crawl toàn bộ website nếu chưa biết dữ liệu đầu ra sẽ phục vụ quyết định nào.
  2. Thiết lập nguồn đối chiếu: dùng danh sách URL từ sitemap, CMS, dữ liệu analytics, Search Console và log máy chủ nếu có. Crawler chỉ dựa vào liên kết có thể bỏ sót những URL không được liên kết nội bộ.
  3. Ưu tiên lỗi theo tác động: lỗi máy chủ diện rộng, index nhầm trang lọc, redirect sai đích và canonical hàng loạt thường đáng xử lý trước một nhóm meta description dài hơn mốc biên tập.
  4. Kiểm tra mẫu thủ công: chọn tối thiểu 10 URL cho mỗi nhóm quan trọng, hoặc 1–5% số URL nếu website lớn, rồi đọc như người dùng. Con số này là quy tắc lấy mẫu vận hành, không phải chuẩn xếp hạng.
  5. Đối chiếu dữ liệu kinh doanh: kiểm tra chuyển đổi, doanh thu, lead đủ điều kiện, tồn kho, cuộc gọi và phản hồi chăm sóc khách hàng. Một trang có traffic thấp chưa chắc cần xóa; một trang không có lỗi kỹ thuật chưa chắc đáng giữ.
  6. Ghi chủ sở hữu và hạn xử lý: mỗi vấn đề cần người phụ trách, mức độ ưu tiên, điều kiện hoàn thành và ngày kiểm tra lại. Với lỗi nghiêm trọng, nên xác nhận sau khi triển khai trong 24–72 giờ; với nội dung, có thể đánh giá lại sau 2–8 tuần tùy lượng truy cập.

Vì sao “0 lỗi” không có nghĩa website tốt?

“0 lỗi” thường chỉ có nghĩa bộ quy tắc đang chạy không phát hiện điều gì trong phạm vi crawl. Có thể crawler chưa vào được các URL quan trọng, chưa render được nội dung động, không xem được phần sau đăng nhập, hoặc các tiêu chí kiểm tra chưa bao phủ chất lượng nội dung.

Một website có thể đạt báo cáo kỹ thuật sạch nhưng vẫn gặp các tình huống sau:

  • Trang trả lời sai câu hỏi, khiến người dùng quay lại kết quả tìm kiếm.
  • Trang có lượng truy cập nhưng không tạo lead vì thông điệp và offer lệch nhu cầu.
  • Nhiều bài viết cùng nhắm một intent, làm tín hiệu và liên kết nội bộ bị phân tán.
  • Thông tin sản phẩm, giá hoặc chính sách đã lỗi thời nhưng HTML vẫn hợp lệ.
  • Trang có schema đúng cú pháp nhưng khai báo dữ liệu không xuất hiện trên giao diện.
  • URL quan trọng không có trong liên kết nội bộ nên không được crawler phát hiện.

Vì vậy, hãy dùng site audit như hệ thống phát hiện rủi ro kỹ thuật, không phải giấy chứng nhận chất lượng. Crawler trả lời câu hỏi “máy có đọc được và đi qua được không?”. Phân tích nội dung trả lời “trang có đúng, hữu ích và đúng intent không?”. Dữ liệu kinh doanh trả lời “trang có đang tạo giá trị không?”. Chỉ khi ba lớp này cùng được kiểm tra, audit mới dẫn đến quyết định SEO đáng tin cậy.

Đọc thêm

Cần làm thật phần “site audit” này trên site của bạn?

Gửi tên miền, chúng tôi chạy audit và trả về danh sách việc theo thứ tự tác động — kèm số đo hiện trạng, không phải nhận định cảm tính.

Nhận audit miễn phí
 034.301.8345

VU
Vu Lam Bach
Content Strategist · Vidco Group
10+ năm kinh nghiệm về SEO, AEO và GEO. Chuyên gia tối ưu hóa nội dung cho các công cụ tìm kiếm thế hệ mới — Google, ChatGPT, Gemini và Perplexity.

Thương hiệu bạn xứng đáng
được AI nhắc đến.

Đặt lịch AI Visibility Audit miễn phí — Vidco Group sẽ cho bạn thấy bức tranh toàn cảnh.

034.301.8345 Chat Zalo