Robots.Txt Là Gì? Cách Cấu Hình File Robots.Txt Chuẩn SEO
“File Robots.txt là gì?” là câu hỏi khá phổ biến đối với những người mới làm SEO hoặc bắt đầu quản trị website. Trong bài viết hôm nay, mời bạn cùng Sài Gòn Xuân Phát tìm hiểu file robots.txt là gì, hoạt động như thế nào và cách cấu hình robots.txt chuẩn SEO ra sao.
File robots.txt là gì?
Robots.txt (Robots Exclusion Standard) là một tệp văn bản thuần túy được đặt tại thư mục gốc của website. File này chứa các quy tắc hướng dẫn các con bot tìm kiếm (như Googlebot, Bingbot) về những đường dẫn URL nào trên website mà chúng được phép hoặc không được phép thu thập dữ liệu.

Nói một cách đơn giản thì khi một con bot tìm kiếm chuẩn bị ghé thăm website của bạn thì nơi đầu tiên nó tìm đến không phải là trang chủ, mà chính là tệp robots.txt này. Bot sẽ đọc kỹ từng dòng lệnh để biết mình nên đi đâu, bỏ qua trang URL nào và làm thế nào để thu thập dữ liệu một cách hiệu quả nhất.
>> Xem thêm: Schema là gì?
Vai trò của file robots.txt trong SEO
File robots.txt có thể hỗ trợ SEO ở nhiều khía cạnh, đặc biệt là đối với những website có cấu trúc lớn hoặc chứa nhiều URL.
- Tối ưu hóa ngân sách thu thập dữ liệu (Crawl Budget). Google không dành nhiều thời gian và tài nguyên để quét một website. Mỗi website sẽ được cấp một “ngân sách crawl” nhất định. Thế nên, việc chặn bot ghé thăm các trang không quan trọng (như trang tìm kiếm nội bộ, trang cảm ơn,…) sẽ giúp bot tìm kiếm tập trung thời gian crawl các trang bài viết, sản phẩm chủ lực.
- Ngăn chặn index các thông tin nội bộ. Bằng cách chặn bot crawl các trang quản trị, trang tài khoản hay các tài liệu nội bộ, bạn sẽ giảm thiểu được nguy cơ các thông tin này vô tình xuất hiện trên kết quả tìm kiếm của Google.
- Tránh quá tải máy chủ. Khi bot quét quá nhiều tệp tin nặng (hình ảnh chất lượng quá cao, tài liệu PDF lớn) cùng lúc thì tài nguyên máy chủ có thể bị tiêu tốn đáng kể. Robots.txt giúp bạn hạn chế bot truy cập vào các thư mục chứa tệp tài nguyên nặng này.
- Khai báo vị trí của Sitemap (Sơ đồ trang web). Robots.txt là nơi tuyệt vời nhất để bạn đính kèm đường dẫn XML Sitemap, giúp con bot dễ dàng tìm thấy bản đồ toàn bộ bài viết/trang trên web để tiến hành thu thập dữ liệu nhanh chóng.
Cú pháp cơ bản và cách đọc file robots.txt
Mặc dù là file kỹ thuật nhưng cú pháp của file robots.txt lại vô cùng đơn giản. Bạn chỉ cần nắm rõ một số câu lệnh cơ bản sau:
User-agent
Lệnh “User-agent” dùng để xác định con bot tìm kiếm nào sẽ áp dụng quy tắc bên dưới. Theo đó:
- User-agent: * (Dấu sao đại diện cho tất cả các con bot trên internet).
- User-agent: Googlebot (Chỉ áp dụng riêng cho bot của Google).
Disallow
Lệnh “Disallow” được sử dụng để chặn bot truy cập vào một thư mục, một trang hoặc một tệp tin cụ thể.
- Disallow: / (Chặn bot truy cập toàn bộ website).
- Disallow: /wp-admin/ (Chặn bot truy cập vào thư mục wp-admin).
- Disallow: /thong-tin-ca-nhan (Chặn trang thông tin cá nhân).
Allow
Lệnh “Allow” cho phép bot truy cập vào một trang/thư mục con nằm bên trong một thư mục vốn đã bị lệnh “Disallow” chặn trước đó. Ví dụ: Bạn chặn thư mục /danh-muc/ bằng câu lệnh Disallow: /danh-muc/, nhưng lại muốn mở riêng trang sản phẩm A nằm bên trong thư mục đó thì sẽ phải nhập thêm lệnh Allow: /danh-muc/san-pham-a.
Sitemap
Lệnh “Sitemap” dùng để khai báo vị trí XML Sitemap của website bạn.
Cú pháp cơ bản của lệnh Sitemap: Sitemap: https://example.com/sitemap.xml
Trong đó, https://example.com/sitemap.xml là địa chỉ của file XML Sitemap.
Ví dụ về file robots.txt chuẩn thực tế

Đoạn mã trên trong hình có ý nghĩa: Áp dụng cho tất cả các bot tìm kiếm (*). Chặn toàn bộ thư mục /wp-admin/, ngoại trừ file admin-ajax.php. Đồng thời cung cấp đường dẫn Sitemap chính thức của website.
Robots.txt hoạt động như thế nào?
Cơ chế hoạt động của file robots.txt tuân theo theo quy trình sau:
- Khởi đầu: Trước khi ghé thăm bất kỳ đường dẫn nào, bot tìm kiếm sẽ gửi yêu cầu truy cập vào địa chỉ yourdomain.com/robots.txt, ví dụ https://tangdiemdomain.com/robots.txt.
- Đọc quy tắc: Nếu file Robots.txt có tồn tại trên web thì bot sẽ tải file về và phân tích các câu lệnh tương ứng với User-agent của nó.
- Thực thi: Nếu một URL nằm trong danh sách Disallow thì bot sẽ bỏ qua và không thu thập dữ liệu trang đó. Nếu URL không nằm trong danh sách cấm thì bot sẽ truy cập, thu thập dữ liệu và gửi về máy chủ Google để xử lý.
- Trường hợp không có file robots.txt: Nếu bot nhận về mã phản hồi 404 (Not Found) thì nó sẽ mặc định hiểu rằng website này không có hạn chế nào và sẽ tiến hành crawl toàn bộ trang web.

File Robots.txt nằm ở đâu trên website?
Về phía người dùng và công cụ tìm kiếm, file Robots.txt luôn nằm ở ngay sau tên miền chính. Đường dẫn truy cập chuẩn có định dạng là yourdomain.com/robots.txt. Ví dụ, website https://inandang.vn sẽ có file robots.txt tại địa chỉ: https://inandang.vn/robots.txt.
Về phía quản trị website, file robots.txt thực tế được lưu trong thư mục gốc (root directory) của website trên máy chủ. Đây thường là thư mục chứa các file và thư mục chính giúp website hoạt động. Tùy vào hosting và nền tảng sử dụng mà thư mục gốc có thể có tên khác nhau như public_html, www, htdocs hoặc một thư mục được máy chủ cấu hình riêng.

Dưới đây là vị trí cụ thể của file robots.txt đối với từng trường hợp hệ thống máy chủ và nền tảng website khác nhau:
- Đối với website dùng cPanel / DirectAdmin / FTP: Khi truy cập vào trình quản lý file (File Manager) của hosting hoặc kết nối FTP, bạn truy cập vào thư mục public_html (hoặc www). File robots.txt sẽ nằm cùng cấp với các file chính như index.php, .htaccess.
- Đối với website WordPress: File robots.txt nằm trực tiếp trong thư mục gốc public_html, nằm song song với các thư mục cốt lõi của WordPress như wp-admin, wp-content, wp-includes và file cấu hình wp-config.php. Lưu ý: Nếu không thấy file thực tế trong hosting nhưng truy cập domain vẫn có, vậy đó là file robots.txt ảo do WordPress tự sinh ra. Bạn có thể chỉnh sửa nhanh file robots.txt qua các plugin như Yoast SEO hoặc Rank Math.
- Đối với website code tay: Với các mã nguồn mở hoặc tự phát triển, file robots.txt thường nằm ở thư mục tài nguyên tĩnh công khai (ví dụ: thư mục /public hoặc /static) trước khi hệ thống build và render ra thư mục gốc trên server.
Cách kiểm tra website đã có file robots.txt chưa
Để biết website của bạn hoặc đối thủ đã cài đặt file robots.txt hay chưa, bạn có thể áp dụng 2 cách cực kỳ đơn giản sau:
Cách 1: Kiểm tra trực tiếp trên trình duyệt
- Mở trình duyệt web (Chrome, Edge, Firefox,…).
- Gõ đường dẫn: https://nhaptenmiencuaban/robots.txt chẳng hạn như https://tangdiemdomain.com/robots.txt
- Nếu màn hình hiển thị các dòng lệnh dạng User-agent, Disallow,… thì tức là website đã có file robots.txt. Còn nếu màn hình báo lỗi 404 Not Found hoặc tự động chuyển hướng về trang chủ, nghĩa là website của bạn chưa có file robots.txt.
Cách 2: Sử dụng Google Search Console (GSC)
- Đăng nhập vào tài khoản Google Search Console của bạn.
- Chọn đúng Property (Tài sản website) cần kiểm tra.
- Tại menu bên trái, truy cập vào mục Cài đặt (Settings) => Robots.txt.
- Tại đây, Google sẽ hiển thị trực tiếp trạng thái file robots.txt mà Googlebot vừa quét được gần nhất, bao gồm ngày giờ quét và nội dung chi tiết của file.

>> Xem thêm: Lỗi 403 là gì? Cách khắc phục lỗi 403 Forbidden
Hướng dẫn tạo và cấu hình file robots.txt
Tùy thuộc vào nền tảng quản trị website bạn đang dùng, bạn có thể linh hoạt chọn 1 trong 3 cách khởi tạo file robots.txt cực kỳ đơn giản dưới đây.
Cách 1: Sử dụng plugin Yoast SEO
Yoast SEO cung cấp tính năng chỉnh sửa file robots.txt trực tiếp ngay trong bảng quản trị WordPress mà không cần đụng đến hosting.
- Bước 1: Đăng nhập vào trang quản trị WordPress (/wp-admin/).
- Bước 2: Tìm đến menu Yoast SEO => chọn Tools (Công cụ).
- Bước 3: Nhấp vào mục File editor (Trình chỉnh sửa tệp).
- Bước 4: Nếu chưa có file thì nhấp vào nút Create robots.txt file.
- Bước 5: Nhập các câu lệnh tối ưu của bạn vào khung văn bản.
- Bước 6: Nhấp Save changes to robots.txt để hoàn tất.

Cách 2: Sử dụng plugin Rank Math SEO
- Bước 1: Bật tính năng Robots.txt. Vào Rank Math SEO => Dashboard => Tìm mục Robots.txt và chuyển trạng thái sang ON (kích hoạt).
- Bước 2: Chỉnh sửa file robots.txt. Vào Rank Math SEO => General Settings => chọn tab Edit robots.txt.
- Bước 3: Thêm/Sửa quy tắc. Nhập các dòng lệnh cấu hình (User-agent, Disallow, Allow, Sitemap) vào khung văn bản.
- Bước 4: Lưu thay đổi. Nhấp nút Save Changes ở cuối trang để hoàn tất.

Lưu ý: Nếu trang web đã có sẵn file robots.txt vật lý nằm trong thư mục gốc (public_html) thì Rank Math sẽ không thể ghi đè. Bạn cần xóa file robots.txt vật lý đó đi (qua FTP hoặc File Manager của Hosting) để Rank Math tự động quản lý file ảo.
Cách 3: Sử dụng Plugin All in One SEO
Tương tự như Yoast SEO và Rank Math, All in One SEO cũng tích hợp trình quản lý robots.txt rất chuyên nghiệp. Cách tạo và cấu hình file robots.txt bằng plugin All in One SEO sẽ như sau:
- Bước 1: Vào All in One SEO => Feature Manager (Quản lý tính năng) > Kích hoạt tính năng Robots.txt.
- Bước 2: Sau khi bật, truy cập All in One SEO => Tools (Công cụ) > chọn tab Robots.txt Editor.
- Bước 3: Bật tùy chọn Enable Custom Robots.txt (Kích hoạt robots.txt tùy chỉnh).
- Bước 4: Tại đây, giao diện trực quan cho phép bạn thêm các quy tắc (Rule), chọn User-Agent, Allow hay Disallow chỉ bằng vài cú nhấp chuột.
- Bước 5: Nhấp Save Changes để lưu lại.

Cách 4: Tạo file robots.txt thủ công
Nếu bạn không sử dụng WordPress hoặc muốn tự tay quản lý mã nguồn thì hãy làm theo các bước đơn giản sau:
- Bước 1: Tạo file. Mở phần mềm Notepad (trên Windows) hoặc TextEdit (trên Mac).
- Bước 2: Soạn nội dung. Nhập các dòng lệnh chuẩn SEO (nhớ khai báo thêm link Sitemap ở cuối).
- Bước 3: Lưu file. Lưu tệp tin với đúng tên robots.txt (định dạng tệp là .txt).
- Bước 4: Upload lên Hosting. Mở phần mềm FTP (như FileZilla) hoặc đăng nhập vào cPanel / DirectAdmin của Hosting. Rồi đưa file robots.txt vừa tạo vào thư mục gốc public_html.
- Bước 5: Kiểm tra lại. Gõ https://nhaptenmiencuaban/robots.txt trên trình duyệt để xác nhận file đã hoạt động.

Những lỗi thường gặp khi dùng robots.txt
Robots.txt có cấu trúc khá đơn giản nhưng chỉ một sai sót nhỏ trong quá trình cấu hình cũng có thể ảnh hưởng đến khả năng thu thập dữ liệu của công cụ tìm kiếm. Dưới đây là những lỗi phổ biến mà quản trị viên website và SEOer nên kiểm tra thường xuyên.
Lỗi vô tình chặn toàn bộ website
Đây là một trong những lỗi nghiêm trọng nhất khi cấu hình robots.txt. Chỉ cần một dấu gạch chéo / đứng sau lệnh Disallow: mà không có một đường dẫn URL cụ thể nào thì tức là bạn đang yêu cầu các bot tìm kiếm không thu thập dữ liệu trên toàn bộ website.
Lỗi chặn nhầm các trang quan trọng
Một lỗi khác thường gặp là sử dụng lệnh Disallow cho những thư mục chứa nội dung có giá trị SEO.
Ví dụ:
User-agent: *
Disallow: /blog/
Nếu /blog/ là nơi chứa toàn bộ bài viết của website thì quy tắc trên có thể khiến bot không thể crawl các bài viết trong thư mục này. Tương tự, website thương mại điện tử cần cẩn thận khi chặn các thư mục chứa trang sản phẩm, danh mục hoặc nội dung quan trọng. Trước khi thêm một đường dẫn vào Disallow, bạn hãy xác định chính xác những URL nào sẽ bị ảnh hưởng.
Lỗi nhầm lẫn giữa Disallow và Noindex
Nhiều người cho rằng: Disallow: /example-page/ có nghĩa là yêu cầu Google không lập chỉ mục trang /example-page/. Tuy nhiên, đây là cách hiểu chưa chính xác. Vì robots.txt chỉ ngăn con bot crawl (thu thập dữ liệu), chứ không ngăn Google index (lập chỉ mục).
Nếu trang đó nhận được backlink từ bên ngoài thì Google vẫn có thể lập chỉ mục trang đó trên kết quả tìm kiếm (nhưng không hiển thị nội dung mô tả). Nếu bạn muốn trang hoàn toàn không xuất hiện trên Google thì phải dùng thẻ <meta name=”robots” content=”noindex”>.
Lỗi chặn CSS, JavaScript
Googlebot cần tải file CSS và JS để “dựng hình” (render) giao diện giống như người dùng thật. Nếu bạn chặn các thư mục chứa tài nguyên này thì Google sẽ đánh giá website bị lỗi giao diện trên di động hoặc trải nghiệm người dùng kém.
Lỗi khai báo Sitemap không chính xác
Robots.txt có thể được sử dụng để khai báo XML Sitemap, chẳng hạn:
Sitemap: https://example.com/sitemap.xml
Một lỗi phổ biến là khai báo sai URL sitemap, sitemap không tồn tại hoặc sử dụng đường dẫn cũ sau khi website thay đổi cấu trúc. Do đó, bạn cần chắc chắn URL được khai báo trong Sitemap có thể truy cập bình thường và trỏ đến sitemap hiện tại của website.
Lỗi sử dụng robots.txt như một công cụ bảo mật
Đây cũng là một hiểu lầm khá phổ biến. Vì robots.txt chỉ là một file công khai và bất kỳ ai cũng có thể truy cập bằng cách thêm /robots.txt vào sau tên miền.
Do đó, nếu bạn khai báo Disallow: /private/ thì điều này không có nghĩa thư mục /private/ được bảo vệ. Người dùng vẫn có thể truy cập URL nếu máy chủ không yêu cầu xác thực.
Nếu bạn cần bảo vệ dữ liệu hoặc giới hạn quyền truy cập website thì nên sử dụng các cơ chế bảo mật như xác thực người dùng, phân quyền hoặc cấu hình máy chủ thay vì dựa vào file robots.txt.
Lỗi sao chép robots.txt của website khác
Mỗi website sẽ có cấu trúc URL, nền tảng, số lượng trang và chiến lược SEO khác nhau. Vì vậy, việc lấy robots.txt của một website khác rồi áp dụng y chang cho website mình thì có thể dẫn đến những quy tắc không phù hợp.
Chẳng hạn, một website có thể cần chặn một thư mục kỹ thuật, trong khi website của bạn lại đang sử dụng chính thư mục đó để lưu trữ nội dung quan trọng. Tóm lại, file robots.txt nên được xây dựng dựa trên cấu trúc thực tế của từng website, thay vì sử dụng một mẫu cố định cho mọi trường hợp.
Kết luận
Trên đây là tất tần tật những thông tin mà bạn cần biết về file robots.txt. Hy vọng bài viết này của Sài Gòn Xuân Phát sẽ giúp bạn hiểu rõ file robots.txt là gì, cách kiểm tra và cấu hình file robots.txt chuẩn SEO.


Write a Comment
You must be logged in to post a comment.