File Robots.txt là gì?
Bùi Tấn Lực
- 1937
- 08/10/2024
File Robots.txt là một trong những tệp quan trọng đối với bất kỳ website nào, đặc biệt là các trang chú trọng SEO và tối ưu hiệu suất thu thập dữ liệu của công cụ tìm kiếm. Tuy chỉ là một tập tin văn bản đơn giản nhưng Robots.txt lại đóng vai trò như một "người hướng dẫn", giúp bot của Google, Bing và nhiều công cụ tìm kiếm khác biết khu vực nào nên thu thập dữ liệu, khu vực nào không nên truy cập.
Nhiều người mới làm website thường hiểu sai rằng Robots.txt có thể bảo mật dữ liệu hoặc ngăn chặn hoàn toàn việc lập chỉ mục. Trên thực tế, đây chỉ là tập tin hướng dẫn dành cho các bot tuân thủ tiêu chuẩn. Nếu cấu hình sai, website có thể mất lưu lượng truy cập tự nhiên hoặc khiến Google không thể đọc được những nội dung quan trọng.
Trong bài viết này, Web Mới sẽ giúp bạn hiểu đầy đủ về Robots.txt, nguyên lý hoạt động, cấu trúc, cú pháp, cách tạo, cách kiểm tra và những lưu ý quan trọng để tối ưu SEO mà vẫn đảm bảo website hoạt động ổn định.

Robots.txt hoạt động như thế nào?
Khi một công cụ tìm kiếm bắt đầu thu thập dữ liệu website, bước đầu tiên thường là truy cập tập tin robots.txt nằm tại thư mục gốc của tên miền.
Ví dụ:
https://tenmien.com/robots.txt
Nếu tập tin tồn tại, bot sẽ đọc toàn bộ nội dung bên trong để xác định những thư mục hoặc đường dẫn nào được phép thu thập dữ liệu và những nơi cần tránh.
Sau khi đọc xong Robots.txt, bot sẽ tiếp tục quá trình thu thập dữ liệu dựa trên các quy tắc đã khai báo. Điều này giúp giảm tải máy chủ, tránh thu thập những trang không cần thiết và tập trung vào các nội dung quan trọng.
Vì sao website nên có Robots.txt?
Dù website nhỏ hay lớn, việc tạo Robots.txt đều mang lại nhiều lợi ích.
Giảm lãng phí Crawl Budget
Mỗi website đều có một giới hạn nhất định về số lượng URL mà Googlebot sẽ thu thập trong một khoảng thời gian. Đây thường được gọi là Crawl Budget.
Nếu bot liên tục đọc những trang tìm kiếm nội bộ, bộ lọc sản phẩm, trang quản trị hoặc URL sinh động thì ngân sách thu thập sẽ bị lãng phí.
Robots.txt giúp hướng bot tập trung vào những nội dung thực sự có giá trị.
Loại bỏ các thư mục không cần thiết
Nhiều hệ thống quản trị nội dung tạo ra rất nhiều thư mục phục vụ cho quản trị hoặc chức năng nội bộ. Người dùng không cần Google lập chỉ mục những khu vực này.
Hạn chế tải cho máy chủ
Website có hàng trăm nghìn URL nếu không kiểm soát tốt sẽ khiến bot truy cập quá nhiều.
Robots.txt góp phần giảm số lượng request không cần thiết.
Hỗ trợ SEO
Mặc dù Robots.txt không trực tiếp giúp tăng thứ hạng nhưng lại hỗ trợ Google thu thập dữ liệu hiệu quả hơn, từ đó cải thiện khả năng lập chỉ mục và đánh giá website.
Cấu trúc của Robots.txt
Robots.txt gồm nhiều nhóm quy tắc. Mỗi nhóm thường bắt đầu bằng User-agent.
Một cấu trúc đơn giản:
User-agent: *
Disallow:
Sitemap: https://tenmien.com/sitemap.xml
Trong đó:
- User-agent xác định bot áp dụng.
- Disallow quy định đường dẫn không được truy cập.
- Sitemap khai báo vị trí sơ đồ website.
Ý nghĩa của từng thành phần
User-agent
Đây là tên của robot mà quy tắc sẽ áp dụng.
Ví dụ:
User-agent: Googlebot
Chỉ áp dụng cho Googlebot.
Hoặc:
User-agent: *
Dấu * nghĩa là áp dụng cho tất cả robot.
Disallow
Quy định những đường dẫn không được phép truy cập.
Ví dụ:
User-agent: *
Disallow: /admin/
Google sẽ không thu thập thư mục admin.
Allow
Cho phép truy cập một thư mục con dù thư mục cha đã bị chặn.
Ví dụ:
User-agent: *
Disallow: /images/
Allow: /images/logo.png
Bot không đọc toàn bộ thư mục images nhưng vẫn được phép truy cập logo.
Sitemap
Khai báo vị trí sitemap để công cụ tìm kiếm phát hiện nhanh hơn.
Sitemap: https://tenmien.com/sitemap.xml
Các ký tự đặc biệt trong Robots.txt
Dấu *
Đại diện cho mọi ký tự.
Ví dụ:
User-agent: *
Disallow: /*?
Chặn mọi URL chứa dấu hỏi.
Dấu $
Đại diện cho phần kết thúc URL.
Ví dụ:
User-agent: *
Disallow: /*.pdf$
Chặn mọi tập tin PDF.
Những URL nên chặn
- Trang quản trị.
- Trang đăng nhập.
- Trang tìm kiếm nội bộ.
- Trang lọc sản phẩm.
- URL tham số không cần SEO.
- Thư mục cache.
- Thư mục backup.
- Tập tin tạm.
Những URL không nên chặn
- Bài viết.
- Danh mục.
- Trang sản phẩm.
- Trang dịch vụ.
- Trang chủ.
- CSS.
- JavaScript.
- Ảnh phục vụ hiển thị.
Nếu chặn CSS hoặc JavaScript, Google có thể hiển thị cảnh báo rằng website không thể render đầy đủ.
Ví dụ Robots.txt cơ bản
User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /search/
Sitemap: https://tenmien.com/sitemap.xml
Ví dụ chỉ chặn một bot cụ thể
User-agent: Googlebot
Disallow: /private/
User-agent: *
Disallow:
Googlebot bị chặn thư mục private nhưng các bot khác vẫn được truy cập.
Ví dụ chặn toàn bộ website
User-agent: *
Disallow: /
Đây là cấu hình cực kỳ nguy hiểm nếu đưa lên website đang hoạt động vì có thể khiến Google không thu thập dữ liệu.
Ví dụ cho phép toàn bộ website
User-agent: *
Disallow:
Khi Disallow để trống nghĩa là không chặn bất kỳ đường dẫn nào.
Cách tạo file Robots.txt đúng chuẩn
Việc tạo Robots.txt không hề phức tạp. Đây chỉ là một tập tin văn bản thuần túy (Plain Text) có tên chính xác là robots.txt. Lưu ý tên tập tin phải viết thường hoàn toàn vì một số máy chủ phân biệt chữ hoa và chữ thường.
Sau khi tạo xong, bạn cần tải tập tin này lên thư mục gốc (Root Directory) của website. Đây là nơi chứa file index hoặc các tập tin chính của website.
Ví dụ:
https://webmoi.vn/robots.txt
Nếu truy cập địa chỉ trên và hiển thị đúng nội dung, nghĩa là Robots.txt đã được đặt đúng vị trí.
Các bước tạo Robots.txt
- Mở Notepad hoặc bất kỳ trình soạn thảo văn bản nào.
- Viết các quy tắc cần sử dụng.
- Lưu tập tin với tên robots.txt.
- Upload lên thư mục gốc của website.
- Kiểm tra lại bằng trình duyệt.
Toàn bộ quá trình chỉ mất vài phút nhưng lại có tác động đáng kể đến khả năng thu thập dữ liệu của website.
Robots.txt có bảo mật website không?
Câu trả lời là không.
Đây là một trong những hiểu lầm phổ biến nhất của người mới làm website.
Robots.txt chỉ là tài liệu hướng dẫn dành cho các công cụ tìm kiếm hoặc những bot tuân thủ tiêu chuẩn. Nếu ai đó biết đường dẫn hoặc cố tình truy cập thì họ vẫn có thể mở được các trang bị Disallow nếu máy chủ không yêu cầu đăng nhập.
Ví dụ:
User-agent: *
Disallow: /admin/
Dòng trên chỉ nói với Google rằng không nên thu thập thư mục /admin/. Tuy nhiên nếu người dùng nhập trực tiếp:
https://tenmien.com/admin/
thì máy chủ vẫn sẽ trả về nội dung nếu khu vực đó không được bảo vệ bằng tài khoản hoặc quyền truy cập.
Do đó, Robots.txt không phải là giải pháp bảo mật.
Robots.txt và thẻ Meta Robots khác nhau như thế nào?
Đây là hai khái niệm thường bị nhầm lẫn.
Robots.txt
- Hoạt động trước khi bot truy cập trang.
- Áp dụng cho thư mục hoặc URL.
- Có thể ngăn bot thu thập dữ liệu.
- Không đảm bảo URL sẽ không xuất hiện trên Google.
Meta Robots
Meta Robots được đặt trực tiếp trong mã HTML của từng trang.
Ví dụ:
<meta name="robots" content="noindex,nofollow">
Meta Robots chỉ có hiệu lực khi bot đã truy cập được trang đó.
Nó giúp hướng dẫn Google có lập chỉ mục hay không, có theo các liên kết trên trang hay không.
Nên dùng cái nào?
Trong thực tế, Robots.txt và Meta Robots thường được sử dụng kết hợp.
- Robots.txt dùng để tối ưu Crawl Budget.
- Meta Robots dùng để kiểm soát việc lập chỉ mục.
Việc hiểu rõ sự khác biệt này sẽ giúp bạn tránh các lỗi SEO không đáng có.
Robots.txt và Sitemap có liên quan gì?
Sitemap là danh sách các URL quan trọng mà bạn muốn công cụ tìm kiếm thu thập.
Trong khi đó Robots.txt giúp điều hướng bot.
Hai thành phần này bổ trợ cho nhau.
Thông thường, cuối file Robots.txt nên khai báo Sitemap để bot dễ dàng phát hiện.
Sitemap: https://tenmien.com/sitemap.xml
Website có thể khai báo nhiều Sitemap.
Sitemap: https://tenmien.com/sitemap.xml
Sitemap: https://tenmien.com/post-sitemap.xml
Sitemap: https://tenmien.com/page-sitemap.xml
Điều này rất hữu ích với các website lớn.
Các lỗi Robots.txt thường gặp
Chặn toàn bộ website
Đây là lỗi nghiêm trọng nhất.
User-agent: *
Disallow: /
Nhiều website sau khi chuyển từ môi trường thử nghiệm sang website chính đã quên xóa quy tắc này, dẫn đến Google không thể thu thập dữ liệu.
Chặn CSS và JavaScript
Nếu Google không đọc được CSS hoặc JavaScript thì khả năng đánh giá trải nghiệm người dùng sẽ giảm.
Điều này có thể ảnh hưởng đến SEO.
Quên khai báo Sitemap
Mặc dù Google vẫn có thể tìm thấy Sitemap thông qua Search Console nhưng việc khai báo trong Robots.txt vẫn là một thói quen tốt.
Chặn nhầm thư mục chứa hình ảnh
Nếu toàn bộ thư mục hình ảnh bị chặn, Google Images sẽ không thể lập chỉ mục ảnh của website.
Viết sai cú pháp
Robots.txt rất đơn giản nhưng chỉ cần sai một ký tự cũng có thể khiến quy tắc không hoạt động như mong muốn.
Do đó, sau mỗi lần chỉnh sửa nên kiểm tra lại cẩn thận trước khi áp dụng lên website.
Cách kiểm tra Robots.txt có hoạt động hay không
Sau khi tạo hoặc chỉnh sửa Robots.txt, bạn không nên đưa vào sử dụng ngay mà chưa kiểm tra. Một lỗi nhỏ cũng có thể khiến công cụ tìm kiếm hiểu sai quy tắc và ảnh hưởng đến khả năng thu thập dữ liệu của toàn bộ website.
Kiểm tra trực tiếp trên trình duyệt
Cách đơn giản nhất là truy cập đường dẫn:
https://tenmien.com/robots.txt
Nếu trình duyệt hiển thị đúng nội dung đã cấu hình thì tập tin đã được đặt đúng vị trí.
Nếu xuất hiện lỗi 404 hoặc không tìm thấy tập tin thì Robots.txt chưa được upload đúng thư mục gốc.
Kiểm tra bằng Google Search Console
Sau khi thêm website vào Google Search Console, bạn có thể sử dụng các công cụ kiểm tra URL để xem Google có thể thu thập dữ liệu của một trang cụ thể hay không.
Nếu Robots.txt đang chặn URL đó, Google sẽ hiển thị thông báo tương ứng.
Đây là cách đáng tin cậy để xác minh rằng các quy tắc đang hoạt động đúng như mong muốn.
Kiểm tra bằng các công cụ SEO
Nhiều công cụ SEO hiện nay có khả năng phân tích Robots.txt, phát hiện lỗi cú pháp, quy tắc xung đột hoặc những URL quan trọng đang bị chặn ngoài ý muốn.
Việc kiểm tra định kỳ sẽ giúp website tránh được các sự cố ảnh hưởng đến SEO trong thời gian dài.
Robots.txt ảnh hưởng đến SEO như thế nào?
Robots.txt không phải là yếu tố xếp hạng trực tiếp nhưng lại ảnh hưởng đáng kể đến quá trình thu thập dữ liệu của công cụ tìm kiếm.
Tăng hiệu quả Crawl Budget
Đối với website có hàng nghìn hoặc hàng triệu URL, Google không thể thu thập toàn bộ dữ liệu trong một lần.
Nếu Robots.txt loại bỏ những URL không cần thiết, bot sẽ dành nhiều thời gian hơn cho các bài viết, sản phẩm hoặc dịch vụ quan trọng.
Đẩy nhanh quá trình lập chỉ mục
Khi Google tập trung vào các trang có giá trị, khả năng phát hiện và lập chỉ mục nội dung mới cũng được cải thiện.
Điều này đặc biệt hữu ích với website thường xuyên cập nhật bài viết.
Hạn chế nội dung trùng lặp
Nhiều website sinh ra hàng loạt URL chỉ khác nhau ở tham số.
Ví dụ:
/san-pham?sort=asc
/san-pham?sort=desc
/san-pham?page=2
/san-pham?page=3
Nếu Google thu thập tất cả các URL trên thì sẽ làm tăng lượng nội dung gần giống nhau.
Robots.txt có thể hỗ trợ hạn chế tình trạng này.
Khi nào không nên sử dụng Robots.txt để chặn trang?
Có những trường hợp Robots.txt không phải là giải pháp phù hợp.
Muốn Google xóa trang khỏi kết quả tìm kiếm
Nếu mục tiêu là không cho một trang xuất hiện trên Google thì Robots.txt chưa chắc đáp ứng được.
Google vẫn có thể hiển thị URL nếu trang đó được liên kết từ nhiều website khác.
Trong trường hợp này, bạn nên sử dụng thẻ Meta Robots với giá trị noindex hoặc trả về mã trạng thái HTTP phù hợp.
Bảo vệ dữ liệu quan trọng
Những khu vực chứa thông tin nhạy cảm cần được bảo vệ bằng cơ chế xác thực người dùng, phân quyền hoặc cấu hình máy chủ.
Không nên chỉ dựa vào Robots.txt.
Robots.txt có bắt buộc phải có không?
Không.
Một website vẫn có thể hoạt động và được Google lập chỉ mục ngay cả khi không có Robots.txt.
Tuy nhiên, đối với các website muốn tối ưu SEO lâu dài thì việc xây dựng Robots.txt là điều nên làm.
Nó giúp công cụ tìm kiếm hiểu rõ cấu trúc website và thu thập dữ liệu hiệu quả hơn.
Những nguyên tắc nên áp dụng khi viết Robots.txt
- Chỉ chặn những khu vực thực sự không cần Google truy cập.
- Không chặn CSS, JavaScript và các tài nguyên cần thiết để hiển thị trang.
- Luôn khai báo Sitemap.
- Kiểm tra lại sau mỗi lần chỉnh sửa.
- Không sử dụng Robots.txt như một biện pháp bảo mật.
- Ưu tiên cấu hình đơn giản, dễ quản lý và dễ kiểm tra.
- Theo dõi Google Search Console để phát hiện các URL bị chặn ngoài ý muốn.
Những hiểu lầm phổ biến về Robots.txt
Chặn Robots.txt là Google sẽ không biết URL
Điều này không hoàn toàn đúng.
Nếu URL được liên kết từ các website khác hoặc xuất hiện trong Sitemap, Google vẫn có thể biết đến sự tồn tại của URL đó dù không truy cập được nội dung.
Website càng chặn nhiều càng tốt
Nhiều quản trị viên cho rằng chặn càng nhiều thì SEO càng hiệu quả.
Thực tế, việc chặn quá mức có thể khiến Google không đọc được các trang quan trọng hoặc không đánh giá chính xác chất lượng website.
Robots.txt giúp tăng thứ hạng từ khóa
Robots.txt không trực tiếp làm tăng vị trí từ khóa.
Giá trị của tập tin này nằm ở việc tối ưu quá trình thu thập dữ liệu và phân bổ Crawl Budget hợp lý.
Câu hỏi thường gặp
Robots.txt có giới hạn kích thước không?
Có. Mặc dù đa số website không bao giờ đạt tới giới hạn này, bạn vẫn nên giữ Robots.txt gọn gàng, chỉ chứa những quy tắc cần thiết để dễ quản lý.
Có thể có nhiều Robots.txt không?
Không.
Mỗi tên miền chỉ nên có một tập tin robots.txt đặt tại thư mục gốc.
Có cần cập nhật Robots.txt thường xuyên không?
Nếu cấu trúc website thay đổi, bổ sung thư mục mới hoặc điều chỉnh chiến lược SEO thì bạn nên rà soát và cập nhật Robots.txt để phù hợp với tình trạng hiện tại.
Xóa Robots.txt có ảnh hưởng đến SEO không?
Nếu trước đó Robots.txt đang chứa những quy tắc quan trọng thì việc xóa tập tin có thể khiến Google bắt đầu thu thập những khu vực vốn không mong muốn.
Ngược lại, nếu tập tin cũ đang cấu hình sai thì việc chỉnh sửa hoặc thay thế sẽ mang lại hiệu quả tích cực hơn.
Kết luận
Robots.txt là một tập tin nhỏ nhưng có vai trò quan trọng trong việc định hướng công cụ tìm kiếm thu thập dữ liệu trên website. Khi được cấu hình đúng, Robots.txt giúp tối ưu Crawl Budget, giảm việc thu thập các URL không cần thiết, hỗ trợ quá trình lập chỉ mục và góp phần cải thiện hiệu quả SEO tổng thể.
Tuy nhiên, Robots.txt không phải là công cụ bảo mật và cũng không thể thay thế các phương pháp kiểm soát lập chỉ mục như Meta Robots hay các cơ chế phân quyền của máy chủ. Vì vậy, người quản trị cần hiểu rõ mục đích của từng giải pháp để áp dụng đúng trong từng trường hợp.
Đối với các website doanh nghiệp, blog, trang tin tức hay cửa hàng trực tuyến, việc xây dựng một Robots.txt khoa học ngay từ đầu sẽ giúp quá trình phát triển SEO bền vững hơn về lâu dài. Hãy thường xuyên kiểm tra, cập nhật và đánh giá tập tin này mỗi khi website có sự thay đổi lớn để đảm bảo các công cụ tìm kiếm luôn thu thập dữ liệu theo đúng định hướng mà bạn mong muốn.
- 0 Bình luận
Email, Điện thoại của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *