Ngày 1/7/2026, Cloudflare công bố một chính sách họ gọi là “Content Independence Day” (Ngày Độc Lập Nội Dung). Tóm gọn: từ 15/9/2026, mọi domain mới onboard vào Cloudflare sẽ nhận default mới cho bot management trên bất kỳ trang nào có chạy quảng cáo. Các crawler thuộc nhóm Training hoặc Agent sẽ bị chặn mặc định. Crawler thuộc nhóm Search vẫn được cho phép mặc định. Cloudflare đứng trước hơn 20% domain trên toàn web, nên đây không phải một tinh chỉnh config nhỏ lẻ — đây là một default chạm tới một phần đáng kể traffic của internet ngay từ ngày đầu, và nó áp dụng cho cả khách hàng free-tier hiện tại, không chỉ domain mới đăng ký.

Nếu bạn vận hành một site sau Cloudflare, hoặc bạn xây một sản phẩm AI phụ thuộc vào việc crawl/browse web, đây là thứ đáng hiểu ở mức cơ chế, không chỉ ở mức tiêu đề, vì cơ chế này có một cạnh rất sắc: nó có thể âm thầm chặn cả Google.

Mô hình ba nhóm

Framework Content Signals của Cloudflare phân loại hành vi bot thành ba nhóm, và sự khác biệt giữa chúng quan trọng hơn vẻ ngoài của nó:

  • Search — “thu thập hoặc lập chỉ mục nội dung của bạn, để có thể trả lời câu hỏi về nó sau.” Đây là mô hình crawl-và-index kinh điển. Thỏa thuận ngầm là việc index sẽ gửi traffic referral về, nên chủ site mặc định chấp nhận nó.
  • Agent — “hành vi tự động, thường diễn ra theo thời gian thực, đại diện cho một người, để hoàn thành việc gì đó ngay lúc đó.” Ví dụ: ChatGPT-User lấy một trang vì user vừa hỏi câu hỏi, hoặc Claude in Chrome điều hướng luồng checkout của bạn thay cho ai đó. Đây là traffic theo thời gian thực, theo yêu cầu cụ thể, gắn với một hành động cụ thể của con người.
  • Training — crawler lấy nội dung để train hoặc fine-tune mô hình, nơi mà, như Cloudflare diễn đạt, nội dung của bạn bị “hấp thụ vĩnh viễn vào kiến trúc bên dưới.” Không có traffic referral, không có attribution, không có cách nào lấy lại sau khi weight đã được “nướng” xong.

Default mới, trên bất kỳ trang nào có quảng cáo: Training và Agent bị chặn, Search được phép. Lý do Cloudflare đưa ra rất thẳng thắn — “một quảng cáo là tín hiệu cho thấy chủ website muốn có người thật đáp xuống trang,” và một trang được xây để kiếm tiền từ mắt người thật là một trang mà các mô hình AI âm thầm thu thập dữ liệu training hoặc thực thi task agentic không hẳn là khách được chào đón.

Phần sẽ thực sự tạo ra ticket hỗ trợ

Đây là cơ chế mọi technical lead vận hành hạ tầng sau Cloudflare cần khắc cốt ghi tâm trước 15/9: crawler đa mục đích sẽ bị xếp vào nhóm hạn chế nhất áp dụng được cho nó.

Googlebot, Applebot, Bingbot đều làm hai việc — crawl cho Search cho Training (các search engine ngày càng tái sử dụng dữ liệu crawl để train mô hình riêng của họ). Cloudflare không thể tách rõ “Googlebot crawl cho search” khỏi “Googlebot crawl cho training” ở mức request, vì đó là cùng một user agent làm cả hai việc. Vậy nếu setting của site bạn chặn crawler Training, Googlebot cũng bị chặn theo, trên mọi trang có quảng cáo, dù gần như chắc chắn bạn muốn traffic tìm kiếm tự nhiên tiếp tục chảy vào.

Đây không phải kiểu dọa suông — đây là hành vi được ghi nhận rõ, có chủ đích, của logic “luật hạn chế nhất thắng.” Ai từng bật toggle “Block AI Bots” đời cũ trong dashboard Cloudflare mà không đọc kỹ chi tiết sắp phải nhận ra toggle đó giờ có “răng” mà trước đây nó không có.

Cần kiểm tra gì trước deadline

Nếu bạn là người quản lý config CDN, đây là checklist cụ thể, không phải bản marketing:

  1. Kiểm kê các trang có quảng cáo. Default mới áp dụng cụ thể cho trang có chạy quảng cáo — nếu sản phẩm của bạn không có ad unit nào, thay đổi này phần lớn không chạm tới bạn theo mặc định, dù bạn vẫn có thể tự nguyện opt-in.
  2. Kiểm tra xem bạn có phụ thuộc vào Googlebot/Bingbot/Applebot cho traffic tự nhiên không. Nếu có, và bạn cũng muốn chặn Training, bạn cần khai báo ngoại lệ rõ ràng thay vì tin vào logic nhóm sẽ tự làm đúng — nó sẽ không, đó là thiết kế có chủ đích.
  3. Quyết định chính sách thực sự cho traffic Agent, tách biệt với Training. Một user yêu cầu Claude hoặc ChatGPT kiểm tra trang giá của bạn thay họ là một quyết định kinh doanh khác hẳn so với một crawler vô danh hút toàn bộ docs của bạn vào một lượt training. Dashboard Cloudflare cho phép set hai thứ này độc lập — hãy dùng nó.
  4. Đặt preference rõ ràng trước 15/9 nếu bạn là domain mới hoặc đang dùng setting cũ. Luồng opt-out của Cloudflare yêu cầu bạn xác nhận chủ động rằng bạn muốn không thay đổi gì với crawler Training kiêm luôn Search — im lặng sẽ mặc định về trạng thái bị chặn mới.
  5. Với khách hàng free-tier hiện tại: thay đổi này áp dụng cho cả bạn, không chỉ domain mới. Kiểm tra lại setting bot management dù bạn đã cấu hình từ nhiều tháng trước.

Sự dịch chuyển lớn hơn phía sau chính sách

Lùi lại khỏi chi tiết kỹ thuật, có một câu chuyện cấu trúc ở đây. Hai thập kỷ qua, hợp đồng ngầm của web là: crawl nội dung của tôi, gửi traffic về cho tôi. Crawler Training phá vỡ hợp đồng đó hoàn toàn — không có traffic referral từ một mô hình đã “học vẹt” cách diễn đạt trong bài blog của bạn. Traffic Agent là một nhóm thứ ba, mới hơn, không khớp hẳn với nhóm “search” cũ hay nhóm “training”: nó theo thời gian thực, có tính giao dịch, và có thể xem gần giống một lượt truy cập của user hơn là một lượt crawl.

Việc Cloudflare đứng ở lớp DNS/CDN cho hơn một phần năm web mang lại cho họ đòn bẩy mà không nhà xuất bản đơn lẻ nào có được. Đây cùng động lực đòn bẩy mà chúng ta đã thấy với robots.txt suốt ba mươi năm, chỉ khác là giờ đây mức cược là các lượt training mô hình đáng giá hàng trăm triệu đô, không phải xếp hạng tìm kiếm. Kỳ vọng các AI lab sẽ phản ứng mạnh với default Training, kỳ vọng nhiều thỏa thuận thương mại kiểu “pay-per-crawl” chi tiết hơn sẽ theo sau (Cloudflare đã xây dựng hướng này từ các pilot pay-per-crawl trước đó), và kỳ vọng các vendor CDN/WAF khác sẽ ra mô hình phân nhóm tương tự trong hai quý tới, vì không ai muốn là kẻ vẫn còn xài checkbox “block AI bots” mập mờ vào năm 2027.

Bài học cho stack của bạn

Nếu bạn xây bất kỳ thứ gì crawl hoặc browse web thay cho user — pipeline RAG, tool agent tự lấy trang, job scraping phục vụ một lượt fine-tune — giờ bạn cần khai báo trung thực mình thuộc nhóm nào trong ba nhóm trên qua user-agent string, hoặc rủi ro bị chặn oan trong một cuộc chiến của ai đó khác với crawler Training. Những ngày mà một Mozilla/5.0 chung chung giả làm browser để né bot detection đang đếm ngược; các site ngày càng phân biệt theo ý định được khai báo, không chỉ theo fingerprint request. Hãy xây câu chuyện nhận diện cho crawler của bạn từ bây giờ, vì “chúng tôi không nói mình là gì” sắp trở thành một default tệ hơn nhiều so với trước.

Nguồn: Cloudflare — Content Independence Day, TechCrunch đưa tin, Search Engine Journal về vấn đề chặn oan Googlebot

Xuất nội dung

Bình luận