GPTBot, ClaudeBot, PerplexityBot: ai đang crawl bạn và vì sao
Mở file log máy chủ của bất kỳ website tiếng Việt nào đang có lượng truy cập kha khá trong năm 2026, bạn sẽ thấy một điều khác hẳn vài năm trước. Bên cạnh Googlebot quen thuộc, bây giờ có cả một đoàn bot mới với những cái tên lạ: GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended, CCBot. Chúng không phải virus, không phải hacker. Chúng là các con bot do những công ty AI lớn vận hành, và chúng đang đọc nội dung của bạn — mỗi con với một mục đích khác nhau.
Phần lớn người làm marketing và chủ website Việt vẫn gộp tất cả lại thành một khái niệm mơ hồ "bot AI" rồi hoặc chặn sạch vì sợ, hoặc kệ hết vì không hiểu. Cả hai phản ứng đều sai, vì những con bot này không giống nhau. Một số lấy nội dung của bạn để huấn luyện mô hình. Một số đọc nội dung của bạn theo thời gian thực để trả lời câu hỏi người dùng — và có thể dẫn lại nguồn về website của bạn. Chặn nhầm con thứ hai nghĩa là bạn tự loại mình khỏi một kênh hiển thị đang lớn rất nhanh.
Bài này điểm danh từng con bot AI có thật đang crawl web năm 2026: ai vận hành nó, nó làm gì, nhận diện nó qua user-agent trong log thế nào, và cho hay chặn nó trong robots.txt ra sao. Không có cái tên nào bịa ra ở đây — tất cả đều là user-agent thật mà các công ty AI công bố chính thức.
AI crawler là các con bot tự động do công ty AI vận hành để thu thập nội dung web cho hai mục đích khác nhau: huấn luyện mô hình ngôn ngữ, và trả lời câu hỏi người dùng theo thời gian thực. Bạn nhận diện chúng qua chuỗi user-agent trong log máy chủ và điều khiển quyền truy cập qua file robots.txt, cho phép từng con riêng biệt thay vì gộp một cục.
Hai loại bot AI hoàn toàn khác nhau
Trước khi đi vào tên cụ thể, bạn cần nắm một sự phân biệt nền tảng, vì nó quyết định bạn nên cho hay chặn từng con. Các con bot AI chia làm hai nhóm theo mục đích, và rất nhiều người chặn nhầm vì không biết sự khác biệt này.
Nhóm thứ nhất là bot huấn luyện (training crawler). Chúng thu thập nội dung web về để đưa vào tập dữ liệu huấn luyện cho các mô hình ngôn ngữ. Khi GPTBot hay ClaudeBot lấy bài viết của bạn, nội dung đó có thể trở thành một phần kiến thức nền của mô hình. Điều quan trọng: bot huấn luyện không dẫn nguồn về bạn theo thời gian thực. Nó lấy chữ, dùng để dạy máy, và website bạn không nhận lại lượt truy cập trực tiếp nào. Cho phép loại bot này là một quyết định mang tính nguyên tắc — bạn có muốn nội dung của mình góp phần dạy mô hình AI hay không — chứ không phải quyết định về traffic.
Nhóm thứ hai là bot truy xuất thời gian thực (retrieval crawler hay search crawler). Khi một người dùng hỏi ChatGPT, Perplexity hay một AI search nào đó một câu, và hệ thống cần thông tin mới để trả lời, nó cử bot này đi đọc các trang web liên quan ngay lúc đó. Bot loại này quan trọng với bạn vì câu trả lời AI thường kèm trích dẫn nguồn — và nếu nội dung bạn được trích, người dùng có thể bấm vào và ghé website bạn. Đây là kênh hiển thị mới, tương tự việc lên top Google nhưng trong một giao diện trả lời AI. Chặn loại bot này nghĩa là bạn vô hình trong các câu trả lời AI.
Nếu bạn chỉ nhớ một điều từ bài này, hãy nhớ điều này: chặn bot huấn luyện là một lựa chọn hợp lý; chặn bot truy xuất thời gian thực thường là tự bắn vào chân mình. Phần lớn các con bot mà người ta chặn "cho an toàn" lại chính là bot truy xuất — con đang muốn mang khách về cho họ. Đây là loại quyết định mà chúng tôi đã bàn kỹ trong bài chặn AI crawler là một quyết định kinh doanh chứ không phải kỹ thuật: nó không nên do một bạn dev quyết một mình, vì nó ảnh hưởng trực tiếp đến việc thương hiệu bạn có xuất hiện trong câu trả lời AI hay không.
Họ nhà OpenAI: GPTBot, OAI-SearchBot, ChatGPT-User
OpenAI vận hành ba con bot riêng biệt, và nhầm lẫn giữa chúng là lỗi phổ biến nhất. Mỗi con có một nhiệm vụ và một user-agent khác nhau.
GPTBot là bot huấn luyện của OpenAI. Đây là con thu thập nội dung web để dùng cho việc huấn luyện các mô hình GPT tương lai. Trong log máy chủ, user-agent của nó chứa chuỗi GPTBot, dạng đầy đủ trông như Mozilla/5.0 ... (compatible; GPTBot/1.x; +https://openai.com/gptbot). Nếu bạn không muốn nội dung của mình tham gia huấn luyện mô hình OpenAI, đây là con cần chặn. Việc chặn GPTBot không ảnh hưởng gì đến việc ChatGPT có trích dẫn bạn trong câu trả lời hay không — đó là việc của con bot khác.
OAI-SearchBot là bot phục vụ tính năng tìm kiếm của OpenAI. Khi ChatGPT cần tra cứu web để trả lời, nó dựa vào hạ tầng tìm kiếm mà OAI-SearchBot xây dựng. User-agent chứa chuỗi OAI-SearchBot. Đây là con bạn thường muốn cho phép, vì nó liên quan trực tiếp đến việc nội dung bạn có được dùng làm nguồn trong kết quả tìm kiếm của ChatGPT hay không. Chặn nó không giúp bạn "bảo vệ" gì cả, chỉ làm bạn biến mất khỏi một kênh.
ChatGPT-User là user-agent xuất hiện khi một người dùng ChatGPT chủ động yêu cầu nó truy cập một URL cụ thể, hoặc khi một tác vụ của người dùng cần lấy nội dung một trang ngay lúc đó. Nó không phải bot crawl hàng loạt mà là hành động do người dùng kích hoạt. User-agent chứa chuỗi ChatGPT-User. Chặn nó nghĩa là khi người dùng dán link website bạn vào ChatGPT và bảo "tóm tắt trang này", nó sẽ không đọc được — một trải nghiệm bực mình mà bạn thường không có lý do gì để gây ra.
Bài học từ riêng họ nhà OpenAI: ba con bot, ba mục đích. Người chặn "OpenAI" mà thực chất chỉ chặn GPTBot vẫn xuất hiện bình thường trong ChatGPT search; người chặn cả ba thì tự xóa mình khỏi hệ sinh thái ChatGPT hoàn toàn. Biết bạn đang chặn con nào là khác biệt giữa một quyết định có chủ đích và một quyết định mù.
ClaudeBot và họ nhà Anthropic
Anthropic — công ty đứng sau trợ lý AI Claude — vận hành bot crawl với user-agent chứa chuỗi ClaudeBot. Đây là con thu thập nội dung web phục vụ cho hệ thống của Anthropic. Dạng user-agent đầy đủ trông như Mozilla/5.0 (compatible; ClaudeBot/1.0; +claudebot@anthropic.com), kèm địa chỉ email liên hệ trong chuỗi.
Anthropic cũng dùng một số user-agent liên quan đến việc lấy nội dung khi người dùng yêu cầu — ví dụ các chuỗi chứa Claude-User hoặc Claude-SearchBot xuất hiện trong những ngữ cảnh người dùng kích hoạt hoặc tính năng tìm kiếm. Cũng như với OpenAI, ý tưởng then chốt là phân biệt việc crawl nền (gắn với huấn luyện và xây chỉ mục) với việc lấy nội dung theo yêu cầu thời gian thực của người dùng.
Điểm đáng khen ở các bot lớn như ClaudeBot và GPTBot là chúng tôn trọng robots.txt. Nếu bạn khai báo đúng, chúng sẽ tuân theo. Điều này nghĩa là quyền kiểm soát thực sự nằm trong tay bạn — miễn là bạn biết cách viết file robots.txt cho đúng từng con, việc mà phần sau sẽ hướng dẫn cụ thể.
PerplexityBot và các công cụ AI search thuần
PerplexityBot là bot của Perplexity, một công cụ tìm kiếm dựa trên AI mà cốt lõi sản phẩm là trả lời câu hỏi kèm trích dẫn nguồn rõ ràng. Vì mô hình kinh doanh của Perplexity dựa trên việc dẫn nguồn, đây là một trong những con bot mà việc xuất hiện trước nó có giá trị hiển thị trực tiếp nhất. User-agent chứa chuỗi PerplexityBot.
Với Perplexity, mối quan hệ giữa bạn và bot rõ ràng hơn bất kỳ nền tảng nào: nếu nội dung bạn được nó dùng để trả lời, người dùng nhìn thấy tên nguồn và có thể bấm vào. Đây gần như là phiên bản AI của việc lên trang một kết quả tìm kiếm. Chặn PerplexityBot là tự loại mình khỏi một công cụ mà toàn bộ thiết kế là gửi người dùng đến nguồn. Rất hiếm trường hợp một website tiếng Việt muốn tăng độ phủ lại có lý do chính đáng để chặn con này.
Ngoài Perplexity, hệ sinh thái AI search còn liên tục xuất hiện các con bot mới từ những công ty khác. Nguyên tắc nhận diện không đổi: đọc chuỗi user-agent trong log, tra tên đó trên tài liệu chính thức của nhà vận hành để biết nó là bot huấn luyện hay bot truy xuất, rồi quyết định. Đừng đoán theo cái tên nghe lạ.
Google-Extended và Bing: kiểm soát tách rời khỏi tìm kiếm thường
Google và Microsoft là trường hợp đặc biệt, vì các con bot tìm kiếm truyền thống của họ đã có mặt trên web từ lâu, và việc dùng nội dung cho AI là một lớp mới chồng lên trên.
Google-Extended không phải là một con bot crawl riêng theo nghĩa thông thường. Nó là một token điều khiển trong robots.txt cho phép bạn quyết định một điều rất cụ thể: nội dung của bạn có được Google dùng để huấn luyện và phục vụ các sản phẩm AI sinh tạo của họ — như Gemini và các tính năng AI trong tìm kiếm — hay không. Điểm tinh tế và quan trọng: chặn Google-Extended không làm bạn rớt khỏi tìm kiếm Google thông thường. Googlebot vẫn crawl và xếp hạng bạn như cũ. Bạn chỉ đang nói "đừng dùng nội dung tôi cho phần AI sinh tạo". Đây là một trong những công cụ kiểm soát sạch nhất hiện có, vì nó tách bạch hai việc mà người ta hay sợ là một.
Phía Microsoft, Bingbot là con bot crawl cho công cụ tìm kiếm Bing, vốn cũng là nền tảng dữ liệu cho các tính năng AI của Microsoft Copilot. Vì Bing vừa là search engine truyền thống vừa là nguồn cho trải nghiệm AI của Microsoft, việc cho Bingbot crawl gắn liền với cả hai. Đây là lý do nhiều website giữ Bingbot mở: nó vừa là kênh tìm kiếm vừa là cửa vào hệ sinh thái AI của Microsoft.
CCBot: con bot gián tiếp nuôi cả ngành AI
CCBot là bot của Common Crawl, một tổ chức phi lợi nhuận thu thập và công bố một kho dữ liệu web khổng lồ miễn phí. Bản thân Common Crawl không phải công ty AI, nhưng kho dữ liệu của nó được rất nhiều dự án và công ty AI dùng làm nguyên liệu huấn luyện. User-agent chứa chuỗi CCBot.
CCBot quan trọng vì một lý do gián tiếp: chặn các bot huấn luyện trực tiếp như GPTBot mà để CCBot mở thì nội dung của bạn vẫn có thể chảy vào các tập huấn luyện qua kho Common Crawl. Nếu mục tiêu của bạn là không cho nội dung tham gia huấn luyện AI dưới mọi hình thức, bạn cần tính cả CCBot vào danh sách, không chỉ các bot mang tên công ty AI cụ thể. Đây là chi tiết mà nhiều người bỏ sót và rồi tưởng mình đã chặn mà thực ra chưa.
Đọc user-agent trong log máy chủ: nhận diện ai đang ghé
Lý thuyết về tên bot chỉ hữu ích khi bạn biết tự kiểm tra trên website của chính mình. Mọi quyết định cho/chặn nên bắt đầu từ việc đọc log thật, xem con nào thực sự đang ghé bạn và ghé nhiều mức nào.
Mỗi lần một con bot truy cập website, máy chủ ghi lại một dòng log, trong đó có trường user-agent — chuỗi tự khai báo của con bot. Đây là nơi bạn tìm thấy các tên như GPTBot, ClaudeBot, PerplexityBot. Cách thực hành cụ thể:
- Tìm file log truy cập. Trên hầu hết hosting và VPS phổ biến ở Việt Nam (cPanel, DirectAdmin, hay nginx/apache trên VPS), log truy cập nằm trong thư mục log của web server. Hỏi nhà cung cấp hosting nếu bạn không tự tìm được — đây là việc họ chỉ được trong vài phút.
- Lọc theo chuỗi user-agent. Bạn không cần đọc cả triệu dòng. Lọc các dòng chứa chuỗi như GPTBot, ClaudeBot, PerplexityBot, CCBot, Bingbot, OAI-SearchBot. Mỗi lần khớp là một lượt ghé của con bot đó.
- Đếm tần suất. Con nào ghé nhiều, con nào ghé ít, con nào không thấy. Điều này cho bạn biết bot nào thực sự quan tâm đến nội dung của bạn, và giúp bạn ưu tiên đúng chỗ.
- Cảnh giác bot giả mạo. User-agent là chuỗi tự khai, nên về lý thuyết ai cũng có thể giả danh GPTBot. Các nhà vận hành lớn công bố dải địa chỉ IP chính thức của bot, cho phép bạn xác minh một lượt ghé "GPTBot" có thật đến từ OpenAI hay không. Với phần lớn website tiếng Việt, mức độ này là tùy chọn nâng cao, nhưng nếu bạn thấy lưu lượng bot bất thường gây tải nặng, đây là cách kiểm chứng.
Thói quen đọc log định kỳ — mỗi tháng một lần chẳng hạn — cho bạn bức tranh thật về hệ sinh thái bot AI đang tương tác với website mình, thay vì phỏng đoán. Nó cũng giúp bạn phát hiện sớm khi một bot mới xuất hiện, để quyết định cho hay chặn một cách chủ động.
robots.txt: cho và chặn từng con bot một
File robots.txt đặt ở thư mục gốc website (ten-mien.com/robots.txt) là nơi bạn ra chỉ thị cho từng con bot. Cú pháp đơn giản: khai báo tên bot bằng User-agent, rồi cho phép hay cấm bằng Allow/Disallow. Điều quan trọng cần hiểu là robots.txt áp theo tên user-agent, nên bạn điều khiển được từng con riêng biệt — đây chính là lý do việc biết tên bot ở các phần trên có giá trị thực hành.
Ví dụ, nếu bạn muốn chặn nội dung tham gia huấn luyện AI nhưng vẫn xuất hiện trong các câu trả lời AI search, một chiến lược phổ biến là chặn các bot huấn luyện và để mở các bot truy xuất:
- Chặn các con bot huấn luyện: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), và dùng token Google-Extended để loại nội dung khỏi AI sinh tạo của Google.
- Để mở các con bot truy xuất thời gian thực: OAI-SearchBot, PerplexityBot, ChatGPT-User — để nội dung bạn vẫn được dùng làm nguồn và dẫn link về bạn.
- Giữ Googlebot và Bingbot mở như bình thường, vì đó là tìm kiếm truyền thống bạn không muốn mất.
Ngược lại, nếu chiến lược của bạn là mở tối đa cho mọi bot AI để tăng độ phủ — lựa chọn mà nhiều website nội dung tiếng Việt mới đang theo đuổi — thì bạn đơn giản là không chặn con nào, và còn nên chủ động dọn các rào cản kỹ thuật vô tình chặn bot. Chúng tôi đã viết một lộ trình cụ thể cho hướng này trong bài mở site cho mọi bot AI trong 90 ngày, từ kiểm tra robots.txt đến đảm bảo nội dung đọc được không cần JavaScript phức tạp.
Vài nguyên tắc khi viết robots.txt cho bot AI:
- Tên user-agent phải khớp chính xác chuỗi mà bot công bố. Viết sai một ký tự là chỉ thị vô hiệu, và bot sẽ crawl như thể bạn chưa cấm gì. Lấy tên chuẩn từ tài liệu chính thức của nhà vận hành, đừng gõ theo trí nhớ.
- robots.txt dựa trên sự tự nguyện tuân thủ. Các bot lớn (GPTBot, ClaudeBot, PerplexityBot, Bingbot, CCBot) tôn trọng nó. Nhưng nó không phải tường lửa — bot xấu có thể phớt lờ. Nếu bạn cần chặn cứng một con bot ngỗ ngược gây tải, đó là việc của tường lửa hoặc cấu hình máy chủ, không phải robots.txt.
- Khai báo riêng từng con, đừng dùng một chỉ thị gộp. Vì bạn muốn cho con này chặn con kia, mỗi bot AI nên có khối User-agent riêng. Dùng dấu sao gộp tất cả là cách nhanh nhất để vô tình chặn con bạn đang muốn mở.
- Rà lại sau mỗi thay đổi. Sau khi sửa robots.txt, kiểm tra lại bằng cách đọc log vài tuần sau xem hành vi bot có đổi đúng ý không. Quyết định trên giấy chỉ có giá trị khi nó phản ánh đúng trong thực tế.
Vượt khỏi robots.txt: llms.txt và nội dung đọc được
robots.txt trả lời câu hỏi "cho ai vào". Nhưng có một câu hỏi thứ hai cũng quan trọng: khi đã cho bot AI vào, bạn có giúp nó hiểu và trích dẫn nội dung mình đúng cách không? Đây là nơi các thực hành mới xuất hiện.
Một chuẩn đang được nhắc tới nhiều là llms.txt — một file bạn đặt ở website để cung cấp cho các mô hình AI một bản đồ có cấu trúc về nội dung quan trọng nhất của mình, viết theo định dạng dễ máy đọc. Ý tưởng là thay vì để bot tự mò qua HTML rối rắm, bạn chủ động chỉ cho nó đâu là nội dung cốt lõi đáng trích dẫn. Đây còn là một quy ước đang định hình chứ chưa phải chuẩn bắt buộc, nhưng các website muốn đi trước nên tìm hiểu sớm. Chúng tôi đã viết một bài thực chiến về cách dựng file này trong bài llms.txt thực chiến cho website Việt, nếu bạn muốn áp dụng cụ thể.
Song song đó, một sự thật kỹ thuật đơn giản vẫn quyết định nhiều thứ: bot AI đọc tốt nhất nội dung hiện diện thẳng trong HTML, không phải nội dung chỉ xuất hiện sau khi trình duyệt chạy JavaScript phức tạp. Nhiều website tiếng Việt dựng bằng các framework hiện đại vô tình giấu nội dung sau lớp JavaScript, khiến bot crawl xong chẳng thấy gì đáng trích. Cho phép bot vào mà nội dung lại không đọc được thì cũng như mở cửa một căn phòng tối. Đảm bảo nội dung chính nằm trong HTML phục vụ ngay từ máy chủ là điều kiện nền cho mọi chiến lược hiển thị trước AI.
Khung quyết định: bạn nên làm gì với mỗi con bot
Gộp tất cả lại, đây là khung tư duy gọn để bạn ra quyết định cho website của mình, thay vì chặn hay mở theo cảm tính.
Bước một, xác định mục tiêu của bạn. Bạn ưu tiên độ phủ và hiển thị trong các câu trả lời AI? Hay bạn ưu tiên bảo vệ nội dung khỏi việc huấn luyện mô hình? Hai mục tiêu này dẫn đến hai cấu hình rất khác nhau, và bạn cần chọn rõ trước khi đụng vào robots.txt. Với phần lớn doanh nghiệp Việt đang muốn tăng nhận biết thương hiệu, độ phủ thường thắng — nhưng đó là quyết định kinh doanh của bạn, không phải mặc định kỹ thuật.
Bước hai, phân loại từng bot bạn thấy trong log. Với mỗi user-agent, hỏi: đây là bot huấn luyện hay bot truy xuất thời gian thực? Tra tài liệu chính thức của nhà vận hành nếu chưa chắc. Phân loại này quyết định gần như mọi thứ.
Bước ba, áp chính sách nhất quán với mục tiêu. Nếu mục tiêu là độ phủ, để mở tất cả bot truy xuất, cân nhắc mở luôn cả bot huấn luyện vì nó cũng góp phần đưa thương hiệu bạn vào kiến thức nền của mô hình. Nếu mục tiêu là bảo vệ nội dung huấn luyện, chặn các bot huấn luyện gồm cả CCBot và token Google-Extended, nhưng giữ mở bot truy xuất để không mất kênh hiển thị. Đừng để trạng thái mặc định "chặn hết cho an toàn" tự quyết thay bạn — đó gần như luôn là lựa chọn tệ nhất cho một website muốn được biết đến.
Bước bốn, kiểm chứng trong log và lặp lại. Vài tuần sau mỗi thay đổi, đọc lại log để xác nhận hành vi bot đổi đúng ý. Hệ sinh thái bot AI đang thay đổi nhanh, tên bot mới liên tục xuất hiện, nên đây không phải việc làm một lần rồi quên.
Vì sao chuyện này đáng để bạn bận tâm ngay bây giờ
Có thể bạn đang nghĩ đây là chuyện kỹ thuật xa vời, để dev lo. Nhưng hãy nhìn xa hơn một chút. Cách người ta tìm thông tin đang dịch chuyển: thay vì gõ vào Google rồi tự bấm vào mười kết quả, ngày càng nhiều người hỏi thẳng một trợ lý AI và nhận một câu trả lời tổng hợp kèm vài nguồn được trích. Trong thế giới đó, việc nội dung của bạn có nằm trong số nguồn được AI đọc và trích hay không trở thành một câu hỏi sống còn về hiển thị — ngang với câu hỏi "tôi có lên trang nhất Google không" của thập kỷ trước.
Các con bot trong bài này chính là cánh cửa đó. Mỗi con là một đường dẫn để nội dung của bạn đi vào một hệ sinh thái AI cụ thể. Hiểu chúng, nhận diện chúng trong log, và điều khiển chúng có chủ đích trong robots.txt là kỹ năng nền của marketing nội dung trong kỷ nguyên AI search. Không phải vì công nghệ, mà vì đó là nơi sự chú ý của người dùng đang chuyển tới.
Điều khó là theo dõi liên tục: bot nào mới xuất hiện, bot nào đang ghé bạn nhiều, nội dung nào của bạn được AI trích dẫn và nội dung nào bị bỏ qua. Đây là loại việc giám sát đều đặn, có cấu trúc, lặp đi lặp lại mà một AI agent làm SEO như Orova được sinh ra để gánh — đọc log, phân loại bot, theo dõi độ hiển thị trước các nền tảng AI, và báo cho bạn khi có thay đổi đáng chú ý, thay vì để bạn tự mò qua hàng triệu dòng log mỗi tháng. Bạn vẫn là người quyết định chính sách cho/chặn — đó là quyết định kinh doanh của bạn. Phần việc lặp lại tẻ nhạt để biến quyết định đó thành hiện thực và giữ nó đúng theo thời gian thì để máy lo. Bắt đầu đơn giản thôi: mở log máy chủ tuần này, lọc vài cái tên trong bài, và xem ai đang thực sự đọc nội dung của bạn.
Để AI Agent lo SEO cho bạn
Orova tự lên kế hoạch, viết bài, tối ưu và theo dõi thứ hạng — bạn chỉ việc đọc kết quả.
Dùng thử miễn phí