OROVA.VN — BIZ AI AGENT
Nghiên cứu

Chúng tôi mở site cho mọi bot AI suốt 90 ngày: quan sát được gì

Orova 2 lượt xem
Chúng tôi mở site cho mọi bot AI suốt 90 ngày: quan sát được gì

Có một câu hỏi mà gần như mọi người làm web ở Việt Nam đều đang lưỡng lự: nên mở cửa cho các con bot AI vào đọc nội dung của mình, hay nên đóng lại để khỏi bị "vắt" chất xám miễn phí. Ai cũng có ý kiến, nhưng phần lớn ý kiến đó dựa trên cảm giác hoặc trên vài dòng tin giật tít, chứ không dựa trên dữ liệu thật từ chính website của mình. Chúng tôi quyết định làm thực nghiệm để có dữ liệu đó.

Trong khoảng 90 ngày, chúng tôi mở toàn bộ cánh cửa: không chặn một con crawler AI nào, để robots.txt thông thoáng nhất có thể, và mỗi tối ngồi đọc server log như đọc nhật ký giao thông của một con phố. Mục tiêu không phải để chứng minh "AI tốt" hay "AI xấu", mà để trả lời những câu rất cụ thể: bot nào ghé nhiều, chúng ghé bao lâu một lần, đọc phần nào của site, có gửi lại lượt khách thật nào không, và việc mở cửa có làm máy chủ mệt thêm hay không. Bài này thuật lại những gì quan sát được, theo xu hướng chứ không theo con số chính xác, và rút ra bài học cân bằng cho một website tiếng Việt bình thường.

Mở site cho mọi bot AI trong 90 ngày cho thấy một bức tranh lệch: bot vào lấy nội dung rất đều và rất nhiều, nhưng lượt khách thật được giới thiệu ngược lại thì nhỏ giọt. Cái giá phải trả chủ yếu là một ít tải máy chủ và cảm giác "cho không"; cái nhận lại là khả năng được AI trích dẫn về sau. Quyết định mở hay đóng nên dựa trên việc bạn coi trọng điều nào hơn, chứ không dựa trên nỗi sợ.

Vì sao chúng tôi quyết định mở thay vì chặn

Phản xạ đầu tiên của nhiều người là chặn ngay. Logic nghe rất hợp lý: các mô hình AI học từ nội dung của bạn, rồi trả lời người dùng bằng kiến thức đó mà không gửi ai về website của bạn, vậy chặn đi cho xong. Đó là một lựa chọn chính đáng và chúng tôi không phản đối. Nhưng trước khi chặn, chúng tôi muốn biết mình thực sự đang chặn cái gì và đang từ chối cái gì.

Vấn đề của việc chặn theo cảm tính là bạn không bao giờ thấy được phần "được" của phương trình. Nếu đóng cửa ngay từ đầu, bạn sẽ không bao giờ biết liệu có lượt khách nào từ ChatGPT hay Perplexity đáng lẽ đã ghé. Bạn cũng không biết bot nào thực sự đến, vì log của bạn sẽ chỉ toàn những cú bị từ chối. Mở cửa trong một khoảng thời gian có kiểm soát là cách duy nhất để thu được dữ liệu thật về cả hai phía của cán cân, và 90 ngày là đủ dài để qua được giai đoạn nhiễu ban đầu mà chưa đủ dài để rủi ro nếu có gì bất ổn.

Chúng tôi đặt ra vài nguyên tắc trước khi bắt đầu. Không thay đổi nội dung trong suốt giai đoạn, để không làm nhiễu quan sát. Không chạy quảng cáo đẩy lưu lượng, để mọi con số đến một cách tự nhiên. Và ghi log đầy đủ user-agent cùng IP, để sau này còn phân biệt được bot thật với bot giả mạo — vì có không ít công cụ tự xưng là một crawler nổi tiếng nhưng thực ra là thứ khác.

Đọc server log: công cụ trung thực nhất bạn đang có

Nếu bạn chưa bao giờ mở server log, đây là lúc nên làm quen. Đó là tệp ghi lại mọi lượt truy cập vào máy chủ của bạn: ai gọi, gọi trang nào, vào lúc nào, bằng "danh tính" gì (user-agent). Khác với các bảng phân tích đẹp đẽ vốn chỉ đếm người dùng có trình duyệt và bật JavaScript, server log thấy hết — kể cả những con bot không bao giờ xuất hiện trong báo cáo lưu lượng thông thường.

Đây chính là lý do server log là công cụ trung thực nhất để trả lời câu hỏi của chúng tôi. Bot AI không chạy JavaScript theo dõi, không hiện trong báo cáo người dùng, nên cách duy nhất để biết chúng có ghé hay không là đọc log. Mỗi dòng log cho bạn bốn mảnh thông tin quý: danh tính kẻ gọi, đường dẫn nó muốn, thời điểm, và mã phản hồi máy chủ trả về. Gộp hàng trăm nghìn dòng đó lại theo từng nhóm, bạn có một bức tranh giao thông rõ ràng đến bất ngờ.

Một lưu ý thực hành cho web tiếng Việt: đừng tin user-agent một cách mù quáng. Một con bot có thể tự khai là trình duyệt của người thật, hoặc giả danh một crawler có tiếng. Cách kiểm tra cơ bản là đối chiếu dải IP — các nhà cung cấp AI lớn công bố dải IP chính thức của bot, và một con tự xưng là crawler chính chủ nhưng đến từ một dải IP lạ thì đáng nghi. Chúng tôi không soi từng dòng, nhưng có lọc những nhóm bất thường nhất để con số phản ánh đúng thực tế.

Bot nào ghé nhiều, và ghé theo nhịp nào

Quan sát đầu tiên, cũng là rõ ràng nhất: lượt truy cập bot không chia đều. Một số ít con bot quen mặt chiếm phần lớn lưu lượng crawl, còn lại là một cái đuôi dài gồm vô số bot nhỏ, lạ, ghé một lần rồi biến mất.

Nhóm dẫn đầu là những cái tên bạn đoán được: các crawler thu thập dữ liệu cho mô hình ngôn ngữ lớn và cho các engine tìm kiếm AI. Chúng ghé rất đều — không phải một đợt ồ ạt rồi thôi, mà theo nhịp gần như hằng ngày, quay lại các trang đã đăng để xem có gì mới. Có cảm giác như chúng coi site như một nguồn cần theo dõi liên tục, chứ không phải một lần chụp ảnh rồi quên. Đây là khác biệt lớn so với crawler tìm kiếm truyền thống mà nhiều người đã quen: nhịp ghé của bot AI dày hơn và đều hơn ở những site được cập nhật thường xuyên.

Biểu đồ cột xếp hạng các bot AI ghé website nhiều nhất trong 90 ngày theo số lượt tải trang, từ GPTBot và Google-Extended cao nhất đến ClaudeBot, PerplexityBot, Bytespider và nhóm bot không rõ danh tính
Vài con bot quen chiếm phần lớn lượt crawl; phần còn lại là một cái đuôi dài bot lạ ghé qua rồi mất hút.

Nhóm thứ hai thú vị hơn: những con bot ghé theo đợt dồn dập. Chúng không đến đều mỗi ngày, mà thỉnh thoảng đổ vào hàng loạt request trong một khoảng ngắn rồi im bặt nhiều ngày. Kiểu hành vi này gây tải đột biến rõ hơn nhóm ghé đều, và là nhóm khiến chúng tôi để mắt nhất về mặt vận hành. Nếu bạn từng thấy máy chủ bỗng dưng nặng trong vài phút mà không có chiến dịch nào đang chạy, rất có thể đó là một con bot kiểu này.

Nhóm thứ ba, cái đuôi dài, gồm các bot không rõ danh tính. Một số là công cụ SEO, một số là máy quét bảo mật, một số đơn giản là không khai báo gì rõ ràng. Từng con không đáng kể, nhưng cộng lại chúng tạo ra một nền nhiễu thường xuyên. Bài học ở đây không phải là "có nhiều bot AI", mà là "có rất nhiều thứ đang gọi vào site của bạn mà bạn chưa từng nhìn tới". Nếu muốn hiểu kỹ hơn về các con crawler AI phổ biến và cách phân biệt chúng, chúng tôi đã viết riêng một bài tìm hiểu GPTBot, ClaudeBot và PerplexityBot crawl những gì để bạn đọc song song với thực nghiệm này.

Chúng crawl phần nào của site

Không phải mọi trang đều được ghé ngang nhau. Khi gom log theo đường dẫn, một mẫu hình rõ ràng hiện ra: bot AI tập trung vào nội dung văn bản nhiều chữ, đặc biệt là các bài blog và trang kiến thức, hơn hẳn các trang công cụ, trang tài khoản hay trang giỏ hàng.

Điều này hợp logic. Những con bot này đi tìm thứ chúng dùng được — văn bản mạch lạc, có cấu trúc, trả lời một câu hỏi nào đó. Một bài viết 2.000 từ giải thích một chủ đề rõ ràng có giá trị với chúng hơn nhiều so với một trang đăng nhập hay một trang thanh toán. Vì vậy nếu site của bạn có một khu vực blog hay tài liệu mạnh, hãy chuẩn bị tinh thần rằng đó chính là nơi bot AI dồn sự chú ý vào.

Một quan sát phụ đáng ghi nhận: bot quay lại các trang cũ nhiều hơn ta tưởng. Người ta hay nghĩ crawler chỉ săn nội dung mới, nhưng trong log, các bài đăng từ lâu vẫn bị tải lại đều đặn. Có vẻ chúng kiểm tra xem nội dung cũ có thay đổi không, và muốn giữ "bản sao" của mình luôn cập nhật. Hệ quả thực hành: một bài viết tốt không chỉ được crawl một lần khi đăng; nó tiếp tục được ghé thăm trong suốt vòng đời của nó. Đây là lập luận mạnh cho việc giữ nội dung cũ sạch sẽ và đúng đắn, vì nó vẫn đang được đọc.

Chúng tôi cũng để ý cách bot xử lý các trang không nên crawl — trang lọc, trang phân trang vô tận, các biến thể URL gần như trùng nhau. Một số bot tôn trọng tín hiệu và bỏ qua; một số khác vẫn lao vào, tải hàng loạt biến thể gần giống nhau và lãng phí tải máy chủ. Đây là lý do bạn nên dọn dẹp những "bẫy crawler" này dù bạn có chặn AI hay không — chúng vốn đã là vấn đề từ thời SEO truyền thống.

Câu hỏi 1 tỷ đồng: có lượt khách thật nào trả về không

Đây là phần mọi người tò mò nhất, và cũng là phần khiến chúng tôi suy nghĩ nhiều nhất. Bot vào lấy nội dung là một chuyện; câu hỏi quan trọng hơn là: sau khi nội dung của bạn được dùng để trả lời ai đó trên ChatGPT hay Perplexity, có người thật nào bấm vào nguồn và ghé website của bạn không?

Trong log, lượt referral từ các engine AI có xuất hiện — nghĩa là có người thật bấm vào liên kết nguồn và đến site. Nhưng phải nói thẳng: nó nhỏ giọt so với khối lượng crawl. Mũi tên "vào lấy" thì dày và đều; mũi tên "khách trả về" thì mỏng và lác đác. Đó là sự thật trung tâm của thực nghiệm, và bất cứ ai bảo bạn rằng mở cửa cho AI sẽ mang về một dòng lưu lượng cuồn cuộn thì hoặc đang bán cái gì đó, hoặc chưa từng đọc log của chính mình.

Sơ đồ cán cân giữa lượng nội dung bị bot AI crawl vào và lượt khách thật được giới thiệu trả về từ ChatGPT và Perplexity, với mũi tên vào dày đều còn mũi tên ra mỏng và lác đác
Mũi tên vào dày và đều; mũi tên ra mỏng — đó là cán cân thực tế khi bạn mở cửa cho mọi bot AI.

Nhưng "nhỏ giọt" không có nghĩa là "vô giá trị". Vài điểm tinh tế cần phân biệt. Thứ nhất, các lượt khách AI gửi về tuy ít nhưng thường có ý định rõ ràng hơn — họ đến sau khi đã đọc một câu trả lời nhắc tên bạn, nên họ tới với một câu hỏi cụ thể chứ không phải tình cờ lướt qua. Thứ hai, hệ sinh thái này còn rất mới; tỷ lệ người bấm vào nguồn trích dẫn đang thay đổi theo từng tháng khi các engine thử nghiệm cách hiển thị nguồn. Con số hôm nay không phải con số mãi mãi.

Và đây là điểm dễ bị bỏ qua nhất: phần lớn giá trị của việc được AI đọc không nằm ở lượt click trực tiếp, mà nằm ở việc được nhắc tên. Khi ai đó hỏi ChatGPT về lĩnh vực của bạn và câu trả lời nhắc đến thương hiệu của bạn, đó là một lần xuất hiện có giá trị thật, dù người dùng không bao giờ bấm vào. Đo lường nó khó, nhưng phủ nhận nó thì sai. Chúng tôi đã bàn kỹ hơn về việc làm sao để nội dung của bạn được ChatGPT, Gemini và Perplexity trích dẫn — vì nếu đã chấp nhận cho bot vào, bạn nên tối ưu để thứ chúng lấy đi thực sự nhắc tên bạn.

Ảnh hưởng tới tải máy chủ: có, nhưng không như lời đồn

Một nỗi lo phổ biến là bot AI sẽ "đốt" tài nguyên máy chủ. Quan sát của chúng tôi: ảnh hưởng là có thật nhưng vừa phải đối với một website nội dung cỡ vừa, và gần như toàn bộ áp lực đến từ một nhóm nhỏ bot ghé theo đợt dồn dập, chứ không phải từ tổng lượng crawl.

Nói cụ thể hơn: nhóm bot ghé đều mỗi ngày trải request ra mỏng nên ít gây vấn đề. Nhóm gây tải đột biến là những con đổ hàng loạt request trong một khoảng ngắn. Trong những phút đó, máy chủ bận hơn hẳn, thời gian phản hồi nhích lên, và nếu hạ tầng của bạn yếu, người dùng thật có thể cảm nhận được. Với một site đặt trên hosting chia sẻ giá rẻ, đây là điều cần để mắt; với một site có bộ nhớ đệm tốt và máy chủ tươm tất, nó nằm trong tầm chịu đựng.

Vài biện pháp thực hành giúp giữ tải trong tầm kiểm soát mà không cần đóng cửa hoàn toàn. Bật bộ nhớ đệm trang để bot lấy bản tĩnh thay vì bắt máy chủ dựng lại trang mỗi lần. Dọn các bẫy crawler — phân trang vô tận, vô số biến thể URL lọc — để bot không tải hàng nghìn trang gần như trùng nhau. Và đặt giới hạn tốc độ ở tầng máy chủ cho những con bot hung hăng nhất, một biện pháp dung hòa cho phép chúng vào nhưng không cho phép chúng nhấn chìm site. Mở cửa không có nghĩa là bỏ mặc cửa không khóa chốt.

Có bị "vắt" nội dung mà không trả lại gì không

Giờ là câu hỏi gai góc nhất, câu khiến nhiều người muốn chặn ngay từ đầu: liệu đây có phải một vụ giao dịch một chiều, nơi bot lấy hết chất xám còn bạn chẳng nhận lại gì?

Câu trả lời trung thực dựa trên log là: gần đúng, nhưng không hoàn toàn. Về thuần lưu lượng, đúng là một chiều — bot lấy đi nhiều hơn rất nhiều so với lượng khách chúng gửi về. Nếu bạn đo thành công chỉ bằng click trực tiếp, bạn sẽ thấy mình đang cho không. Nhưng nếu mở rộng định nghĩa "nhận lại" bao gồm cả việc được nhắc tên trong câu trả lời AI, được trích dẫn như một nguồn, được giới thiệu tới những người sẽ không bao giờ tìm thấy bạn qua tìm kiếm truyền thống, thì giao dịch này cân bằng hơn vẻ ngoài của nó.

Cách nghĩ hữu ích là phân biệt hai loại "trả lại" hoàn toàn khác nhau. Loại thứ nhất là lưu lượng — người thật bấm vào và ghé. Loại này, hôm nay, là nhỏ. Loại thứ hai là sự hiện diện — tên bạn, quan điểm của bạn, sản phẩm của bạn xuất hiện trong các câu trả lời mà ngày càng nhiều người dùng để ra quyết định. Loại này khó đo nhưng đang lớn dần. Quyết định mở hay chặn rốt cuộc là quyết định bạn coi trọng loại nào hơn, và bạn tin loại thứ hai sẽ quan trọng đến đâu trong vài năm tới.

Cũng cần thẳng thắn về phía ngược lại: có những trường hợp chặn là quyết định đúng. Nếu nội dung của bạn là tài sản độc quyền mà chính nó là sản phẩm bạn bán — báo cáo trả phí, dữ liệu nghiên cứu, khóa học — thì việc để AI tóm tắt miễn phí có thể bào mòn lý do người ta phải trả tiền cho bạn. Đây hoàn toàn là một quyết định kinh doanh, không phải một quyết định kỹ thuật, và chúng tôi đã viết riêng về cách chặn AI crawler như một quyết định kinh doanh chứ không phải một phản xạ sợ hãi. Thực nghiệm này không bảo bạn phải mở; nó cho bạn dữ liệu để quyết định một cách tỉnh táo.

Bài học cân bằng cho một website Việt

Sau 90 ngày đọc log mỗi tối, đây là những kết luận mà chúng tôi tin là áp dụng được cho phần lớn website tiếng Việt, từ blog cá nhân đến site doanh nghiệp vừa.

1. Đừng chặn theo cảm tính, cũng đừng mở theo cảm tính

Cả hai cực đoan đều dở. Chặn ngay vì sợ "bị vắt" khiến bạn bỏ lỡ sự hiện diện trong một kênh khám phá đang lớn. Mở toang và quên đi khiến bạn không kiểm soát được tải và không biết mình đang đánh đổi gì. Vị trí lành mạnh nằm ở giữa: mở có chọn lọc, theo dõi bằng log, và điều chỉnh dựa trên thứ bạn thật sự thấy chứ không phải thứ bạn lo.

2. Tách quyết định theo từng loại nội dung

Bạn không buộc phải mở hết hoặc đóng hết. Một cấu hình hợp lý cho nhiều site là mở phần nội dung muốn được biết tới — blog, trang kiến thức, trang giới thiệu sản phẩm — vì chính sự hiện diện là điều bạn muốn ở đó; đồng thời chặn phần là tài sản độc quyền hoặc phần riêng tư. Quyết định ở mức thư mục thay vì ở mức toàn site giúp bạn vừa được nhắc tên ở nơi cần, vừa giữ kín nơi cần giữ.

3. Coi server log là bảng điều khiển, không phải tệp để quên

Bài học vận hành lớn nhất là: bạn không thể quản lý thứ bạn không nhìn. Hầu hết chủ website chưa từng mở log của mình, nên họ tranh luận về bot AI hoàn toàn bằng lý thuyết. Chỉ cần định kỳ ngó qua log — bot nào ghé, ghé bao nhiêu, vào đường dẫn nào, có gây tải bất thường không — bạn đã đi trước phần lớn mọi người. Không cần công cụ đắt tiền; cần một thói quen.

4. Tối ưu để thứ bị lấy đi có lợi cho bạn

Nếu đã chấp nhận cho bot vào, hãy làm cho nội dung của bạn dễ được trích dẫn đúng cách: câu trả lời rõ ràng ngay đầu bài, tên thương hiệu gắn liền với quan điểm, dữ kiện được trình bày gọn để dễ rút trích. Khi nội dung bị "vắt", ít nhất hãy bảo đảm cái bị vắt có mang theo tên bạn. Đây là điểm gặp nhau giữa SEO truyền thống và tối ưu cho engine AI: nội dung tốt, mạch lạc, có uy tín vẫn thắng ở cả hai sân.

5. Đo bằng nhiều thước, đừng chỉ đo click

Nếu bạn chỉ nhìn lượt click referral từ AI, bạn sẽ kết luận rằng việc mở cửa là vô nghĩa, vì con số nhỏ. Nhưng đó là dùng một cái thước cũ để đo một hiện tượng mới. Hãy bổ sung các thước phù hợp hơn: bạn có được nhắc tên khi tự hỏi AI về lĩnh vực của mình không, chất lượng của số ít khách AI gửi về có cao không, xu hướng của cả hai theo từng tháng ra sao. Bức tranh đầy đủ hơn cái biểu đồ click rất nhiều.

Những gì chúng tôi sẽ làm khác ở lần sau

Thực nghiệm nào cũng có chỗ để cải thiện, và chúng tôi muốn trung thực về giới hạn của lần này. Chín mươi ngày là đủ để thấy mẫu hình, nhưng chưa đủ để thấy hiệu ứng dài hạn của việc được trích dẫn tích lũy — sự hiện diện trong câu trả lời AI là thứ bồi đắp chậm, và một quý chỉ là khởi đầu.

Lần sau, chúng tôi sẽ làm ba việc khác. Một, gắn nhãn nguồn chặt chẽ hơn để tách bạch lượt khách đến từ engine AI với lượt đến từ tìm kiếm thường, vì ranh giới đang mờ dần khi tìm kiếm truyền thống cũng chèn câu trả lời AI vào. Hai, chủ động kiểm tra mức độ được nhắc tên bằng cách định kỳ hỏi các engine những câu mà khách hàng tiềm năng sẽ hỏi, rồi xem mình có xuất hiện không — đây là thước đo sự hiện diện trực tiếp hơn là chờ click. Ba, thử nghiệm chính sách theo thư mục thay vì mở/đóng toàn site, để đo xem việc mở chọn lọc có giữ được phần lợi mà giảm phần thiệt hay không.

Điều không thay đổi là nguyên tắc nền: quyết định dựa trên log của chính mình, không dựa trên tiêu đề bài báo hay nỗi sợ chung chung. Website của bạn có lưu lượng riêng, đối tượng riêng, loại nội dung riêng — và bot sẽ hành xử với site của bạn khác với site của người khác. Dữ liệu thật luôn ở đó, trong log, chờ bạn đọc.

Kết: mở cửa là một phép thử, không phải một lời thề

Bài học lớn nhất sau 90 ngày không phải là "hãy mở" hay "hãy đóng". Đó là: hãy biến câu hỏi này thành một phép đo thay vì một cuộc tranh cãi. Mở cửa trong một khoảng có kiểm soát, đọc log, nhìn cán cân giữa thứ bị lấy đi và thứ nhận lại, rồi quyết định dựa trên website cụ thể của bạn và trên điều bạn coi trọng — lưu lượng tức thời hay sự hiện diện dài hạn. Không có câu trả lời đúng cho mọi site, nhưng có một cách đúng để tìm câu trả lời của riêng bạn.

Việc theo dõi crawler, tách nguồn lưu lượng, kiểm tra mức độ được trích dẫn và điều chỉnh chính sách theo từng loại nội dung là loại công việc lặp đi lặp lại, có cấu trúc, đúng kiểu để một AI agent làm SEO gánh giúp — đây cũng chính là phần việc Orova được dựng ra để tự động hoá, để bạn còn thời gian dành cho quyết định, thay vì cho việc đọc từng dòng log. Dù bạn chọn mở hay đóng, hãy chọn sau khi đã nhìn dữ liệu của chính mình, chứ đừng chọn vì người khác đang sợ.

Để AI Agent lo SEO cho bạn

Orova tự lên kế hoạch, viết bài, tối ưu và theo dõi thứ hạng — bạn chỉ việc đọc kết quả.

Dùng thử miễn phí