llms.txt thực chiến: file này là gì, viết sao, có giúp gì không
Vài tháng gần đây, nếu bạn theo dõi các cộng đồng SEO và marketing nội dung, gần như chắc chắn bạn đã nghe ai đó nhắc đến một file tên là llms.txt. Có người nói nó là "robots.txt cho thời đại AI". Có người bán dịch vụ "tối ưu llms.txt" với giá không hề rẻ. Và cũng có người khẳng định chắc nịch rằng ChatGPT hay Gemini sẽ đọc file này để hiểu website của bạn. Phần lớn những lời ấy đều phóng đại, một số thì sai hẳn.
Bài viết này không bán cho bạn một niềm tin. Nó giải thích thẳng llms.txt thực sự là gì, ai đề xuất ra nó, viết file này như thế nào cho đúng cú pháp, đặt nội dung gì vào, nó khác robots.txt ra sao, và — câu hỏi quan trọng nhất — có nên làm hay không, khi mà cho đến giờ chưa một hãng AI lớn nào cam kết dùng nó. Bạn sẽ rời khỏi đây với một quyết định có cơ sở, không phải một nỗi sợ bị bỏ lại phía sau.
llms.txt là một chuẩn do cộng đồng đề xuất, chưa được hãng AI nào cam kết dùng chính thức. Đó là một file văn bản dạng Markdown đặt ở gốc tên miền (yourdomain.com/llms.txt), liệt kê những trang nội dung quan trọng nhất của bạn để mô hình ngôn ngữ lớn dễ tìm và hiểu. Nó chỉ đường, không cấp phép hay chặn truy cập. Hiệu quả hiện tại chưa chắc chắn, nhưng chi phí làm gần như bằng không.
llms.txt ra đời từ đâu, và "chuẩn đề xuất" nghĩa là gì
llms.txt được Jeremy Howard — đồng sáng lập Answer.AI và fast.ai — đề xuất công khai vào tháng 9 năm 2023. Ý tưởng gốc rất cụ thể và khiêm tốn: các trang web hiện đại đầy JavaScript, menu, quảng cáo, banner cookie và những thành phần điều hướng mà một mô hình ngôn ngữ lớn phải lọc qua mới chạm tới nội dung thật. Cửa sổ ngữ cảnh của mô hình có giới hạn, và việc nhồi cả một trang HTML rối rắm vào đó vừa tốn vừa kém chính xác. Vậy tại sao không cho website một cách để tự nói "đây là những nội dung cốt lõi của tôi, ở dạng sạch sẽ, dễ đọc"? Đó chính là llms.txt.
Điểm bạn cần khắc cốt ghi tâm trước khi đi tiếp: llms.txt là một chuẩn đề xuất của cộng đồng (community proposal), không phải một tiêu chuẩn được tổ chức tiêu chuẩn hoá nào phê chuẩn, và càng không phải thứ mà các hãng AI bắt buộc phải tuân theo. Nó giống như khi ai đó đề nghị một quy ước hay và mọi người bắt đầu thử dùng, chứ không giống một luật giao thông được nhà nước ban hành. Sự khác biệt này không phải tiểu tiết — nó quyết định toàn bộ kỳ vọng đúng đắn của bạn về file này.
Để so sánh: robots.txt mất nhiều năm mới trở thành quy ước được mọi công cụ tìm kiếm tôn trọng, và đến năm 2022 mới chính thức thành một tiêu chuẩn được ghi nhận. llms.txt mới được vài năm tuổi và vẫn đang ở giai đoạn "thử nghiệm trong cộng đồng". Có một thư mục các website đã triển khai nó, có những thư viện tài liệu kỹ thuật áp dụng nó, nhưng đó là sự lan toả tự nguyện từ dưới lên, không phải sự công nhận từ trên xuống.
Sự thật phải nói thẳng: chưa hãng AI lớn nào cam kết dùng
Đây là phần mà rất nhiều bài viết và rất nhiều người bán dịch vụ cố tình làm mờ đi, nên tôi sẽ nói rõ ràng nhất có thể.
Tính đến thời điểm bài này được viết, OpenAI, Google và Anthropic đều chưa công bố cam kết chính thức nào về việc các sản phẩm của họ — ChatGPT, Gemini, Claude — sẽ đọc và sử dụng file llms.txt của website bạn. Không có tài liệu chính thức nào từ các hãng này xác nhận rằng bot thu thập dữ liệu của họ ưu tiên llms.txt, hay rằng việc có file này sẽ ảnh hưởng đến việc nội dung bạn được trích dẫn trong câu trả lời AI. Bất kỳ ai nói với bạn điều ngược lại đều đang khẳng định nhiều hơn những gì bằng chứng cho phép.
Điều này không có nghĩa llms.txt vô dụng. Nó có nghĩa là hiệu quả của nó hiện tại chưa chắc chắn — và đó là một trạng thái trung thực, không phải một lời chê. Có những bối cảnh mà llms.txt đã được dùng thật: một số nền tảng tài liệu kỹ thuật, một số công cụ và trợ lý lập trình cho phép người dùng trỏ tới file llms.txt để nạp ngữ cảnh. Ở những nơi đó, file mang lại giá trị cụ thể và đo được. Nhưng "một số công cụ tự nguyện hỗ trợ" rất khác với "các công cụ tìm kiếm AI lớn dùng nó để xếp hạng hay trích dẫn bạn". Đừng để hai điều đó bị trộn vào nhau trong đầu bạn.
Nếu bạn muốn hiểu sâu hơn về cách các bot AI thực sự thu thập nội dung website ngày nay — con nào của hãng nào, đọc gì, tôn trọng quy tắc nào — thì bức tranh đó được mổ xẻ trong bài về cách GPTBot, ClaudeBot và PerplexityBot thu thập dữ liệu. Hiểu các bot này hành xử ra sao trong thực tế quan trọng hơn nhiều so với việc tin vào một file mà các hãng chưa hứa sẽ đọc.
llms.txt khác robots.txt như thế nào — đừng lẫn lộn
Hiểu lầm tai hại nhất về llms.txt là coi nó như một phiên bản robots.txt cho AI. Tên gọi giống nhau, vị trí đặt file giống nhau, nên người ta dễ suy ra chúng làm cùng một việc. Không phải vậy. Chúng đối lập về bản chất.
robots.txt là về cấp phép và chặn. Nó nói với bot: "anh được phép thu thập những đường dẫn này, không được phép đụng vào những đường dẫn kia". Nó là một cánh cổng — mở hoặc đóng. Một bot tôn trọng quy tắc sẽ đọc robots.txt và tự kiềm chế không vào những khu vực bị cấm. Đây là cơ chế kiểm soát truy cập.
llms.txt là về chỉ đường và làm nổi bật. Nó không cấp phép gì, cũng không chặn gì. Nó nói: "trong toàn bộ website của tôi, đây là những nội dung quan trọng nhất, đây là nơi tìm chúng ở dạng sạch sẽ nhất". Nó là một tấm bản đồ chỉ tới kho báu, không phải một ổ khoá trên cửa. Có file llms.txt không ngăn được bot nào, và không có nó cũng không cấm được ai.
Hệ quả thực hành rất quan trọng: nếu mục tiêu của bạn là chặn AI thu thập nội dung, llms.txt hoàn toàn không phải công cụ cho việc đó. Để chặn, bạn vẫn dùng robots.txt (khai báo cụ thể tên bot AI muốn chặn) và các biện pháp kỹ thuật khác ở tầng máy chủ. llms.txt và robots.txt giải quyết hai bài toán trái ngược nhau, và bạn có thể — thậm chí thường nên — dùng cả hai cùng lúc cho hai mục đích khác nhau. Một website hoàn toàn có thể vừa chặn một số khu vực bằng robots.txt, vừa làm nổi bật nội dung công khai bằng llms.txt.
Còn một file thứ ba thường bị kéo vào cuộc so sánh này là sitemap.xml. Sitemap liệt kê toàn bộ URL của bạn cho công cụ tìm kiếm lập chỉ mục — nó đầy đủ và máy đọc. llms.txt thì chọn lọc và người-cũng-đọc-được: bạn cố tình chỉ đưa vào những gì quan trọng nhất, kèm mô tả bằng văn xuôi để ngữ cảnh rõ ràng. Sitemap nói "đây là tất cả mọi thứ tôi có"; llms.txt nói "đây là những thứ đáng để bạn đọc trước tiên".
Viết file llms.txt đúng cú pháp: cấu trúc cụ thể
Tin tốt là cú pháp llms.txt cực kỳ đơn giản, đơn giản đến mức bạn không cần công cụ nào ngoài một trình soạn thảo văn bản. File là Markdown thuần, và nó tuân theo một cấu trúc quy ước gồm vài phần.
Phần bắt buộc: tiêu đề H1
Dòng đầu tiên phải là một tiêu đề cấp một, chính là tên dự án hoặc tên website của bạn, viết theo cú pháp Markdown với một dấu thăng ở đầu. Ví dụ một dòng bắt đầu bằng dấu thăng rồi đến "Tên Công Ty Của Bạn". Đây là phần duy nhất bắt buộc theo quy ước. Nó cho mô hình biết ngay file này nói về thực thể nào.
Phần khuyến nghị: đoạn tóm tắt blockquote
Ngay sau tiêu đề, bạn nên có một đoạn tóm tắt ngắn đặt trong một blockquote (dòng bắt đầu bằng dấu lớn hơn theo cú pháp Markdown). Đoạn này nói trong một đến hai câu: website này là gì, phục vụ ai, làm gì. Hãy coi nó như câu trả lời bạn muốn một mô hình đưa ra khi có người hỏi "công ty này là gì". Viết nó rõ ràng, không hoa mỹ, đúng sự thật.
Phần thân: các đoạn văn ngữ cảnh tuỳ chọn
Sau blockquote, bạn có thể thêm vài đoạn văn xuôi giải thích bối cảnh cần thiết: những thuật ngữ riêng của ngành bạn, những điều dễ hiểu nhầm, những lưu ý quan trọng khi đọc nội dung của bạn. Phần này không bắt buộc, nhưng nó hữu ích nếu lĩnh vực của bạn có nhiều đặc thù.
Phần cốt lõi: các mục H2 chứa danh sách liên kết
Đây là trái tim của file. Bạn tạo các mục bằng tiêu đề cấp hai (hai dấu thăng), mỗi mục gom một nhóm nội dung — ví dụ "Tài liệu sản phẩm", "Hướng dẫn", "Bài viết chủ đề", "Thông tin công ty". Dưới mỗi mục là một danh sách Markdown, mỗi dòng là một liên kết theo cú pháp Markdown chuẩn: chữ neo trong ngoặc vuông, đường dẫn trong ngoặc đơn, rồi một dấu hai chấm và một câu mô tả ngắn cho biết trang đó nói về gì. Câu mô tả này chính là phần làm nên giá trị — nó cho mô hình ngữ cảnh để hiểu nên đọc trang nào khi cần thông tin gì.
Phần đặc biệt: mục "Optional"
Quy ước llms.txt có một mục tên riêng là "Optional". Mọi liên kết đặt trong mục H2 mang đúng tên này được hiểu là có thể bỏ qua nếu ngữ cảnh chật chội. Nói cách khác, đây là nơi bạn để những nội dung phụ — quan trọng nhưng không thiết yếu — để khi cửa sổ ngữ cảnh của mô hình bị giới hạn, nó biết có thể lược bỏ phần này trước. Đây là một cơ chế thông minh giúp bạn phân tầng độ ưu tiên ngay trong file.
Một quy ước mở rộng đáng biết: bên cạnh llms.txt, một số website còn tạo thêm file llms-full.txt — phiên bản đầy đủ chứa toàn bộ nội dung dạng văn bản gộp lại trong một file, dành cho trường hợp một công cụ muốn nạp trọn vẹn kho nội dung của bạn vào ngữ cảnh thay vì chỉ lấy danh sách liên kết. Bạn không bắt buộc phải có nó, nhưng nó tồn tại như một biến thể.
Đặt nội dung gì vào — và đừng đặt gì
Biết cú pháp mới là một nửa. Nửa còn lại — và là nửa quyết định file của bạn có ích hay vô nghĩa — là chọn đúng nội dung đưa vào.
Nguyên tắc bao trùm: llms.txt là một bản tuyển chọn, không phải một danh mục đầy đủ. Nếu bạn nhồi mọi URL của website vào đó, bạn đã biến nó thành một sitemap kém và xoá mất toàn bộ giá trị "chỉ đường có chọn lọc" của nó. Hãy hỏi: nếu một người thông minh chỉ có mười phút để hiểu doanh nghiệp và nội dung của tôi, tôi sẽ chỉ họ đọc những trang nào? Đó là danh sách của bạn.
Những thứ nên có:
- Trang giới thiệu cốt lõi: trang về công ty, trang sản phẩm/dịch vụ chính, trang giải thích bạn làm gì và cho ai.
- Nội dung trụ cột: những bài viết chủ đề sâu, hướng dẫn toàn diện, tài liệu định nghĩa ngành — những trang thể hiện chuyên môn của bạn rõ nhất.
- Tài liệu kỹ thuật hoặc tài liệu sản phẩm: nếu bạn là công ty phần mềm hay SaaS, đây thường là nội dung được mô hình dùng nhiều nhất, vì nó cụ thể và có giá trị tra cứu.
- Các câu hỏi thường gặp và trang khái niệm: những trang trả lời thẳng một câu hỏi cụ thể thường rất hợp để mô hình trích dẫn.
Những thứ không nên có:
- Các trang tiện ích như điều khoản, chính sách bảo mật, trang đăng nhập, giỏ hàng — chúng không giúp mô hình hiểu nội dung của bạn.
- Nội dung mỏng, trang trùng lặp, hay các trang chỉ tồn tại vì lý do kỹ thuật.
- Bất cứ thứ gì bạn không muốn được mô hình đọc và nhắc lại — nhớ rằng llms.txt làm nổi bật, nó kéo sự chú ý tới nội dung chứ không che giấu.
Một lưu ý chất lượng mà nhiều người bỏ qua: câu mô tả đi kèm mỗi liên kết quan trọng ngang với chính liên kết đó. Một dòng "Hướng dẫn triển khai" chung chung kém xa một dòng nói rõ "Hướng dẫn từng bước cài đặt và cấu hình cho doanh nghiệp dưới 50 nhân sự". Mô tả tốt giúp mô hình chọn đúng trang cho đúng câu hỏi. Hãy viết chúng như bạn đang giải thích cho một đồng nghiệp mới, không phải như bạn đang nhồi từ khoá.
Đặt file ở đâu và kiểm tra ra sao
Vị trí của file không có gì để bàn cãi: nó phải nằm ở gốc tên miền, truy cập được tại đường dẫn yourdomain.com/llms.txt. Đây là quy ước cố định, giống hệt cách robots.txt luôn nằm ở gốc. Nếu bạn đặt nó ở một thư mục con, không công cụ nào biết tìm nó ở đâu.
Về mặt kỹ thuật, file phải được máy chủ trả về dưới dạng văn bản thuần (text/plain hoặc tương đương), truy cập công khai không cần đăng nhập, và mã hoá UTF-8 nếu nội dung của bạn có dấu tiếng Việt — điều này quan trọng với website Việt Nam để các ký tự có dấu không bị vỡ. Sau khi đăng, hãy tự mở đường dẫn trong trình duyệt để xác nhận nó hiển thị đúng như văn bản, không bị máy chủ chuyển hướng hay trả về trang lỗi.
Vì cú pháp là Markdown, bạn có thể kiểm tra nhanh bằng cách dán nội dung vào bất kỳ trình xem Markdown nào để chắc rằng các tiêu đề, blockquote và danh sách liên kết hiển thị đúng cấu trúc. Nếu một liên kết không thành liên kết, hay một tiêu đề không thành tiêu đề, bạn có lỗi cú pháp cần sửa.
Có nên làm không? Câu trả lời thực dụng
Giờ là câu hỏi mà bạn thực sự đến đây để hỏi. Sau khi đã biết llms.txt chưa được hãng nào cam kết dùng, có đáng bỏ công làm không?
Câu trả lời thẳng thắn của tôi: với hầu hết website, có — nhưng vì lý do đúng, và với kỳ vọng đúng. Lý do không phải vì nó chắc chắn mang lại lưu lượng hay trích dẫn AI. Lý do là phép tính chi phí–rủi ro nghiêng hẳn về một phía.
Hãy nhìn vào ba yếu tố. Chi phí: cực thấp. Một file Markdown vài chục dòng, viết trong một buổi, cập nhật khi nội dung lớn thay đổi. Bạn không cần lập trình viên, không cần ngân sách, không cần thay đổi gì trên website. Rủi ro: gần như bằng không. File chỉ đường, không chặn gì, không phá vỡ gì, không xung đột với SEO truyền thống. Trường hợp xấu nhất là không công cụ nào đọc nó và bạn mất một buổi làm việc. Lợi ích tiềm năng: chưa chắc chắn nhưng không phải con số không. Một số công cụ đã dùng nó hôm nay, và nếu các hãng lớn áp dụng trong tương lai, bạn đã sẵn sàng mà không phải làm gấp.
Khi một việc có chi phí gần bằng không, rủi ro gần bằng không, và lợi ích tiềm năng dương — kể cả khi xác suất lợi ích chưa chắc chắn — thì làm là quyết định hợp lý. Đây là một khoản đầu tư đón đầu chi phí thấp, không phải một canh bạc. Bạn không đặt cược vào việc llms.txt sẽ thắng; bạn chỉ bỏ một chi phí nhỏ để có mặt sẵn nếu nó thắng.
Điều ngược lại cũng quan trọng không kém: đừng để ai bán cho bạn llms.txt như một dịch vụ đắt tiền hay một phép màu xếp hạng. Nếu một đơn vị báo giá cao để "tối ưu llms.txt" và hứa hẹn bạn sẽ được ChatGPT trích dẫn nhờ nó, họ đang bán cho bạn sự không chắc chắn với giá của sự chắc chắn. File này đơn giản đến mức bạn tự làm được, và không ai có thể bảo đảm kết quả mà các hãng còn chưa cam kết.
Có những trường hợp llms.txt đáng ưu tiên hơn hẳn. Nếu bạn là một công ty SaaS hay phần mềm có tài liệu kỹ thuật, llms.txt giúp các trợ lý lập trình và công cụ dev nạp đúng tài liệu của bạn — đây là lợi ích thật, đo được, ngay hôm nay. Nếu bạn có một kho nội dung trụ cột lớn và muốn nội dung đó được hiểu đúng, file này giúp tổ chức lại nó một cách rõ ràng. Còn nếu website bạn nhỏ và tĩnh, lợi ích mỏng hơn, nhưng chi phí cũng mỏng tương ứng, nên vẫn chẳng có lý do gì để không làm.
llms.txt cho web Việt Nam: vài lưu ý riêng
Với website tiếng Việt, có vài điểm cụ thể đáng nhắc. Thứ nhất là dấu tiếng Việt và mã hoá UTF-8 — như đã nói, hãy chắc máy chủ trả file đúng mã hoá để các ký tự có dấu không vỡ thành ký tự lạ. Đây là lỗi phổ biến trên một số cấu hình hosting Việt Nam.
Thứ hai là ngôn ngữ của mô tả. Nếu nội dung của bạn bằng tiếng Việt và đối tượng là người Việt, hãy viết mô tả bằng tiếng Việt — đó là ngôn ngữ thật của nội dung bạn. Nếu bạn có cả phiên bản tiếng Anh nhắm thị trường nước ngoài, bạn có thể cân nhắc mô tả song ngữ hoặc một file riêng cho phần nội dung tiếng Anh. Đừng dịch máy cứng nhắc; viết tự nhiên bằng ngôn ngữ mà nội dung thực sự dùng.
Thứ ba, và quan trọng về mặt chiến lược: llms.txt chỉ là một mảnh nhỏ trong bức tranh được AI nhìn thấy. Việc nội dung của bạn có được các công cụ AI hiểu, trích dẫn và giới thiệu hay không phụ thuộc vào nhiều thứ căn bản hơn nhiều — chất lượng nội dung, cấu trúc rõ ràng, dữ liệu có cấu trúc, và cách bạn tối ưu cho các công cụ AI nói chung. Khái niệm rộng hơn này được trình bày trong bài GEO là gì và cách tối ưu cho công cụ AI, và nếu mục tiêu cuối của bạn là được các trợ lý AI nhắc tên, thì hiểu cách được ChatGPT, Gemini và Perplexity trích dẫn sẽ cho bạn nhiều đòn bẩy hơn một file llms.txt rất nhiều. Hãy đặt llms.txt vào đúng chỗ của nó: một việc nhỏ, rẻ, nên làm — nhưng không phải nền tảng.
Tóm lại: làm, nhưng giữ đầu lạnh
llms.txt là một ý tưởng hay đến từ cộng đồng, giải quyết một vấn đề có thật — giúp mô hình ngôn ngữ tìm và hiểu nội dung quan trọng của bạn nhanh hơn. Nó là một file Markdown đơn giản đặt ở gốc tên miền, chỉ đường chứ không cấp phép hay chặn, và khác hẳn robots.txt về bản chất. Viết nó dễ, chi phí gần bằng không, rủi ro gần bằng không.
Nhưng nó cũng chưa được OpenAI, Google hay Anthropic cam kết dùng chính thức, nên hiệu quả hiện tại chưa chắc chắn. Cách tiếp cận đúng là làm nó như một khoản đầu tư đón đầu chi phí thấp — bỏ một buổi viết một file gọn gàng, đặt đúng chỗ, rồi quay lại tập trung vào những thứ thực sự quyết định khả năng hiển thị với AI. Đừng phóng đại, đừng trả tiền cho lời hứa mà các hãng còn chưa hứa, và đừng để nó thay thế công việc nội dung nền tảng.
Việc giữ những file kỹ thuật như thế này luôn đồng bộ với nội dung mới, theo dõi xem website bạn có được các công cụ AI nhìn thấy hay không, và liên tục tinh chỉnh nội dung cho dễ được trích dẫn — đó chính là loại công việc lặp đi lặp lại, có cấu trúc mà một AI agent làm SEO như Orova được sinh ra để gánh, để bạn dành sức cho những quyết định cần đầu óc người.
Để AI Agent lo SEO cho bạn
Orova tự lên kế hoạch, viết bài, tối ưu và theo dõi thứ hạng — bạn chỉ việc đọc kết quả.
Dùng thử miễn phí