01/10/2026

Cách SEO trên ChatGPT, Gemini, Perplexity: 10 tên cần biết

Cách SEO trên ChatGPT, Gemini, Perplexity: bảng 9 trình thu thập và 1 mã robots.txt của OpenAI, Perplexity, Anthropic, Google, kèm mẫu robots.txt mở tìm kiếm.

Cách SEO trên ChatGPT bắt đầu từ robots.txt: cho phép OAI-SearchBot, trình thu thập (bot) đưa website vào kết quả ChatGPT search. Với Perplexity, đó là PerplexityBot; với Gemini, đường vào là chỉ mục Google Tìm kiếm. OpenAI, Perplexity, Anthropic và Google công bố 10 tên trình thu thập và mã robots.txt, theo tài liệu chính chủ của bốn hãng, bản xem tháng 10 năm 2026. Mỗi tên lo một việc: tìm kiếm, huấn luyện mô hình hoặc mở trang theo yêu cầu người dùng. Mở đúng tên chỉ là điều kiện cần, không bảo đảm được trích dẫn.

Cách SEO trên ChatGPT: mở OAI-SearchBot hay GPTBot?

Muốn có mặt trong ChatGPT search, website cần mở OAI-SearchBot; GPTBot phục vụ huấn luyện mô hình và có thể chặn riêng. OpenAI khuyên 2 việc để website xuất hiện trong kết quả tìm kiếm, theo tài liệu về trình thu thập của OpenAI, bản xem tháng 10 năm 2026. Việc thứ nhất là cho phép OAI-SearchBot trong robots.txt. Việc thứ hai là cho phép yêu cầu đến từ dải IP mà hãng công bố. Ở bản tải ngày 02/10/2026, tệp searchbot.json liệt kê 39 dải IP; số này thay đổi.

  • OAI-SearchBot đưa website vào kết quả tìm kiếm của ChatGPT. Trang bị chặn vẫn có thể hiện trong ChatGPT Atlas dưới dạng liên kết kèm tiêu đề, nếu OpenAI có địa chỉ trang từ nguồn khác và thấy trang liên quan tới câu hỏi. Muốn tránh, OpenAI hướng dẫn dùng thẻ noindex và cho trình thu thập đọc được thẻ đó.
  • GPTBot thu thập nội dung có thể dùng để huấn luyện mô hình. Nếu website mở cả GPTBot và OAI-SearchBot, OpenAI có thể dùng một lần thu thập cho cả hai mục đích.
  • ChatGPT-User mở trang khi người dùng ChatGPT hoặc Custom GPT yêu cầu. OpenAI ghi quy tắc robots.txt «may not apply» với trình này, tức có thể không áp dụng. Trình này cũng không quyết định việc nội dung có mặt trong Search.
  • OAI-AdsBot kiểm tra độ an toàn của trang được gửi làm quảng cáo trên ChatGPT và chỉ vào những trang đó. Trang trợ giúp của OpenAI ghi nhà quảng cáo «must allow OAI-AdsBot»: trình này bắt buộc cho bước kiểm tra và duyệt trang đích của quảng cáo.
  • Bốn tệp dải IP nằm trên openai.com. Ở bản tải ngày 02/10/2026, gptbot.json có 18 dải, chatgpt-user.json có 230 dải và adsbot.json có 2 dải. Số này thay đổi khi OpenAI cập nhật tệp.

SEO Perplexity cần mở PerplexityBot hay Perplexity-User?

SEO Perplexity cần mở PerplexityBot, trình thu thập đưa website vào kết quả tìm kiếm của Perplexity. Perplexity công bố 2 trình thu thập, theo tài liệu về trình thu thập của Perplexity, bản xem tháng 10 năm 2026. Hãng ghi PerplexityBot không dùng để thu thập nội dung cho mô hình AI nền tảng. Perplexity-User mở trang khi câu hỏi của người dùng cần đến trang đó. Vì yêu cầu do người dùng khởi tạo, Perplexity ghi trình này «generally ignores robots.txt rules», tức nói chung bỏ qua robots.txt.

  • Để website hiện trong kết quả tìm kiếm, Perplexity khuyên cho phép PerplexityBot trong robots.txt và cho phép yêu cầu từ dải IP hãng công bố.
  • Dải IP nằm ở hai tệp trên perplexity.com: perplexitybot.json (8 dải) và perplexity-user.json (4 dải), bản tải ngày 02/10/2026. Số này thay đổi khi hãng cập nhật tệp.
  • Với tường lửa, Perplexity hướng dẫn kết hợp so khớp chuỗi user-agent với kiểm tra địa chỉ IP, có ví dụ cho Cloudflare WAF và AWS WAF. Perplexity khuyên lập quy trình tự động tải lại hai tệp IP định kỳ, vì dải IP được cập nhật thường xuyên.
  • Trang bị chặn PerplexityBot thì Perplexity không lập chỉ mục toàn bộ hay một phần văn bản, theo trang trợ giúp của Perplexity, bản xem tháng 10 năm 2026. Hãng vẫn có thể lập chỉ mục tên miền, tiêu đề và một tóm tắt dữ kiện ngắn của trang đó.
  • Cũng trang trợ giúp đó ghi tính năng cho người dùng yêu cầu tóm tắt một URL bị robots.txt chặn «has been disabled», tức đã bị tắt. Tài liệu về trình thu thập thì ghi Perplexity-User nói chung bỏ qua robots.txt; bài này không phân xử hai cách diễn đạt đó.

SEO Gemini có trình thu thập riêng nào cần mở không?

SEO Gemini không có trình thu thập riêng để mở. Ứng dụng Gemini lấy căn cứ trả lời từ chỉ mục của Google Tìm kiếm, nên việc chính vẫn là SEO trên Google. Google-Extended chỉ là một mã trong robots.txt và quản lý 2 việc, theo tài liệu về trình thu thập của Google cập nhật tháng 7 năm 2026. Việc thứ nhất là dùng nội dung để huấn luyện các thế hệ mô hình Gemini sau này. Việc thứ hai là dùng nội dung từ chỉ mục Google làm căn cứ trả lời (grounding) trong ứng dụng Gemini.

  • Google-Extended không có chuỗi user-agent riêng trong yêu cầu HTTP: việc thu thập do các trình thu thập sẵn có của Google thực hiện.
  • Chặn Google-Extended vì thế đi ngược mục tiêu SEO Gemini.
  • Google ghi Google-Extended không ảnh hưởng việc website có mặt trong Google Tìm kiếm và không phải tín hiệu xếp hạng. AI Overviews là tính năng của Google Tìm kiếm, nên đi theo cách tối ưu cho AI Overviews.
  • Các trình thu thập chung của Google dùng dải IP công bố trong tệp common-crawlers.json. Vì không có trình thu thập riêng, Google-Extended cũng không có tệp IP riêng.
  • Với nhà phát triển, công cụ «Grounding with Google Search» của Gemini API cho phép mô hình tự tạo truy vấn tìm kiếm. Câu trả lời kèm chú thích url_citation gắn từng đoạn văn với địa chỉ nguồn, theo tài liệu Gemini API cập nhật tháng 9 năm 2026.

Claude của Anthropic có mấy trình thu thập và có tuân robots.txt không?

Claude có 3 trình thu thập và Anthropic cho biết các trình này tuân lệnh trong robots.txt, theo trang trợ giúp của Anthropic, bản xem tháng 10 năm 2026. ClaudeBot thu thập nội dung có thể dùng để huấn luyện mô hình. Claude-User mở trang khi người dùng Claude đặt câu hỏi. Claude-SearchBot thu thập để cải thiện chất lượng kết quả tìm kiếm. Anthropic ghi rằng chặn Claude-User hoặc Claude-SearchBot có thể làm website giảm hiển thị trong kết quả tìm kiếm của người dùng Claude.

  • Chặn ClaudeBot là báo cho Anthropic loại nội dung về sau của website khỏi tập dữ liệu huấn luyện.
  • Anthropic hỗ trợ lệnh Crawl-delay, một phần mở rộng ngoài chuẩn của robots.txt, để giảm tần suất thu thập.
  • Lệnh chặn phải đặt trong robots.txt của từng tên miền phụ muốn chặn.
  • Anthropic công bố một danh sách IP chung tại claude.com/crawling/bots.json; bản tải ngày 02/10/2026 có 26 dải. Số này thay đổi khi hãng cập nhật tệp.
  • Anthropic ghi chặn bằng địa chỉ IP có thể không có tác dụng ổn định, vì cách đó cản trình thu thập đọc tệp robots.txt.

Dịch vụ SEO ChatGPT thực chất gồm những việc gì?

Dịch vụ SEO ChatGPT gồm các việc giúp website đủ điều kiện để ChatGPT search thu thập và dẫn nguồn. Trung tâm trợ giúp của OpenAI ghi «Any public website can appear in ChatGPT search», tức website công khai nào cũng có thể xuất hiện. Phần kiểm được bằng tài liệu OpenAI: cấu hình robots.txt, mở tường lửa cho dải IP và đối chiếu nhật ký. MOMD áp dụng 28 mẫu GEO cho 4 công cụ ChatGPT, Gemini, Perplexity và Claude, theo số liệu MOMD công bố năm 2026. MOMD chưa công bố danh sách chi tiết 28 mẫu này.

  • Người mua nên yêu cầu nhà cung cấp bàn giao tệp robots.txt sau khi sửa, ghi rõ từng trình thu thập được mở hay chặn và lý do.
  • Nên yêu cầu quy tắc tường lửa cho phép dải IP của OAI-SearchBot, kèm ngày đối chiếu với tệp searchbot.json.
  • Nên yêu cầu trích nhật ký máy chủ cho thấy OAI-SearchBot đã vào các trang chính.
  • Trong quy trình 6 bước của MOMD, tối ưu cho ChatGPT, Gemini và Perplexity thuộc bước 5 và chạy liên tục. Cấu hình trình thu thập chỉ là một phần việc của dịch vụ GEO và SEO AI.
  • robots.txt là một điểm trong audit kỹ thuật 60+ điểm của MOMD; MOMD chưa công bố audit này kiểm những trình thu thập AI nào. MOMD chưa công bố giá riêng cho phần GEO trong bảng giá 4 gói SEO.

Mẫu robots.txt nào cho tìm kiếm AI vào mà chặn huấn luyện?

Mẫu robots.txt «cho tìm kiếm, chặn huấn luyện» gồm 5 nhóm lệnh: mở OAI-SearchBot, PerplexityBot và Claude-SearchBot, chặn GPTBot và ClaudeBot. Cách tách này làm được vì OpenAI và Perplexity đều ghi mỗi thiết lập độc lập với các thiết lập còn lại. Sau khi sửa tệp, hệ thống tìm kiếm của OpenAI cần khoảng 24 giờ để điều chỉnh, theo tài liệu về trình thu thập của OpenAI, bản xem tháng 10 năm 2026. Perplexity ghi thay đổi có thể mất tới 24 giờ mới có hiệu lực.

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /
  • Ba trình mở trang khi người dùng yêu cầu (ChatGPT-User, Perplexity-User, Claude-User) không có nhóm lệnh riêng trong mẫu. Nếu tệp không có lệnh chặn chung, cả ba vẫn được phép vào.
  • Google-Extended không nằm trong mẫu, vì mã này không tách được việc huấn luyện khỏi việc làm căn cứ trả lời của ứng dụng Gemini.
  • Chuẩn robots.txt RFC 9309 quy định trình thu thập có nhóm lệnh riêng thì dùng nhóm đó; không có mới dùng nhóm «User-agent: *».
  • Cảnh báo: trình thu thập đã có nhóm riêng với «Allow: /» sẽ bỏ qua mọi dòng Disallow của nhóm «User-agent: *». Tài liệu robots.txt của Google ghi, với trình thu thập của Google, nhóm riêng và nhóm chung «are not combined», tức không được gộp; RFC 9309 quy định cùng nguyên tắc cho mọi trình. Nếu nhóm chung đang chặn trang quản trị hay giỏ hàng, hãy chép các dòng Disallow đó vào ba nhóm «Allow: /» của mẫu.
  • robots.txt không thay được tường lửa: tường lửa chặn dải IP thì trình thu thập vẫn không vào được dù tệp đã mở.

Hãng nào công bố tín hiệu chọn nguồn để ChatGPT, Gemini trích dẫn?

Không hãng nào trong bốn hãng OpenAI, Perplexity, Anthropic và Google nêu tín hiệu chọn nguồn trong tài liệu về trình thu thập của mình. Một thí nghiệm công bố trong giai đoạn 2023–2024 đã thử các cách sửa nội dung trên Perplexity.ai với 200 mẫu truy vấn. Ở phần thử đó, thêm lời trích giúp tăng 22% ở chỉ số số từ có điều chỉnh vị trí, theo nghiên cứu GEO công bố tại hội nghị KDD năm 2024. Nhóm tác giả tải văn bản nguồn lên dưới dạng tệp, không để Perplexity tự thu thập từ web.

  • Cũng ở phần thử đó, thêm số liệu thống kê giúp tăng 37% ở chỉ số ấn tượng chủ quan.
  • Nhồi từ khoá cho kết quả kém mức gốc 10% ở cùng chỉ số số từ có điều chỉnh vị trí.
  • OpenAI chỉ nhắc chung tới «signals the page is relevant to a user’s query», tức tín hiệu cho thấy trang liên quan tới câu hỏi. Hãng không liệt kê tín hiệu nào.
  • Kết quả của phần thử có thể không còn đúng với Perplexity hiện nay, nên chỉ coi đó là gợi ý.
  • Việc tự kiểm được: hỏi một bộ truy vấn cố định trên từng công cụ rồi ghi lại trang nào được dẫn nguồn; đây là một trong các nguồn dữ liệu đo hiệu quả GEO.

Bảng 10 tên của bốn hãng: 9 trình thu thập và 1 mã robots.txt

Bảng gom 10 tên mà bốn hãng công bố: 9 trình thu thập (4 của OpenAI, 2 của Perplexity, 3 của Anthropic) và 1 mã robots.txt của Google là Google-Extended. Mỗi dòng chỉ ghi điều có trong tài liệu về trình thu thập và trung tâm trợ giúp của chính hãng đó. Ô ghi «không nêu» nghĩa là cả hai nơi đó đều không ghi, ở bản xem ngày 02/10/2026.

Tên trong robots.txt (hãng) Dùng để làm gì Có tuân robots.txt không Chặn thì mất gì Tệp dải IP để đối chiếu nhật ký máy chủ
OAI-SearchBot (OpenAI) Đưa website vào kết quả tìm kiếm của ChatGPT Có; OpenAI nêu đây là thẻ robots.txt để chủ website quản lý Không hiện trong câu trả lời của ChatGPT search; vẫn có thể hiện dưới dạng liên kết điều hướng openai.com/searchbot.json
OAI-AdsBot (OpenAI) Kiểm tra độ an toàn của trang được gửi làm quảng cáo trên ChatGPT Có; OpenAI ghi trình thu thập của hãng dừng ngay khi robots.txt chặn Trang đích không được kiểm tra và duyệt cho quảng cáo ChatGPT; OpenAI ghi «You must allow OAI-AdsBot» openai.com/adsbot.json
GPTBot (OpenAI) Thu thập nội dung có thể dùng để huấn luyện mô hình Có; OpenAI nêu đây là thẻ robots.txt để chủ website quản lý Nội dung không được dùng để huấn luyện mô hình; ChatGPT search được cấu hình riêng openai.com/gptbot.json
ChatGPT-User (OpenAI) Mở trang khi người dùng ChatGPT hoặc Custom GPT yêu cầu «robots.txt rules may not apply» OpenAI không nêu, cả ở tài liệu về trình thu thập lẫn trung tâm trợ giúp; trình này không quyết định việc có mặt trong Search openai.com/chatgpt-user.json
PerplexityBot (Perplexity) Đưa website vào kết quả tìm kiếm của Perplexity Có; Perplexity nêu đây là thẻ robots.txt Văn bản của trang không được lập chỉ mục; tên miền, tiêu đề và một tóm tắt dữ kiện ngắn vẫn có thể được lập chỉ mục perplexity.com/perplexitybot.json
Perplexity-User (Perplexity) Mở trang khi câu hỏi của người dùng cần đến «generally ignores robots.txt rules» Tài liệu về trình thu thập ghi lệnh chặn nói chung bị bỏ qua; trang trợ giúp ghi tính năng tóm tắt URL bị chặn đã bị tắt («has been disabled») perplexity.com/perplexity-user.json
ClaudeBot (Anthropic) Thu thập nội dung có thể dùng để huấn luyện mô hình Có; hỗ trợ cả lệnh Crawl-delay Nội dung về sau được loại khỏi tập dữ liệu huấn luyện claude.com/crawling/bots.json (danh sách chung)
Claude-User (Anthropic) Mở trang khi người dùng Claude đặt câu hỏi Có Claude không lấy được nội dung khi người dùng hỏi; có thể giảm hiển thị claude.com/crawling/bots.json (danh sách chung)
Claude-SearchBot (Anthropic) Thu thập để cải thiện chất lượng kết quả tìm kiếm Có Nội dung không được lập chỉ mục cho tìm kiếm; có thể giảm hiển thị và độ chính xác claude.com/crawling/bots.json (danh sách chung)
Google-Extended (Google) Mã robots.txt quản lý việc huấn luyện Gemini và làm căn cứ trả lời Là mã trong robots.txt, không có chuỗi user-agent riêng Nội dung không được dùng để huấn luyện Gemini và làm căn cứ trả lời; Google Tìm kiếm không bị ảnh hưởng Không có tệp riêng; trình thu thập chung của Google dùng common-crawlers.json

Hạn chế của việc mở trình thu thập AI và khi nào không nên mở

Mở trình thu thập chỉ là điều kiện cần: không tài liệu nào của bốn hãng cam kết trang sẽ được trích dẫn. robots.txt không ràng buộc mọi trình: ChatGPT-User và Perplexity-User có thể không áp dụng tệp này. Tên trình thu thập và dải IP thay đổi, nên cần đối chiếu lại tài liệu gốc. robots.txt không phải cách bảo vệ nội dung trả phí hay dữ liệu khách hàng: phần đó phải đặt sau đăng nhập. Website chưa được Google lập chỉ mục nên làm SEO nền trước.

Gửi địa chỉ website và tệp robots.txt hiện tại qua trang Liên hệ của MOMD hoặc gọi 034 9324 993. Hãy hỏi rõ gói SEO bạn định chọn có gồm việc cấu hình trình thu thập AI hay không.