← Блог

GPTBot и поиск ChatGPT: как проверить доступ к сайту

У OpenAI разные роботы для поиска, обучения моделей и открытия страниц по просьбе пользователя. Их настройки нужно различать. Иначе можно разрешить использование материалов для обучения, хотя вы хотели только сделать сайт доступным для поиска ChatGPT.

Какой робот за что отвечает

ИмяДля чего используется
OAI-SearchBotОбход сайтов для поисковых функций ChatGPT.
GPTBotСбор материалов, которые могут использоваться для обучения моделей.
ChatGPT-UserОткрытие некоторых страниц по просьбе пользователя, а не регулярный автоматический обход сайтов.

Эти назначения и независимость настроек поиска и обучения описаны в официальной документации OpenAI. Для ChatGPT-User правила robots.txt могут не применяться, поскольку запрос инициирован пользователем. Разрешение поискового обхода не означает гарантированного цитирования.

Что разработчик может проверить через curl

Программа curl загружает ответ сервера без выполнения JavaScript. Разработчик может проверить, пришёл ли основной текст, сообщение об ошибке или требование подтвердить доступ. В команде ниже нужно заменить пример адресом вашей страницы:

curl -sS -L --max-time 30 -D headers.txt -o page.html 'https://example.com/service/'

Файл headers.txt сохранит заголовки ответов, в том числе при перенаправлениях. В page.html окажется содержимое конечной страницы. Найдите в нём название услуги и несколько предложений из описания: вместо них может прийти, например, форма входа.

В следующем запросе можно указать другое имя клиента — User-Agent. Это поможет проверить, меняется ли ответ сервера в зависимости от такого имени:

curl -sS -L --max-time 30 -A 'OAI-SearchBot' -D bot-headers.txt -o bot-page.html 'https://example.com/service/'

Запрос с именем робота всё равно отправляется с вашего компьютера и IP-адреса. Он не воспроизводит настоящий визит OpenAI. Поэтому успешная загрузка не подтверждает доступ реального робота, а отказ не доказывает его блокировку. Если ответы различаются, разработчику нужно выяснить причину.

Как понять ответ сервера

Затем проверьте robots.txt и защиту сайта

В файле robots.txt задаются правила обхода сайта. Попросите разработчика определить, какие из них относятся к нужному роботу и разрешают ли они доступ к проверяемому адресу. Одной строки Allow недостаточно, чтобы судить обо всём файле.

Также проверьте защиту на хостинге или в CDN — сервисе, через который загружается сайт. Она может отклонять запросы независимо от robots.txt. Настоящие обращения OpenAI проверяют по журналам сервера и опубликованным диапазонам IP-адресов из документации. Имя User-Agent само по себе не подтверждает отправителя.

В отчёте укажите время запроса, адрес страницы, ответ сервера и правило защиты, которое сработало. Если запросов не найдено, выясните, какие обращения и за какой срок сохраняются в журнале. Отсутствие записи за несколько дней не доказывает, что поисковый сервис никогда не посещает сайт.

Каких выводов нельзя сделать по загрузке страницы

Исходный HTML позволяет проверить текст, метаданные и JSON-LD. Но он не показывает, что конкретный сервис передал модели и почему она выбрала другой источник.

Если ассистент не упомянул метаданные в пересказе, это не повод удалять description, canonical или разметку. Пересказ не перечисляет всё, что обработал сервис. И наоборот: факт загрузки страницы не подтверждает её использование в обучении или цитирование.

В результате проверки должно стать понятно, где возникает препятствие и устранено ли оно. Например, учебный вывод может выглядеть так: «Запросы поискового робота блокировались с кодом 403. После изменения правила подтверждена загрузка нужного текста с кодом 200». Дальше отдельно проверяют появление сайта в ответах.

Опубликовано: · Проверено редакцией geo-rank.ai · Как мы проверяем