Проверка цепочки редиректов
Показывает весь путь от адреса до конечной страницы и коды ответа.
Открыть
/tool/robots-txt-generator/ работает сборка в браузере, загрузка через сервер
Соберите файл по группам — Яндексу и Гуглу можно закрыть разное, — а потом сразу проверьте на нём список адресов: инструмент скажет не только «закрыт или нет», но и какая строка сработала. Сборка и проверка идут в браузере; на сервер уходит только домен, когда вы просите забрать файл с сайта или проверить карту.
Группа — это «кому» и «что». Робот читает правила только своей группы, поэтому Яндексу и Гуглу задают разное именно так: двумя группами, а не одним списком на всех.
Собранный выше файл применяется к списку адресов так же, как это делает поисковик: выигрывает самое длинное совпадение, при равной длине — разрешение, звёздочка и доллар работают. Видно не «да или нет», а какая именно строка сработала.
Полный адрес обрезается до пути с параметрами — вставляйте прямо из выгрузки. Кириллицу приводим к процентной записи сами, как это делает робот.
Группа выбирается по правилам поисковика: сначала точное имя, потом более общее (YandexBot берёт группу Yandex), в последнюю очередь — звёздочка.
Готово
| Адрес | Сработавшее правило | Итог |
|---|
—
Подложкой помечены строки, которых после замены не станет. Строки со знаком плюс — новые. Совпавшие показаны без пометки, чтобы было видно, куда именно встают изменения.
Нажмите на свой движок в наборах — пути лягут в поля первой группы. Дальше правьте их как обычный текст: набор нужен, чтобы не вспоминать, что у Битрикса лежит в /bitrix/, а не чтобы принять его молча.
Если Яндексу и Гуглу нужно разное, нажмите «Добавить группу» или «Скопировать группу для Яндекса»: вторая группа получит свои роботы и свой список. Роботам нейросетей отдельная кнопка — она добавляет группу с восемью именами и запретом на весь сайт.
Впишите адреса карт сайта, по одному в строке, и нажмите «Проверить карты»: сервер сходит по каждому адресу и вернёт код ответа, размер и тип содержимого. Строка Sitemap, ведущая в 404, — самая частая молчаливая ошибка.
Введите свой домен и нажмите «Забрать файл» — мы принесём то, что лежит у вас сейчас, разложим по группам и покажем построчно, что изменится. Ничего не перезапишется без вашего нажатия.
Проверьте адреса во втором разделе. Вставьте туда список из выгрузки и посмотрите, какая строка их закрывает: именно здесь видно, что «Allow: /cart/rules/» не работает, если выше стоит «Disallow: /cart/*».
Скачайте файл кнопкой «Скачать файлом» и положите его в корень домена. Проверьте, что он открывается по адресу вашсайт.ru/robots.txt.
Исходные данные — те же, что стоят в полях по умолчанию: их можно пересчитать в уме и убедиться, что инструмент не врёт.
Одна группа даёт одну строку User-agent: * — все роботы, для которых нет своей группы, читают её.
Три строки Disallow: по одной на каждый закрытый путь, и одна строка Allow.
Строка Sitemap уходит в конец, за пределы групп: она общая для всех роботов, и повторять её в каждой группе не нужно.
В проверке адресов /cart/ получает «Запрещён» с правилом «Disallow: /cart/», а /cart/rules/ — «Разрешён» с правилом «Allow: /cart/rules/»: у него совпадение на двенадцать знаков против шести.
Адрес /catalog/shkafy/ не совпадает ни с одним правилом, поэтому он разрешён, и в столбце правила стоит прочерк — запрещать его нечему.
Итого 6 непустых строк: 1 User-agent, 3 Disallow, 1 Allow, 1 Sitemap. Из шести проверенных адресов закрыты три: корзина, служебная страница и поиск.
Затем, что робот читает правила ровно одной группы — своей, самой подходящей по имени, — и в остальные не заглядывает. Пока правила у всех одинаковые, разницы нет. Как только Яндексу нужен Clean-param, а Гуглу — открытый /wp-content/uploads/, одним списком это не записывается: нужны две группы. Раньше этот генератор клонировал один набор во все выбранные группы, то есть делал вид, что умеет то, чего не умел.
Нет. robots.txt запрещает обход, а не показ. Если на страницу ведут ссылки, она может остаться в выдаче без описания. Чтобы убрать страницу из индекса, нужен noindex в мета-теге или в заголовке ответа, и тогда эту страницу нельзя закрывать в robots.txt: робот не зайдёт и не увидит запрет.
По длине записи, а не по порядку строк. Выигрывает самое длинное совпадение, а при равной длине — разрешающее. Поэтому «Allow: /cart/rules/» открывает страницу правил даже ниже строки «Disallow: /cart/», а «Disallow: /cart/*» той же длины её уже перебьёт. Проверка адресов на этой странице считает ровно так же — вместе со звёздочкой и знаком доллара.
Clean-param говорит Яндексу, что параметр не меняет содержимое: страницы с ним и без него склеиваются, а вес переходит на основной адрес. Disallow просто запрещает обход, и вес с закрытых адресов никуда не идёт. Записывается как «Clean-param: sort&order /catalog/»: слева параметры через амперсанд, справа — необязательный путь. Google эту директиву не понимает, для него параметры закрывают шаблоном.
Это решение о правах на тексты, а не о поиске. GPTBot, ClaudeBot, CCBot и подобные собирают материал для обучения; Google-Extended отвечает только за обучение и на позиции в поиске не влияет, а вот OAI-SearchBot и PerplexityBot приводят живых людей — закрыв их, вы теряете переходы. Кнопка на странице добавляет группу со всеми восемью именами, но какие оставить открытыми, решаете вы.
Google читает первые 500 КиБ и всё, что дальше, отбрасывает. На практике файл на сотню строк — уже большой; если он вырос до сотен килобайт, значит вместо шаблонов туда построчно перечислили адреса. Инструмент считает размер и предупреждает при приближении к пределу.
Строго в корне: example.com/robots.txt. У поддомена свой файл, и правила действуют только на свой протокол, домен и порт. Файл в подпапке роботы не читают. Кодировка — UTF-8 без BOM, переводы строк любые, но BOM в начале ломает первую директиву.
Показывает весь путь от адреса до конечной страницы и коды ответа.
Открыть
Строит дерево заголовков страницы и находит пропущенные уровни.
Открыть
Пишет title и description и сразу показывает, как это выглядит в выдаче.
Открыть