vasilenko.info

Генератор sitemap.xml

/tool/sitemap-generator/ работает обходит сайт

Дайте адрес сайта — сервер пройдёт по внутренним ссылкам, соберёт список страниц, выбросит закрытые от индексации и битые, проставит даты из ответа сервера. Готовая карта скачивается файлом: xml, xml.gz или архивом с частями и индексом. Уже лежащую на сайте карту сервер забирает по её адресу и сверяет с обходом.

промоДвадцать лет заметок про сайтыКак это делали в 2008-м и что из этого работает сейчас.Открыть

Сборка карты

Сервер пройдёт по внутренним ссылкам и принесёт список страниц с кодами ответа. Адрес сайта уходит на наш сервер, сам файл собирается в браузере.

За один заход сервер отдаёт сотню адресов. Дальше обход продолжается от уже найденных страниц: каждая следующая сотня — ещё один запрос, а их не больше трёхсот в час на все инструменты сайта.

Подробная проверка ходит по каждому адресу отдельно: берёт Last-Modified, meta robots, X-Robots-Tag, canonical и языковые версии.

Обход ещё не запускали. Список ниже можно вставить и руками.

Заполняется обходом. Понимает и построчный вид «адрес → дата → приоритет → частота» через табуляцию, точку с запятой или запятую, шапку CSV и целиком вставленный ситемап. Строка с решёткой в начале — примечание, в файл не идёт.

Переопределяет даты, найденные проверкой. Пусто — у каждого адреса своя дата или её нет вовсе.

Предел спецификации — 50 000 адресов и 50 МБ. Что не влезло, уходит в следующую часть, а части перечисляются в индексном файле.

Приоритет, тег priority
Частота обновления, тег changefreq
Что учитывать и что добавить

robots.txt читается одним запросом после обхода: закрытые правилами адреса помечаются и в карту не идут. Оттуда же берётся адрес объявленной карты — он сам подставится в проверку ниже. Картинки и языковые версии берутся во время подробной проверки — картинки стоят ещё одного запроса на страницу.

Готовая карта

sitemap.xml

Готово

    Адресов в карте
    Исключено проверкой
    Строк в файле
    Строк отброшено
    Файлов карты
    Размер файла

    Строка для robots.txt

    robots.txt

    Файл собирается и скачивается на вашем устройстве. На сервер уходит только то, что нужно прочитать чужими руками: адрес сайта, адреса страниц при подробной проверке, robots.txt и адрес готовой карты. Ничего из этого не сохраняется.

    Адреса и что с ними

    Тот же отчёт, ради которого запускают настольные обходчики: код ответа, глубина, дата и причина, по которой адрес не попал в карту.

    Найденные адреса: код ответа, глубина, дата изменения, состояние и приоритет

    Проверка существующей карты

    Карту по её адресу забирает наш сервер: сжатую распаковывает, индексную раскрывает по частям. Дальше — сколько в ней адресов, что в них сломано и чем она разошлась с обходом сайта.

    Оставьте пусто — возьмём /sitemap.xml в корне обойдённого сайта. После обхода сюда сам подставляется адрес, объявленный в robots.txt. Понимаются xml, xml.gz, индексный файл со ссылками на части и текстовый список по адресу в строке.

    Годится и sitemap.xml, и sitemap.xml.gz, и текстовый список. Нужно, когда карту ещё не выложили.

    Индексный файл перечисляет части, и каждая — отдельный запрос к серверу. У сайта с сотней частей разбирать все незачем: по первым уже видно, как устроена карта.

    Карту не разбирали

    Адресов в карте
    Строк с замечаниями
    Без lastmod
    Файлов прочитано
    Обход нашёл, в карте нет
    В карте есть, обход не нашёл
    Разбор карты: адрес, что с ним не так и нашёл ли его обход
    Адрес Что не так Обход

    Карту ещё не разбирали.

    промоПосчитайте заодно ROIОкупаемость кампании по расходу и доходу.Открыть

    Как пользоваться

    1. Вставьте адрес сайта и нажмите «Обойти». Сервер пройдёт по внутренним ссылкам и вернёт список страниц с кодами ответа; ниже он ляжет в поле, где его можно править руками.

    2. Нажмите «Проверить страницы подробно». Каждый адрес опрашивается отдельно: оттуда берутся дата из Last-Modified, meta robots и X-Robots-Tag, canonical и языковые версии. Закрытые от индексации, битые и указывающие canonical на чужой адрес помечаются и в карту не идут.

    3. Посмотрите таблицу «Адреса и что с ними». Там видно, почему каждый исключённый адрес исключён; лишнее можно убрать кнопкой, а всю таблицу — скачать CSV.

    4. Выберите приоритет и частоту, при желании поставьте общую дату. Если у адресов есть свои даты и приоритеты — они сильнее общей настройки, кроме «Не указывать».

    5. Скачайте файл. Один файл — sitemap.xml или сжатый sitemap.xml.gz; больше 50 000 адресов — архив с частями и индексным sitemap-index.xml. Рядом лежат HTML-карта для посетителей и простой текстовый список, который Google тоже принимает.

    6. Положите файл в корень сайта и добавьте в robots.txt готовую строку Sitemap — она напечатана справа от карты.

    7. Если карта уже лежит на сайте, начните с последнего блока: нажмите «Разобрать», и сервер принесёт её сам. Индексный файл раскроется по частям, .gz распакуется. Инструмент покажет число адресов, ошибки формата и — если перед этим был обход — чего в карте не хватает и что в ней осталось от прошлой версии сайта.

    промоСписок задач в браузереБез аккаунта, всё хранится на вашем устройстве.Открыть

    Разбор примера: четыре адреса, приоритет по глубине

    Исходные данные — те же, что стоят в полях по умолчанию: их можно пересчитать в уме и убедиться, что инструмент не врёт.

    1. Глубина — это число частей пути. У корня их ноль, у /about/ одна, у /blog/first-post/ две.

    2. Приоритет: 1,0 − 0,2 × глубину. Получается 1,0 для корня, 0,8 для /about/ и /blog/, 0,6 для записи блога.

    3. Каждый адрес занимает четыре строки: открывающий url, loc, priority и закрывающий url.

    4. Сверху две служебные строки — объявление XML и открывающий urlset, снизу одна закрывающая.

    В карте 4 адреса и 19 строк: 2 сверху, 4 × 4 = 16 на адреса и 1 снизу. Ровно это показывают счётчики. После обхода живого сайта в тех же строках появятся даты из ответа сервера, а исключённые адреса уйдут в таблицу с причиной.

    Частые вопросы

    промоВесь каталог инструментовСорок четыре штуки, все считают в браузере.Открыть

    Смежные инструменты

    6

    Генератор robots.txt

    Собирает правила для поисковых роботов и проверяет их на ошибки.

    Открыть