Что такое robots.txt и sitemap простыми словами

137 0
8 минут на прочтение

Чтобы страница сайта появилась в Google, поисковый робот сначала должен найти ее, перейти по адресу, загрузить содержимое и передать его на обработку. После этого поисковая система решает, добавлять ли страницу в свой индекс и по каким запросам ее можно показывать.

Частично управлять этим процессом помогают два технических файла — robots.txt и sitemap. Они выполняют разные задачи:

  • robots.txt подсказывает поисковым роботам, какие разделы сайта можно или не нужно сканировать;

  • sitemap помогает поисковым системам находить важные страницы сайта.

Эти файлы не заменяют качественный контент, внутренние ссылки и правильную техническую настройку сайта. Однако ошибки в robots.txt или sitemap могут затруднить сканирование страниц и замедлить их появление в поиске.

Как поисковые системы находят страницы

Поисковые системы используют специальных автоматических роботов. Робот Google называется Googlebot. Он переходит по ссылкам, загружает страницы и собирает информацию об их содержимом.

В упрощенном виде процесс состоит из трех этапов:

  1. Поисковый робот находит адрес страницы.

  2. Сканирует ее содержимое.

  3. Поисковая система анализирует страницу и решает, добавлять ли ее в индекс.

Сканирование и индексирование — это не одно и то же. Страница может быть просканирована, но не попасть в индекс из-за низкого качества, дублирования, технических ошибок, директивы noindex или других причин. Google прямо указывает, что индексирование не гарантируется даже тогда, когда страница доступна для сканирования.

Что такое robots.txt

Robots.txt — это обычный текстовый файл с правилами для поисковых и других автоматических роботов. В нем владелец сайта может указать, какие URL или каталоги не нужно сканировать.

Файл должен быть доступен в корне сайта по адресу:

https://example.com/robots.txt

Варианты вроде https://example.com/folder/robots.txt не будут управлять сканированием всего домена.

Robots.txt используется прежде всего для управления сканированием, а не для удаления страниц из поиска. Он может помочь ограничить доступ роботов к техническим каталогам, внутреннему поиску, страницам с параметрами или большому количеству неважных URL.

Как выглядит файл robots.txt

Самый простой файл может выглядеть так:

User-agent: *
Disallow:

Sitemap: https://example.com/sitemap.xml 

Эта запись означает:

  • правило распространяется на всех роботов;

  • запрещенных для сканирования разделов нет;

  • карта сайта расположена по указанному адресу.

Файл состоит из директив. Основными являются User-agent, Disallow, Allow и Sitemap.

Что означает User-agent

Директива User-agent определяет, для какого робота действуют следующие правила.

Звездочка означает всех роботов:

User-agent: *

Для Googlebot можно создать отдельную группу:

User-agent: Googlebot

Например:

User-agent: Googlebot
Disallow: /private/

В этом случае правило адресовано Googlebot и запрещает ему сканировать каталог /private/.

На практике для большинства небольших сайтов достаточно общей группы:

User-agent: *

Что означает Disallow

Директива Disallow указывает путь, который робот не должен сканировать.

Пример:

User-agent: *
Disallow: /admin/

Робот не должен переходить на страницы, адреса которых начинаются с /admin/.

Еще один пример:

User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/

Так можно закрыть от сканирования внутренний поиск, корзину и страницу оформления заказа.

Чтобы запретить сканирование всего сайта, используют:

User-agent: *
Disallow: /

Такое правило опасно для рабочего сайта. Оно часто остается после переноса проекта с тестового домена и мешает Google сканировать все страницы.

Если после Disallow: ничего не указано, запретов нет:

User-agent: *
Disallow:

Что означает Allow

Директива Allow позволяет открыть конкретную страницу или подкаталог внутри закрытого раздела.

Например:

User-agent: *
Disallow: /catalog/
Allow: /catalog/popular/

В этом случае каталог /catalog/ закрыт, но раздел /catalog/popular/ разрешен для сканирования.

Такие правила нужно составлять внимательно. Чем сложнее robots.txt, тем выше риск случайно закрыть нужные страницы.

Как добавить sitemap в robots.txt

Адрес карты сайта можно указать отдельной строкой:

Sitemap: https://example.com/sitemap.xml

Если карт несколько, допускается добавить несколько строк:

Sitemap: https://example.com/sitemap-pages.xml
Sitemap: https://example.com/sitemap-posts.xml
Sitemap: https://example.com/sitemap-products.xml

Google может найти карту сайта через robots.txt. Кроме того, ее можно отдельно отправить через Google Search Console.

Чего robots.txt не делает

Одна из самых распространенных ошибок — использовать robots.txt для удаления страницы из результатов поиска.

Строка:

Disallow: /old-page/

не означает, что страница гарантированно будет удалена из индекса. Она только просит робота не сканировать ее содержимое.

Если Google уже знает адрес страницы из других источников, URL иногда может оставаться в результатах поиска без нормального описания. Google прямо предупреждает, что страница, закрытая через robots.txt, все равно может появляться в поиске как отдельный адрес.

Для запрета индексирования HTML-страницы обычно используют тег:

<meta name="robots" content="noindex">

Но робот должен иметь возможность открыть страницу и увидеть этот тег. Если одновременно закрыть URL в robots.txt, Google может не просканировать страницу и не прочитать директиву noindex.

Поэтому не стоит одновременно использовать для одной страницы:

Disallow: /old-page/

и:

<meta name="robots" content="noindex">

когда главная цель — именно удаление страницы из индекса.

Для конфиденциальных материалов robots.txt также не подходит. Файл открыт для всех, поэтому любой человек может просмотреть перечень закрытых каталогов. Приватные страницы нужно защищать авторизацией, паролем или ограничениями на уровне сервера.

Пример robots.txt для обычного сайта

Универсального robots.txt для всех сайтов не существует. Структура зависит от CMS, типа проекта и системы формирования URL.

Упрощенный пример:

User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/

Sitemap: https://example.com/sitemap.xml 

Такой файл:

  • разрешает сканировать основное содержимое;

  • закрывает служебные разделы;

  • сообщает адрес карты сайта.

Не нужно копировать чужой robots.txt без проверки. Каталоги, которые являются техническими на одном сайте, на другом могут содержать важные страницы.

Что такое sitemap

Sitemap, или карта сайта, — это файл со списком URL, которые владелец сайта считает важными для поисковых систем.

Чаще всего используется XML-карта по адресу:

https://example.com/sitemap.xml

В ней могут быть перечислены:

  • главная страница;

  • статьи;

  • категории;

  • страницы услуг;

  • товары;

  • изображения;

  • видео;

  • языковые версии страниц.

Sitemap помогает поисковым роботам находить URL, но не заставляет Google индексировать их. Отправка карты является подсказкой, а не гарантией сканирования, индексирования или высоких позиций.

Как выглядит XML sitemap

Упрощенный файл может выглядеть так:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/</loc>
    <lastmod>2026-08-01</lastmod>
  </url>
  <url>
    <loc>https://example.com/blog/</loc>
    <lastmod>2026-07-30</lastmod>
  </url>
</urlset>

Основные элементы:

  • <urlset> — контейнер со списком страниц;

  • <url> — отдельная запись;

  • <loc> — полный адрес страницы;

  • <lastmod> — дата последнего существенного изменения.

В sitemap нужно использовать полные абсолютные адреса:

https://example.com/blog/article/

Вариант без домена:

/blog/article/

для XML-карты использовать не стоит. Google рекомендует указывать полные канонические URL именно в том виде, в котором их нужно сканировать.

Какие страницы нужно добавлять в sitemap

В карту сайта стоит добавлять страницы, которые:

  • доступны для поисковых роботов;

  • возвращают код ответа 200;

  • разрешены для индексирования;

  • имеют самостоятельное полезное содержимое;

  • являются каноническими версиями URL;

  • должны появляться в результатах поиска.

Например, в sitemap интернет-магазина можно добавить:

  • категории товаров;

  • карточки доступных товаров;

  • информационные страницы;

  • статьи блога.

Для информационного сайта в карту обычно входят:

  • статьи;

  • категории;

  • основные статические страницы;

  • страницы авторов, если они имеют самостоятельную ценность.

Sitemap должен показывать поисковой системе желаемую структуру индексируемого сайта, а не содержать все технически доступные адреса.

Какие URL не нужно добавлять в sitemap

В карту сайта обычно не стоит включать:

  • страницы с тегом noindex;

  • URL, закрытые в robots.txt;

  • страницы с ошибкой 404;

  • серверные ошибки;

  • URL с перенаправлением;

  • дубликаты;

  • неканонические версии страниц;

  • результаты внутреннего поиска;

  • корзину и оформление заказа;

  • страницы личного кабинета;

  • технические URL с параметрами;

  • тестовые страницы.

Например, если адрес:

https://example.com/old-page/

перенаправляет на:

https://example.com/new-page/

в sitemap нужно оставить только конечный адрес /new-page/.

Если одна статья доступна с несколькими параметрами, но каноническим является чистый URL-адрес, в карту нужно добавлять только каноническую версию. Google рекомендует включать в sitemap именно те URL, которые владелец сайта хочет видеть в поиске.

Для каких сайтов sitemap особенно важен

Карта сайта полезна практически для любого проекта, но особое значение имеет для:

  • новых сайтов с небольшим количеством внешних ссылок;

  • крупных интернет-магазинов;

  • сайтов с тысячами страниц;

  • проектов со сложной структурой;

  • сайтов с большим количеством архивных материалов;

  • ресурсов со страницами, на которые ведет мало внутренних ссылок;

  • сайтов с большим количеством изображений или видео.

На небольшом сайте с качественной внутренней перелинковкой Google может найти страницы и без sitemap. Однако правильно сформированная карта упрощает контроль URL и помогает быстрее замечать технические проблемы. Google отдельно указывает, что sitemap особенно полезен для крупных, сложных и специализированных сайтов.

Влияет ли sitemap на позиции

Наличие sitemap само по себе не повышает позиции страниц.

Карта не делает контент качественнее и не заменяет:

  • оптимизацию Title и Description;

  • полезный текст;

  • внутренние ссылки;

  • внешние упоминания;

  • скорость загрузки;

  • правильную мобильную версию;

  • канонические адреса;

  • отсутствие технических ошибок.

Sitemap помогает найти URL и передать дополнительную информацию о них. Окончательное решение о сканировании, индексировании и ранжировании принимает поисковая система.

Что означает lastmod

Элемент <lastmod> показывает дату последнего существенного изменения страницы.

Пример:

<lastmod>2026-08-03</lastmod>

Дату нужно обновлять после реальных изменений:

  • редактирования основного текста;

  • добавления важного раздела;

  • обновления характеристик товара;

  • изменения структурированных данных;

  • существенного обновления внутренних ссылок.

Не нужно изменять дату каждый день или после автоматического обновления года в подвале сайта. Google использует <lastmod>, если данные являются последовательными и соответствуют фактическим изменениям страницы.

Нужны ли changefreq и priority

В старых примерах sitemap часто встречаются:

<changefreq>weekly</changefreq>
<priority>0.8</priority>

changefreq якобы указывает частоту обновления, а priority — относительную важность URL.

Google сообщает, что игнорирует значения <changefreq> и <priority>. Поэтому специально настраивать эти поля ради Google нет необходимости. Значительно важнее передавать правильные URL и достоверный <lastmod>.

Ограничения XML sitemap

Один файл sitemap может содержать не более:

  • 50 000 URL;

  • 50 МБ в несжатом виде.

Если сайт превышает эти ограничения, карту нужно разделить на несколько файлов и создать индекс sitemap.

Например:

https://example.com/sitemap_index.xml

Индекс может ссылаться на отдельные карты:

https://example.com/post-sitemap.xml
https://example.com/page-sitemap.xml
https://example.com/product-sitemap.xml
https://example.com/category-sitemap.xml

Такое разделение также упрощает диагностику. В Google Search Console можно увидеть, в каком именно файле возникли ошибки.

Как robots.txt и sitemap работают вместе

Эти файлы не заменяют друг друга.

Robots.txt отвечает на вопрос:

Какие разделы поисковому роботу не нужно сканировать?

Sitemap отвечает на другой вопрос:

Какие страницы сайта нужно найти и рассмотреть для индексирования?

Правильная логика выглядит так:

  • важные страницы открыты в robots.txt;

  • они разрешены для индексирования;

  • возвращают код 200;

  • имеют канонический адрес;

  • присутствуют в sitemap;

  • доступны через внутренние ссылки.

Неправильная ситуация:

  • URL добавлен в sitemap;

  • тот же URL закрыт в robots.txt;

  • на странице установлен noindex;

  • каноническая ссылка ведет на другой адрес.

Такие противоречивые сигналы усложняют обработку сайта. Карта должна содержать преимущественно чистые, доступные и канонические страницы.

Как проверить robots.txt

Откройте в браузере:

https://ваш-сайт.com/robots.txt

Проверьте:

  • открывается ли файл;

  • не установлено ли Disallow: /;

  • не закрыты ли статьи, категории или товары;

  • правильно ли указаны пути;

  • есть ли ссылка на актуальный sitemap;

  • нет ли правил, скопированных с другого сайта.

После изменения robots.txt стоит проверить важные страницы через инструмент проверки URL в Google Search Console.

Как проверить sitemap

Откройте предполагаемый адрес:

https://ваш-сайт.com/sitemap.xml

В некоторых CMS карта может иметь другой адрес:

https://ваш-сайт.com/sitemap_index.xml

Проверьте, чтобы:

  • файл открывался без ошибки;

  • URL принадлежали вашему домену;

  • использовался правильный протокол HTTPS;

  • не было тестового домена;

  • отсутствовали страницы с ошибкой 404;

  • не было URL с перенаправлением;

  • не были включены страницы noindex;

  • даты lastmod соответствовали реальным обновлениям.

Как добавить sitemap в Google Search Console

Для отправки карты сайта необходимо:

  1. Открыть нужный ресурс в Google Search Console.

  2. Перейти в раздел «Файлы Sitemap».

  3. Ввести адрес или конечную часть URL карты.

  4. Нажать кнопку отправки.

  5. Проверить статус обработки.

Например, если карта доступна по адресу:

https://example.com/sitemap_index.xml

в соответствующее поле обычно вводят:

sitemap_index.xml

После обработки Google Search Console может показать:

  • успешную загрузку;

  • количество обнаруженных URL;

  • ошибки чтения;

  • недоступность файла;

  • неправильный формат;

  • проблемы с отдельными вложенными картами.

Отправлять один и тот же sitemap после каждой новой статьи не нужно. Если карта формируется автоматически, поисковая система будет периодически проверять ее повторно. Отправка sitemap только сообщает Google о его существовании и не гарантирует индексирование URL.

Типичные ошибки в robots.txt

Закрыт весь сайт

User-agent: *
Disallow: /

Для тестового проекта это может быть осознанным решением, но на рабочем сайте правило блокирует сканирование всех разделов.

Закрыта папка с важными файлами

Иногда в robots.txt блокируют каталоги со стилями, скриптами или изображениями. В результате поисковый робот может неправильно отобразить страницу и не понять ее полное содержимое.

Попытка удалить страницу из индекса

Disallow управляет сканированием, но не гарантирует удаление URL из поиска.

Копирование чужого файла

Одинаковые CMS могут иметь разные плагины, каталоги, параметры и структуру URL. Чужие правила могут закрыть важные страницы.

Закрытие страниц с noindex

Если робот не может открыть страницу, он может не увидеть директиву noindex.

Типичные ошибки в sitemap

Добавление всех URL без проверки

Карта не должна быть свалкой всех адресов, которые когда-либо создавал сайт.

Наличие страниц с ошибками

URL с кодами 404 или 5xx нужно удалить из sitemap или исправить.

Наличие перенаправлений

В карте должен быть конечный адрес, а не URL, который перенаправляет пользователя.

Добавление noindex-страниц

Если страница не должна индексироваться, ее не нужно предлагать Google через sitemap.

Неправильный домен

После переноса сайта в карте иногда остаются адреса тестового домена, HTTP-версии или неправильный вариант с www.

Недостоверный lastmod

Автоматическая установка текущей даты для всех страниц не помогает поисковой системе и делает данные ненадежными.

Что стоит проверить на своем сайте

Для базовой технической проверки достаточно выполнить несколько шагов:

  1. Открыть /robots.txt.

  2. Убедиться, что важные разделы не закрыты.

  3. Найти адрес XML sitemap.

  4. Проверить, открывается ли карта.

  5. Посмотреть, какие типы URL в нее входят.

  6. Удалить из sitemap ошибочные, закрытые и неканонические страницы.

  7. Добавить адрес sitemap в robots.txt.

  8. Отправить карту через Google Search Console.

  9. Проверить важные URL инструментом проверки страниц.

  10. После изменений просмотреть отчет об индексировании.

Robots.txt помогает управлять доступом поисковых роботов, а sitemap показывает им важные адреса. Правильно настроенные файлы не гарантируют высоких позиций, но создают понятную техническую основу для сканирования и индексирования сайта.

Что такое robots.txt простыми словами?

Robots.txt – это небольшой текстовый файл, который находится на вашем сайте. Он служит инструкцией для поисковых роботов (например, Googlebot), которые сканируют веб-страницы. В нем вы можете указать, какие части вашего сайта разрешено сканировать, а какие – нет.

Зачем нужен robots.txt?

Его основные функции
  • Предотвращение перегрузки сервера роботами
  • Скрытие определенных разделов сайта от индексации поисковыми системами (например, страниц админ-панели, тестовых версий, конфиденциальных данных)
  • Управление поведением роботов на сайте

Что такое sitemap простыми словами?

Sitemap – это файл (обычно в формате XML), который является "картой" вашего сайта. В нем перечислены все важные страницы, файлы и другие медиаданные, которые вы хотите, чтобы поисковые системы знали и индексировали. Он похож на оглавление книги для поисковых систем.

Зачем нужна карта сайта?

Sitemap помогает поисковым системам
  • Найти все страницы вашего сайта, особенно новые или те, на которые нет ссылок с других сайтов
  • Понять структуру вашего сайта
  • Определить, какие страницы являются наиболее важными
  • Быстрее индексировать новый контент

Каково главное отличие между robots.txt и sitemap?

Robots.txt дает инструкции поисковым роботам, что НЕ НУЖНО сканировать или показывать в поиске. Это файл-ограничитель. Sitemap дает поисковым системам полный список того, что НУЖНО сканировать и индексировать. Это файл-путеводитель. Проще говоря, robots.txt говорит "НЕ ИДИ СЮДА", а sitemap говорит "ВОТ ВСЁ, ЧТО ЕСТЬ, ИДИ СЮДА".

Обязательны ли robots.txt и sitemap для сайта?

Не обязательно, но очень рекомендовано. * Без robots.txt поисковые роботы будут сканировать весь сайт, что может потреблять ресурсы или обнаружить нежелательные страницы. * Без sitemap поисковым системам может быть сложнее найти все ваши страницы, особенно если сайт большой или имеет сложную структуру.

Что произойдет, если я неправильно настрою robots.txt?

Неправильная настройка robots.txt может привести к серьезным проблемам * Важные страницы сайта могут быть исключены из индекса поисковых систем и не показываться в выдаче. * Весь ваш сайт может исчезнуть из поиска, если вы случайно запретите доступ ко всем страницам. * Это может повлиять на SEO и видимость вашего сайта.

Может ли sitemap улучшить SEO сайта?

Sitemap сам по себе не является прямым фактором ранжирования, то есть он не улучшит ваши позиции в поисковой выдаче напрямую. Однако он * Помогает поисковым системам эффективнее индексировать ваш сайт. * Гарантирует, что все ваши важные страницы будут найдены и потенциально включены в индекс. * Косвенно способствует лучшему SEO, обеспечивая полную индексацию контента.

Как поисковые системы узнают о моей карте сайта?

Есть несколько способов
  • Вы можете добавить URL вашей карты сайта в файл robots.txt.
  • Самый распространённый способ – это подать (отправить) карту сайта через панели для веб-мастеров, например Google Search Console.
  • Некоторые поисковые системы могут найти карту сайта, если на неё есть ссылка с вашего сайта.

Стоит ли блокировать какие-либо страницы через robots.txt?

Да, это полезно для определенных типов страниц * Страницы для входа в админ-панель * Результаты внутреннего поиска на сайте * Тестовые или разработческие версии страниц * Страницы с конфиденциальной информацией, не предназначенные для публичного доступа * Дубликаты контента, которые вы не хотите индексировать (хотя для этого есть и другие SEO-методы)
Что такое robots.txt и sitemap простыми словами
4.8/5
31
Комментарии (0)

Похожие статьи