- Как поисковые системы находят страницы
- Что такое robots.txt
- Как выглядит файл robots.txt
- Что означает User-agent
- Что означает Disallow
- Что означает Allow
- Как добавить sitemap в robots.txt
- Чего robots.txt не делает
- Пример robots.txt для обычного сайта
- Что такое sitemap
- Как выглядит XML sitemap
- Какие страницы нужно добавлять в sitemap
- Какие URL не нужно добавлять в sitemap
- Для каких сайтов sitemap особенно важен
- Влияет ли sitemap на позиции
- Что означает lastmod
- Нужны ли changefreq и priority
- Ограничения XML sitemap
- Как robots.txt и sitemap работают вместе
- Как проверить robots.txt
- Как проверить sitemap
- Как добавить sitemap в Google Search Console
- Типичные ошибки в robots.txt
- Типичные ошибки в sitemap
- Что стоит проверить на своем сайте
Чтобы страница сайта появилась в Google, поисковый робот сначала должен найти ее, перейти по адресу, загрузить содержимое и передать его на обработку. После этого поисковая система решает, добавлять ли страницу в свой индекс и по каким запросам ее можно показывать.
Частично управлять этим процессом помогают два технических файла — robots.txt и sitemap. Они выполняют разные задачи:
-
robots.txt подсказывает поисковым роботам, какие разделы сайта можно или не нужно сканировать;
-
sitemap помогает поисковым системам находить важные страницы сайта.
Эти файлы не заменяют качественный контент, внутренние ссылки и правильную техническую настройку сайта. Однако ошибки в robots.txt или sitemap могут затруднить сканирование страниц и замедлить их появление в поиске.
Как поисковые системы находят страницы
Поисковые системы используют специальных автоматических роботов. Робот Google называется Googlebot. Он переходит по ссылкам, загружает страницы и собирает информацию об их содержимом.
В упрощенном виде процесс состоит из трех этапов:
-
Поисковый робот находит адрес страницы.
-
Сканирует ее содержимое.
-
Поисковая система анализирует страницу и решает, добавлять ли ее в индекс.
Сканирование и индексирование — это не одно и то же. Страница может быть просканирована, но не попасть в индекс из-за низкого качества, дублирования, технических ошибок, директивы noindex или других причин. Google прямо указывает, что индексирование не гарантируется даже тогда, когда страница доступна для сканирования.
Что такое robots.txt
Robots.txt — это обычный текстовый файл с правилами для поисковых и других автоматических роботов. В нем владелец сайта может указать, какие URL или каталоги не нужно сканировать.
Файл должен быть доступен в корне сайта по адресу:
https://example.com/robots.txt
Варианты вроде https://example.com/folder/robots.txt не будут управлять сканированием всего домена.
Robots.txt используется прежде всего для управления сканированием, а не для удаления страниц из поиска. Он может помочь ограничить доступ роботов к техническим каталогам, внутреннему поиску, страницам с параметрами или большому количеству неважных URL.
Как выглядит файл robots.txt
Самый простой файл может выглядеть так:
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Эта запись означает:
-
правило распространяется на всех роботов;
-
запрещенных для сканирования разделов нет;
-
карта сайта расположена по указанному адресу.
Файл состоит из директив. Основными являются User-agent, Disallow, Allow и Sitemap.
Что означает User-agent
Директива User-agent определяет, для какого робота действуют следующие правила.
Звездочка означает всех роботов:
User-agent: *
Для Googlebot можно создать отдельную группу:
User-agent: Googlebot
Например:
User-agent: Googlebot
Disallow: /private/
В этом случае правило адресовано Googlebot и запрещает ему сканировать каталог /private/.
На практике для большинства небольших сайтов достаточно общей группы:
User-agent: *
Что означает Disallow
Директива Disallow указывает путь, который робот не должен сканировать.
Пример:
User-agent: *
Disallow: /admin/
Робот не должен переходить на страницы, адреса которых начинаются с /admin/.
Еще один пример:
User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Так можно закрыть от сканирования внутренний поиск, корзину и страницу оформления заказа.
Чтобы запретить сканирование всего сайта, используют:
User-agent: *
Disallow: /
Такое правило опасно для рабочего сайта. Оно часто остается после переноса проекта с тестового домена и мешает Google сканировать все страницы.
Если после Disallow: ничего не указано, запретов нет:
User-agent: *
Disallow:
Что означает Allow
Директива Allow позволяет открыть конкретную страницу или подкаталог внутри закрытого раздела.
Например:
User-agent: *
Disallow: /catalog/
Allow: /catalog/popular/
В этом случае каталог /catalog/ закрыт, но раздел /catalog/popular/ разрешен для сканирования.
Такие правила нужно составлять внимательно. Чем сложнее robots.txt, тем выше риск случайно закрыть нужные страницы.
Как добавить sitemap в robots.txt
Адрес карты сайта можно указать отдельной строкой:
Sitemap: https://example.com/sitemap.xml
Если карт несколько, допускается добавить несколько строк:
Sitemap: https://example.com/sitemap-pages.xml
Sitemap: https://example.com/sitemap-posts.xml
Sitemap: https://example.com/sitemap-products.xml
Google может найти карту сайта через robots.txt. Кроме того, ее можно отдельно отправить через Google Search Console.
Чего robots.txt не делает
Одна из самых распространенных ошибок — использовать robots.txt для удаления страницы из результатов поиска.
Строка:
Disallow: /old-page/
не означает, что страница гарантированно будет удалена из индекса. Она только просит робота не сканировать ее содержимое.
Если Google уже знает адрес страницы из других источников, URL иногда может оставаться в результатах поиска без нормального описания. Google прямо предупреждает, что страница, закрытая через robots.txt, все равно может появляться в поиске как отдельный адрес.
Для запрета индексирования HTML-страницы обычно используют тег:
<meta name="robots" content="noindex">
Но робот должен иметь возможность открыть страницу и увидеть этот тег. Если одновременно закрыть URL в robots.txt, Google может не просканировать страницу и не прочитать директиву noindex.
Поэтому не стоит одновременно использовать для одной страницы:
Disallow: /old-page/
и:
<meta name="robots" content="noindex">
когда главная цель — именно удаление страницы из индекса.
Для конфиденциальных материалов robots.txt также не подходит. Файл открыт для всех, поэтому любой человек может просмотреть перечень закрытых каталогов. Приватные страницы нужно защищать авторизацией, паролем или ограничениями на уровне сервера.
Пример robots.txt для обычного сайта
Универсального robots.txt для всех сайтов не существует. Структура зависит от CMS, типа проекта и системы формирования URL.
Упрощенный пример:
User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://example.com/sitemap.xml
Такой файл:
-
разрешает сканировать основное содержимое;
-
закрывает служебные разделы;
-
сообщает адрес карты сайта.
Не нужно копировать чужой robots.txt без проверки. Каталоги, которые являются техническими на одном сайте, на другом могут содержать важные страницы.
Что такое sitemap
Sitemap, или карта сайта, — это файл со списком URL, которые владелец сайта считает важными для поисковых систем.
Чаще всего используется XML-карта по адресу:
https://example.com/sitemap.xml
В ней могут быть перечислены:
-
главная страница;
-
статьи;
-
категории;
-
страницы услуг;
-
товары;
-
изображения;
-
видео;
-
языковые версии страниц.
Sitemap помогает поисковым роботам находить URL, но не заставляет Google индексировать их. Отправка карты является подсказкой, а не гарантией сканирования, индексирования или высоких позиций.
Как выглядит XML sitemap
Упрощенный файл может выглядеть так:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/</loc>
<lastmod>2026-08-01</lastmod>
</url>
<url>
<loc>https://example.com/blog/</loc>
<lastmod>2026-07-30</lastmod>
</url>
</urlset>
Основные элементы:
-
<urlset>— контейнер со списком страниц; -
<url>— отдельная запись; -
<loc>— полный адрес страницы; -
<lastmod>— дата последнего существенного изменения.
В sitemap нужно использовать полные абсолютные адреса:
https://example.com/blog/article/
Вариант без домена:
/blog/article/
для XML-карты использовать не стоит. Google рекомендует указывать полные канонические URL именно в том виде, в котором их нужно сканировать.
Какие страницы нужно добавлять в sitemap
В карту сайта стоит добавлять страницы, которые:
-
доступны для поисковых роботов;
-
возвращают код ответа 200;
-
разрешены для индексирования;
-
имеют самостоятельное полезное содержимое;
-
являются каноническими версиями URL;
-
должны появляться в результатах поиска.
Например, в sitemap интернет-магазина можно добавить:
-
категории товаров;
-
карточки доступных товаров;
-
информационные страницы;
-
статьи блога.
Для информационного сайта в карту обычно входят:
-
статьи;
-
категории;
-
основные статические страницы;
-
страницы авторов, если они имеют самостоятельную ценность.
Sitemap должен показывать поисковой системе желаемую структуру индексируемого сайта, а не содержать все технически доступные адреса.
Какие URL не нужно добавлять в sitemap
В карту сайта обычно не стоит включать:
-
страницы с тегом noindex;
-
URL, закрытые в robots.txt;
-
страницы с ошибкой 404;
-
серверные ошибки;
-
URL с перенаправлением;
-
дубликаты;
-
неканонические версии страниц;
-
результаты внутреннего поиска;
-
корзину и оформление заказа;
-
страницы личного кабинета;
-
технические URL с параметрами;
-
тестовые страницы.
Например, если адрес:
https://example.com/old-page/
перенаправляет на:
https://example.com/new-page/
в sitemap нужно оставить только конечный адрес /new-page/.
Если одна статья доступна с несколькими параметрами, но каноническим является чистый URL-адрес, в карту нужно добавлять только каноническую версию. Google рекомендует включать в sitemap именно те URL, которые владелец сайта хочет видеть в поиске.
Для каких сайтов sitemap особенно важен
Карта сайта полезна практически для любого проекта, но особое значение имеет для:
-
новых сайтов с небольшим количеством внешних ссылок;
-
крупных интернет-магазинов;
-
сайтов с тысячами страниц;
-
проектов со сложной структурой;
-
сайтов с большим количеством архивных материалов;
-
ресурсов со страницами, на которые ведет мало внутренних ссылок;
-
сайтов с большим количеством изображений или видео.
На небольшом сайте с качественной внутренней перелинковкой Google может найти страницы и без sitemap. Однако правильно сформированная карта упрощает контроль URL и помогает быстрее замечать технические проблемы. Google отдельно указывает, что sitemap особенно полезен для крупных, сложных и специализированных сайтов.
Влияет ли sitemap на позиции
Наличие sitemap само по себе не повышает позиции страниц.
Карта не делает контент качественнее и не заменяет:
-
оптимизацию Title и Description;
-
полезный текст;
-
внутренние ссылки;
-
внешние упоминания;
-
скорость загрузки;
-
правильную мобильную версию;
-
канонические адреса;
-
отсутствие технических ошибок.
Sitemap помогает найти URL и передать дополнительную информацию о них. Окончательное решение о сканировании, индексировании и ранжировании принимает поисковая система.
Что означает lastmod
Элемент <lastmod> показывает дату последнего существенного изменения страницы.
Пример:
<lastmod>2026-08-03</lastmod>
Дату нужно обновлять после реальных изменений:
-
редактирования основного текста;
-
добавления важного раздела;
-
обновления характеристик товара;
-
изменения структурированных данных;
-
существенного обновления внутренних ссылок.
Не нужно изменять дату каждый день или после автоматического обновления года в подвале сайта. Google использует <lastmod>, если данные являются последовательными и соответствуют фактическим изменениям страницы.
Нужны ли changefreq и priority
В старых примерах sitemap часто встречаются:
<changefreq>weekly</changefreq>
<priority>0.8</priority>
changefreq якобы указывает частоту обновления, а priority — относительную важность URL.
Google сообщает, что игнорирует значения <changefreq> и <priority>. Поэтому специально настраивать эти поля ради Google нет необходимости. Значительно важнее передавать правильные URL и достоверный <lastmod>.
Ограничения XML sitemap
Один файл sitemap может содержать не более:
-
50 000 URL;
-
50 МБ в несжатом виде.
Если сайт превышает эти ограничения, карту нужно разделить на несколько файлов и создать индекс sitemap.
Например:
https://example.com/sitemap_index.xml
Индекс может ссылаться на отдельные карты:
https://example.com/post-sitemap.xml
https://example.com/page-sitemap.xml
https://example.com/product-sitemap.xml
https://example.com/category-sitemap.xml
Такое разделение также упрощает диагностику. В Google Search Console можно увидеть, в каком именно файле возникли ошибки.
Как robots.txt и sitemap работают вместе
Эти файлы не заменяют друг друга.
Robots.txt отвечает на вопрос:
Какие разделы поисковому роботу не нужно сканировать?
Sitemap отвечает на другой вопрос:
Какие страницы сайта нужно найти и рассмотреть для индексирования?
Правильная логика выглядит так:
-
важные страницы открыты в robots.txt;
-
они разрешены для индексирования;
-
возвращают код 200;
-
имеют канонический адрес;
-
присутствуют в sitemap;
-
доступны через внутренние ссылки.
Неправильная ситуация:
-
URL добавлен в sitemap;
-
тот же URL закрыт в robots.txt;
-
на странице установлен noindex;
-
каноническая ссылка ведет на другой адрес.
Такие противоречивые сигналы усложняют обработку сайта. Карта должна содержать преимущественно чистые, доступные и канонические страницы.
Как проверить robots.txt
Откройте в браузере:
https://ваш-сайт.com/robots.txt
Проверьте:
-
открывается ли файл;
-
не установлено ли
Disallow: /; -
не закрыты ли статьи, категории или товары;
-
правильно ли указаны пути;
-
есть ли ссылка на актуальный sitemap;
-
нет ли правил, скопированных с другого сайта.
После изменения robots.txt стоит проверить важные страницы через инструмент проверки URL в Google Search Console.
Как проверить sitemap
Откройте предполагаемый адрес:
https://ваш-сайт.com/sitemap.xml
В некоторых CMS карта может иметь другой адрес:
https://ваш-сайт.com/sitemap_index.xml
Проверьте, чтобы:
-
файл открывался без ошибки;
-
URL принадлежали вашему домену;
-
использовался правильный протокол HTTPS;
-
не было тестового домена;
-
отсутствовали страницы с ошибкой 404;
-
не было URL с перенаправлением;
-
не были включены страницы noindex;
-
даты lastmod соответствовали реальным обновлениям.
Как добавить sitemap в Google Search Console
Для отправки карты сайта необходимо:
-
Открыть нужный ресурс в Google Search Console.
-
Перейти в раздел «Файлы Sitemap».
-
Ввести адрес или конечную часть URL карты.
-
Нажать кнопку отправки.
-
Проверить статус обработки.
Например, если карта доступна по адресу:
https://example.com/sitemap_index.xml
в соответствующее поле обычно вводят:
sitemap_index.xml
После обработки Google Search Console может показать:
-
успешную загрузку;
-
количество обнаруженных URL;
-
ошибки чтения;
-
недоступность файла;
-
неправильный формат;
-
проблемы с отдельными вложенными картами.
Отправлять один и тот же sitemap после каждой новой статьи не нужно. Если карта формируется автоматически, поисковая система будет периодически проверять ее повторно. Отправка sitemap только сообщает Google о его существовании и не гарантирует индексирование URL.
Типичные ошибки в robots.txt
Закрыт весь сайт
User-agent: *
Disallow: /
Для тестового проекта это может быть осознанным решением, но на рабочем сайте правило блокирует сканирование всех разделов.
Закрыта папка с важными файлами
Иногда в robots.txt блокируют каталоги со стилями, скриптами или изображениями. В результате поисковый робот может неправильно отобразить страницу и не понять ее полное содержимое.
Попытка удалить страницу из индекса
Disallow управляет сканированием, но не гарантирует удаление URL из поиска.
Копирование чужого файла
Одинаковые CMS могут иметь разные плагины, каталоги, параметры и структуру URL. Чужие правила могут закрыть важные страницы.
Закрытие страниц с noindex
Если робот не может открыть страницу, он может не увидеть директиву noindex.
Типичные ошибки в sitemap
Добавление всех URL без проверки
Карта не должна быть свалкой всех адресов, которые когда-либо создавал сайт.
Наличие страниц с ошибками
URL с кодами 404 или 5xx нужно удалить из sitemap или исправить.
Наличие перенаправлений
В карте должен быть конечный адрес, а не URL, который перенаправляет пользователя.
Добавление noindex-страниц
Если страница не должна индексироваться, ее не нужно предлагать Google через sitemap.
Неправильный домен
После переноса сайта в карте иногда остаются адреса тестового домена, HTTP-версии или неправильный вариант с www.
Недостоверный lastmod
Автоматическая установка текущей даты для всех страниц не помогает поисковой системе и делает данные ненадежными.
Что стоит проверить на своем сайте
Для базовой технической проверки достаточно выполнить несколько шагов:
-
Открыть
/robots.txt. -
Убедиться, что важные разделы не закрыты.
-
Найти адрес XML sitemap.
-
Проверить, открывается ли карта.
-
Посмотреть, какие типы URL в нее входят.
-
Удалить из sitemap ошибочные, закрытые и неканонические страницы.
-
Добавить адрес sitemap в robots.txt.
-
Отправить карту через Google Search Console.
-
Проверить важные URL инструментом проверки страниц.
-
После изменений просмотреть отчет об индексировании.
Robots.txt помогает управлять доступом поисковых роботов, а sitemap показывает им важные адреса. Правильно настроенные файлы не гарантируют высоких позиций, но создают понятную техническую основу для сканирования и индексирования сайта.
Что такое robots.txt простыми словами?
Зачем нужен robots.txt?
- Предотвращение перегрузки сервера роботами
- Скрытие определенных разделов сайта от индексации поисковыми системами (например, страниц админ-панели, тестовых версий, конфиденциальных данных)
- Управление поведением роботов на сайте
Что такое sitemap простыми словами?
Зачем нужна карта сайта?
- Найти все страницы вашего сайта, особенно новые или те, на которые нет ссылок с других сайтов
- Понять структуру вашего сайта
- Определить, какие страницы являются наиболее важными
- Быстрее индексировать новый контент
Каково главное отличие между robots.txt и sitemap?
Обязательны ли robots.txt и sitemap для сайта?
Что произойдет, если я неправильно настрою robots.txt?
Может ли sitemap улучшить SEO сайта?
Как поисковые системы узнают о моей карте сайта?
- Вы можете добавить URL вашей карты сайта в файл robots.txt.
- Самый распространённый способ – это подать (отправить) карту сайта через панели для веб-мастеров, например Google Search Console.
- Некоторые поисковые системы могут найти карту сайта, если на неё есть ссылка с вашего сайта.