Що таке robots.txt і sitemap простими словами

136 0
8 хвилин на прочитання

Щоб сторінка сайту з’явилася в Google, пошуковий робот спочатку повинен знайти її, перейти за адресою, завантажити вміст і передати його на обробку. Після цього пошукова система вирішує, чи додавати сторінку до свого індексу та за якими запитами її можна показувати.

Керувати цим процесом частково допомагають два технічні файли — robots.txt і sitemap. Вони виконують різні завдання:

  • robots.txt підказує пошуковим роботам, які розділи сайту можна або не потрібно сканувати;

  • sitemap допомагає пошуковим системам знаходити важливі сторінки сайту.

Ці файли не замінюють якісний контент, внутрішні посилання та правильне технічне налаштування сайту. Проте помилки в robots.txt або sitemap можуть ускладнити сканування сторінок і сповільнити їх появу в пошуку.

Як пошукові системи знаходять сторінки

Пошукові системи використовують спеціальних автоматичних роботів. Робот Google називається Googlebot. Він переходить за посиланнями, завантажує сторінки та збирає інформацію про їхній вміст.

У спрощеному вигляді процес складається з трьох етапів:

  1. Пошуковий робот знаходить адресу сторінки.

  2. Сканує її вміст.

  3. Пошукова система аналізує сторінку та вирішує, чи додавати її до індексу.

Сканування та індексування — це не одне й те саме. Сторінка може бути просканована, але не потрапити до індексу через низьку якість, дублювання, технічні помилки, директиву noindex або інші причини. Google прямо зазначає, що індексування не гарантується навіть тоді, коли сторінка доступна для сканування.

Що таке robots.txt

Robots.txt — це звичайний текстовий файл із правилами для пошукових та інших автоматичних роботів. У ньому власник сайту може вказати, які URL або каталоги не потрібно сканувати.

Файл повинен бути доступний у корені сайту за адресою:

https://example.com/robots.txt

Варіанти на кшталт https://example.com/folder/robots.txt не керуватимуть скануванням усього домену.

Robots.txt використовується насамперед для керування скануванням, а не для видалення сторінок із пошуку. Він може допомогти обмежити доступ роботів до технічних каталогів, внутрішнього пошуку, сторінок із параметрами або великої кількості неважливих URL.

Як виглядає файл robots.txt

Найпростіший файл може виглядати так:

User-agent: *
Disallow:

Sitemap: https://example.com/sitemap.xml

Цей запис означає:

  • правило поширюється на всіх роботів;

  • заборонених для сканування розділів немає;

  • карта сайту розташована за вказаною адресою.

Файл складається з директив. Основними є User-agent, Disallow, Allow і Sitemap.

Що означає User-agent

Директива User-agent визначає, для якого робота діють наступні правила.

Зірочка означає всіх роботів:

User-agent: *

Для Googlebot можна створити окрему групу:

User-agent: Googlebot

Наприклад:

User-agent: Googlebot
Disallow: /private/

У цьому випадку правило адресоване Googlebot і забороняє йому сканувати каталог /private/.

На практиці для більшості невеликих сайтів достатньо загальної групи:

User-agent: *

Що означає Disallow

Директива Disallow вказує шлях, який робот не повинен сканувати.

Приклад:

User-agent: *
Disallow: /admin/

Робот не повинен переходити на сторінки, адреси яких починаються з /admin/.

Ще один приклад:

User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/

Так можна закрити від сканування внутрішній пошук, кошик і сторінку оформлення замовлення.

Щоб заборонити сканування всього сайту, використовують:

User-agent: *
Disallow: /

Таке правило небезпечне для робочого сайту. Воно часто залишається після перенесення проєкту з тестового домену та заважає Google сканувати всі сторінки.

Якщо після Disallow: нічого не вказано, заборон немає:

User-agent: *
Disallow:

Що означає Allow

Директива Allow дає змогу відкрити конкретну сторінку або підкаталог усередині закритого розділу.

Наприклад:

User-agent: *
Disallow: /catalog/
Allow: /catalog/popular/

У цьому випадку каталог /catalog/ закритий, але розділ /catalog/popular/ дозволений для сканування.

Такі правила потрібно складати уважно. Чим складніший robots.txt, тим вищий ризик випадково закрити потрібні сторінки.

Як додати sitemap до robots.txt

Адресу карти сайту можна вказати окремим рядком:

Sitemap: https://example.com/sitemap.xml

Якщо карт декілька, допускається додати кілька рядків:

Sitemap: https://example.com/sitemap-pages.xml
Sitemap: https://example.com/sitemap-posts.xml
Sitemap: https://example.com/sitemap-products.xml

Google може знайти карту сайту через robots.txt. Крім того, її можна окремо надіслати через Google Search Console.

Чого robots.txt не робить

Одна з найпоширеніших помилок — використовувати robots.txt для видалення сторінки з результатів пошуку.

Рядок:

Disallow: /old-page/

не означає, що сторінку гарантовано буде видалено з індексу. Він лише просить робота не сканувати її вміст.

Якщо Google уже знає адресу сторінки з інших джерел, URL іноді може залишатися в результатах пошуку без нормального опису. Google прямо попереджає, що сторінка, закрита через robots.txt, все одно може з’являтися в пошуку як окрема адреса.

Для заборони індексування HTML-сторінки зазвичай використовують тег:

<meta name="robots" content="noindex">

Але робот повинен мати можливість відкрити сторінку та побачити цей тег. Якщо одночасно закрити URL у robots.txt, Google може не просканувати сторінку і не прочитати директиву noindex.

Тому не варто одночасно використовувати для однієї сторінки:

Disallow: /old-page/

і:

<meta name="robots" content="noindex">

коли головна мета — саме видалення сторінки з індексу.

Для конфіденційних матеріалів robots.txt також не підходить. Файл відкритий для всіх, тому будь-яка людина може переглянути перелік закритих каталогів. Приватні сторінки потрібно захищати авторизацією, паролем або обмеженнями на рівні сервера.

Приклад robots.txt для звичайного сайту

Універсального robots.txt для всіх сайтів не існує. Структура залежить від CMS, типу проєкту та системи формування URL.

Спрощений приклад:

User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/

Sitemap: https://example.com/sitemap.xml

Такий файл:

  • дозволяє сканувати основний вміст;

  • закриває службові розділи;

  • повідомляє адресу карти сайту.

Не потрібно копіювати чужий robots.txt без перевірки. Каталоги, які є технічними на одному сайті, на іншому можуть містити важливі сторінки.

Що таке sitemap

Sitemap, або карта сайту, — це файл зі списком URL, які власник сайту вважає важливими для пошукових систем.

Найчастіше використовується XML-карта за адресою:

https://example.com/sitemap.xml

У ній можуть бути перелічені:

  • головна сторінка;

  • статті;

  • категорії;

  • сторінки послуг;

  • товари;

  • зображення;

  • відео;

  • мовні версії сторінок.

Sitemap допомагає пошуковим роботам знаходити URL, але не змушує Google індексувати їх. Надсилання карти є підказкою, а не гарантією сканування, індексування або високих позицій.

Як виглядає XML sitemap

Спрощений файл може виглядати так:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/</loc>
    <lastmod>2026-08-01</lastmod>
  </url>
  <url>
    <loc>https://example.com/blog/</loc>
    <lastmod>2026-07-30</lastmod>
  </url>
</urlset>

Основні елементи:

  • <urlset> — контейнер зі списком сторінок;

  • <url> — окремий запис;

  • <loc> — повна адреса сторінки;

  • <lastmod> — дата останньої суттєвої зміни.

У sitemap потрібно використовувати повні абсолютні адреси:

https://example.com/blog/article/

Варіант без домену:

/blog/article/

для XML-карти використовувати не варто. Google рекомендує вказувати повні канонічні URL саме в тому вигляді, у якому їх потрібно сканувати.

Які сторінки потрібно додавати до sitemap

У карту сайту варто додавати сторінки, які:

  • доступні для пошукових роботів;

  • повертають код відповіді 200;

  • дозволені для індексування;

  • мають самостійний корисний вміст;

  • є канонічними версіями URL;

  • повинні з’являтися в результатах пошуку.

Наприклад, до sitemap інтернет-магазину можна додати:

  • категорії товарів;

  • картки доступних товарів;

  • інформаційні сторінки;

  • статті блогу.

Для інформаційного сайту до карти зазвичай входять:

  • статті;

  • категорії;

  • основні статичні сторінки;

  • сторінки авторів, якщо вони мають самостійну цінність.

Sitemap має показувати пошуковій системі бажану структуру індексованого сайту, а не містити всі технічно доступні адреси.

Які URL не потрібно додавати до sitemap

До карти сайту зазвичай не варто включати:

  • сторінки з тегом noindex;

  • URL, закриті в robots.txt;

  • сторінки з помилкою 404;

  • серверні помилки;

  • URL із перенаправленням;

  • дублікати;

  • неканонічні версії сторінок;

  • результати внутрішнього пошуку;

  • кошик і оформлення замовлення;

  • сторінки особистого кабінету;

  • технічні URL із параметрами;

  • тестові сторінки.

Наприклад, якщо адреса:

https://example.com/old-page/

перенаправляє на:

https://example.com/new-page/

у sitemap потрібно залишити лише кінцеву адресу /new-page/.

Якщо одна стаття доступна з кількома параметрами, але канонічною є чиста URL-адреса, у карту потрібно додавати тільки канонічну версію. Google рекомендує включати в sitemap саме ті URL, які власник сайту бажає бачити в пошуку.

Для яких сайтів sitemap особливо важливий

Карта сайту корисна практично для будь-якого проєкту, але особливе значення має для:

  • нових сайтів із малою кількістю зовнішніх посилань;

  • великих інтернет-магазинів;

  • сайтів із тисячами сторінок;

  • проєктів зі складною структурою;

  • сайтів із великою кількістю архівних матеріалів;

  • ресурсів зі сторінками, на які веде мало внутрішніх посилань;

  • сайтів із великою кількістю зображень або відео.

На невеликому сайті з якісною внутрішньою перелінковкою Google може знайти сторінки й без sitemap. Проте правильно сформована карта спрощує контроль URL і допомагає швидше помічати технічні проблеми. Google окремо зазначає, що sitemap особливо корисний для великих, складних і спеціалізованих сайтів.

Чи впливає sitemap на позиції

Наявність sitemap сама по собі не підвищує позиції сторінок.

Карта не робить контент якіснішим і не замінює:

  • оптимізацію Title та Description;

  • корисний текст;

  • внутрішні посилання;

  • зовнішні згадки;

  • швидкість завантаження;

  • правильну мобільну версію;

  • канонічні адреси;

  • відсутність технічних помилок.

Sitemap допомагає знайти URL і передати додаткову інформацію про них. Остаточне рішення щодо сканування, індексування та ранжування приймає пошукова система.

Що означає lastmod

Елемент <lastmod> показує дату останньої суттєвої зміни сторінки.

Приклад:

<lastmod>2026-08-03</lastmod>

Дату потрібно оновлювати після реальних змін:

  • редагування основного тексту;

  • додавання важливого розділу;

  • оновлення характеристик товару;

  • зміни структурованих даних;

  • суттєвого оновлення внутрішніх посилань.

Не потрібно змінювати дату щодня або після автоматичного оновлення року в підвалі сайту. Google використовує <lastmod>, якщо дані є послідовними та відповідають фактичним змінам сторінки.

Чи потрібні changefreq і priority

У старих прикладах sitemap часто зустрічаються:

<changefreq>weekly</changefreq>
<priority>0.8</priority>

changefreq нібито вказує частоту оновлення, а priority — відносну важливість URL.

Google повідомляє, що ігнорує значення <changefreq> та <priority>. Тому спеціально налаштовувати ці поля заради Google немає потреби. Значно важливіше передавати правильні URL і правдивий <lastmod>.

Обмеження XML sitemap

Один файл sitemap може містити не більше:

  • 50 000 URL;

  • 50 МБ у нестисненому вигляді.

Якщо сайт перевищує ці обмеження, карту потрібно розділити на кілька файлів і створити індекс sitemap.

Наприклад:

https://example.com/sitemap_index.xml

Індекс може посилатися на окремі карти:

https://example.com/post-sitemap.xml
https://example.com/page-sitemap.xml
https://example.com/product-sitemap.xml
https://example.com/category-sitemap.xml

Такий поділ також спрощує діагностику. У Google Search Console можна побачити, у якому саме файлі виникли помилки.

Як robots.txt і sitemap працюють разом

Ці файли не замінюють один одного.

Robots.txt відповідає на запитання:

Які розділи пошуковому роботу не потрібно сканувати?

Sitemap відповідає на інше запитання:

Які сторінки сайту потрібно знайти та розглянути для індексування?

Правильна логіка виглядає так:

  • важливі сторінки відкриті в robots.txt;

  • вони дозволені для індексування;

  • повертають код 200;

  • мають канонічну адресу;

  • присутні в sitemap;

  • доступні через внутрішні посилання.

Неправильна ситуація:

  • URL додано до sitemap;

  • той самий URL закритий у robots.txt;

  • на сторінці встановлено noindex;

  • канонічне посилання веде на іншу адресу.

Такі суперечливі сигнали ускладнюють обробку сайту. Карта повинна містити переважно чисті, доступні та канонічні сторінки.

Як перевірити robots.txt

Відкрийте в браузері:

https://ваш-сайт.com/robots.txt

Перевірте:

  • чи файл відкривається;

  • чи не встановлено Disallow: /;

  • чи не закриті статті, категорії або товари;

  • чи правильно вказані шляхи;

  • чи є посилання на актуальний sitemap;

  • чи немає правил, скопійованих з іншого сайту.

Після зміни robots.txt варто перевірити важливі сторінки через інструмент перевірки URL у Google Search Console.

Як перевірити sitemap

Відкрийте передбачувану адресу:

https://ваш-сайт.com/sitemap.xml

У деяких CMS карта може мати іншу адресу:

https://ваш-сайт.com/sitemap_index.xml

Перевірте, чи:

  • файл відкривається без помилки;

  • URL належать вашому домену;

  • використовується правильний протокол HTTPS;

  • немає тестового домену;

  • відсутні 404-сторінки;

  • немає URL із перенаправленням;

  • не включені сторінки noindex;

  • дати lastmod відповідають реальним оновленням.

Як додати sitemap у Google Search Console

Для надсилання карти сайту потрібно:

  1. Відкрити потрібний ресурс у Google Search Console.

  2. Перейти до розділу «Файли Sitemap».

  3. Ввести адресу або кінцеву частину URL карти.

  4. Натиснути кнопку надсилання.

  5. Перевірити статус обробки.

Наприклад, якщо карта доступна за адресою:

https://example.com/sitemap_index.xml

у відповідне поле зазвичай вводять:

sitemap_index.xml

Після обробки Google Search Console може показати:

  • успішне завантаження;

  • кількість виявлених URL;

  • помилки читання;

  • недоступність файла;

  • неправильний формат;

  • проблеми з окремими вкладеними картами.

Надсилати один і той самий sitemap після кожної нової статті не потрібно. Якщо карта формується автоматично, пошукова система періодично перевірятиме її повторно. Надсилання sitemap лише повідомляє Google про його існування і не гарантує індексування URL.

Типові помилки в robots.txt

Закритий весь сайт

User-agent: *
Disallow: /

Для тестового проєкту це може бути свідомим рішенням, але на робочому сайті правило блокує сканування всіх розділів.

Закрита папка з важливими файлами

Іноді в robots.txt блокують каталоги зі стилями, скриптами або зображеннями. У результаті пошуковий робот може неправильно відобразити сторінку та не зрозуміти її повний вміст.

Спроба видалити сторінку з індексу

Disallow керує скануванням, але не гарантує видалення URL із пошуку.

Копіювання чужого файла

Однакові CMS можуть мати різні плагіни, каталоги, параметри та структуру URL. Чужі правила можуть закрити важливі сторінки.

Закриття сторінок із noindex

Якщо робот не може відкрити сторінку, він може не побачити директиву noindex.

Типові помилки в sitemap

Додавання всіх URL без перевірки

Карта не повинна бути звалищем усіх адрес, які коли-небудь створював сайт.

Наявність сторінок із помилками

URL із кодами 404 або 5xx потрібно видалити з sitemap або виправити.

Наявність перенаправлень

У карті повинна бути кінцева адреса, а не URL, який перенаправляє користувача.

Додавання noindex-сторінок

Якщо сторінка не повинна індексуватися, її не потрібно пропонувати Google через sitemap.

Неправильний домен

Після перенесення сайту в карті іноді залишаються адреси тестового домену, HTTP-версії або неправильний варіант із www.

Неправдивий lastmod

Автоматичне встановлення поточної дати для всіх сторінок не допомагає пошуковій системі та робить дані ненадійними.

Що варто перевірити на своєму сайті

Для базової технічної перевірки достатньо пройти кілька кроків:

  1. Відкрити /robots.txt.

  2. Переконатися, що важливі розділи не закриті.

  3. Знайти адресу XML sitemap.

  4. Перевірити, чи карта відкривається.

  5. Переглянути, які типи URL до неї входять.

  6. Видалити з sitemap помилкові, закриті та неканонічні сторінки.

  7. Додати адресу sitemap до robots.txt.

  8. Надіслати карту через Google Search Console.

  9. Перевірити важливі URL інструментом перевірки сторінок.

  10. Після змін переглянути звіт про індексування.

Robots.txt допомагає керувати доступом пошукових роботів, а sitemap показує їм важливі адреси. Правильно налаштовані файли не гарантують високих позицій, але створюють зрозумілу технічну основу для сканування та індексування сайту.

Що таке robots.txt простими словами?

Robots.txt – це невеликий текстовий файл, який знаходиться на вашому сайті. Він слугує інструкцією для пошукових роботів (наприклад, Googlebot), які сканують веб-сторінки. У ньому ви можете вказати, які частини вашого сайту дозволено сканувати, а які – ні.

Для чого потрібен robots.txt?

Його основні функції * Запобігання перевантаженню сервера роботами * Приховування певних розділів сайту від індексації пошуковими системами (наприклад, сторінок адмінпанелі, тестових версій, конфіденційних даних) * Керування поведінкою роботів на сайті

Що таке sitemap простими словами?

Sitemap – це файл (зазвичай у форматі XML), який є "картою" вашого сайту. У ньому перераховані всі важливі сторінки, файли та інші медіа-дані, які ви хочете, щоб пошукові системи знали та індексували. Він схожий на зміст книги для пошукових систем.

Для чого потрібен sitemap?

Sitemap допомагає пошуковим системам * Знайти всі сторінки вашого сайту, особливо нові або ті, на які немає посилань з інших сайтів * Зрозуміти структуру вашого сайту * Визначити, які сторінки є найважливішими * Швидше індексувати новий контент

Яка головна відмінність між robots.txt і sitemap?

Robots.txt дає інструкції пошуковим роботам, що НЕ ТРЕБА сканувати або показувати в пошуку. Це файл-обмежувач. Sitemap дає пошуковим системам повний список того, що ТРЕБА сканувати та індексувати. Це файл-путівник. Простіше кажучи, robots.txt каже "НЕ ЙДИ СЮДИ", а sitemap каже "ОСЬ ВСЕ, ЩО Є, ІДИ СЮДИ".

Чи обов'язково мати robots.txt і sitemap для сайту?

Не обов'язково, але дуже рекомендовано. * Без robots.txt пошукові роботи будуть сканувати весь сайт, що може споживати ресурси або виявити небажані сторінки. * Без sitemap пошуковим системам може бути складніше знайти всі ваші сторінки, особливо якщо сайт великий або має складну структуру.

Що станеться, якщо я неправильно налаштую robots.txt?

Неправильне налаштування robots.txt може призвести до серйозних проблем * Важливі сторінки сайту можуть бути виключені з індексу пошукових систем і не показуватимуться у видачі. * Весь ваш сайт може зникнути з пошуку, якщо ви випадково забороните доступ до всіх сторінок. * Це може вплинути на SEO та видимість вашого сайту.

Чи може sitemap покращити SEO сайту?

Sitemap сам по собі не є прямим фактором ранжування, тобто він не покращить ваші позиції в пошуковій видачі безпосередньо. Однак він * Допомагає пошуковим системам ефективніше індексувати ваш сайт. * Гарантує, що всі ваші важливі сторінки будуть знайдені та потенційно включені в індекс. * Непрямо сприяє кращому SEO, забезпечуючи повну індексацію контенту.

Як пошукові системи дізнаються про мій sitemap?

Є кілька способів * Ви можете додати URL вашого sitemap у файл robots.txt. * Найпоширеніший спосіб – це подати (відправити) sitemap через панелі для веб-майстрів, наприклад Google Search Console. * Деякі пошукові системи можуть знайти sitemap, якщо на нього є посилання з вашого сайту.

Чи варто блокувати якісь сторінки через robots.txt?

Так, це корисно для певних типів сторінок * Сторінки для входу в адмінпанель * Результати внутрішнього пошуку на сайті * Тестові або розробницькі версії сторінок * Сторінки з конфіденційною інформацією, які не призначені для публічного доступу * Дублікати контенту, які ви не хочете, щоб індексувалися (хоча для цього є й інші SEO-методи)
Що таке robots.txt і sitemap простими словами
4.6/5
24
Коментарі (0)

Схожі статті