- Як пошукові системи знаходять сторінки
- Що таке robots.txt
- Як виглядає файл robots.txt
- Що означає User-agent
- Що означає Disallow
- Що означає Allow
- Як додати sitemap до robots.txt
- Чого robots.txt не робить
- Приклад robots.txt для звичайного сайту
- Що таке sitemap
- Як виглядає XML sitemap
- Які сторінки потрібно додавати до sitemap
- Які URL не потрібно додавати до sitemap
- Для яких сайтів sitemap особливо важливий
- Чи впливає sitemap на позиції
- Що означає lastmod
- Чи потрібні changefreq і priority
- Обмеження XML sitemap
- Як robots.txt і sitemap працюють разом
- Як перевірити robots.txt
- Як перевірити sitemap
- Як додати sitemap у Google Search Console
- Типові помилки в robots.txt
- Типові помилки в sitemap
- Що варто перевірити на своєму сайті
Щоб сторінка сайту з’явилася в Google, пошуковий робот спочатку повинен знайти її, перейти за адресою, завантажити вміст і передати його на обробку. Після цього пошукова система вирішує, чи додавати сторінку до свого індексу та за якими запитами її можна показувати.
Керувати цим процесом частково допомагають два технічні файли — robots.txt і sitemap. Вони виконують різні завдання:
-
robots.txt підказує пошуковим роботам, які розділи сайту можна або не потрібно сканувати;
-
sitemap допомагає пошуковим системам знаходити важливі сторінки сайту.
Ці файли не замінюють якісний контент, внутрішні посилання та правильне технічне налаштування сайту. Проте помилки в robots.txt або sitemap можуть ускладнити сканування сторінок і сповільнити їх появу в пошуку.
Як пошукові системи знаходять сторінки
Пошукові системи використовують спеціальних автоматичних роботів. Робот Google називається Googlebot. Він переходить за посиланнями, завантажує сторінки та збирає інформацію про їхній вміст.
У спрощеному вигляді процес складається з трьох етапів:
-
Пошуковий робот знаходить адресу сторінки.
-
Сканує її вміст.
-
Пошукова система аналізує сторінку та вирішує, чи додавати її до індексу.
Сканування та індексування — це не одне й те саме. Сторінка може бути просканована, але не потрапити до індексу через низьку якість, дублювання, технічні помилки, директиву noindex або інші причини. Google прямо зазначає, що індексування не гарантується навіть тоді, коли сторінка доступна для сканування.
Що таке robots.txt
Robots.txt — це звичайний текстовий файл із правилами для пошукових та інших автоматичних роботів. У ньому власник сайту може вказати, які URL або каталоги не потрібно сканувати.
Файл повинен бути доступний у корені сайту за адресою:
https://example.com/robots.txt
Варіанти на кшталт https://example.com/folder/robots.txt не керуватимуть скануванням усього домену.
Robots.txt використовується насамперед для керування скануванням, а не для видалення сторінок із пошуку. Він може допомогти обмежити доступ роботів до технічних каталогів, внутрішнього пошуку, сторінок із параметрами або великої кількості неважливих URL.
Як виглядає файл robots.txt
Найпростіший файл може виглядати так:
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Цей запис означає:
-
правило поширюється на всіх роботів;
-
заборонених для сканування розділів немає;
-
карта сайту розташована за вказаною адресою.
Файл складається з директив. Основними є User-agent, Disallow, Allow і Sitemap.
Що означає User-agent
Директива User-agent визначає, для якого робота діють наступні правила.
Зірочка означає всіх роботів:
User-agent: *
Для Googlebot можна створити окрему групу:
User-agent: Googlebot
Наприклад:
User-agent: Googlebot
Disallow: /private/
У цьому випадку правило адресоване Googlebot і забороняє йому сканувати каталог /private/.
На практиці для більшості невеликих сайтів достатньо загальної групи:
User-agent: *
Що означає Disallow
Директива Disallow вказує шлях, який робот не повинен сканувати.
Приклад:
User-agent: *
Disallow: /admin/
Робот не повинен переходити на сторінки, адреси яких починаються з /admin/.
Ще один приклад:
User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Так можна закрити від сканування внутрішній пошук, кошик і сторінку оформлення замовлення.
Щоб заборонити сканування всього сайту, використовують:
User-agent: *
Disallow: /
Таке правило небезпечне для робочого сайту. Воно часто залишається після перенесення проєкту з тестового домену та заважає Google сканувати всі сторінки.
Якщо після Disallow: нічого не вказано, заборон немає:
User-agent: *
Disallow:
Що означає Allow
Директива Allow дає змогу відкрити конкретну сторінку або підкаталог усередині закритого розділу.
Наприклад:
User-agent: *
Disallow: /catalog/
Allow: /catalog/popular/
У цьому випадку каталог /catalog/ закритий, але розділ /catalog/popular/ дозволений для сканування.
Такі правила потрібно складати уважно. Чим складніший robots.txt, тим вищий ризик випадково закрити потрібні сторінки.
Як додати sitemap до robots.txt
Адресу карти сайту можна вказати окремим рядком:
Sitemap: https://example.com/sitemap.xml
Якщо карт декілька, допускається додати кілька рядків:
Sitemap: https://example.com/sitemap-pages.xml
Sitemap: https://example.com/sitemap-posts.xml
Sitemap: https://example.com/sitemap-products.xml
Google може знайти карту сайту через robots.txt. Крім того, її можна окремо надіслати через Google Search Console.
Чого robots.txt не робить
Одна з найпоширеніших помилок — використовувати robots.txt для видалення сторінки з результатів пошуку.
Рядок:
Disallow: /old-page/
не означає, що сторінку гарантовано буде видалено з індексу. Він лише просить робота не сканувати її вміст.
Якщо Google уже знає адресу сторінки з інших джерел, URL іноді може залишатися в результатах пошуку без нормального опису. Google прямо попереджає, що сторінка, закрита через robots.txt, все одно може з’являтися в пошуку як окрема адреса.
Для заборони індексування HTML-сторінки зазвичай використовують тег:
<meta name="robots" content="noindex">
Але робот повинен мати можливість відкрити сторінку та побачити цей тег. Якщо одночасно закрити URL у robots.txt, Google може не просканувати сторінку і не прочитати директиву noindex.
Тому не варто одночасно використовувати для однієї сторінки:
Disallow: /old-page/
і:
<meta name="robots" content="noindex">
коли головна мета — саме видалення сторінки з індексу.
Для конфіденційних матеріалів robots.txt також не підходить. Файл відкритий для всіх, тому будь-яка людина може переглянути перелік закритих каталогів. Приватні сторінки потрібно захищати авторизацією, паролем або обмеженнями на рівні сервера.
Приклад robots.txt для звичайного сайту
Універсального robots.txt для всіх сайтів не існує. Структура залежить від CMS, типу проєкту та системи формування URL.
Спрощений приклад:
User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://example.com/sitemap.xml
Такий файл:
-
дозволяє сканувати основний вміст;
-
закриває службові розділи;
-
повідомляє адресу карти сайту.
Не потрібно копіювати чужий robots.txt без перевірки. Каталоги, які є технічними на одному сайті, на іншому можуть містити важливі сторінки.
Що таке sitemap
Sitemap, або карта сайту, — це файл зі списком URL, які власник сайту вважає важливими для пошукових систем.
Найчастіше використовується XML-карта за адресою:
https://example.com/sitemap.xml
У ній можуть бути перелічені:
-
головна сторінка;
-
статті;
-
категорії;
-
сторінки послуг;
-
товари;
-
зображення;
-
відео;
-
мовні версії сторінок.
Sitemap допомагає пошуковим роботам знаходити URL, але не змушує Google індексувати їх. Надсилання карти є підказкою, а не гарантією сканування, індексування або високих позицій.
Як виглядає XML sitemap
Спрощений файл може виглядати так:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/</loc>
<lastmod>2026-08-01</lastmod>
</url>
<url>
<loc>https://example.com/blog/</loc>
<lastmod>2026-07-30</lastmod>
</url>
</urlset>
Основні елементи:
-
<urlset>— контейнер зі списком сторінок; -
<url>— окремий запис; -
<loc>— повна адреса сторінки; -
<lastmod>— дата останньої суттєвої зміни.
У sitemap потрібно використовувати повні абсолютні адреси:
https://example.com/blog/article/
Варіант без домену:
/blog/article/
для XML-карти використовувати не варто. Google рекомендує вказувати повні канонічні URL саме в тому вигляді, у якому їх потрібно сканувати.
Які сторінки потрібно додавати до sitemap
У карту сайту варто додавати сторінки, які:
-
доступні для пошукових роботів;
-
повертають код відповіді 200;
-
дозволені для індексування;
-
мають самостійний корисний вміст;
-
є канонічними версіями URL;
-
повинні з’являтися в результатах пошуку.
Наприклад, до sitemap інтернет-магазину можна додати:
-
категорії товарів;
-
картки доступних товарів;
-
інформаційні сторінки;
-
статті блогу.
Для інформаційного сайту до карти зазвичай входять:
-
статті;
-
категорії;
-
основні статичні сторінки;
-
сторінки авторів, якщо вони мають самостійну цінність.
Sitemap має показувати пошуковій системі бажану структуру індексованого сайту, а не містити всі технічно доступні адреси.
Які URL не потрібно додавати до sitemap
До карти сайту зазвичай не варто включати:
-
сторінки з тегом noindex;
-
URL, закриті в robots.txt;
-
сторінки з помилкою 404;
-
серверні помилки;
-
URL із перенаправленням;
-
дублікати;
-
неканонічні версії сторінок;
-
результати внутрішнього пошуку;
-
кошик і оформлення замовлення;
-
сторінки особистого кабінету;
-
технічні URL із параметрами;
-
тестові сторінки.
Наприклад, якщо адреса:
https://example.com/old-page/
перенаправляє на:
https://example.com/new-page/
у sitemap потрібно залишити лише кінцеву адресу /new-page/.
Якщо одна стаття доступна з кількома параметрами, але канонічною є чиста URL-адреса, у карту потрібно додавати тільки канонічну версію. Google рекомендує включати в sitemap саме ті URL, які власник сайту бажає бачити в пошуку.
Для яких сайтів sitemap особливо важливий
Карта сайту корисна практично для будь-якого проєкту, але особливе значення має для:
-
нових сайтів із малою кількістю зовнішніх посилань;
-
великих інтернет-магазинів;
-
сайтів із тисячами сторінок;
-
проєктів зі складною структурою;
-
сайтів із великою кількістю архівних матеріалів;
-
ресурсів зі сторінками, на які веде мало внутрішніх посилань;
-
сайтів із великою кількістю зображень або відео.
На невеликому сайті з якісною внутрішньою перелінковкою Google може знайти сторінки й без sitemap. Проте правильно сформована карта спрощує контроль URL і допомагає швидше помічати технічні проблеми. Google окремо зазначає, що sitemap особливо корисний для великих, складних і спеціалізованих сайтів.
Чи впливає sitemap на позиції
Наявність sitemap сама по собі не підвищує позиції сторінок.
Карта не робить контент якіснішим і не замінює:
-
оптимізацію Title та Description;
-
корисний текст;
-
внутрішні посилання;
-
зовнішні згадки;
-
швидкість завантаження;
-
правильну мобільну версію;
-
канонічні адреси;
-
відсутність технічних помилок.
Sitemap допомагає знайти URL і передати додаткову інформацію про них. Остаточне рішення щодо сканування, індексування та ранжування приймає пошукова система.
Що означає lastmod
Елемент <lastmod> показує дату останньої суттєвої зміни сторінки.
Приклад:
<lastmod>2026-08-03</lastmod>
Дату потрібно оновлювати після реальних змін:
-
редагування основного тексту;
-
додавання важливого розділу;
-
оновлення характеристик товару;
-
зміни структурованих даних;
-
суттєвого оновлення внутрішніх посилань.
Не потрібно змінювати дату щодня або після автоматичного оновлення року в підвалі сайту. Google використовує <lastmod>, якщо дані є послідовними та відповідають фактичним змінам сторінки.
Чи потрібні changefreq і priority
У старих прикладах sitemap часто зустрічаються:
<changefreq>weekly</changefreq>
<priority>0.8</priority>
changefreq нібито вказує частоту оновлення, а priority — відносну важливість URL.
Google повідомляє, що ігнорує значення <changefreq> та <priority>. Тому спеціально налаштовувати ці поля заради Google немає потреби. Значно важливіше передавати правильні URL і правдивий <lastmod>.
Обмеження XML sitemap
Один файл sitemap може містити не більше:
-
50 000 URL;
-
50 МБ у нестисненому вигляді.
Якщо сайт перевищує ці обмеження, карту потрібно розділити на кілька файлів і створити індекс sitemap.
Наприклад:
https://example.com/sitemap_index.xml
Індекс може посилатися на окремі карти:
https://example.com/post-sitemap.xml
https://example.com/page-sitemap.xml
https://example.com/product-sitemap.xml
https://example.com/category-sitemap.xml
Такий поділ також спрощує діагностику. У Google Search Console можна побачити, у якому саме файлі виникли помилки.
Як robots.txt і sitemap працюють разом
Ці файли не замінюють один одного.
Robots.txt відповідає на запитання:
Які розділи пошуковому роботу не потрібно сканувати?
Sitemap відповідає на інше запитання:
Які сторінки сайту потрібно знайти та розглянути для індексування?
Правильна логіка виглядає так:
-
важливі сторінки відкриті в robots.txt;
-
вони дозволені для індексування;
-
повертають код 200;
-
мають канонічну адресу;
-
присутні в sitemap;
-
доступні через внутрішні посилання.
Неправильна ситуація:
-
URL додано до sitemap;
-
той самий URL закритий у robots.txt;
-
на сторінці встановлено noindex;
-
канонічне посилання веде на іншу адресу.
Такі суперечливі сигнали ускладнюють обробку сайту. Карта повинна містити переважно чисті, доступні та канонічні сторінки.
Як перевірити robots.txt
Відкрийте в браузері:
https://ваш-сайт.com/robots.txt
Перевірте:
-
чи файл відкривається;
-
чи не встановлено
Disallow: /; -
чи не закриті статті, категорії або товари;
-
чи правильно вказані шляхи;
-
чи є посилання на актуальний sitemap;
-
чи немає правил, скопійованих з іншого сайту.
Після зміни robots.txt варто перевірити важливі сторінки через інструмент перевірки URL у Google Search Console.
Як перевірити sitemap
Відкрийте передбачувану адресу:
https://ваш-сайт.com/sitemap.xml
У деяких CMS карта може мати іншу адресу:
https://ваш-сайт.com/sitemap_index.xml
Перевірте, чи:
-
файл відкривається без помилки;
-
URL належать вашому домену;
-
використовується правильний протокол HTTPS;
-
немає тестового домену;
-
відсутні 404-сторінки;
-
немає URL із перенаправленням;
-
не включені сторінки noindex;
-
дати lastmod відповідають реальним оновленням.
Як додати sitemap у Google Search Console
Для надсилання карти сайту потрібно:
-
Відкрити потрібний ресурс у Google Search Console.
-
Перейти до розділу «Файли Sitemap».
-
Ввести адресу або кінцеву частину URL карти.
-
Натиснути кнопку надсилання.
-
Перевірити статус обробки.
Наприклад, якщо карта доступна за адресою:
https://example.com/sitemap_index.xml
у відповідне поле зазвичай вводять:
sitemap_index.xml
Після обробки Google Search Console може показати:
-
успішне завантаження;
-
кількість виявлених URL;
-
помилки читання;
-
недоступність файла;
-
неправильний формат;
-
проблеми з окремими вкладеними картами.
Надсилати один і той самий sitemap після кожної нової статті не потрібно. Якщо карта формується автоматично, пошукова система періодично перевірятиме її повторно. Надсилання sitemap лише повідомляє Google про його існування і не гарантує індексування URL.
Типові помилки в robots.txt
Закритий весь сайт
User-agent: *
Disallow: /
Для тестового проєкту це може бути свідомим рішенням, але на робочому сайті правило блокує сканування всіх розділів.
Закрита папка з важливими файлами
Іноді в robots.txt блокують каталоги зі стилями, скриптами або зображеннями. У результаті пошуковий робот може неправильно відобразити сторінку та не зрозуміти її повний вміст.
Спроба видалити сторінку з індексу
Disallow керує скануванням, але не гарантує видалення URL із пошуку.
Копіювання чужого файла
Однакові CMS можуть мати різні плагіни, каталоги, параметри та структуру URL. Чужі правила можуть закрити важливі сторінки.
Закриття сторінок із noindex
Якщо робот не може відкрити сторінку, він може не побачити директиву noindex.
Типові помилки в sitemap
Додавання всіх URL без перевірки
Карта не повинна бути звалищем усіх адрес, які коли-небудь створював сайт.
Наявність сторінок із помилками
URL із кодами 404 або 5xx потрібно видалити з sitemap або виправити.
Наявність перенаправлень
У карті повинна бути кінцева адреса, а не URL, який перенаправляє користувача.
Додавання noindex-сторінок
Якщо сторінка не повинна індексуватися, її не потрібно пропонувати Google через sitemap.
Неправильний домен
Після перенесення сайту в карті іноді залишаються адреси тестового домену, HTTP-версії або неправильний варіант із www.
Неправдивий lastmod
Автоматичне встановлення поточної дати для всіх сторінок не допомагає пошуковій системі та робить дані ненадійними.
Що варто перевірити на своєму сайті
Для базової технічної перевірки достатньо пройти кілька кроків:
-
Відкрити
/robots.txt. -
Переконатися, що важливі розділи не закриті.
-
Знайти адресу XML sitemap.
-
Перевірити, чи карта відкривається.
-
Переглянути, які типи URL до неї входять.
-
Видалити з sitemap помилкові, закриті та неканонічні сторінки.
-
Додати адресу sitemap до robots.txt.
-
Надіслати карту через Google Search Console.
-
Перевірити важливі URL інструментом перевірки сторінок.
-
Після змін переглянути звіт про індексування.
Robots.txt допомагає керувати доступом пошукових роботів, а sitemap показує їм важливі адреси. Правильно налаштовані файли не гарантують високих позицій, але створюють зрозумілу технічну основу для сканування та індексування сайту.