MasterServerБлог › robots-ili-noindex

Використання robots.txt

← усі статті

Усі, хто стикався з розробкою або просто використанням сайтів, чули про такий термін як robots.txt.
Це спеціальний файл із кодуванням UTF-8, який має знаходитися в корені домену (https://mypersonaldomen.com/robots.txt) і важити не більше 500 Кб. Команди в цьому файлі рекомендують (але не гарантують) пошуковим роботам Google, Yandex та іншим виконувати ті чи інші вказівки. Наприклад, ми можемо попросити ботів не індексувати сторінки з реєстрацією, формою пошуку, особистим кабінетом клієнтів або будь-яку іншу сторінку.
Важливо розуміти, що це просто рекомендації, які ми хочемо передати, однак це не дає 100% гарантії. Якщо на закриту сторінку в robots.txt буде знайдено внутрішнє або зовнішнє посилання, то існує певна ймовірність, що сторінка все одно потрапить до індексу пошукової видачі.

Синтаксис файлу robots.txt

User-Agent: вказує назву бота пошукової системи, до якого будемо звертатися.

Disallow: шлях до сторінки, куди хочемо закрити доступ.

Crawl-delay: команда, що вказує, як часто має робот пошукової системи заходити на сайт.
Іноді може бути корисно при великій відвідуваності, для зменшення навантаження на сервер.

На замітку:

  • Символ #: використовується для коментарів усередині файлу robots.txt
  • Файли та папки потрібно писати, враховуючи їхній регістр
  • Host: директива для Яндекс, яка вказує головне дзеркало сайту
  • Sitemap: тут прописується повний шлях з https до карти сайту
  • * - цей знак позначає будь-яку послідовність символів

Приклад використання файлу robots.txt

Забороняємо індексацію всіх сторінок (корисно при розробці нового сайту):
User-agent: *
Disallow: /

Заборонимо роботу від google індексувати папку /tmp
User-agent: Googlebot
Disallow: /tmp/

Заборонимо роботу від google індексувати файл /provider.html
User-agent: Googlebot
Disallow: /tmp/provider.html

Заборонимо всім ботам індексувати файли .pdf
User-agent: *
Disallow: /*.pdf$

Дозволимо роботам Яндекс індексувати сторінку provider.html
User-agent: Yandex
Allow: /tmp/provider.html

Шлях до карти сайту:
User-agent: *
Disallow:
Sitemap: https://mypersonaldomen.com/sitemap.xml

Для чого використовується мета тег noindex

На відміну від наших рекомендацій у файлі robots.txt, ми можемо вказати для ботів пошукових систем гарантовану заборону індексації сторінки.
Для цього в HEAD сторінки потрібно прописати рядок:

<meta name="robots" content="noindex, follow"> - заборонити індексацію, але дозволити переходити за посиланнями на поточній сторінці

<meta name="robots" content="noindex, nofollow"> - заборонити як індексацію, так і переходити за посиланнями на поточній сторінці