SEO

Robots txt

Файл в корне сайта, который задает правила для поисковых роботов и определяет, какие URL им разрешено запрашивать. robots.txt управляет обходом сайта, но сам по себе не является универсальным способом запретить страницу к индексации.

Что внутри

Основные директивы – User-agent, Allow и Disallow. С их помощью задают правила для конкретного робота или группы роботов. В файле также можно указать адрес Sitemap.xml. Для Яндекса существуют отдельные роботы и директивы, связанные с обработкой контента для сервисов Алисы AI.

Важно не путать запрет обхода с запретом индексации. Например, Google может узнать о закрытом через Disallow URL из других источников и показать его в поиске без содержимого страницы. Для запрета индексации Google рекомендует использовать noindex, при этом робот должен иметь возможность просканировать URL и увидеть эту директиву.

Что это значит на практике

Ошибка в robots.txt может случайно закрыть от поисковика важные разделы сайта. После изменения структуры, CMS или правил индексации файл стоит проверять вручную.

Для кого критично

Важен для любого сайта, особенно крупного с большим количеством технических URL и отдельных правил для поисковых роботов.

Проверим ваш сайт по этим же пунктам

Посмотрим, что мешает сайту расти, и скажем, с чего начать. Бесплатно, за два рабочих дня.