SEO

Robots txt

Файл в корне сайта, который задает правила для поисковых роботов и определяет, какие URL им разрешено запрашивать. robots.txt управляет обходом сайта, но сам по себе не является универсальным способом запретить страницу к индексации.

Что внутри

Основные директивы – User-agent, Allow и Disallow. С их помощью задают правила для конкретного робота или группы роботов. В файле также можно указать адрес Sitemap.xml. Для Яндекса существуют отдельные роботы и директивы, связанные с обработкой контента для сервисов Алисы AI.

Важно не путать запрет обхода с запретом индексации. Например, Google может узнать о закрытом через Disallow URL из других источников и показать его в поиске без содержимого страницы. Для запрета индексации Google рекомендует использовать noindex, при этом робот должен иметь возможность просканировать URL и увидеть эту директиву.

Что это значит на практике

Ошибка в robots.txt может случайно закрыть от поисковика важные разделы сайта. После изменения структуры, CMS или правил индексации файл стоит проверять вручную.

Для кого критично

Важен для любого сайта, особенно крупного с большим количеством технических URL и отдельных правил для поисковых роботов.

We will check your site against the same points

We will see what holds the site back and tell you where to start. Free, within two business days.