Техничка
Robots.txt: как настроить файл и что закрывать от индексации
Разбираем robots.txt по директивам: что закрывать, что нельзя закрывать никогда, как проверить файл и какие ошибки ломают обход сайта роботом.
Robots.txt и Sitemap.xml — это базовый технический фундамент и «инструкция по эксплуатации» вашего сайта для поисковых систем Гугл и Яндекс. Файл robots.txt говорит роботу, куда заходить нельзя, а sitemap.xml показывает карту всех важных страниц, которые нужно добавить в поиск.
Неправильная настройка именно этих двух текстовых файлов — самая частая причина, по которой сайты годами не получают трафик, а их владельцы тратят сотни тысяч рублей на бесполезные ссылки. В этой статье мы разберем стандарты 2026 года, поделимся «боевым» шаблоном и покажем ошибки, которые мы регулярно находим во время наших технических аудитов.
ТОП-5 частых ошибок из наших аудитов
Когда к нам на продвижение заходит новый проект, базовая проверка robots.txt часто вскрывает катастрофические недоработки предыдущих подрядчиков. Вот антирейтинг:
1. Случайный Disallow на весь сайт
Программист разрабатывал сайт на тестовом домене и закрыл его строчкой Disallow: /. При переносе на основной домен (инструкцию по безопасному переносу читайте в гайде по переезду сайта на новый домен) он забыл удалить эту строчку. Итог: сайт месяцами вообще не индексируется.
2. Блокировка папок с CSS и JavaScript
В попытке «скрыть» код от конкурентов, вебмастера пишут Disallow: /assets/ или Disallow: /js/. В 2026 году робот Google (Googlebot) полноценно рендерит страницу как живой браузер. Если вы закрыли стили и скрипты, он увидит «сломанную» текстовую версию и пессимизирует ваш Core Web Vitals.
3. Наличие директивы Host (Устарело)
Раньше Яндекс требовал указывать главное зеркало через директиву Host: https://vash-site.ru. Яндекс отменил поддержку этой директивы еще в 2018 году (!), но мы до сих пор видим ее на 30% сайтов. Сегодня зеркала склеиваются только через 301-редирект.
4. Мусорные страницы в Sitemap.xml
Sitemap.xml — это приглашение для робота. Если в карте сайта лежат страницы с ошибкой 404, редиректами 301 или закрытые тегом noindex, робот тратит свой краулинговый бюджет впустую. В карте должны быть строго страницы со статусом 200 OK.
5. Отсутствие ссылки на Sitemap в Robots.txt
Робот не обязан угадывать, где лежит ваша карта сайта. Ссылка на неё обязательно должна быть прописана в самом конце файла robots.txt.
Идеальный шаблон robots.txt для интернет-магазина (2026)
Современный файл должен быть лаконичным. Чем меньше строчек, тем меньше шанс допустить ошибку конфликта правил.
User-agent: *
# Закрываем системные разделы
Disallow: /admin/
Disallow: /bitrix/ # Если у вас 1С-Битрикс
Disallow: /wp-admin/ # Если у вас WordPress
# Закрываем корзину и оформление заказа
Disallow: /cart/
Disallow: /checkout/
# Закрываем результаты внутреннего поиска
Disallow: /search/
Disallow: /*?q=*
# Закрываем UTM-метки и параметры сортировки
Disallow: /*?utm_*
Disallow: /*?sort=*
# Разрешаем индексацию картинок, скриптов и стилей
Allow: /assets/
Allow: /images/
# Обязательно указываем путь до Sitemap
Sitemap: https://vash-site.ru/sitemap.xml
Sitemap.xml: правила выживания для больших сайтов
Если у вас корпоративный сайт на 100 страниц, достаточно одного файла sitemap.xml, лежащего в корне сайта. Но если вы интернет-магазин, соблюдайте архитектуру:
- Лимиты файлов: Один файл
sitemap.xmlтехнически не может содержать более 50 000 ссылок или весить более 50 МБ (в несжатом виде). - Индексные карты (Sitemap Index): Если товаров больше 50 тысяч, создайте главный файл
sitemap-index.xml, внутри которого будут лежать ссылки на под-карты (например,sitemap-products-1.xml,sitemap-blog.xml). - Автоматизация: Карта сайта не должна собираться руками. В современных системах она должна генерироваться динамически при каждом добавлении или удалении товара.
Где здесь место IndexNow
Robots и sitemap отвечают за правила обхода и подсказку по структуре URL. IndexNow решает другую задачу: помогает быстрее уведомить Яндекс и Bing о новых или измененных страницах.
Это полезное дополнение, но не замена корректному robots.txt и чистой карте сайта. Если в файлах обхода хаос, один IndexNow ситуацию не вытащит. Детальную инструкцию по этому сценарию мы вынесли в гайд по диагностике индексации.
Заключение
Robots.txt должен быть максимально «свободным» для краулера, блокируя только очевидный технический мусор. Всё, что касается сборки карты сайта, её разбиения на файлы и отправки в панели вебмастеров, мы вынесли в отдельный разбор — Sitemap.xml: как собрать карту сайта и ускорить индексацию.
Сомневаетесь в своих настройках или графики индексации падают? Мы найдем технические дыры в рамках нашего профессионального аудита сайта и составим ТЗ для ваших программистов на исправление генерации Sitemap.
Тема статьи
Техническое SEO
Статьи про техническую сторону SEO: индексация и robots.txt, sitemap.xml, canonical и дубли, редиректы, Core Web Vitals и скорость, микроразметка, SPA и рендеринг. То, что решается в коде и настройках, а не в текстах.
Читайте также
Похожие статьи
301 и 302 редиректы: когда какой использовать в SEO
Чем отличаются 301 и 302 редиректы, как их видят поисковики, когда нужен постоянный перенос и какие ошибки ломают миграции.
10 минCanonical URL: как выбрать главную версию страницы и убрать дубли
Разбираем, как работает rel="canonical", когда он действительно помогает, почему не заменяет редиректы и какие ошибки чаще всего ломают индексацию дублей.
11 минКак добавить организацию в Яндекс.Бизнес и прокачать карточку в Картах
Разбираем, как добавить компанию в Яндекс.Бизнес, оформить карточку в Картах, работать с отзывами и связать профиль с сайтом для локального спроса.
10 мин