Коротко: Техническое SEO — это фундамент: если robots.txt блокирует нужные страницы, canonical указывает на неправильный URL, а sitemap.xml пустой или с мусором, сайт не попадёт в индекс даже при идеальном контенте. По данным Ahrefs (2025), до 35% страниц крупных сайтов имеют критические технические ошибки, которые съедают 20–60% органического трафика.

Техническое SEO — это не магия, а набор конкретных настроек, которые говорят поисковым роботам: что можно сканировать, какую версию страницы считать основной, какие URL важны и куда перенаправлять пользователей. Если эти настройки сделаны криво, весь бюджет на контент и ссылки уходит в пустоту. На проектах, которые мы аудируем, в 8 случаях из 10 органический трафик «не растёт» именно из-за технических косяков, а не из-за плохих текстов.

В этой статье — практический чек-лист по техническому SEO: как правильно настроить robots.txt, когда нужен rel canonical, что класть в sitemap.xml, как бороться с дублями страниц, зачем нужен 301 редирект, какие коды ответа сервера критичны и как не слить краулинговый бюджет. В конце — готовый чек-лист, который можно пройти по своему сайту за 1–2 часа.

Что такое техническое SEO простыми словами

Техническое SEO — это оптимизация технической части сайта, чтобы поисковые роботы могли быстро, полно и без ошибок просканировать страницы, понять их структуру и положить в индекс. Сюда входят файлы robots.txt и sitemap.xml, мета-теги (canonical, noindex), HTTP-коды ответа, скорость загрузки, мобильная версия и внутренняя перелинковка.

Если сравнить сайт с книгой, то техническое SEO — это оглавление, навигация и библиотечный шифр. Без них даже гениальный текст не найдут. Поисковик не угадает, какие страницы главные, и будет тратить ресурс на мусор. Подробнее о скорости и мобильной оптимизации мы писали в статьях про Core Web Vitals и mobile-first индексацию, а здесь сосредоточимся на «невидимой» части — индексации.

Robots.txt — что разрешить, а что закрыть

Robots.txt — это текстовый файл в корне сайта, который говорит роботам, какие разделы можно сканировать, а какие нет. Это рекомендация, а не запрет: злонамеренный бот проигнорирует, но Яндекс и Google следуют указаниям. Главное правило: через robots.txt нельзя закрывать страницы, которые вы хотите убрать из индекса. Для этого есть noindex — но об этом ниже.

Минимальный рабочий robots.txt

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search/
Disallow: /*?utm_
Allow: /

Sitemap: https://example.ru/sitemap.xml

Здесь мы закрываем служебные разделы (админка, корзина, внутренний поиск) и все URL с UTM-метками — они создают дубли. Закрытие /admin/ обязательно — иначе робот может случайно проиндексировать страницу входа в админку. В файле обязательно указывается путь к sitemap.xml — это ускоряет обнаружение новых страниц.

Типичные ошибки в robots.txt

Ошибка Что происходит Как проверить
Disallow: / Заблокирован весь сайт — трафик падает до нуля Яндекс Вебмастер → «Мониторинг»
Закрыт раздел с товарами Робот не видит карточки — они не в индексе Проверить URL на site:domain.ru
Не указан Sitemap Бот узнаёт о новых страницах медленно Открыть robots.txt в браузере
Закрыты страницы с пагинацией Робот не индексирует листинги каталога «Статистика сканирования» в Вебмастере
По данным Google Search Central (2025), самые частые ошибки в robots.txt — закрытие всего сайта одним правилом Disallow: / и забытая директива Sitemap. Обе ломаются за 30 секунд, но стоят сайту месяцев органического трафика.

Rel canonical — какой URL считать главным

Rel canonical — это мета-тег в HTML-коде страницы или HTTP-заголовок, который указывает поисковику основной (канонический) адрес. Если у одной и той же страницы несколько URL (например, с www и без, с параметрами сортировки, с UTM-метками), canonical говорит роботу: «вот этот адрес — главный, остальные — копии».

Canonical работает мягко: это рекомендация, а не приказ. Если указанный канонический URL отдаёт 404 или недоступен, поисковик проигнорирует подсказку. И ещё важный момент: canonical только указывает предпочтительный URL — он не объединяет страницы автоматически. Поэтому для полноценного склеивания лучше использовать 301 редирект.

Когда ставить canonical

  • Дубли каталога — одна и та же категория с разной сортировкой (/catalog/?sort=price, /catalog/?sort=name).
  • Страницы с параметрами — UTM-метки, идентификаторы сессий, фильтры в URL.
  • Синхронизация версий — страницы с www и без, http и https, с слэшем на конце и без.
  • Товары в нескольких категориях — один товар лежит в двух разделах, но канонический URL один.

Когда canonical НЕ нужен

Не надо ставить canonical с одной страницы на другую, если это разный контент. Поисковик воспримет это как попытку манипуляции и может пессимизировать обе страницы. Canonical — для дублей, не для «перекачки веса» с одной темы на другую.

Не уверены, что у сайта всё в порядке с индексацией?
Сделаем технический аудит за 3–5 дней: robots.txt, sitemap, canonical, коды ответа, дубли. Список из 50–120 конкретных правок с приоритетами.
Написать в Telegram →

Sitemap.xml — какие страницы показывать роботу

Sitemap.xml — это карта сайта в формате XML, которая перечисляет URL, которые вы хотите видеть в индексе. Это рекомендация, но в отличие от robots.txt поисковики относятся к ней серьёзно: всё, что есть в sitemap, сканируется в первую очередь. И наоборот — если страницы нет в sitemap.xml, она может попасть в индекс только через внутренние ссылки.

Что должно быть в sitemap.xml

  1. Только 200-е страницы — никаких 301, 404, 410.
  2. Только канонические URL — без UTM, без параметров сортировки.
  3. Только индексируемые страницы — если на странице стоит noindex, уберите её из sitemap.
  4. Актуальный lastmod — дата последнего изменения. Если она врёт, поисковик перестанет доверять.
  5. Разделение по типам — для крупных сайтов отдельные sitemap для страниц, товаров, изображений, новостей.

Лимиты sitemap

Параметр Лимит
URL в одном файле 50 000
Размер файла (несжатый) 50 МБ
Sitemap index до 500 sitemap на индекс
Sitemap в одном индексе до 25 000 000 URL

Если у вас интернет-магазин на 100 000 товаров — нужен sitemap index с разбивкой по категориям. Для блога на 200 страниц хватит одного файла. Залить sitemap можно в корень сайта или в любую доступную папку — главное правильно указать путь в robots.txt и в Яндекс Вебмастере / Google Search Console.

Дубли страниц — откуда берутся и как их убрать

Дубли страниц — это URL с одинаковым или почти одинаковым контентом, доступные по разным адресам. Поисковик не знает, какой из дублей ранжировать, и в худшем случае выкидывает из индекса все варианты, а в лучшем — выбирает «неправильный» и теряет на нём трафик.

Типичные источники дублей

  • www и без wwwhttps://site.ru и https://www.site.ru.
  • Слэш на конце/about и /about/.
  • HTTP и HTTPS — если сертификат настроен нестрого.
  • ID сессии в URL?PHPSESSID=abc123.
  • UTM-метки и параметры фильтрации — сохраняются при шейринге.
  • Товар в нескольких категориях — один и тот же товар доступен по двум URL.
  • Страницы пагинации/blog?page=2, /blog?page=3 часто содержат почти одинаковый контент.

Как бороться с дублями

Универсального рецепта нет — комбинируйте три инструмента: 301 редирект на основной домен и протокол, canonical для технически нужных дублей (например, страниц с фильтрами) и noindex для служебных страниц, которые не должны попадать в выдачу. Подробнее про поисковый интент — почему важно, чтобы в индексе оставались именно те страницы, которые ищут люди.

301 редирект — когда и куда перенаправлять

301 редирект — это постоянный ответ сервера, который говорит роботу и браузеру: «страница навсегда переехала на новый адрес». Весь «вес» старой страницы (PageRank, ссылочный вес, поведенческие сигналы) передаётся новому URL. Это самый правильный способ переезда и борьбы с дублями, которые образуются технически.

Когда использовать 301 редирект

  1. Смена доменаsite.runewsite.ru.
  2. Переезд на HTTPS — все HTTP-страницы → их HTTPS-версии.
  3. Склейка www — выбираете основной вариант и редиректите второй.
  4. Удаление дублей категорий/catalog/sort/price//catalog/.
  5. Перенос страниц при редизайне — старый URL → новый с сохранением смысла.

Когда НЕ надо использовать 301

Если страница временно недоступна (идёт обновление контента, проводятся работы) — используйте 302 или 307. Если страница удалена навсегда и замены нет — пусть отдаёт 404 или 410. И никогда не ставьте редирект в цепочку (A → B → C → D) — это крадёт до 10–15% веса на каждом шаге. Яндекс и Google нормально обрабатывают 3–5 редиректов в цепочке, но лучше обновлять цепочку и сокращать её.

Коды ответа сервера — что важно для SEO

Коды ответа сервера — это трёхзначные числа, которые сервер возвращает на каждый запрос. Поисковик читает их при каждом заходе на URL и принимает решения об индексации. Ниже — коды, которые критичны именно для технического SEO.

Код Что означает Влияние на SEO
200 OK Страница доступна, всё в порядке Норма — такие страницы должны быть в индексе
301 Moved Permanently Постоянный редирект Передаёт вес на новый URL, склеивает дубли
302 Found / 307 Temporary Временный редирект Не передаёт вес; использовать только для реально временных переносов
404 Not Found Страница не найдена Удалённые страницы со временем уходят из индекса — это нормально
410 Gone Страница удалена навсегда Быстрее убирается из индекса, чем 404
500 / 502 / 503 Ошибка сервера Временно выводит страницу из индекса; 503 с Retry-After сохраняет позиции
По данным Google Search Central (2025), регулярные 5xx на ключевых страницах — одна из самых частых причин «просадки» позиций после деплоя. Бот делает несколько попыток, потом выбрасывает страницу из индекса, и на её восстановление уходит 2–6 недель.

Noindex — правильное закрытие страниц от индексации

Noindex — это мета-тег <meta name="robots" content="noindex"> или HTTP-заголовок X-Robots-Tag: noindex, который запрещает поисковику добавлять страницу в индекс. В отличие от robots.txt, noindex — это приказ: робот видит страницу, читает указание и не кладёт её в индекс. Но это работает только если робот действительно смог зайти на страницу.

Главное правило: robots.txt + noindex = ошибка

Если страница закрыта в robots.txt, робот не сможет зайти на неё и прочитать мета-тег noindex. Результат — страница остаётся в индексе, потому что бот не получил указание её удалить. Чтобы убрать страницу из индекса, нужно либо открыть её в robots.txt и поставить noindex, либо использовать HTTP-заголовок X-Robots-Tag: noindex — он работает даже при закрытом robots.txt.

Где ставить noindex

  • Страницы фильтрации и сортировки каталога, которые не нужны в выдаче.
  • Служебные страницы: результаты внутреннего поиска, корзина, личный кабинет.
  • Дубли пагинации — ?page=2, ?page=3 и т. д.
  • Страницы с техническим или тестовым контентом.
  • Страницы с тонким или некачественным контентом, которые лучше не показывать в выдаче.

Краулинговый бюджет — как не слить ресурс робота впустую

Краулинговый бюджет — это ограниченный ресурс, который поисковик выделяет вашему сайту: сколько URL робот готов скачать за день. У Google и Яндекса нет точных цифр «лимита» для конкретного сайта, но он зависит от авторитетности домена, скорости ответа сервера и истории обходов. Если бот тратит ресурс на мусор — важные страницы сканируются реже и попадают в индекс с задержкой.

Что съедает краулинговый бюджет

  1. Бесконечные фильтры и сортировки — каждая комбинация фильтров создаёт новый URL.
  2. Календари, ID сессий, динамические параметры — тысячи одинаковых страниц.
  3. Товары с одинаковым описанием — особенно в больших каталогах одежды и электроники.
  4. Страницы пагинации до 50-й страницы — бот обходит их, но толку мало.
  5. Битые ссылки и 404 — каждый такой ответ тратит ресурс впустую.

Следить за обходом можно в Яндекс Вебмастере («Мониторинг → Статистика обхода») и Google Search Console («Настройки → Статистика сканирования»). Если видите резкий рост числа запрошенных URL без роста полезного контента — это сигнал, что бот ушёл в мусор.

Чек-лист по техническому SEO — что проверить перед сдачей сайта

Прошли по основным элементам — теперь соберём всё в один чек-лист. Его можно пройти по своему сайту за 1–2 часа или отдать техническому SEO-специалисту на аудит.

  1. Robots.txt — закрыты только служебные разделы, указан путь к sitemap, нет правила Disallow: /.
  2. Sitemap.xml — содержит только 200-е страницы, актуальный lastmod, нет URL с UTM и фильтрами.
  3. Canonical — указан на всех страницах с возможными дублями, ведёт на 200-й URL, не на 404.
  4. Noindex — стоит на страницах фильтрации, поиска, пагинации, тонком контенте.
  5. 301 редиректы — настроены для www, http→https, удалённых страниц и смены домена.
  6. 404 и 410 — отдаются на удалённых URL, не маскируются под 200.
  7. 5xx ошибки — нет 500/502/503 на ключевых страницах (проверить через Яндекс Вебмастер).
  8. Дубли — нет двух версий одной страницы в индексе (проверить оператор site:).
  9. Мобильная версия — контент и meta-теги совпадают с десктопной (подробнее — в статье про mobile-first).
  10. Скорость — Core Web Vitals в зелёной зоне (подробнее — в материале про LCP/INP/CLS).
  11. Внутренние ссылки — нет битых ссылок, anchor-тексты разнообразны, ключевые страницы получают достаточно ссылок.
  12. Schema.org — базовая разметка внедрена (подробнее — в полном справочнике Schema.org).

Как часто проверять техническое SEO

Техническое SEO — не разовая настройка, а регулярный процесс. После каждого релиза, смены CMS, переезда или массового добавления контента что-то ломается. Минимальный ритм проверок: после релиза — полный аудит, раз в квартал — выборочная проверка robots.txt, sitemap и кодов ответа на ключевых разделах. Если трафик просел без видимых причин — сначала проверяйте техническую часть, потом контент и ссылки.

Поведенческие сигналы (CTR, время на сайте, отказы) зависят от того, какие страницы попали в индекс. Если в индекс пролез мусор, а нужные страницы остались за бортом — никакая оптимизация мета-тегов не поможет. Подробно об этом — в статье про поведенческие факторы.

Коротко о главном

Техническое SEO — это фундамент, на котором стоит всё остальное. Главные точки контроля: robots.txt должен разрешать сканирование важных страниц и указывать путь к sitemap; sitemap.xml должен содержать только 200-е канонические URL без UTM и фильтров; canonical — стоять на технических дублях и вести на существующие страницы; 301 редирект — основной способ борьбы с дублями при переезде; коды ответа сервера — никаких 5xx на ключевых страницах; noindex — не путать с robots.txt, иначе страница так и останется в индексе. Если пройти весь чек-лист выше — 70–80% технических проблем уйдёт за один рабочий день.

Поделиться: ВК TG