Роботы поисковых систем
Если поисковый робот регулярно посещает какой-либо ресурс, это означает, что поисковая система считает его качественным. Таким образом, наиболее эффективным способом обеспечения частых визитов поискового робота является разработка такого веб-сайта, содержание которого было бы интересным, полезным и безопасным для пользователей.Способы привлечения поискового робота
Между тем существуют и чисто технические способы привлечения поискового робота, пренебрегать которыми было бы не совсем разумно. Привлечь робота и ускорить индексацию можно, выполнив следующие условия: 1. Обновление контента. Здесь действует очень простое правило: чем чаще обновляется содержание ресурса, тем выше вероятность занятия им солидных позиций в поисковой выдаче. 2. Оптимизация структуры. Необходимо регулярно анализировать структуру веб-сайта и внутреннюю перелинковку с целью удаления дублирующих друг друга страниц и статей. 3. Время загрузки страниц. Посещение поисковым роботом веб-сайта ограниченно по сроку. И если он потратит на индексацию одних страниц ресурса слишком много времени, то другие он просто-напросто проигнорирует. Во избежание этого не стоит перегружать страницы «тяжёлыми» документами, особенно в формате pdf или с большим количеством качественных иллюстраций. 4. Качественный хостинг. Нередко поисковый робот игнорирует при очередной индексации страницы того веб-сайта, который размещён на сервере, работающем некачественно или с перебоями. Для проверки работы сервера необходимо регулярно проверять аптайм и пропущенные роботом страницы при помощи приложений Google Webmaster tools или Pingdom and Monitor.us. 5.Наращивание ссылочной массы. Чем больше существует внешних ссылок, полученных посредством обмена, покупки или участия в «белых» каталогах, тем выше вероятность, что поисковый робот не пропустит страницу при очередной индексации. При этом важно помнить о том, что наращивание ссылочной массы должно выглядеть естественным. 6. Скорость индексирования. Не стоит игнорировать возможность управлять скоростью индексирования с помощью панели веб-мастеров поисковой системы Google. 7. Карта сайта. Многие авторитетные SEO-оптимизаторы считают, что создание карты значительно ускоряет индексацию веб-сайта. 8. Грамотная вёрстка. Каждая страница веб-сайта должна обязательно иметь собственный уникальный заголовок (title) и прочие мета-теги, которые содержат подобранные ключевые фразы и обеспечивают высокое ранжирование ресурса в поисковой выдаче. Читайте также: 1) Сколько покупать ссылок, чтобы вывести сайт в ТОП? 2) Почему не растут позиции сайта? 3) Что такое околоссылочный текст? 4) Ссылочное эхо или положительное снятие ссылок 5) Как сделать редирект? 6) Способы поисковой оптимизации сайтов (SEO), которых стоит избегать в 2015 году 7) Низкочастотные запросы в раскрутке сайтаКак проверить, что поисковому роботу разрешён доступ к страницам
Проверьте для нужного URL правила в файле robots.txt, метатег robots, HTTP-заголовки, код ответа сервера и указание canonical. Эти настройки отвечают за разные этапы: робот может получить страницу, но не добавить её в индекс; либо не суметь её загрузить вовсе. Поэтому доступность сайта в браузере и регулярные обновления сами по себе не гарантируют обход и индексацию каждой страницы.
Начните с robots.txt в корне сайта: обычно файл доступен по адресу домен/robots.txt. Найдите правила для User-agent, которые применяются к нужному поисковому роботу, и проверьте, не закрыт ли путь директивой Disallow. Она запрещает обход адреса, но не служит надёжным способом удаления уже известной страницы из поиска. Если на неё ведут ссылки с других сайтов, поисковик может сохранить URL в результатах без содержимого. Для удаления страницы из индекса используют другие механизмы, например noindex, при условии что робот может её просканировать.
Правила robots.txt могут различаться для разных роботов и разделов сайта. Проверьте, что нужный путь не попадает под более общее правило и что файл доступен с кодом 200, а не возвращает ошибку или перенаправление на неподходящий адрес. После изменения файла убедитесь, что правило действительно разрешает обход конкретного URL. Ошибка в одной строке может закрыть целый каталог, включая страницы, которые должны попадать в поиск.
Затем проверьте исходный HTML страницы и ответ сервера на наличие директив noindex. В HTML она обычно задаётся метатегом <meta name="robots" content="noindex">; для отдельных поисковых систем могут использоваться собственные значения name. Если робот видит такую директиву, он может исключить страницу из индекса, даже когда она открывается без ошибок и доступна через внутренние ссылки. Проверьте также, не добавляет ли noindex шаблон сайта или система управления контентом автоматически, например для страниц фильтров, результатов поиска по сайту или тестовой версии.
Ту же директиву можно передать в HTTP-заголовке X-Robots-Tag. Это часто применяют к файлам, у которых нет HTML-кода, например документам PDF. Заголовок проверяют в ответе сервера, а не только в исходном коде страницы. Если одновременно заданы разные правила для robots.txt, HTML и X-Robots-Tag, выясните, какие из них доступны роботу: закрытый в robots.txt URL поисковик может не просканировать и не увидеть размещённую на нём директиву noindex.
Проверьте, какой код ответа получает робот. Код 200 означает, что сервер передал страницу; 301 и 302 указывают на перенаправление, поэтому индексироваться может конечный адрес. Ошибки 4xx сообщают, что запрошенный ресурс недоступен, а 5xx — что сервер не смог обработать запрос. Если ошибки повторяются, поисковый робот может реже обращаться к сайту или исключить URL из индекса. Учитывайте и цепочки перенаправлений: несколько переходов подряд усложняют обход и могут привести робота не на ту страницу.
Отдельно изучите canonical — ссылку вида <link rel="canonical" href="…">, которая подсказывает поисковику предпочтительный адрес среди похожих страниц. Если canonical указывает на другую страницу, поисковик может выбрать её для индекса, а проверяемый URL считать дублем. Убедитесь, что адрес canonical доступен, отдаёт нужную страницу и не ведёт на URL с ошибкой, редиректом или запретом индексации. Для самостоятельной страницы обычно указывают её собственный адрес, если нет причины объединять её с другой версией.
Проверяйте страницу в двух представлениях: исходный ответ сервера и отрендеренный вариант, который видит робот после выполнения сценариев. JavaScript может добавить метатег, изменить ссылки или показать пустой блок, если загрузка данных завершается ошибкой. Сравните результат проверки в инструментах веб-мастеров с содержимым, которое видит обычный браузер, и проверьте, не блокируются ли необходимые файлы CSS и JavaScript.
Для первичной диагностики удобно пройтись по списку:
| Проверка | Что может помешать |
|---|---|
| robots.txt | Запрет обхода URL или всего раздела |
| meta robots | Директива noindex в HTML |
| X-Robots-Tag | Запрет индексации в HTTP-заголовке |
| Код ответа | Ошибка сервера, недоступная страница или неверный редирект |
| Canonical | Указание на другой адрес, выбранный основной страницей |
| Отрисовка | Контент не появляется или важные ресурсы недоступны роботу |
Если все настройки выглядят корректно, это ещё не подтверждает, что URL уже находится в индексе. Веб-мастера проверяют отдельно факт обхода, выбранный поисковиком canonical и состояние индексации: эти сведения помогают понять, на каком этапе возникла проблема.
Как отправить страницы на индексацию и проверить результат
Проверяйте URL в панели веб-мастера той поисковой системы, где нужно увидеть страницу в результатах. Инструмент диагностики покажет, известен ли адрес поисковику, когда его обходили, какой вариант страницы выбран основным и обнаружены ли ошибки. Если страница важная и недавно изменена, запросите переобход через доступную функцию панели. Запрос ускоряет передачу сигнала поисковой системе, но не гарантирует мгновенный обход или включение URL в индекс.
В Яндекс Вебмастере добавьте сайт и подтвердите права на него, затем используйте проверку URL и инструменты переобхода страниц. Введите полный адрес с нужным протоколом и доменом: варианты с www и без него, а также HTTP и HTTPS могут учитываться отдельно, если перенаправления настроены неправильно. По результатам проверки выясните, известен ли URL роботу, доступен ли он для обхода и есть ли причины, препятствующие появлению в поиске. Интерфейс и названия функций могут меняться, поэтому ориентируйтесь на текущие подсказки внутри панели.
Для Google Search Console применяют проверку URL в верхней строке инструмента. Она сообщает, присутствует ли адрес в индексе, когда Google в последний раз обходил страницу и какую canonical-версию выбрал. При необходимости можно запросить индексирование и запустить проверку опубликованной страницы: так легче обнаружить, какой ответ сервера или содержимое доступно роботу сейчас. Функция ограничена по частоте, а отправленный запрос ставится в очередь; многократная отправка одного адреса не превращает её в приоритетную обработку.
Перед запросом проверьте, что страница действительно готова к индексации. У неё должен быть корректный ответ сервера, доступ для робота, полезное содержание и подходящий canonical. Уберите случайный noindex, исправьте ошибку загрузки или перенаправление и убедитесь, что страница не закрыта в robots.txt. Если причина не устранена, повторный запрос обычно не меняет результат.
Отправлять на переобход каждую страницу сайта вручную не нужно. Для новых разделов добавьте URL в XML-карту сайта и укажите дату изменения, если она отражает реальное обновление содержимого. Проверьте, что карта доступна роботу и содержит канонические адреса с кодом 200. В панели веб-мастера можно передать карту на обработку и посмотреть, сколько страниц из неё известно поисковой системе. Ссылки с уже просканированных страниц также помогают роботу обнаружить новые URL.
Для срочного обновления выбирайте страницы, где изменились сведения, способные повлиять на пользователя или поисковую выдачу: цены, условия, характеристики, текст важного раздела. После публикации проверьте доступность страницы, дату изменения и внутренние ссылки на неё. Если на сайте много URL, отправляйте карту целиком, а не пытайтесь вручную обойти ограничения панели отдельными запросами.
Причину отсутствия страницы в индексе ищите по этапам. Сначала выясните, обнаружил ли её робот: отсутствие URL в отчётах может означать, что на страницу мало ссылок и она не включена в карту сайта. Затем проверьте результат обхода: ошибка 5xx, недоступность для робота или неудачная отрисовка мешают обработке. Если обход прошёл, изучите сообщение о статусе индексации и canonical. Страница может быть исключена из-за noindex, считаться дублем либо иметь мало самостоятельного содержания по сравнению с другой страницей.
Сопоставляйте данные панели с тем, что фактически отдаёт сервер. Иногда проверка сообщает о прежнем состоянии: поисковик ещё не успел повторно загрузить URL после исправления. Если панель указывает на закрытый доступ, проверьте robots.txt и ответ для конкретного робота. Если выбрана другая canonical-страница, сравните содержание и перенаправления между адресами. При статусе «обнаружена, но пока не проиндексирована» проверьте внутреннюю перелинковку, качество содержания и наличие дублей; само сообщение не означает, что нужно повторять запрос каждый день.
Сроки зависят от частоты обхода сайта, важности URL для поисковой системы, доступности сервера и качества страницы. Переобход может занять от нескольких часов до нескольких дней, а включение в индекс — больше времени; точного срока панели обычно не обещают. Если прошло несколько дней, проверьте статус повторно и устраните указанную причину. Постоянно отправлять один и тот же URL без изменений не требуется.
Как составить и поддерживать XML-карту сайта
В XML-карту включают страницы, которые должны появиться в поиске: доступные для обхода, отвечающие кодом 200 и имеющие канонический адрес на самом сайте. Не добавляйте URL с перенаправлением, ошибкой, директивой noindex, закрытые от обхода в robots.txt страницы и технические варианты с параметрами, если они не являются самостоятельными страницами. Карта помогает роботу обнаружить URL, но не заставляет поисковую систему индексировать его.
Для каждой страницы указывайте абсолютный адрес, включая протокол и домен. Адрес в карте должен совпадать с каноническим URL, который задан в rel="canonical" или выбран настройками сайта. Если несколько адресов ведут на одну страницу, оставьте в карте только основной. Проверьте также единый формат домена, слешей в конце пути и регистра символов: поисковые системы могут считать варианты разными URL.
Поле lastmod заполняйте датой реального изменения содержимого страницы. Перестановка блоков навигации, обновление счётчика или автоматическая замена даты в шаблоне не должны менять это значение. Если дата обновляется при каждом формировании карты, робот перестаёт использовать её как сигнал свежести. Указывать changefreq и priority необязательно: поисковые системы не обязаны учитывать эти подсказки.
Размер файла и количество URL определяют, делить ли карту на части. По протоколу в одном файле допускается не более 50 000 URL и размер не более 50 МБ до сжатия. Если сайт больше или карта приближается к лимиту, создайте отдельные файлы для типов страниц или разделов, а затем объедините их в индексный файл. Например, отдельно можно хранить адреса товаров, категорий и публикаций. Так проще найти источник ошибки и обновлять карту частями.
| Ситуация | Что сделать |
|---|---|
| До 50 000 URL и 50 МБ | Использовать один XML-файл |
| Превышен один из лимитов | Разделить URL на несколько файлов |
| Несколько файлов карты | Добавить их адреса в sitemap index |
| Частые изменения каталога | Генерировать карту автоматически при обновлении данных |
Проверьте синтаксис XML: у документа должна быть корректная кодировка UTF-8, открывающие и закрывающие теги должны совпадать, а специальные символы в адресах — быть экранированы. Каждый URL разместите в элементе <loc>, дату — в <lastmod> при наличии достоверных данных. После генерации выборочно откройте несколько адресов из файла и проверьте код ответа, директивы индексации и канонический URL. Ошибка в одном шаблоне может привести к появлению сотен неподходящих адресов.
Разместите карту по постоянному адресу, например /sitemap.xml, и укажите его в robots.txt директивой Sitemap:. Затем добавьте файл в инструменты веб-мастеров нужных поисковых систем. Отправка подтверждает поисковику, где искать список URL, но сама по себе не гарантирует их обход или включение в индекс. В панели проверяйте дату последнего чтения, число обнаруженных адресов и сообщения об ошибках.
Если инструмент сообщает о недоступности файла, проверьте, что сервер отвечает кодом 200 и не требует авторизации. При ошибках разбора найдите некорректный тег или символ. Если обнаружены URL, закрытые от индексации или перенаправляющие, исправьте генератор: не удаляйте из карты отдельные строки вручную, если они будут созданы заново при следующем обновлении. После правки повторно отправьте файл и убедитесь, что отчёт обновился.
Пересобирайте карту после появления, удаления или смены канонического адреса страниц. Для крупных сайтов полезно регулярно сравнивать список из карты с базой CMS и обходом сайта: так выявляются потерянные URL, дубли и страницы, которые случайно остались в выгрузке после удаления. При переносе раздела сначала настройте постоянные перенаправления, затем обновите карту так, чтобы в ней остались конечные адреса.
Как оценить обход сайта по логам сервера
Журнал сервера показывает, какие адреса запрашивали роботы, когда это произошло и какой ответ получил каждый запрос. Обычно в записи есть время, IP-адрес, метод запроса, URL, код ответа, объём переданных данных и строка User-Agent. По этим полям можно увидеть, какие разделы робот посещает часто, какие URL пропускает, где встречает ошибки и сколько запросов уходит на технические адреса.
Сначала отберите запросы, в User-Agent которых указано название поискового робота. Одной этой строки недостаточно: её может подставить обычный скрипт или посторонний сканер. Для Google проверяют обратное DNS-разрешение IP, а затем убеждаются, что имя хоста при прямом разрешении возвращает тот же адрес; для Яндекса сверяются с официальными диапазонами IP или проверочными способами, доступными в его инструментах веб-мастера. Не подтверждённые таким образом запросы не следует считать визитами поискового робота.
Обрабатывать логи удобнее за сопоставимый период, например за несколько недель, и группировать запросы по разделам и кодам ответа. Перед подсчётом нормализуйте URL: удалите параметры аналитики, приведите варианты слешей к одному виду и отделите страницы от файлов. Иначе один и тот же материал может выглядеть как множество разных адресов, а статистика обхода окажется завышенной.
| Что проверить | Что искать в логах |
|---|---|
| Частота обхода | Число запросов к каждому разделу за период |
| Доступность | Коды 4xx и 5xx, тайм-ауты, повторные запросы |
| Перенаправления | Цепочки 3xx и старые адреса, которые всё ещё запрашиваются |
| Бесполезные URL | Параметры сортировки, фильтры, внутренний поиск, дубли |
| Редко посещаемые страницы | URL, которые должны индексироваться, но почти не запрашиваются |
Высокая частота запросов сама по себе не означает, что раздел хорошо индексируется. Робот может тратить запросы на пагинацию с параметрами, бесконечные фильтры, дубли страниц или служебные файлы. Сопоставьте адреса из логов с XML-картой, каноническими адресами и правилами обхода. Если робот снова и снова запрашивает один URL с разными параметрами, проверьте, нужны ли эти варианты пользователям и поиску; при необходимости ограничьте генерацию ссылок на них или настройте обработку параметров.
Редкие визиты тоже требуют проверки контекста. Новая страница может ещё не успеть попасть в расписание обхода, а старый материал с малым спросом не обязательно нуждается в частом посещении. Для важных и доступных страниц выясните, есть ли на них внутренние ссылки, присутствуют ли они в карте сайта и не закрыты ли ошибочно правилами robots.txt, метатегом `noindex или HTTP-заголовком. Сравните последний запрос робота с датой публикации и обновления содержимого.
Коды ответа помогают отделить сбои от ожидаемого поведения. Код 200 означает успешную передачу страницы, но не подтверждает её качество или индексацию. Повторяющиеся 404 могут указывать на удалённые адреса, на которые сайт продолжает ссылаться; 5xx и тайм-ауты говорят о проблемах сервера, приложения или перегрузке. Коды 301 и 302 проверьте на лишние переходы: длинная цепочка расходует запросы, а перенаправление на нерелевантный адрес сбивает робота с нужного пути.
Чтобы приоритизировать исправления, оцените не только число ошибок, но и их масштаб. Сначала разбирайте сбои, затрагивающие важные разделы или большое количество URL, затем — повторяющиеся перенаправления и технические обходы, после — единичные ошибки малозначимых страниц. Например, сотни запросов к несуществующим комбинациям фильтров обычно требуют изменения шаблона ссылок или правил обхода, а не ручной обработки каждого адреса. После исправления повторно проверьте логи: число запросов к проблемным URL должно уменьшиться, а доля успешных ответов важных страниц — вырасти.
Для регулярного контроля сохраняйте исходные журналы и сравнивайте одинаковые интервалы. Если после релиза резко выросли ответы 5xx или робот перестал запрашивать раздел, это помогает связать изменение поведения с конкретной технической правкой. При этом логи показывают факт обращения к серверу, а не решение поисковика о включении страницы в индекс; сведения об индексировании проверяйте отдельно в панели веб-мастера.
Как обеспечить индексацию страниц с JavaScript и другими форматами контента
Поисковому роботу нужно получить содержимое страницы и понять, какие адреса ведут на другие материалы. На сайте с JavaScript эти задачи могут выполняться в несколько этапов: сначала робот загружает исходный HTML, затем при необходимости запускает скрипты и обрабатывает отрисованную страницу. Если нужный текст или ссылки появляются только после выполнения кода, их обнаружение может задержаться или не состояться.
По возможности передавайте основное содержание уже в исходном HTML. Для этого используют серверный рендеринг или предварительную генерацию страниц: сервер отдаёт заголовок, текст, метаданные и ссылки, а JavaScript отвечает за интерактивные элементы. Такой подход помогает роботу обработать страницу даже в случае, если выполнение скриптов затруднено.
Если сайт формирует контент в браузере, проверьте, что скрипты и данные для их работы доступны роботу. Не закрывайте в файле robots.txt каталоги с JavaScript, стилями и API, от которых зависит отображение основного текста. При этом открытый скрипт сам по себе не гарантирует индексацию: важно, чтобы после его выполнения на странице появились читаемый текст, корректный заголовок и внутренние ссылки.
Для перехода между разделами используйте обычные ссылки с адресом в атрибуте href. Кнопки, обработчики событий и ссылки вида javascript:void(0) могут работать для посетителя, но не всегда дают роботу понятный путь к следующей странице. Внутренние ссылки должны вести на конечные URL, без цепочек редиректов и параметров, создающих множество дублей.
После изменений проверьте страницу средствами для веб-мастеров: сравните исходный HTML с отрисованным вариантом и убедитесь, что робот видит основной текст, заголовки и ссылки. Проверяйте также страницы при отключённых скриптах или с медленным соединением. Если содержимое появляется только после прокрутки, нажатия кнопки или авторизации, оно может остаться недоступным для обхода.
Состояние загрузки имеет значение: ответ сервера должен содержать подходящий код, а важные страницы не должны отдавать пустой экран или ошибку. Проверьте, что содержимое доступно без обязательного входа в личный кабинет, если оно предназначено для индексации. Для страниц, которые не нужно показывать в поиске, задайте соответствующие ограничения отдельно, не закрывая случайно весь раздел.
Документы и изображения поисковый робот обнаруживает по ссылкам и картам сайта, а не по одному факту их визуального отображения. Файл, подставленный через скрипт или доступный только после нажатия, может остаться незамеченным. Размещайте адрес документа в обычном HTML-ссылке с понятным текстом: например, «Скачать инструкцию в PDF». Добавляйте важные файлы в карту сайта, если формат и настройки сайта это позволяют.
PDF-документы должны открываться без авторизации и содержать текстовый слой, если нужно индексировать их содержание. Сканированные страницы без распознанного текста робот может трактовать как изображения. Для таких файлов подготовьте HTML-страницу с кратким описанием и ссылкой на документ; это также поможет пользователю понять, что находится внутри.
Изображения размещайте в элементе <img> с доступным адресом файла. Указывайте содержательный alt, который описывает изображение в контексте страницы, и не заменяйте им текст вокруг картинки. Если изображение загружается только после прокрутки, настройте отложенную загрузку так, чтобы робот мог получить его адрес из HTML или обработать соответствующий атрибут. Для важных изображений можно использовать карту сайта изображений и проверить, что файл не закрыт от обхода.
При большом количестве графики следите за размером файлов и стабильностью адресов. Удаление или перенос документа без перенаправления разрывает ссылку, а одинаковые файлы по разным адресам могут затруднить выбор версии для индексации. О том, как изображения используют для привлечения поискового трафика, можно прочитать в материале продвижение картинками.
Материал подготовлен практикующим специалистом по маркетингу
Михаил Каржин — Вебмастер, маркетолог, преподаватель и специалист по рекламным технологиям. Разрабатываю сайты, рекламные кампании и стратегии продвижения для бизнеса. Работаю с Яндекс Директ, SEO, контентом, аналитикой и комплексным интернет-маркетингом. Пишу полезные статьи и книги.













