К содержанию

Как работает поиск Yottis

Коротко и по существу: что происходит между тем, как вы нажали «Найти», и тем, как на экране появились десять ссылок. Без метафор про «библиотеку с карточками»: тут настоящая последовательность шагов.

Четыре этапа

1. Обход

Робот скачивает страницы, переходя по ссылкам. Порядок задаёт очередь, в которой у каждого адреса есть вес: чем чаще страница меняется и чем больше на неё ссылаются, тем раньше до неё дойдут. Перед обходом читается robots.txtпроверить свой файл можно тем же кодом, которым читает его наш робот.

Мы вежливы: не больше запроса в секунду к одному хосту по умолчанию, и мы замедляемся сами, если сервер начал отвечать медленнее. Подробности — на странице о роботе.

2. Разбор

Из скачанного HTML извлекается содержательный текст: заголовок, тело, подписи. Меню, подвал и блоки «читайте также» отбрасываются — иначе каждая страница сайта выглядела бы одинаково, потому что общего у них больше, чем своего.

Отдельно читается структурированная разметка: она сообщает то, чего в тексте нет явно, — что это рецепт, товар или статья. Проверить свою разметку.

3. Индексация

Слова приводятся к основам («покупка», «покупки», «покупкой» становятся одним словом) и складываются в обратный индекс: для каждого слова — список страниц, где оно встречается, с позициями. Позиции нужны для поиска по точной фразе.

Одновременно считается отпечаток текста: страницы, отличающиеся только рекламой, склеиваются в одну.

4. Ранжирование

По запросу из индекса отбирается около тысячи кандидатов, а дальше их несколько раз пересортировывают, каждый раз дороже и точнее. На последнем шаге работает модель, обученная на оценках асессоров — людей, которые размечают выдачу по инструкции.

Учитывается около трёхсот пятидесяти признаков. Главные группы: совпадение слов запроса с текстом, ссылки на страницу, качество самой страницы, свежесть, регион и язык.

Чего мы не делаем

Частые вопросы

Как быстро Yottis находит новую страницу?

Зависит от того, как часто меняется сайт. Ленту новостей мы обходим каждые несколько минут, страницу, не менявшуюся год, — раз в несколько недель. Ускорить обход можно картой сайта: укажите её в robots.txt или в кабинете вебмастера.

Почему моя страница не в индексе?

Причин ровно одиннадцать, и все они перечислены в кабинете вебмастера напротив каждого адреса. Чаще всего это запрет в robots.txt, метатег noindex, ошибка ответа сервера или указание на другой канонический адрес. Свободного текста в причинах нет: список закрыт, чтобы его можно было прочесть и исправить.

Влияет ли скорость сайта на позицию?

Да, но слабо и только при прочих равных. Медленный сайт с точным ответом окажется выше быстрого без ответа. Скорость — признак, а не наказание.

Что делать, если сайт взломали?

Мы уведомим вас в кабинете с перечнем затронутых адресов и фрагментом найденного кода. Взломанный сайт — жертва, а не нарушитель, и предупреждение в выдаче показывается только при подтверждении на нескольких загрузках. После исправления запросите проверку из кабинета.

Как убрать страницу из выдачи?

Оставьте её открытой для обхода и поставьте метатег noindex. Запретив страницу в robots.txt, вы запрещаете нам прочитать сам запрет: чтобы увидеть noindex, страницу надо загрузить.

Можно ли купить позицию в выдаче?

Нет. Рекламные блоки помечены и стоят отдельно от результатов; на порядок результатов они не влияют. Тот, кто предлагает вам «продвижение по договорённости с поиском», предлагает то, чего не существует.