БИЗНЕС И ЦИФРОВИЗАЦИЯ

Как Авито проводит performance review для DS и ML-команд

Авито проводит performance review дважды в год по два месяца: тимлид Alina Babenko описала, как оценивают DS и ML-специалистов.

✍️ Редакция iTech News | 16.05.2026 | ⏱ 5 мин | 👁 3 | Источник: Habr / Карьера
💼

В Авито performance review для DS- и ML-команд идет дважды в год и занимает по два месяца за цикл. Для рынка, где разговоры о прозрачном росте часто заканчиваются туманными формулировками и субъективными оценками, это важный кейс: компания с тысячами сотрудников публично раскладывает по шагам, как именно проверяет вклад инженеров, менеджеров и претендентов на повышение.

О процессе рассказала Алина Бабенко, тимлид команды Auction Efficiency в Авито, под руководством которой работают 12 data scientists. По данным Habr / Карьера, ее команда отвечает за то, чтобы в поиске и рекомендациях Авито корректно учитывались разные целевые действия продавцов: клики, сделки и звонки. Этой зимой Бабенко провела уже четвертый цикл review как менеджер и описала механику изнутри: от самооценки и сбора отзывов до менеджерской защиты и финальной калибровки.

Сама логика performance review в большой компании у Авито построена вокруг вполне приземленной проблемы: когда в департаменте сотни людей, вклад конкретного специалиста легко потерять, а требования к одинаковым грейдам в разных командах начинают расползаться. Иными словами, мидл в одной группе может выглядеть сильнее синьора в другой просто потому, что команды живут в разных локальных нормах. Review здесь нужен не как ритуал ради HR-отчетности, а как попытка выровнять ожидания для одной роли во всех направлениях, будь то поиск, монетизация или автомодерация.

Процесс состоит из нескольких этапов. Сначала сотрудник сам описывает, что сделал за последние полгода: какие задачи вел, зачем они были нужны и к чему привели. Важная деталь, которую часто недооценивают в похожих системах, состоит в обязательной опоре на артефакты. В review можно приложить pull request, результаты A/B-теста, дизайн-документы и ссылки на OKR. Для этого в Авито используют внутреннюю платформу с говорящим названием «Перфоратор»: туда заносятся цели, респонденты, артефакты и привязка к целям. На бумаге это выглядит бюрократией, но на практике снижает главный риск любого performance review: обсуждать не сделанную работу, а чье-то общее впечатление о человеке.

Следом собираются отзывы коллег и смежников. Здесь Авито подчеркивает еще одну вещь, которая заметно отличается от привычного «поставьте пару теплых комментариев»: оценивается не личность, а конкретная работа и ее эффект. Внутри компании даже есть обучающее видео о том, как писать такие отзывы. Вместо реплики в духе «он классно справился» ожидается объяснение, какой именно результат принесла работа и почему он был важен для команды или юнита. Негативная обратная связь тоже должна быть прикладной: не «мне не понравилось», а что именно стоит изменить в коммуникации, сроках, мониторинге или процессе. Более того, если менеджер видит слабый по содержанию отзыв, он может вернуть его автору на доработку.

После этого начинается управленческая часть, где система уже проверяется на прочность. Менеджер пишет «защиту» сотрудника: краткий текст с описанием достижений, их оценкой и аргументами, почему человек заслуживает конкретный результат или повышение. Затем идут калибровки, где менеджеры презентуют своих людей и обсуждают оценки между собой. Для лидов это, судя по описанию, самая напряженная часть: нужно быстро объяснить, что именно сделал специалист, ответить на вопросы о сложности задачи, доказать масштаб вклада и одновременно разбираться в кейсах других сотрудников, чтобы голосовать по ним. Внутри одного грейда для сравнения обычно случайным образом выбирают одного специалиста с хорошим результатом, а остальных соотносят уже с этим ориентиром.

Ключевой инструмент в этой схеме — матрица компетенций. Именно она должна не дать performance review превратиться в соревнование по ораторскому мастерству менеджеров. Для каждого грейда описаны обязательные навыки, а затем review за последние полгода сверяют с этим списком. Если специалист находится на уровне мидла, то и оценка строится не по принципу «человек в целом нравится», а по вопросу, продемонстрировал ли он нужные компетенции на практике. У Авито, как пишет Бабенко, несколько вариантов итоговой оценки: от недостаточного результата с зонами роста и коррекционным планом до промо, если сотрудник уже работает на следующем уровне. Есть и промежуточный вариант, когда результат очень высокий, но для перехода не хватает части компетенций.

Для российского IT-рынка этот кейс интересен не тем, что кто-то в очередной раз придумал форму самооценки. Самооценки умеют делать все. Сложнее построить систему, где инженер заранее понимает, какие доказательства нужны для разговора о росте, а менеджер не может протащить решение одной харизмой. Особенно это чувствительно для DS- и ML-команд, где результат часто размазан между экспериментами, инфраструктурой, качеством данных, влиянием на метрики и совместной работой с продуктом. Когда вклад специалиста не сводится к одной закрытой задаче в Jira, без артефактов, отзывов и калибровок разговор о повышении быстро превращается в вкусовщину.

Есть и менее приятная сторона, о которой статья прямо не спорит, но из описания она хорошо видна. Такой performance review требует от сотрудников не только делать работу, но и регулярно документировать ее, собирать подтверждения и правильно упаковывать результат. Для сильных, но не слишком публичных инженеров это может быть отдельным навыком, без которого реальный вклад оказывается недооценен. Менеджерам тоже не легче: защита команды, участие в калибровках и проверка отзывов превращаются в полноценный управленческий контур, который съедает время и требует дисциплины не меньше, чем найм или планирование квартала.

На этом фоне главный вопрос не в том, фикция ли performance review, а в другом: сколько российских IT-команд готовы довести такую систему до состояния, где она действительно работает на рост, а не на производство красивых форм. История Авито показывает, что прозрачность в оценке появляется не из деклараций, а из довольно скучной, но жесткой конструкции: артефакты, единые критерии, отзывы по делу и публичная для менеджеров калибровка решений.

Поделиться: Telegram X LinkedIn