На собеседовании Data Scientist в Билайн обсуждали признаки, сокращение размерности и устойчивость модели после запуска. Заявленная в названии компенсация — около 300 тысяч рублей в месяц. Уровень позиции и окончательный результат работодателя в открытой части не уточняются.
Как правильно отбирать признаки
Отбор признаков нужен не ради минимального числа столбцов. Он должен сохранять качество на новых данных, уменьшать шум, ускорять обучение или делать модель понятнее. Метод выбирают под тип данных и модели: статистический тест, mutual information, регуляризацию, importance дерева или последовательный отбор.
Главная проверка — качество на данных, которые не использовались при выборе. Если сначала отобрать признаки на всей выборке, а потом разделить её, информация из теста попадёт в обучение. Поэтому selection включают в pipeline и выполняют внутри каждого train-fold кросс-валидации.

На синтетическом примере информативные признаки получают больший вес после отбора, а шумовые — меньший. Источник: scikit-learn.
Коротко: отбор признаков оценивают на отдельной выборке и внутри pipeline, иначе легко выбрать шум и получить утечку.
Когда использовать PCA
PCA — метод сокращения размерности. Он создаёт ортогональные компоненты: первая сохраняет максимум дисперсии, следующая — максимум оставшейся дисперсии и так далее. Это помогает сжать коррелирующие числовые признаки, визуализировать данные и иногда ускорить модель.
Перед PCA признаки обычно масштабируют, иначе столбец с большим числовым диапазоном может доминировать. Компоненты становятся комбинациями исходных признаков, поэтому объяснить влияние конкретного столбца сложнее.

Четыре исходных признака преобразованы в три компоненты; точки окрашены по классам. Источник: scikit-learn.
Коротко: PCA сокращает размерность, создавая новые компоненты, но исходные признаки после преобразования сложнее объяснять.
Как проверить стабильность модели
Стабильность состоит из двух разных задач. Первая — не падает ли качество: ROC-AUC, precision, recall или бизнес-метрика на размеченных данных. Вторая — не изменились ли входы и предсказания до появления меток.
Проверяем распределения признаков, доли пропусков, неизвестные категории и распределение score. PSI может подсветить сдвиг между базовой и текущей выборкой, но не объясняет причину и не заменяет метрику качества. Порог нельзя брать механически: он зависит от размера выборки, разбиения на интервалы и бизнес-риска.
Если одна группа клиентов изменилась сильнее остальных, общая средняя метрика способна скрыть проблему. Поэтому мониторинг режут по важным сегментам, версиям источника и времени.
Коротко: стабильность модели проверяют отдельно по качеству предсказаний и по изменению входных распределений.
Что такое Information Value
Information Value оценивает, насколько признак разделяет два класса. Значения признака делят на интервалы, для каждого считают доли событий и несобытий, затем находят Weight of Evidence и суммируют вклад интервалов.
IV особенно распространён в бинарном кредитном скоринге. Высокое значение не означает, что признак безопасно брать в модель: возможны утечка таргета, нестабильность во времени и зависимость от способа биннинга. Признак всё равно проверяют на отложенном периоде и вместе с остальными признаками.
Типичная ошибка. Называть IV универсальной важностью для любой модели.
Как лучше. Сказать, что это одномерная оценка разделения классов в конкретном разбиении, а финальное решение принимает валидация.
Коротко: Information Value измеряет разделяющую способность признака в бинарной задаче, но не заменяет валидацию модели.
Как обнаружить переобучение
Переобучение проявляется, когда модель хорошо запоминает train, но хуже работает на новых данных. Простой сигнал — растущий разрыв между обучающей и проверочной метрикой. Для временных данных нужен временной split: случайное перемешивание может дать будущую информацию прошлому.
Руководство scikit-learn по validation curves предлагает сравнивать train и validation score при изменении сложности модели. Если train высок, а validation заметно ниже, модель имеет высокую variance.
Исправление зависит от причины: упростить модель, усилить регуляризацию, остановить обучение раньше, убрать утечку, собрать больше репрезентативных данных или пересмотреть признаки. «Добавить шум ко всем признакам» может быть диагностическим экспериментом, но не универсальным лечением.
Коротко: переобучение видно по разрыву между обучающей и проверочной метрикой, а устраняют его с учётом причины.
Итог: получил бы кандидат оффер
Фактический результат в открытой записи не раскрыт. Кандидат хорошо объяснил общую цель feature selection, ограничения PCA и идею мониторинга по сегментам. Слабее прозвучали причины нестабильности и способ отделить drift от переобучения; часть гипотез осталась без плана проверки.
По нашей оценке, кандидат мог пройти дальше, если позиция предполагала уверенный middle-уровень без глубокой специализации в model monitoring. Для оффера на сильную позицию стоило точнее развести качество модели, drift признаков, PSI и переобучение.
Коротко: финальный результат не раскрыт; кандидат понимал основные темы, но несколько ответов требовали более строгой проверки.
Чек-лист подготовки
- Выполняю feature selection только внутри train-части.
- Объясняю, что теряется после PCA.
- Разделяю drift данных и падение качества.
- Называю ограничения PSI и IV.
- Выбираю split по способу появления данных.
- Предлагаю проверяемое исправление переобучения.
Источники
частые вопросы
Короткие ответы
Чем отбор признаков отличается от PCA?
Отбор сохраняет часть исходных признаков, а PCA создаёт новые компоненты как комбинации исходных. Поэтому после PCA интерпретация обычно сложнее.
Что показывает PSI?
PSI сравнивает распределение признака или score между двумя выборками. Он сигнализирует о сдвиге данных, но сам не доказывает падение качества модели.
Когда используют Information Value?
Чаще всего IV применяют для первичной оценки признаков в бинарном скоринге вместе с WoE. Решение о признаке нельзя принимать только по одному IV.
Получил ли кандидат оффер в Билайн?
В открытой записи итог работодателя не назван. Можно оценить ответы, но нельзя утверждать, что кандидат получил или не получил оффер.


