Это собеседование на позицию Middle Data Scientist с акцентом на Deep Learning, NLP и распознавание речи. Компания скрыта. Кандидат уверенно знает часть классического ML, но роль требует практического опыта с нейросетями и аудио.
Почему опыт нужно сверять с профилем позиции
Короткий ответ: одинаковое название Data Scientist может скрывать совершенно разные задачи.
Одна команда ищет специалиста по табличным данным и бустингам, другая — по рекомендациям, третья — по NLP или ASR, то есть автоматическому распознаванию речи. Здесь интервьюер сразу уточняет работу со звуком, нейросетями и Hugging Face.
Перед собеседованием полезно выписать обязательные требования вакансии и подготовить по каждому реальный пример: данные, модель, метрика, собственная роль и результат. Если опыта нет, лучше честно назвать смежную базу и план переноса знаний, чем пытаться угадать детали.
Схема показывает, почему сначала определяют тип задачи и свойства данных, а уже затем выбирают семейство моделей; это ориентир, а не полный перечень тем профессии. Источник: scikit-learn.
Что нужно знать о декораторах и Hugging Face
Короткий ответ: декоратор принимает функцию и возвращает изменённое поведение, а Hugging Face предоставляет модели и инструменты, но не отменяет понимание обучения.
Нужно уметь объяснить, какие слои и параметры менялись при fine-tuning, как готовились данные, какая функция потерь использовалась и как проверялось качество. Ответ «загрузил готовую модель» недостаточен для Middle-позиции.
Разница списка и кортежа также проверяет модель объектов: список изменяем, кортеж нет, но оба хранят ссылки. Если два имени указывают на один список, изменение видно через оба имени.
Чем loc отличается от iloc
Короткий ответ: loc выбирает строки и столбцы по меткам, iloc — по целочисленным позициям.
У loc правая граница диапазона меток обычно включается, а у iloc срез работает как обычный Python-срез и не включает правую позицию. На практике важно не только помнить синтаксис, но и проверять форму результата и тип индекса.
Пайплайн подготовки данных обучают только на train-части. Если рассчитать среднее, словарь категорий или отбор признаков на всём наборе, информация из валидации попадёт в обучение.
Как выбирать метрики классификации
Короткий ответ: precision показывает чистоту положительных прогнозов, recall — полноту найденных положительных объектов.
Accuracy может выглядеть высокой, если редкий класс почти всегда предсказывать как обычный. Поэтому при дисбалансе смотрят confusion matrix, precision, recall, F1 и PR-AUC. ROC-AUC полезна для ранжирования, но тоже не заменяет выбор рабочего порога.
Например, в медицинском скрининге пропуск случая может быть дороже лишней проверки, поэтому повышают recall и отдельно контролируют precision. В дорогой ручной модерации цена ложного срабатывания может изменить приоритет.
Типичная ошибка. Выбирать accuracy по привычке, не уточнив долю классов и цену ошибок. Модель, которая почти всегда отвечает «обычный случай», может показать красивую accuracy и не решить задачу.
Как лучше. Сначала назовите положительный класс и более дорогую ошибку, затем выберите метрику и рабочий порог. Такой порядок связывает формулу с решением, которое примет продукт или специалист.
Как распознать переобучение
Короткий ответ: качество на обучении растёт, а на валидации перестаёт улучшаться или ухудшается.
Помогают регуляризация, уменьшение модели, больше данных, аугментации, ранняя остановка и корректная кросс-валидация. Но сначала нужно исключить утечку, неверное разбиение и различие распределений.
Для временных данных нельзя случайно смешивать прошлое и будущее. Для нескольких записей одного пользователя нужно следить, чтобы один человек не оказался одновременно в train и validation.
Что нужно знать для задач с аудио
Короткий ответ: как устроен сигнал, как его оцифровать и представить модели, какую архитектуру и метрику выбрать.
Частота дискретизации показывает, сколько измерений амплитуды делается в секунду. Перед моделью звук приводят к нужной частоте, нормализуют, делят на фрагменты и при необходимости строят спектрограмму или мел-признаки.
В ASR часто оценивают Word Error Rate или Character Error Rate. Для подготовки модели важны разметка текста, шум, разные дикторы и отсутствие пересечения говорящих между обучением и проверкой.
N-граммы описывают последовательности из n элементов и служат простой базой для текста. Трансформеры используют attention, чтобы учитывать связи между токенами на большом расстоянии. На Middle-интервью нужно объяснить не только название архитектуры, но и путь от сырых данных до измеримого результата.
Получил ли кандидат оффер
Короткий ответ: на этом собеседовании — нет.
Главная причина не в одной ошибке. Позиция требовала уверенного Deep Learning и опыта со звуком, а кандидат лучше ориентировался в классическом ML и базовом Python. Он путался в precision, не смог раскрыть аудиопайплайн и архитектуры на нужной глубине.
Позже кандидат нашёл другую работу. Это важный вывод: отказ может означать несовпадение с конкретным профилем, а не слабость специалиста вообще. Перед следующим интервью нужно точнее выбирать вакансии и закрывать именно требования роли.
Диагностику по темам можно пройти в тренажёре собеседований ЮНИКОД, чтобы увидеть такие расхождения до разговора с работодателем.
Источники
частые вопросы
Короткие ответы
Что должен знать Junior Data Scientist на собеседовании?
Базовый набор включает Python, NumPy и pandas, подготовку данных, обучение и проверку моделей, метрики классификации и регрессии, переобучение и основы статистики. Дополнительные темы зависят от вакансии.
Нужно ли Junior Data Scientist знать нейросети?
Если нейросети указаны в вакансии, нужно понимать базовые архитектуры, функцию потерь, оптимизацию и подготовку соответствующих данных. Для классического табличного ML глубина может быть ниже.
Как отвечать на вопрос о незнакомой предметной области?
Уточните формат данных, цель, доступное бизнес-действие и цену ошибок. Затем предложите базовый способ подготовки данных, валидации и сравнения с простым решением.


