Назад к материалам

Видео + статья / Собеседования

Теория Data Science для собеседования: математика, ML и метрики

Собрали карту теории для Data Science-интервью: вероятность, линейная алгебра, регрессии, деревья, регуляризация, нейросети и ROC-AUC.

Опубликовано
Видео вышло
Видео
16:26
Текст
9 минут

Если ролик не загружается, выберите другую площадку.

Смотреть на

Теоретическая часть Data Science-интервью может за короткое время пройти путь от производной и условной вероятности до случайного леса, регуляризации и ROC-AUC. Запоминать изолированные определения тяжело. Мы предлагаем собрать темы в систему: математическая основа, модели, борьба с переобучением, нейросети и оценка качества.

Как определить нужную глубину теории

Одинаковое название должности не означает одинаковое интервью. В исследовательской команде могут подробно спрашивать статистику и устройство моделей. В продуктовой — постановку эксперимента, метрики и связь решения с бизнесом. В инженерной — код, данные и запуск модели.

До подготовки разберите описание вакансии и проекты команды. Выпишите технологии, тип задач и ожидаемый уровень. Затем разделите темы на три группы: обязательно объяснить без подготовки, повторить перед встречей и изучать только при наличии времени.

На самом интервью уточняйте формат: «Нужно дать интуитивное объяснение или вывести формулу?» Это помогает показать нужную глубину и не тратить время на неподходящую часть ответа.

Математическая база без заучивания ради заучивания

Градиент — вектор частных производных. Он показывает направление самого быстрого роста функции и лежит в основе методов оптимизации. Определитель помогает судить о свойствах линейного преобразования, а собственные значения и векторы появляются в анализе матриц и снижении размерности.

Для случайной величины нужно уверенно объяснить:

  • математическое ожидание как среднее значение в вероятностной модели;
  • дисперсию как средний квадрат отклонения от ожидания;
  • ковариацию как совместное изменение двух величин;
  • корреляцию как нормированную меру линейной связи;
  • условную вероятность как вероятность события при известном условии.

Учите не только формулу, но и ограничения. Нулевая корреляция не всегда означает независимость. Высокая корреляция не доказывает причинную связь. Маленький числовой пример помогает проговорить это точнее длинного определения.

Линейная и логистическая регрессии

Линейная регрессия предсказывает числовую цель как линейную комбинацию признаков. На интервью стоит назвать функцию потерь, смысл коэффициентов и предположения об ошибках, если вопрос уходит в статистическую постановку.

Логистическая регрессия решает задачу классификации. Линейный результат проходит через логистическую функцию и превращается в значение от нуля до единицы. Обычно модель обучают с логарифмической функцией потерь.

Не ограничивайтесь формулой. Объясните, что коэффициент меняет логарифм отношения шансов при изменении признака, а порог классификации выбирается отдельно под задачу. Для обеих моделей полезно упомянуть масштабирование признаков при регуляризации и риск утечки данных.

Деревья, случайный лес и смещение с разбросом

Решающее дерево последовательно делит пространство признаков. Поэтому монотонное масштабирование числового признака обычно не меняет порядок объектов и доступные разбиения. Но дерево легко переобучается, если разрешить ему расти без ограничений.

Случайный лес обучает много деревьев на разных выборках и подмножествах признаков, а затем усредняет результат. Это обычно снижает разброс по сравнению с одним глубоким деревом. Параметры глубины, минимального числа объектов в листе и числа признаков влияют на сложность отдельных деревьев.

Термины «смещение» и «разброс» лучше объяснять через поведение модели. Слишком простая модель повторяет систематическую ошибку — у неё высокое смещение. Слишком сложная сильно меняется от выборки к выборке — у неё высокий разброс.

Регуляризация и контроль сложности

Регуляризация добавляет к функции потерь штраф за сложность параметров. L2-регуляризация штрафует сумму квадратов весов и обычно плавно уменьшает коэффициенты. L1-регуляризация использует сумму модулей и может занулить часть коэффициентов.

Коэффициент регуляризации определяет силу штрафа. Слишком слабый почти не влияет на модель, слишком сильный ведёт к недообучению. Поэтому его выбирают на валидации, а преобразования признаков обучают только на тренировочной части данных.

Dropout и Batch Normalization в нейросетях

Dropout во время обучения случайно зануляет часть активаций. Это мешает сети слишком сильно полагаться на отдельные связи. При применении модели случайное зануление отключается, а библиотека учитывает масштаб активаций согласно выбранной реализации.

Batch Normalization нормализует промежуточные значения по мини-батчу, а затем применяет обучаемые масштаб и сдвиг. Во время применения используются накопленные статистики. Это другой механизм, поэтому нельзя объяснять Batch Normalization только как замену предварительному масштабированию входных данных.

Для инициализации весов важно нарушить симметрию между нейронами и сохранить разумный масштаб сигнала. Конкретный способ зависит от функции активации и архитектуры.

Метрики: от ROC-кривой к решению задачи

ROC-кривая показывает, как меняются доля верно найденных положительных объектов и доля ложных срабатываний при разных порогах. ROC-AUC оценивает качество ранжирования: насколько часто случайный положительный объект получает больший скор, чем случайный отрицательный.

Метрика не выбирается по привычке. При сильном дисбалансе классов дополнительно смотрят precision, recall и PR-AUC. В продукте нужен конкретный порог, который учитывает цену ошибок и доступные ресурсы.

Ниже — короткий пример корректного конвейера. Масштабирование обучается только внутри кросс-валидации, поэтому информация из проверочной части не попадает в обучение.

Пример кодаPython
from sklearn.datasets import make_classification
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import cross_val_score
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler


# Создаём небольшой воспроизводимый набор для бинарной классификации.
features, target = make_classification(
    n_samples=500,
    n_features=8,
    random_state=42,
)

# Pipeline обучает масштабирование отдельно внутри каждого разбиения.
model = make_pipeline(
    StandardScaler(),
    LogisticRegression(max_iter=1000),
)

# ROC-AUC считаем на пяти проверочных разбиениях, а не на обучающих данных.
scores = cross_val_score(model, features, target, cv=5, scoring="roc_auc")

# Среднее даёт общую оценку, разброс показывает устойчивость результата.
print(f"ROC-AUC: {scores.mean():.3f} ± {scores.std():.3f}")

На реальном проекте к этой оценке добавляют анализ данных, подбор порога и проверку на отложенном временном периоде, если данные меняются со временем.

План подготовки, который можно выполнить

Для каждой темы подготовьте ответ на 60 секунд, формулу или схему и один пример. Затем попросите коллегу задать два уточняющих вопроса. Если объяснение ломается, возвращайтесь не ко всей теме, а к конкретному пробелу.

  • Объясните ожидание, дисперсию и условную вероятность на числах.
  • Сравните линейную и логистическую регрессии.
  • Разберите переобучение дерева и случайного леса.
  • Сравните L1- и L2-регуляризацию.
  • Объясните режимы Dropout и Batch Normalization.
  • Выберите метрику и порог для двух разных бизнес-задач.

На тренажёре собеседований ЮНИКОД мы собираем вопросы по Data Science в последовательный маршрут, помогаем проверить объяснение и увидеть слабые темы до реальной встречи. Так теория становится не экзаменом на память, а инструментом уверенного профессионального разговора.

Источники

частые вопросы

Короткие ответы

Нужно ли Data Scientist помнить все формулы наизусть?

Базовые определения и формулы стоит знать, но сильный ответ включает смысл, предположения и пример применения. Редкую формулу лучше честно восстановить по шагам, чем уверенно назвать неверно.

С чего начать повторение математики?

Начните с вероятности и статистики, линейной алгебры и производных, которые используются в знакомых моделях. После каждого понятия разберите маленький числовой пример.

Как отвечать, если вопрос кажется слишком академическим?

Уточните требуемую глубину, дайте определение своими словами и свяжите его с практической задачей. Спокойный структурный ответ показывает уровень лучше, чем спор о полезности вопроса.

Какая метрика лучше для классификации?

Универсальной метрики нет. Выбор зависит от баланса классов, цены ложноположительной и ложноотрицательной ошибки, а также от того, нужен ли фиксированный порог или качество ранжирования.

следующий шаг

Повторите теорию по реальным вопросам

В тренажёре ЮНИКОД вопросы собраны по профессиям и темам, а разбор помогает превратить каждую ошибку в конкретный пункт подготовки.

Открыть вопросы Data Science →