Теоретическая часть Data Science-интервью может за короткое время пройти путь от производной и условной вероятности до случайного леса, регуляризации и ROC-AUC. Запоминать изолированные определения тяжело. Мы предлагаем собрать темы в систему: математическая основа, модели, борьба с переобучением, нейросети и оценка качества.
Как определить нужную глубину теории
Одинаковое название должности не означает одинаковое интервью. В исследовательской команде могут подробно спрашивать статистику и устройство моделей. В продуктовой — постановку эксперимента, метрики и связь решения с бизнесом. В инженерной — код, данные и запуск модели.
До подготовки разберите описание вакансии и проекты команды. Выпишите технологии, тип задач и ожидаемый уровень. Затем разделите темы на три группы: обязательно объяснить без подготовки, повторить перед встречей и изучать только при наличии времени.
На самом интервью уточняйте формат: «Нужно дать интуитивное объяснение или вывести формулу?» Это помогает показать нужную глубину и не тратить время на неподходящую часть ответа.
Математическая база без заучивания ради заучивания
Градиент — вектор частных производных. Он показывает направление самого быстрого роста функции и лежит в основе методов оптимизации. Определитель помогает судить о свойствах линейного преобразования, а собственные значения и векторы появляются в анализе матриц и снижении размерности.
Для случайной величины нужно уверенно объяснить:
- математическое ожидание как среднее значение в вероятностной модели;
- дисперсию как средний квадрат отклонения от ожидания;
- ковариацию как совместное изменение двух величин;
- корреляцию как нормированную меру линейной связи;
- условную вероятность как вероятность события при известном условии.
Учите не только формулу, но и ограничения. Нулевая корреляция не всегда означает независимость. Высокая корреляция не доказывает причинную связь. Маленький числовой пример помогает проговорить это точнее длинного определения.
Линейная и логистическая регрессии
Линейная регрессия предсказывает числовую цель как линейную комбинацию признаков. На интервью стоит назвать функцию потерь, смысл коэффициентов и предположения об ошибках, если вопрос уходит в статистическую постановку.
Логистическая регрессия решает задачу классификации. Линейный результат проходит через логистическую функцию и превращается в значение от нуля до единицы. Обычно модель обучают с логарифмической функцией потерь.
Не ограничивайтесь формулой. Объясните, что коэффициент меняет логарифм отношения шансов при изменении признака, а порог классификации выбирается отдельно под задачу. Для обеих моделей полезно упомянуть масштабирование признаков при регуляризации и риск утечки данных.
Деревья, случайный лес и смещение с разбросом
Решающее дерево последовательно делит пространство признаков. Поэтому монотонное масштабирование числового признака обычно не меняет порядок объектов и доступные разбиения. Но дерево легко переобучается, если разрешить ему расти без ограничений.
Случайный лес обучает много деревьев на разных выборках и подмножествах признаков, а затем усредняет результат. Это обычно снижает разброс по сравнению с одним глубоким деревом. Параметры глубины, минимального числа объектов в листе и числа признаков влияют на сложность отдельных деревьев.
Термины «смещение» и «разброс» лучше объяснять через поведение модели. Слишком простая модель повторяет систематическую ошибку — у неё высокое смещение. Слишком сложная сильно меняется от выборки к выборке — у неё высокий разброс.
Регуляризация и контроль сложности
Регуляризация добавляет к функции потерь штраф за сложность параметров. L2-регуляризация штрафует сумму квадратов весов и обычно плавно уменьшает коэффициенты. L1-регуляризация использует сумму модулей и может занулить часть коэффициентов.
Коэффициент регуляризации определяет силу штрафа. Слишком слабый почти не влияет на модель, слишком сильный ведёт к недообучению. Поэтому его выбирают на валидации, а преобразования признаков обучают только на тренировочной части данных.
Dropout и Batch Normalization в нейросетях
Dropout во время обучения случайно зануляет часть активаций. Это мешает сети слишком сильно полагаться на отдельные связи. При применении модели случайное зануление отключается, а библиотека учитывает масштаб активаций согласно выбранной реализации.
Batch Normalization нормализует промежуточные значения по мини-батчу, а затем применяет обучаемые масштаб и сдвиг. Во время применения используются накопленные статистики. Это другой механизм, поэтому нельзя объяснять Batch Normalization только как замену предварительному масштабированию входных данных.
Для инициализации весов важно нарушить симметрию между нейронами и сохранить разумный масштаб сигнала. Конкретный способ зависит от функции активации и архитектуры.
Метрики: от ROC-кривой к решению задачи
ROC-кривая показывает, как меняются доля верно найденных положительных объектов и доля ложных срабатываний при разных порогах. ROC-AUC оценивает качество ранжирования: насколько часто случайный положительный объект получает больший скор, чем случайный отрицательный.
Метрика не выбирается по привычке. При сильном дисбалансе классов дополнительно смотрят precision, recall и PR-AUC. В продукте нужен конкретный порог, который учитывает цену ошибок и доступные ресурсы.
Ниже — короткий пример корректного конвейера. Масштабирование обучается только внутри кросс-валидации, поэтому информация из проверочной части не попадает в обучение.
from sklearn.datasets import make_classification
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import cross_val_score
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
# Создаём небольшой воспроизводимый набор для бинарной классификации.
features, target = make_classification(
n_samples=500,
n_features=8,
random_state=42,
)
# Pipeline обучает масштабирование отдельно внутри каждого разбиения.
model = make_pipeline(
StandardScaler(),
LogisticRegression(max_iter=1000),
)
# ROC-AUC считаем на пяти проверочных разбиениях, а не на обучающих данных.
scores = cross_val_score(model, features, target, cv=5, scoring="roc_auc")
# Среднее даёт общую оценку, разброс показывает устойчивость результата.
print(f"ROC-AUC: {scores.mean():.3f} ± {scores.std():.3f}")На реальном проекте к этой оценке добавляют анализ данных, подбор порога и проверку на отложенном временном периоде, если данные меняются со временем.
План подготовки, который можно выполнить
Для каждой темы подготовьте ответ на 60 секунд, формулу или схему и один пример. Затем попросите коллегу задать два уточняющих вопроса. Если объяснение ломается, возвращайтесь не ко всей теме, а к конкретному пробелу.
- Объясните ожидание, дисперсию и условную вероятность на числах.
- Сравните линейную и логистическую регрессии.
- Разберите переобучение дерева и случайного леса.
- Сравните L1- и L2-регуляризацию.
- Объясните режимы Dropout и Batch Normalization.
- Выберите метрику и порог для двух разных бизнес-задач.
На тренажёре собеседований ЮНИКОД мы собираем вопросы по Data Science в последовательный маршрут, помогаем проверить объяснение и увидеть слабые темы до реальной встречи. Так теория становится не экзаменом на память, а инструментом уверенного профессионального разговора.
Источники
частые вопросы
Короткие ответы
Нужно ли Data Scientist помнить все формулы наизусть?
Базовые определения и формулы стоит знать, но сильный ответ включает смысл, предположения и пример применения. Редкую формулу лучше честно восстановить по шагам, чем уверенно назвать неверно.
С чего начать повторение математики?
Начните с вероятности и статистики, линейной алгебры и производных, которые используются в знакомых моделях. После каждого понятия разберите маленький числовой пример.
Как отвечать, если вопрос кажется слишком академическим?
Уточните требуемую глубину, дайте определение своими словами и свяжите его с практической задачей. Спокойный структурный ответ показывает уровень лучше, чем спор о полезности вопроса.
Какая метрика лучше для классификации?
Универсальной метрики нет. Выбор зависит от баланса классов, цены ложноположительной и ложноотрицательной ошибки, а также от того, нужен ли фиксированный порог или качество ранжирования.


