Что проверяли на собеседовании
Позиция объединяла задачи Data Scientist и NLP-инженера в банке. Поэтому интервьюер переходил от кредитного скоринга и классического машинного обучения к поиску, RAG и большим языковым моделям. Такой формат проверяет не число выученных терминов, а способность связать модель с бизнес-задачей и довести решение до эксплуатации.
Кандидат заметно сильнее отвечал про NLP-системы, чем про классический ML. Это не помешало ему показать главную ценность: практический опыт построения решений, которые работают с корпоративными документами и реальными ограничениями.
Что важнее в скоринге: precision или recall
Короткий ответ: сначала определяем положительный класс и цену двух ошибок. Только после этого выбираем метрику.
Допустим, модель рекомендует одобрить кредит. Тогда false positive — одобрение рискованного заёмщика — может стоить банку денег. Высокий precision среди одобренных заявок становится важным. Если модель, наоборот, ищет все подозрительные операции, пропуск опасного случая может быть дороже ложной тревоги — тогда нужен высокий recall.
В сильном ответе кандидат добавляет, что метрика зависит от порога. Кривая precision–recall в документации scikit-learn показывает этот обмен: улучшая полноту, мы часто теряем точность, и наоборот.

Кривая помогает выбрать рабочий порог, а не спорить о метрике в отрыве от задачи. Источник: scikit-learn.
Как построить ML-пайплайн для кредитного скоринга
Ответ удобно строить по порядку: бизнес-цель, данные, схема валидации, базовая модель, улучшения и мониторинг. Для временных кредитных данных случайное перемешивание может дать слишком оптимистичную оценку, поэтому разделение часто делают по времени.
После проверки качества данных мы собираем baseline, фиксируем метрику и только потом подбираем гиперпараметры. Optuna автоматизирует поиск конфигурации, но не заменяет корректную валидацию. SHAP и feature importance помогают понять вклад признаков, однако важность ещё не доказывает причинную связь.
Хорошее завершение ответа: после запуска следим за дрейфом данных, качеством решений и бизнес-метрикой. Модель, которая была точной на исторической выборке, со временем может потерять качество.
Когда нужен файнтюнинг NLP-модели
Файнтюнинг — дополнительное обучение готовой модели на данных конкретной задачи. Он полезен, когда есть качественная размеченная выборка, стабильный сценарий и измеримый выигрыш по сравнению с базовым решением.
Начинать с файнтюнинга необязательно. Для корпоративного ассистента сначала часто выгоднее улучшить документы, разбиение текста, поиск и подсказку модели. Если ошибка находится в retrieval, дополнительное обучение генератора её не исправит. На интервью стоит предложить эксперимент: baseline без файнтюнинга, набор контрольных запросов, новая версия и сравнение качества, цены и задержки.
Чем отличаются MAP и MRR
Обе метрики оценивают ранжированный список, но отвечают на разные вопросы.
| Метрика | Что измеряет | Когда особенно полезна |
|---|---|---|
| MRR | Насколько высоко находится первый релевантный результат | Когда пользователю достаточно одного точного ответа |
| MAP | Насколько хорошо расположены все релевантные результаты по нескольким запросам | Когда важно качество всей выдачи |
Если верный документ оказался первым, reciprocal rank равен 1. Если четвёртым — 1/4. MRR усредняет эти значения по запросам. Для MAP сначала считается average precision по каждому запросу, затем результаты усредняются.
Бэггинг, бустинг и стекинг
Бэггинг обучает независимые модели на разных выборках и объединяет их ответы. Так Random Forest снижает разброс отдельных деревьев. Бустинг строит модели последовательно: каждая следующая исправляет ошибки ансамбля. Стекинг передаёт прогнозы нескольких моделей метамодели, которая учится их сочетать.
На собеседовании мало назвать три определения. Добавьте выбор: бэггинг — когда нестабильная модель переобучается; бустинг — когда нужна высокая точность на табличных данных; стекинг — когда разные модели делают непохожие ошибки и есть строгая валидация без утечки.
Как устроены RAG и HyDE
RAG сначала находит подходящие фрагменты документов, затем передаёт их языковой модели как контекст. Рабочая цепочка выглядит так: подготовка документов → разбиение на части → индекс → поиск → реранжирование → генерация ответа со ссылками.
Гибридный поиск соединяет точность ключевых слов с семантической близостью векторов. После него реранкер поднимает самые полезные фрагменты. HyDE добавляет ещё один шаг: модель создаёт гипотетический документ-ответ, его представление используется для поиска похожих реальных документов. Метод может улучшить сложные запросы, но добавляет задержку и требует отдельной проверки на контрольном наборе.
Получил ли кандидат оффер
Да. В классическом ML были пробелы: ответы про подбор параметров, интерпретацию и метрики ранжирования стоило сделать точнее. Зато кандидат уверенно раскрыл RAG, гибридный поиск, работу с корпоративными документами и ограничения LLM-систем.
Мы бы сохранили сильную специализацию и отдельно закрыли короткий список основ: выбор метрик по цене ошибок, временную валидацию, инструменты подбора параметров и ансамбли. Такой план усиливает профиль без попытки одинаково глубоко выучить весь ML.
- Я могу объяснить цену false positive и false negative для своей задачи.
- Я строю ответ про пайплайн от бизнес-цели до мониторинга.
- Я различаю MAP, MRR и продуктовую метрику поиска.
- Я называю не только архитектуру RAG, но и способ её проверки.
- Я могу честно обозначить пробел и предложить план решения.
Источники
частые вопросы
Короткие ответы
Что важнее в банковском скоринге: precision или recall?
Универсального ответа нет. Сначала задают положительный класс и считают цену false positive и false negative, затем выбирают метрику и порог решения.
Нужно ли Data Scientist знать и классический ML, и RAG?
Для гибридной роли — да. Глубина может различаться, но кандидат должен уверенно объяснять базовые метрики, валидацию, ансамбли и архитектуру поиска.
Как проверить ответы до настоящего интервью?
Ответьте вслух по схеме «цель — решение — проверка — ограничение» и пройдите мок-собеседование. Так быстро видны знания, которые пока не складываются в связный ответ.


