Собеседование на Data Scientist в СберЗдоровье
Готовим вопросы…
Три вопроса по теме этой страницы, с объяснениями.
Содержание:
Почему СберЗдоровье — особенный работодатель для DS
При подготовке к DS-интервью в medtech полезно разбирать задачи с текстами обращений, рекомендациями и возвращаемостью пользователей. Это примеры для тренировки: конкретные задачи команды СберЗдоровья нужно сверять с описанием вакансии.
Особенность таких кейсов — чувствительные данные и разная цена ошибок. В ответе важно объяснить, какие данные доступны модели, как проверить качество и где требуется участие профильного специалиста. Для учебного проекта используйте синтетические данные или открытый набор, условия которого разрешают выбранное применение.
Это редакционный план подготовки, а не подтверждённая программа отбора СберЗдоровья. Число встреч, их длительность и требования к опыту уточняйте у рекрутера конкретной команды.
Этапы собеседования
Разделите подготовку на пять блоков ниже. Время в заголовках — ориентир для тренировочной сессии; эти блоки могут объединяться на реальном интервью или проверяться в другом формате.
1. Скрининг (30 минут)
Подготовьте рассказ о проекте: задача, ваша роль, выбранный метод, результат и ограничения. Заранее выпишите вопросы о продукте, данных и зоне ответственности DS.
2. SQL и Python (60 минут)
Потренируйте JOIN, агрегации, оконные функции и обработку пропусков. В Python разберите подготовку признаков и разделение выборки. Объясняйте, как проверяете результат и предотвращаете утечку целевой переменной.
3. ML-теория (60-90 минут)
- Classical ML
- NLP: классификация, NER (медицинские термины)
- Recsys (врачи)
- Метрики classification
4. ML system design (60 минут)
«NLP жалоб», «scoring рисков», «recsys врачей».
5. Поведенческое + финал
Разберите по схеме STAR ситуацию с неудачным экспериментом, конфликтом требований или ошибкой в данных. Покажите своё решение и то, что изменили после обратной связи.
Что СберЗдоровье ценит в DS
Точные критерии оценки зависят от вакансии. Для самостоятельной подготовки используйте следующий список навыков, а затем сопоставьте его с требованиями команды:
- Classical ML.
- NLP. Медицинский домен.
- Recsys. Врачи.
- Работа с чувствительными данными. Умение обсуждать доступы, ограничения использования и риск утечки с ответственными специалистами.
- Оценка последствий ошибок. Понимание того, почему одной общей метрики качества может быть недостаточно.
Типичные задачи и кейсы
Ниже — учебные формулировки для обсуждения, а не список действующих проектов или вопросов работодателя:
- «NLP-классификация жалоб пациентов»
- «Scoring рисков по симптомам»
- «Recsys врачей»
- «Classification рецептов / диагнозов»
- «Retention пациентов»
Как готовиться: план
- Classical ML.
- NLP базовый. TF-IDF, BERT, NER.
- Recsys.
- Работа с данными. Ограничения доступа, происхождение признаков и проверка на утечки.
- MedTech-domain.
Частые ошибки
- Игнорировать compliance. Медданные = privacy.
- NLP без domain. Медицинские термины специфичны.
- Слабая SQL.
Связанные темы
- Собеседование на DS в Sber AI
- Embeddings на собесе DS
- Accuracy vs F1
- Собеседование на PM в СберЗдоровье
- Anomaly detection на собесе DS
FAQ
Сколько этапов?
Единого подтверждённого числа этапов для всех DS-вакансий СберЗдоровья у нас нет. В статье выделены пять блоков подготовки: разговор об опыте, SQL и Python, ML-теория, проектирование решения и поведенческие вопросы. Это темы для повторения, а не обещанный маршрут отбора. До первой встречи уточните у рекрутера число секций, наличие тестового задания и формат работы с кодом.
Нужен ли medtech-опыт?
Обязательность такого опыта нужно проверять в конкретной вакансии. Если вы раньше работали в другом домене, подготовьте пример, где учитывали дисбаланс классов, цену ложноположительных и ложноотрицательных ошибок, качество разметки или ограничения доступа к данным. Покажите, как будете изучать предметную область вместе с экспертами. Не представляйте учебную модель как готовое медицинское решение.
Какой уровень SQL?
Для подготовки полезнее список задач, чем ярлык «middle». Отработайте объединение таблиц без размножения строк, агрегации, оконные функции, дедупликацию и расчёты по датам. Например, посчитайте долю пользователей, которые повторно записались в течение 30 дней, и объясните выбор знаменателя и обработку повторных событий. У рекрутера уточните SQL-диалект, разрешённые инструменты и будет ли отдельная секция по данным.
Это официальная информация?
Нет. Это материал Карьерника для самостоятельной подготовки к DS-интервью в medtech. Примеры кейсов и тренировочные блоки не подтверждают текущие проекты, внутренний стек или правила найма СберЗдоровья. Актуальные требования берите из вакансии и переписки с рекрутером; используйте статью, чтобы составить план повторения и вопросы к команде.