Распределение задач направления, контроль качества и сроков их выполнения.
Устранение инцидентов и разработка мер по их предотвращению (troubleshooting, написание post-mortem).
Взаимодействие с командами разработки, DevOps и эксплуатации в рамках задач по развитию платформы(Hadoop, HBase, Jupyterhub, zeppelin, Hue, Kafka, Yarn, Kubernetes).
Оптимизация процессов автоматизации развертывания, обновлений систем и сервисов.
Обеспечение отказоустойчивости системы и подготовка к масштабированию в условиях растущих объемов данных.
Настройка мониторинга (инфраструктурный/прикладной/мониторинг бизнес-метрик, создание dashboard и правил alerting).
Опыт руководства/наставничества в небольшой команде от 2-х лет.
Опыт работы с Kubernetes (k8s) уровня управления pods, namespace, helm, конфигурациями развертывания.
Опыт сопровождения распределенных систем, таких как HDFS, YARN, HBase, Kafka.
Опыт работы с мониторингом - визуализация метрик(построение дашбородов в Grafana), и алертингом(prometheus) в высоконагруженных системах.
Желательно владение скриптовыми языками, такими как Python, Bash.
Опыт работы с инструментами CI/CD (GitLab) - push, pull, fetch, ветвление, построение пайплайнов.