Ми шукаємо досвідченого hands-on DevOps/SRE-інженера для роботи з високонавантаженою bare-metal інфраструктурою та критично важливими production-системами.
ВИМОГИ: * 5+ років практичного досвіду в DevOps/SRE, включно з експлуатацією bare-metal інфраструктури та високонавантажених production-систем * Глибоке розуміння Linux internals: CPU, керування пам’яттю, файлові дескриптори, системні ліміти, IRQ affinity, NUMA тощо * Ґрунтовне знання TCP/IP і мережевого стеку Linux: життєвий цикл з’єднання, listen та accept queues, SYN backlog, TIME_WAIT, conntrack, ephemeral ports, ретрансмісії та socket limits * Досвід діагностики мережевих перевантажень, втрати пакетів, переповнення черг, вичерпання з’єднань, переповнення SYN backlog та аномальних патернів трафіку * Впевнене володіння інструментами production-діагностики: ss, tcpdump, perf, strace, /proc тощо * Досвід експлуатації й оптимізації балансувальників навантаження у високонавантажених production-середовищах * Впевнене володіння Ansible, GitLab CI, Bash і Git * Досвід роботи з Prometheus або VictoriaMetrics, Grafana та PromQL * Досвід участі в on-call ротаціях та усунення критичних production-інцидентів * Здатність самостійно ухвалювати технічні рішення, вести складні ініціативи та ділитися експертизою з іншими інженерами * Уміння читати й розуміти технічну документацію англійською мовою
Експертиза в одному з напрямів: * Go у production: pprof, goroutine dumps, execution traces і runtime-метрики; діагностика надмірних алокацій, GC pressure, витоків goroutine, lock contention, blocked I/O та некоректних мережевих таймаутів; розуміння GOGC, GOMEMLIMIT, GOMAXPROCS, connection pooling і graceful shutdown. Уміння читати Go-код і надавати розробникам обґрунтовані гіпотези щодо проблем із продуктивністю та надійністю * Балансування навантаження: досвід роботи із системами, що обробляють понад 1 мільйон запитів на секунду * Безпечне розгортання на великому парку серверів: rolling і canary deployments, health checks, версіонування та стратегії rollback * Observability і продуктивність: capacity planning, навантажувальне тестування та системний аналіз вузьких місць
БУДЕ ПЕРЕВАГОЮ: * Досвід роботи з latency-sensitive або real-time системами обробки даних * Досвід експлуатації ClickHouse, Kafka, Redis або Aerospike * Досвід роботи з AdTech/OpenRTB * Досвід роботи з MAAS/PXE, IPMI/BMC або BGP * Досвід роботи з Proxmox, FreeIPA або nftables * Практичний досвід використання AI-асистентів в інженерних процесах * Розмовна англійська на рівні B1 або вище
МИ ПРОПОНУЄМО: * Конкурентну заробітну плату * Дружню команду професіоналів * Можливості для професійного розвитку * Оплачувану відпустку та лікарняні * Корпоративні заняття англійською мовою * Медичне страхування