O kliencie
Klient to to globalna organizacja działająca w sektorze farmaceutycznym i rozwijająca zaawansowane rozwiązania technologiczne wspierające obszary związane ze zdrowiem i nauką.
O projekcie
Dołączysz do nowego, długoterminowego projektu, którego celem jest rozwój i utrzymanie skalowalnej platformy AI/ML stanowiącej fundament jednego z kluczowych produktów klienta.
Rola koncentruje się na infrastrukturze chmurowej w Google Cloud Platform, ze szczególnym naciskiem na środowiska GPU wykorzystywane przez obciążenia AI/ML. Będziesz pracować również nad automatyzacją infrastruktury, platformą CI/CD, zaawansowaną architekturą sieciową oraz governance środowiska obejmującego ponad 50 projektów GCP.
Model współpracy
100% zdalnie
Realizację projektu ułatwi Ci
- Praktyczne doświadczenie w projektowaniu i utrzymaniu infrastruktury GPU dla obciążeń AI/ML w Google Cloud Platform
- Znajomość GPU NVIDIA A100 H100 L4 lub T4
- Doświadczenie w konfiguracji GPU w Compute Engine lub GKE Node Pools
- Umiejętność automatyzacji instalacji sterowników GPU bibliotek CUDA oraz środowisk runtime
- Doświadczenie w zarządzaniu limitami GPU planowaniu dostępności zasobów i capacity planningu
- Bardzo dobra znajomość Terraform i języka HCL wykorzystywanych w dużych środowiskach produkcyjnych
- Doświadczenie w tworzeniu modułów Terraform zarządzaniu remote state dynamic blocks lifecycle rules oraz integracji IaC z pipeline’ami CI/CD
- Znajomość narzędzi Terragrunt tflint tfsec oraz Infracost
- Bardzo dobra znajomość Google Cloud Platform oraz pracy w środowiskach multi-project
- Doświadczenie w obszarze GCP IAM Organization Policies centralnego audytu monitoringu billing management oraz cost controls
- Praktyczna znajomość GitHub Actions oraz projektowania self-hosted runners w GCP
- Doświadczenie z runnerami wdrażanymi na VM lub GKE w tym autoscalingiem ephemeral runners i środowiskami multi-tenant
- Zaawansowana znajomość sieci w GCP obejmująca VPC DNS Cloud NAT VPC Service Controls HA VPN Cloud Interconnect oraz BGP
- Umiejętność diagnozowania problemów sieciowych z wykorzystaniem VPC Flow Logs Connectivity Tests i Firewall Insights
- Znajomość Kubernetes lub GKE
- Doświadczenie w automatyzacji CI/CD oraz wdrażaniu mechanizmów plan-review gates i approval workflows
- Swoboda w komunikacji w języku angielskim
- Samodzielność ownership oraz security-first mindset
- Umiejętność współpracy z interesariuszami planowania pracy i tworzenia dokumentacji technicznej
Mile widziane
- Doświadczenie z Kubernetes Autoscaling Runner Controller
- Znajomość Managed Instance Groups i autoscalingu sterowanego webhookami
- Doświadczenie w integracji infrastruktury GPU ze Slurm
- Praktyka w budowaniu rozwiązań zgodnych z wymaganiami compliance i governance
- Doświadczenie w optymalizacji kosztów infrastruktury chmurowej i GPU
Twój wkład do projektu
- Projektowanie wdrażanie i utrzymywanie infrastruktury GPU dla obciążeń AI/ML w GCP
- Rozwijanie skalowalnej i bezpiecznej platformy AI/ML
- Tworzenie oraz utrzymywanie infrastruktury jako kodu z wykorzystaniem Terraform
- Zarządzanie środowiskiem obejmującym ponad 50 projektów GCP
- Rozwijanie governance polityk organizacyjnych kontroli dostępu audytu oraz monitoringu
- Budowa i utrzymanie platformy GitHub Actions Self-Hosted Runners
- Projektowanie skalowalnych środowisk runnerów działających na VM oraz GKE
- Projektowanie i rozwój zaawansowanej architektury sieciowej w Google Cloud
- Automatyzacja wdrożeń infrastruktury oraz integracja narzędzi IaC z procesami CI/CD
- Zapewnienie wysokich standardów bezpieczeństwa zgodności niezawodności i kontroli kosztów
- Planowanie dostępności zasobów GPU oraz zarządzanie limitami i zapotrzebowaniem
- Diagnozowanie problemów infrastrukturalnych i sieciowych
- Współpraca z zespołami technicznymi oraz interesariuszami biznesowymi
- Raportowanie postępów i przygotowywanie dokumentacji technicznej
Tak o Ciebie zadbamy
Dołączając do Edge One Solutions, otrzymujesz pełne wsparcie w rozwoju zawodowym i osobistym, co daje Ci realną szansę na budowanie kariery zgodnie z własnymi celami.
-
Zyskujesz indywidualne wsparcie Service Delivery Managera, który pomoże Ci zaplanować ścieżkę kariery i zadba o Twój komfort i satysfakcję z pracy w projekcie
-
Szkolenia, certyfikaty i konferencje - dofinansowujemy lub w pełni pokrywamy koszty rozwoju kompetencji technicznych
-
#SmartChange – umożliwiamy zmianę projektu i dobieramy kolejny zgodnie z Twoimi preferencjami
-
Dbamy o Twój work-life balance, dlatego poza pracą oferujemy wyjścia integracyjne, aktywności sportowe i inspirujące webinary #edge1talks, które rozwijają i łączą ludzi.
-
Aktywność fizyczna – wspieramy sportowe inicjatywy i wynajem sal treningowych
-
Pakiet zdrowotny – prywatna opieka, karta sportowa, ubezpieczenie i wsparcie psychologiczne
-
Elastyczne benefity – sam decydujesz, na co przeznaczasz punkty w naszym systemie benefitowym
Nie spełniasz wszystkich wymagań, a projekt Cię zainteresował? Nie wahaj się i aplikuj. Porozmawiajmy!