Likeremote

Subscribe to the latest remote jobs:

  • Likeremote jobs on https://LinkedIn.com/
  • Likeremote jobs on https://telegram.org/
  • Likeremote jobs on Reddit.com
NR

GPU Cluster Engineer (Mensch)

neura-robotics-gmbh
🇩🇪 Germany
On-site
5 months ago
  • AWS
  • Slurm
  • EKS
  • Node.js
  • IaC
  • Kubernetes
Not scoredNo CV on file. Upload one and this job gets a score out of 100.Upload CV

Deine Mission & Herausforderungen

  • Du bist die zentrale Ansprechperson fĂĽr NEURAs GPU‑Cluster-Infrastruktur – ein groĂźskaliges AWS‑HyperPod‑Setup mit topmodernen GPU‑Instanzen fĂĽr Foundation‑Model‑Training und kundenspezifische Fine‑Tuning‑Workloads.

  • Du entwickelst das Betriebsframework, baust Self‑Service‑Tools fĂĽr die ML‑Teams und arbeitest direkt mit AWS zusammen, um die Plattform auf Hyperscaler‑Ebene mitzugestalten.

  • Dein Fokus liegt voll auf Cluster Engineering & Operations — nicht auf ML‑Forschung selbst, sondern darauf, dass die Leute, die forschen, eine extrem stabile, effiziente und leicht zugängliche Infrastruktur haben.

  • Aufsetzen, Konfigurieren und kontinuierliches Weiterentwickeln der HyperPod‑Cluster von NEURA, inkl. HyperPod/Slurm und HyperPod/EKS‑Orchestrierungsmodellen.

  • Design und Umsetzung von Strategien fĂĽr Cluster-Stabilität: Node‑Failure‑Detection, automatische Job‑Recovery, Checkpoint‑Koordination und fehlertolerante Multi‑Node‑Training‑Workflows.

  • Aufbau eines Workload‑Priority‑Frameworks, das mehreren Teams und Use Cases – Pretraining, Fine‑Tuning, Kundenjobs – erlaubt, Clusterkapazität fair und effizient zu teilen.

  • Optimierung der End‑to‑End‑GPU‑Auslastung: Erkennen und Lösen von Bottlenecks in Compute, GPU‑Speicher, EFA‑Netzwerk und Storage‑Durchsatz.

  • Enge Zusammenarbeit mit den AWS HyperPod‑Produkt‑ und Engineering‑Teams: Issues eskalieren, Learnings aus einer der größten Deployments teilen und Anforderungen fĂĽr die Roadmap platzieren.

  • Bereitstellung von Self‑Service‑Tools, damit ML‑Researchers und Engineers Trainingsjobs eigenständig starten, monitoren und managen können – ohne ständige InfrastrukturunterstĂĽtzung.

  • Erstellung von Onboarding‑Dokus, Trainingsmaterial und internen Workshops, damit User effizient arbeiten, Best Practices einhalten und Kosten ihrer Workloads verstehen.

  • Infrastructure as Code ist fĂĽr dich Standard. Jede Cluster‑Konfiguration, jede Ă„nderung, jede Umgebung ist Code‑first.

  • Verantwortung fĂĽr Kosten- und Kapazitätsstrategie: Spot‑Management, Reserved‑Instance‑Planung, Savings Plans und laufende AWS‑Commitment‑Verhandlungen.

Auf was können wir uns freuen

  • 5+ Jahre Erfahrung im Infrastructure‑ oder Systems‑Engineering, idealerweise mit Fokus auf GPU‑Cluster oder HPC‑Umgebungen.

  • Tiefe praktische Erfahrung mit AWS HyperPod und AWS‑Instanzen; direkte Erfahrung mit HyperPod ist ein starker Vorteil.

  • Solides Verständnis von Slurm und Kubernetes als Orchestrierungsschichten – und die Fähigkeit, ihre Trade‑offs fĂĽr groĂźe GPU‑Workloads zu bewerten.

  • Praktisches Wissen ĂĽber Distributed Training – du weiĂźt, was Durchsatz beeinflusst und wie man Probleme debuggt.

  • Erfahrung in der Entwicklung von Self‑Service‑Tools und technischer Dokumentation fĂĽr anspruchsvolle Endnutzer: Du machst komplexe Infrastruktur zugänglich, nicht nur funktionsfähig.

  • Starkes Verständnis fĂĽr Cloud‑Kostenmanagement im groĂźen MaĂźstab: Spot‑Interruptions, Kapazitätsreservierungen, Kostenverteilung ĂĽber Teams und Workloads.

  • WohlfĂĽhlen in der Zusammenarbeit ĂĽber Teamgrenzen hinweg – deine Hauptpartner sind ML‑Forschende, aber auch Product, Finance und Cloud‑Vendors.

  • Sehr gute Englischkenntnisse; Deutsch ist ein Plus.

GPU Cluster Engineer (Mensch) · neura-robotics-gmbh

Auto apply with Likeremote