PL
AWS Observability Architect
PeopleNTech LLC
πΊπΈ United States
On-site
3 months ago
- AWS
- Grafana
- OpenTelemetry
- EC2
- EKS
- ECS
- AIOps
- FinOps
- RBAC
- CloudWatch
- Mimir
- Prometheus
- Loki
- OpenSearch
- Elasticsearch
- Incident Response
- PagerDuty
- Opsgenie
- ServiceNow
- Incident Management
- YAML
- JSON
- Terraform
- GitOps
- Jaeger
- Zipkin
- X-ray
- Fluent Bit
- Java
- Python
- Node.js
- Microservices
- CloudTrail
- VPC
- RDS
- API Gateway
- Datadog
- New Relic
- Splunk
- Nagios
- Zabbix
- Devops
- Kubernetes
3 months ago
Location: Warren, NJ (Onsite)
Fulltime ($160 - $170K PA) Don't stop profiles on Salary
Indent: TBC (will share tomorrow)
We are seeking a highly skilledAWS Observability Architect with deep, hands-on expertise in designing and implementing enterprise-grade observability platforms on AWS β withGrafana as the primary observability tool andOpenTelemetry as the instrumentation standard. This is a technical specialist role requiring genuine implementation experience, not platform familiarity.
The ideal candidate has personally architected and delivered large-scale observability solutions for production AWS environments β building telemetry pipelines, designing dashboards that operations teams actually use, and creating alerting frameworks that reduce MTTR rather than add noise. You understand the full observability stack: from application instrumentation with OpenTelemetry SDKs through to Grafana dashboards consumed by SREs, on-call engineers, and engineering leadership.
This role sits at the intersection of cloud infrastructure, software engineering discipline, and operational excellence β requiring someone who can design an enterprise observability architecture in the morning, write a Grafana dashboard query in the afternoon, and advise a development team on OpenTelemetry instrumentation strategy the next day.
Key Responsibilities
Observability Architecture & Strategy
- Define and own theenterprise observability architecture for AWS environments β establishing the target-state design across the four pillars of observability: metrics, logs, traces, and events.
- Designend-to-end telemetry pipelines β from instrumentation at the application and infrastructure layer through collection, processing, storage, and visualisation β with Grafana as the enterprise observability platform.
- Developobservability standards and reference architectures β defining how AWS workloads across compute (EC2, EKS, ECS, Lambda), storage, networking, and managed services should be instrumented, collected, and visualised consistently across the organisation.
- Establishsignal-to-noise discipline across the observability platform β designing alerting frameworks that surface actionable signals, eliminate false positives, and ensure on-call engineers are alerted only when human intervention is genuinely required.
- Defineobservability maturity roadmaps for client environments β assessing current-state coverage, identifying gaps, and building a phased improvement plan from reactive monitoring to proactive, AIOps-ready observability.
- DriveFinOps for observability β optimising telemetry data volumes, retention policies, and Grafana Enterprise licensing costs to ensure the observability platform itself does not become a significant cost centre.
Grafana Enterprise Implementation
- Architect, deploy, and operateGrafana Enterprise orGrafana SaaS as the primary observability platform β including high-availability Grafana deployment on AWS (EKS-based or managed via Grafana Cloud), data source federation, RBAC configuration, and enterprise plugin management.
- Design and implementGrafana data source integrations across the AWS observability ecosystem:
- Amazon CloudWatch β metrics, logs, and alarms as a core AWS data source
- Grafana Mimir β for scalable, long-term Prometheus-compatible metrics storage
- Grafana Loki β for cost-efficient, label-based log aggregation at scale
- Grafana Tempo β for distributed tracing storage and trace-to-log-to-metric correlation
- Amazon Managed Service for Prometheus (AMP) β for AWS-native Prometheus metrics
- Amazon OpenSearch β for log analytics and full-text search use cases
- Elasticsearch / OpenSearch β for existing log infrastructure integration
- Build and maintain aGrafana dashboard library β covering infrastructure health, application performance, SLO/SLA tracking, capacity planning, cost visibility, incident response, and executive reporting β using reusable, variable-driven, and consistently styled templates.
- ImplementGrafana alerting at enterprise scale β including alert routing, notification policies, silence management, and integration with PagerDuty, OpsGenie, ServiceNow, and Slack for multi-channel incident notification.
- ConfigureGrafana RBAC and team structures β designing role hierarchies, folder permissions, and data source access controls that enable self-service dashboarding for development teams while protecting sensitive operational data.
- Deploy and manageGrafana Oncall for on-call scheduling and alert routing, or integrate Grafana alerting with existing incident management platforms.
- ImplementGrafana SLO (Service Level Objectives) β defining, tracking, and reporting error budgets across production services, enabling data-driven reliability decisions.
- ManageGrafana as code β using Grafana's provisioning capabilities (YAML/JSON), Terraform provider, and Grizzly/Grafonnet for dashboard version control, environment promotion, and GitOps-based dashboard management.
OpenTelemetry Implementation
- Define and lead the organisation'sOpenTelemetry (OTel) instrumentation strategy β establishing standards for automatic and manual instrumentation across application stacks running on AWS.
- Design and deploy theOpenTelemetry Collector as the central telemetry processing layer β including:
- Collector deployment patterns: agent (DaemonSet on EKS), gateway (centralised), and sidecar configurations
- Receiver configuration β OTLP, Prometheus, Jaeger, Zipkin, AWS X-Ray, CloudWatch, Fluent Bit
- Processor pipeline design β batch processing, memory limiting, attribute enrichment, tail-based sampling, and resource detection processors
- Exporter configuration β routing telemetry to Grafana Mimir (metrics), Grafana Loki (logs), Grafana Tempo (traces), AMP, and CloudWatch
- InstrumentAWS workloads with OpenTelemetry SDKs across languages (Java, Python, Node.js, Go) β including auto-instrumentation for containerised EKS workloads, Lambda instrumentation using OTel Lambda layers, and ECS task definition instrumentation.
- Implementdistributed tracing using OpenTelemetry β establishing trace propagation standards across microservices, configuring context propagation (W3C TraceContext, B3), and ensuring end-to-end trace visibility from frontend to backend to database.
- DesignOTel-based log correlation β enriching logs with trace IDs and span IDs to enable trace-to-log navigation in Grafana, supporting faster RCA during incidents.
- ImplementOTel-based metric instrumentation β defining custom business and application metrics alongside system metrics, following OTel semantic conventions for consistent metric naming and attribute tagging across services.
- Definesampling strategies for distributed traces β including head-based sampling for development environments and tail-based sampling (via OTel Collector) for production environments, balancing observability coverage with storage cost.
- ManageOTel Collector as infrastructure β including horizontal scaling, resource limits, high-availability deployment, collector health monitoring, and pipeline performance optimisation.
AWS Observability Services Integration
- Design theintegration architecture between AWS-native observability services and Grafana β positioning Grafana as the unified observability plane while leveraging AWS-native services as data sources:
- Amazon CloudWatch β metrics, logs, alarms, dashboards, Contributor Insights, and Synthetics
- Amazon Managed Grafana (AMG) β evaluating and advising on AMG vs self-managed Grafana deployment decisions
- Amazon Managed Service for Prometheus (AMP) β remote write from OTel Collector and Prometheus agents, recording rules, and alert manager integration
- AWS X-Ray β ingesting X-Ray traces into Grafana Tempo or directly via Grafana X-Ray data source
- AWS CloudTrail β audit log integration for security and compliance observability
- VPC Flow Logs β network observability integration for security monitoring and traffic analysis
- Implementinfrastructure-level observability for core AWS services β EC2 (CloudWatch agent, Node Exporter via OTel), EKS (kube-state-metrics, cAdvisor, OTel DaemonSet), RDS (Enhanced Monitoring, Performance Insights), Lambda (OTel Lambda layer, custom metrics), and API Gateway (access logs, CloudWatch metrics).
- Designbusiness and synthetic monitoring β implementing Grafana Synthetic Monitoring or CloudWatch Synthetics for endpoint availability, API health, and user journey monitoring with Grafana alerting integration.
Delivery & Enablement
- Leadobservability implementation projects end-to-end β from requirements gathering and architecture design through deployment, dashboard development, alert tuning, and team enablement.
- Conductobservability maturity assessments for client environments β evaluating current monitoring coverage, tool sprawl, alert quality, and SLO definition maturity, and producing prioritised remediation roadmaps.
- Develop and deliverobservability enablement workshops for engineering and operations teams β covering OTel instrumentation, Grafana dashboard development, alert design, and on-call best practices.
- Produceobservability architecture documentation β reference architectures, runbooks, onboarding guides, and dashboard documentation that enable teams to self-serve and maintain the platform.
- Advise onobservability tool consolidation β helping organisations rationalise fragmented monitoring estates (Datadog, New Relic, Splunk, Nagios, Zabbix) toward a unified Grafana + OTel platform, including migration planning and cost impact analysis.
Experience
- 10+ years of overall experience in cloud infrastructure, platform engineering, or DevOps.
- 5+ years of hands-on AWS experience in production environments β not advisory or oversight roles.
- 3+ years of hands-on Grafana Enterprise or SaaS implementation experience β designing, deploying, and operating Grafana at enterprise scale, including Mimir, Loki, Tempo, and the LGTM stack.
- Proven experience implementingOpenTelemetry in production environments β including OTel Collector deployment, SDK-based instrumentation, and distributed tracing implementation.
- Demonstrated experience buildingproduction-grade observability pipelines β from instrumentation through collection, processing, storage, and visualisation.
- Hands-on experience withPromQL for metrics querying and alerting β including complex queries, recording rules, and alert expression design.
- Experience withLogQL (Grafana Loki) for log querying and log-based alerting.
- Hands-on experience deployingobservability infrastructure on Kubernetes (EKS) β including Prometheus Operator, OTel DaemonSets, Grafana deployment, and persistent storage configuration.
- Experience withGrafana as code β provisioning dashboards, data sources, and alert rules via YAML, Terraform, or Grafonnet.
AWS Observability Architect Β· PeopleNTech LLC