About The Position

We are seeking a skilled Grafana Engineer with 4–6 years of experience in designing, implementing, and maintaining enterprise monitoring and observability solutions. The ideal candidate will have hands-on expertise in Grafana, Prometheus, Loki, OpenTelemetry, Splunk, Kubernetes, and cloud monitoring platforms. The role involves building dashboards, configuring alerts, integrating multiple monitoring data sources, implementing observability strategies, automating monitoring infrastructure, and collaborating with DevOps, SRE, Infrastructure, and Application Support teams to ensure the reliability, availability, and performance of enterprise applications.

Requirements

  • 4–6 Years Monitoring & Observability Engineering
  • Site Reliability Engineering (SRE)
  • DevOps / Platform Engineering
  • Grafana
  • Grafana Enterprise
  • Grafana Alerting
  • Prometheus
  • Loki
  • Tempo
  • OpenTelemetry
  • PromQL
  • LogQL
  • Splunk
  • Elasticsearch
  • OpenSearch
  • InfluxDB
  • AWS CloudWatch
  • Azure Monitor
  • Google Cloud Operations (GCP)
  • Kubernetes
  • Docker
  • CI/CD
  • Terraform
  • Ansible
  • Python
  • Bash
  • Shell Scripting
  • PowerShell
  • Metrics
  • Logs
  • Distributed Tracing
  • Root Cause Analysis (RCA)
  • Incident Management
  • Performance Monitoring
  • Strong analytical and troubleshooting skills
  • Excellent communication skills
  • Stakeholder management
  • Problem-solving mindset
  • Team collaboration
  • Documentation and knowledge sharing
  • Ability to work independently
  • Bachelor's degree in Computer Science, Information Technology, Engineering, or a related field.

Nice To Haves

  • OpenTelemetry AIOps
  • Dynatrace
  • Datadog
  • AppDynamics
  • New Relic
  • Prometheus Federation
  • Service Mesh Monitoring

Responsibilities

  • Design, develop, and maintain Grafana dashboards and visualizations.
  • Build operational, infrastructure, application, and business monitoring dashboards.
  • Configure Grafana Alerting, notification channels, and alert rules.
  • Administer and maintain Grafana Enterprise environments.
  • Optimize dashboards for usability and performance.
  • Design enterprise observability solutions covering: Metrics, Logs, Distributed Traces.
  • Implement monitoring strategies for: Kubernetes clusters, Containers, Virtual Machines, Cloud Infrastructure, Enterprise Applications.
  • Configure proactive monitoring and alerting to reduce downtime.
  • Perform root cause analysis using monitoring and log data.
  • Integrate Grafana with enterprise monitoring platforms including: Prometheus, Loki, Tempo, OpenTelemetry, Elasticsearch / OpenSearch, InfluxDB, SQL Databases, Splunk, AWS CloudWatch, Azure Monitor, Google Cloud Operations (GCP).
  • Implement cloud-native monitoring solutions on: AWS, Microsoft Azure, Google Cloud Platform (GCP).
  • Monitor containerized workloads and Kubernetes clusters.
  • Support enterprise platform observability.
  • Automate dashboard deployment using Infrastructure-as-Code (IaC).
  • Implement CI/CD pipelines for monitoring configurations.
  • Use: Terraform, Ansible.
  • Develop automation scripts using: Python, Bash, PowerShell.
  • Tune monitoring systems to reduce alert fatigue.
  • Perform capacity planning.
  • Conduct system performance analysis.
  • Optimize monitoring configurations for scalability.
  • Create monitoring standards and operational runbooks.
  • Maintain technical documentation.
  • Ensure monitoring platform security and governance.
  • Implement access control and monitoring best practices.
© 2026 Teal Labs, Inc
Privacy PolicyTerms of Service