Logo for Outcoding

SRE

Role overview

Qualifications

  • Professional experience in Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering or Operations.
  • Hands-on experience with critical services and production environments.
  • Strong knowledge of Linux and troubleshooting infrastructure and applications.
  • Experience with cloud computing platforms.

Responsibilities

  • Design and implement automation solutions to reduce manual operational tasks in production environments.
  • Implement and evolve observability practices using metrics, logs, and traces to understand service behavior.
  • Define and maintain SLIs and SLOs in collaboration with development teams and business stakeholders.
  • Participate in incident response and on-call schemes, performing diagnostics, containment, and service recovery.

Key facts

Hard skills

Other skills

  • Troubleshooting (Problem Solving)
  • Resilience
  • Teamwork
  • Collaboration

About the company

Outcoding logo

Outcoding

IT Services & IT Consulting

Welcome to Outcoding, an EX Squared company - your premier nearshore outsourcing solution provider! Combining technical expertise with creative execution, we serve as a subsidiary of the renowned technology services provider, EX Squared. With over two decades of experience in the software industry, we excel in delivering high-quality solutions for businesses worldwide.Our team consists of creative minds and technical experts who imagine, build, and evolve digital futures for organizations across the globe. Experience the best of technology and innovation with Outcoding.

Company details

Company typeSME
IndustryIT Services & IT Consulting
Company size501 - 1000

Your match analysis

See how your profile stacks up against this role.

We compared the job requirements to your profile to show where you're strong and where you fall short.

Job description

En EX Squared LATAM somos una empresa de transformación digital enfocada en desarrollar soluciones tecnológicas innovadoras y de alto impacto que generan valor real para el negocio. Trabajamos con clientes de primer nivel en mercados globales, regionales y locales, fomentando una cultura colaborativa, inclusiva e impulsada por la innovación, donde las ideas de cada persona realmente importan.

Buscamos un/a Site Reliability Engineer (SRE) con experiencia sólida en operación de servicios críticos y entornos productivos, que combine conocimientos de cloud, automatización, observabilidad y gestión de incidentes para contribuir a la construcción y evolución de plataformas tecnológicas confiables, resilientes y escalables.

La posición trabajará de manera cercana con equipos de desarrollo y plataforma, promoviendo prácticas de confiabilidad desde el diseño hasta la operación y equilibrando la estabilidad de los servicios con la velocidad de entrega de cambios.

Tipo de posición: Tiempo completo, long-term.

Responsabilidades

  • Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
  • Implementar y evolucionar prácticas de observabilidad, utilizando métricas, logs y trazas para entender el comportamiento de los servicios.
  • Definir y mantener SLIs y SLOs en conjunto con equipos de desarrollo y stakeholders del negocio.
  • Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios.
  • Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
  • Promover el modelo “you build it, you run it”, incorporando prácticas de confiabilidad desde el desarrollo.
  • Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD.
  • Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
  • Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
  • Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.

Requisitos

  • Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
  • Experiencia hands-on trabajando con servicios críticos y ambientes productivos.
  • Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones.
  • Experiencia con plataformas de cloud computing.
  • Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
  • Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis.
  • Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
  • Experiencia con automatización y scripting.
  • Conocimiento de CI/CD y procesos modernos de deployment.
  • Experiencia con Infrastructure as Code, idealmente Terraform.
  • Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
  • Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.

Deseable

  • Experiencia con AWS y arquitecturas cloud-native.
  • Experiencia con Terraform y automatización de infraestructura.
  • Experiencia con Docker y Kubernetes.
  • Conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
  • Experiencia trabajando con estrategias de High Availability y Disaster Recovery.
  • Experiencia en análisis de capacidad, performance y escalabilidad.
  • Experiencia participando en esquemas de on-call y gestión de incidentes críticos.
  • Certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.

Beneficios

  • Seguro médico privado.
  • Asociación solidarista.
  • Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
  • Oportunidades de aprendizaje y crecimiento profesional.
  • Participación en proyectos tecnológicos de alto impacto.

Nota de elegibilidad

Esta oportunidad está disponible únicamente para candidatos que residan actualmente en Costa Rica. Aplicaciones fuera de esta región no serán consideradas.

Apply once. Then go straight to the hiring manager.

After you apply, unlock the direct contact details of the people who actually make the call. A quick follow-up makes you 5x more likely to land an interview.

MR

Marcus Rivera

Chief Revenue Officer

m.rivera@company.com
linkedin.com/in/marcusrivera
Unlocked after you apply
·

Related jobs

Other jobs at Outcoding

Premium

Reach out to the hiring manager directly.

Gain access to the contact details of the hiring managers who actually decide, and reach out to network with them directly. That, plus more when you upgrade:

  • Full match report with fit score and gaps
  • Career diagnostics on how recruiters read you
  • Curated company matches and warm intros
  • 48h early access to new roles

Cancel anytime.