DevOps Engineer

DevOps Engineer

토스플레이스 소속
정규직
초기 멤버

합류하게 될 팀에 대해 알려드려요

  • 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 제품과 서비스가 성장하는 과정에서도 안정적인 결제 경험과 매장 운영을 제공할 수 있도록 신뢰성과 확장성을 중요한 가치로 생각해요.
  • Server Platform Team은 제품들이 빠르고 안정적으로 개발·배포·운영될 수 있는 공통 기술 기반을 만들어요. DevOps Engineer는 AWS, Kubernetes와 Istio를 기반으로 Cloud Native 플랫폼을 설계하고 운영해요.
  • 서비스와 트래픽의 성장을 안정적으로 수용하려면 플랫폼의 용량과 변경 위험을 예측 가능하게 관리하고, 반복되는 운영 업무를 도구와 자동화로 전환해야 해요. 장애가 발생했을 때 시스템 상태를 빠르게 파악하고 복구할 수 있는 기반도 함께 만들어가고 있어요.
  • DevOps Engineer는 현재 플랫폼의 구조와 운영 방식을 진단하고, Cloud, Kubernetes, Service Mesh, 배포 플랫폼, IaC와 Observability 기반을 아우르는 주요 기술적 의사결정을 주도해요. 제품과 조직의 성장 계획을 바탕으로 DevOps 전략과 중장기 로드맵을 수립하고 실행해요.
  • Server Developer, DBA와 각 제품팀의 개발자들을 비롯해 SRE 역할과 긴밀하게 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 사용자 관점의 공통 신뢰성 기준을 발전시켜요. DevOps는 이를 안정적으로 달성할 수 있는 플랫폼과 배포·운영 기반을 만들어요.

합류하면 함께 할 업무예요

  • 토스플레이스의 제품과 조직 성장 계획을 바탕으로 DevOps 전략과 Cloud Native 플랫폼의 중장기 로드맵을 수립해요. 현재 플랫폼의 리스크와 한계를 진단하고 주요 과제의 목표와 우선순위 및 성공 기준을 정해 실행해요.
  • AWS 환경의 여러 Kubernetes 클러스터와 Istio 기반 Service Mesh의 목표 아키텍처를 설계해요. Capacity Planning과 성능 검증을 바탕으로 확장성, SPOF, 장애 격리, 변경 안전성, 리소스와 비용 효율을 지속적으로 개선해요.
  • 빌드부터 배포·검증·롤백까지의 과정을 표준화하고 CI/CD와 GitOps 기반의 배포 플랫폼을 고도화해요. IaC와 Policy as Code를 이용해 인프라 변경을 재현 가능하게 관리하고, 보안과 컴플라이언스 요구사항을 플랫폼의 기본 안전장치로 구현해요.
  • 개발자의 반복적인 인프라 작업과 운영 과정의 불편을 발견하고, 이를 안전하게 직접 처리할 수 있는 Self-service 도구와 플랫폼으로 해결해요. 실제 사용 범위와 작업 시간 및 반복 작업량의 변화를 통해 개선 효과를 확인해요.
  • Metric과 Log를 포함한 관측 데이터를 안정적으로 수집·저장·조회할 수 있는 Observability 기반을 운영해요. SRE와 제품팀이 정의한 신뢰성 기준을 측정하고 활용할 수 있도록 필요한 플랫폼 기능과 도구를 제공해요.
  • 인프라와 플랫폼 영역의 장애 대응과 복구를 주도하고, 서비스 장애에서는 SRE 및 제품팀과 함께 원인을 분석해 복구를 지원해요. 주요 장애 시나리오의 Runbook과 복구 도구를 마련하고 반복되는 진단과 복구 작업을 자동화해요.
  • 주요 설계와 기술적 의사결정을 문서화하고, 설계 리뷰와 경험 공유를 통해 동료의 성장을 도와요. 여러 사람이 일관된 기준으로 플랫폼을 설계하고 운영할 수 있도록 팀의 기술 기준과 업무 방식을 발전시켜요.

이런 분과 함께하고 싶어요

  • DevOps 또는 Platform Engineering 영역에서 현재 시스템과 조직의 문제를 진단하고, 목표와 로드맵을 수립해 주요 과제를 실행까지 주도해본 분을 찾아요.
  • Public Cloud 환경에서 Kubernetes 기반 프로덕션 플랫폼을 설계·운영하고, 아키텍처, 확장, 업그레이드, 장애 격리와 변경 안전성에 관한 주요 기술적 의사결정을 내려본 경험이 필요해요.
  • IaC를 이용해 프로덕션 인프라를 재현 가능하게 관리하고, 여러 서비스와 팀이 사용하는 CI/CD, GitOps 또는 인프라 자동화 시스템을 구축해 실제 도입과 운영 방식의 변화까지 만들어본 분과 함께하고 싶어요.
  • 하나 이상의 프로그래밍 언어로 플랫폼 기능, 진단·복구 도구와 운영 자동화를 개발하고, 테스트와 리뷰를 포함한 소프트웨어 엔지니어링 방식으로 관리할 수 있는 분을 찾아요.
  • 애플리케이션, Container, OS, Network 등 여러 계층에 걸친 장애의 원인 분석과 복구를 주도하고, 자동화와 아키텍처 개선을 통해 재발을 방지해본 분을 찾아요.
  • 안정성, 성능, 보안, 비용과 운영 복잡도 사이의 트레이드오프를 바탕으로 기술 방향을 결정하고, 여러 팀의 합의를 만들어 실제 업무 방식으로 정착시켜본 분과 함께하고 싶어요.

이런 분이면 더 좋아요

  • Istio 또는 Envoy 기반 Service Mesh에서 트래픽 관리, 보안, 관측성이나 성능 문제를 해결해본 경험이 있으면 좋아요.
  • 멀티 클러스터 또는 멀티 리전 환경의 고가용성과 재해 복구 구조를 설계하고 검증해본 경험이 있으면 좋아요.
  • 여러 서비스가 사용하는 배포 플랫폼에서 점진적 배포, 자동 검증과 롤백을 구현해본 경험이 있으면 좋아요.
  • Prometheus, Thanos, Grafana 또는 OpenTelemetry 기반의 Observability 플랫폼을 운영해본 경험이 있으면 좋아요.
  • 결제·금융처럼 가용성, 데이터 정합성, 보안과 컴플라이언스가 중요한 환경을 운영해본 경험이 있으면 좋아요.
  • 장애 복구 훈련이나 Fault Injection을 통해 시스템의 장애 전파 경로와 복구 방식을 검증해본 경험이 있으면 좋아요.
  • 인프라 비용과 리소스 효율을 가시화하고, 아키텍처나 운영 정책의 변화로 실질적인 개선을 만들어본 경험이 있으면 좋아요.

이력서는 이렇게 작성하시는 걸 추천해요

  • Kubernetes, CI/CD, IaC, 플랫폼 도구 개발, 장애 대응 또는 운영 자동화와 관련해 본인이 주도한 대표 경험 2~3가지를 중심으로 작성해 주세요.
  • 어떤 사용자 또는 비즈니스 문제가 있었고, 당시 시스템과 조직에 어떤 제약이 있었는지 알려주세요.
  • 본인이 직접 판단하고 설계·구현·조율한 범위와, 검토한 대안 및 선택 과정에서 고려한 트레이드오프를 구체적으로 작성해 주세요.
  • 여러 팀이 사용하는 플랫폼을 만든 경험은 적용 범위, 도입 과정에서 해결한 문제와 실제 업무 방식의 변화를 함께 알려주세요.
  • 개선 전후의 배포 리드타임, 변경 실패율, 장애 복구 시간, 반복 작업량, 리소스 사용량 또는 인프라 비용의 변화를 가능한 범위에서 작성해 주세요.

토스플레이스가 사용하는 기술

  • Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle
  • MySQL, MongoDB, Elasticsearch, Redis, Kafka
  • AWS, Kubernetes, Istio, Podman, Containerd
  • Git, GoCD, ArgoCD, Vault
  • Prometheus, Thanos, Grafana
  • Chaos Mesh
  • 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요.

토스플레이로의 합류 여정

  • 서류 접수 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우 협의 > 최종 합격 및 입사

자주 묻는 질문

Q. 토스플레이스 DevOps Engineer는 어떤 목표를 가지고 일하나요?

  • A. 단순히 배포와 운영을 자동화하는 게 아니라, 개발자들이 스스로 빠르고 안전하게 배포할 수 있는 환경을 만드는 것이 목표예요. CI/CD, 모니터링, 비용 최적화, 보안 컴플라이언스까지 인프라 전반에서 안정성과 속도의 균형을 찾고 있습니다.

Q. 현재 사용하는 인프라 환경은 어떤가요?

  • A. AWS 환경에서 여러개의 Kubernetes Cluster와 다양한 리소스들을 구성 및 운영하고 있어요. Service Mesh로 Istio를 사용하고 있고, Prometheus, Thanos, Grafana 등으로 다양한 리소스들을 모니터링하고 있어요.
지원하기
토스플레이스 소속
정규직
초기 멤버

합류하게 될 팀에 대해 알려드려요

  • 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 제품과 서비스가 성장하는 과정에서도 안정적인 결제 경험과 매장 운영을 제공할 수 있도록 신뢰성과 확장성을 중요한 가치로 생각해요.
  • Server Platform Team은 제품들이 빠르고 안정적으로 개발·배포·운영될 수 있는 공통 기술 기반을 만들어요. DevOps Engineer는 AWS, Kubernetes와 Istio를 기반으로 Cloud Native 플랫폼을 설계하고 운영해요.
  • 서비스와 트래픽의 성장을 안정적으로 수용하려면 플랫폼의 용량과 변경 위험을 예측 가능하게 관리하고, 반복되는 운영 업무를 도구와 자동화로 전환해야 해요. 장애가 발생했을 때 시스템 상태를 빠르게 파악하고 복구할 수 있는 기반도 함께 만들어가고 있어요.
  • DevOps Engineer는 현재 플랫폼의 구조와 운영 방식을 진단하고, Cloud, Kubernetes, Service Mesh, 배포 플랫폼, IaC와 Observability 기반을 아우르는 주요 기술적 의사결정을 주도해요. 제품과 조직의 성장 계획을 바탕으로 DevOps 전략과 중장기 로드맵을 수립하고 실행해요.
  • Server Developer, DBA와 각 제품팀의 개발자들을 비롯해 SRE 역할과 긴밀하게 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 사용자 관점의 공통 신뢰성 기준을 발전시켜요. DevOps는 이를 안정적으로 달성할 수 있는 플랫폼과 배포·운영 기반을 만들어요.

합류하면 함께 할 업무예요

  • 토스플레이스의 제품과 조직 성장 계획을 바탕으로 DevOps 전략과 Cloud Native 플랫폼의 중장기 로드맵을 수립해요. 현재 플랫폼의 리스크와 한계를 진단하고 주요 과제의 목표와 우선순위 및 성공 기준을 정해 실행해요.
  • AWS 환경의 여러 Kubernetes 클러스터와 Istio 기반 Service Mesh의 목표 아키텍처를 설계해요. Capacity Planning과 성능 검증을 바탕으로 확장성, SPOF, 장애 격리, 변경 안전성, 리소스와 비용 효율을 지속적으로 개선해요.
  • 빌드부터 배포·검증·롤백까지의 과정을 표준화하고 CI/CD와 GitOps 기반의 배포 플랫폼을 고도화해요. IaC와 Policy as Code를 이용해 인프라 변경을 재현 가능하게 관리하고, 보안과 컴플라이언스 요구사항을 플랫폼의 기본 안전장치로 구현해요.
  • 개발자의 반복적인 인프라 작업과 운영 과정의 불편을 발견하고, 이를 안전하게 직접 처리할 수 있는 Self-service 도구와 플랫폼으로 해결해요. 실제 사용 범위와 작업 시간 및 반복 작업량의 변화를 통해 개선 효과를 확인해요.
  • Metric과 Log를 포함한 관측 데이터를 안정적으로 수집·저장·조회할 수 있는 Observability 기반을 운영해요. SRE와 제품팀이 정의한 신뢰성 기준을 측정하고 활용할 수 있도록 필요한 플랫폼 기능과 도구를 제공해요.
  • 인프라와 플랫폼 영역의 장애 대응과 복구를 주도하고, 서비스 장애에서는 SRE 및 제품팀과 함께 원인을 분석해 복구를 지원해요. 주요 장애 시나리오의 Runbook과 복구 도구를 마련하고 반복되는 진단과 복구 작업을 자동화해요.
  • 주요 설계와 기술적 의사결정을 문서화하고, 설계 리뷰와 경험 공유를 통해 동료의 성장을 도와요. 여러 사람이 일관된 기준으로 플랫폼을 설계하고 운영할 수 있도록 팀의 기술 기준과 업무 방식을 발전시켜요.

이런 분과 함께하고 싶어요

  • DevOps 또는 Platform Engineering 영역에서 현재 시스템과 조직의 문제를 진단하고, 목표와 로드맵을 수립해 주요 과제를 실행까지 주도해본 분을 찾아요.
  • Public Cloud 환경에서 Kubernetes 기반 프로덕션 플랫폼을 설계·운영하고, 아키텍처, 확장, 업그레이드, 장애 격리와 변경 안전성에 관한 주요 기술적 의사결정을 내려본 경험이 필요해요.
  • IaC를 이용해 프로덕션 인프라를 재현 가능하게 관리하고, 여러 서비스와 팀이 사용하는 CI/CD, GitOps 또는 인프라 자동화 시스템을 구축해 실제 도입과 운영 방식의 변화까지 만들어본 분과 함께하고 싶어요.
  • 하나 이상의 프로그래밍 언어로 플랫폼 기능, 진단·복구 도구와 운영 자동화를 개발하고, 테스트와 리뷰를 포함한 소프트웨어 엔지니어링 방식으로 관리할 수 있는 분을 찾아요.
  • 애플리케이션, Container, OS, Network 등 여러 계층에 걸친 장애의 원인 분석과 복구를 주도하고, 자동화와 아키텍처 개선을 통해 재발을 방지해본 분을 찾아요.
  • 안정성, 성능, 보안, 비용과 운영 복잡도 사이의 트레이드오프를 바탕으로 기술 방향을 결정하고, 여러 팀의 합의를 만들어 실제 업무 방식으로 정착시켜본 분과 함께하고 싶어요.

이런 분이면 더 좋아요

  • Istio 또는 Envoy 기반 Service Mesh에서 트래픽 관리, 보안, 관측성이나 성능 문제를 해결해본 경험이 있으면 좋아요.
  • 멀티 클러스터 또는 멀티 리전 환경의 고가용성과 재해 복구 구조를 설계하고 검증해본 경험이 있으면 좋아요.
  • 여러 서비스가 사용하는 배포 플랫폼에서 점진적 배포, 자동 검증과 롤백을 구현해본 경험이 있으면 좋아요.
  • Prometheus, Thanos, Grafana 또는 OpenTelemetry 기반의 Observability 플랫폼을 운영해본 경험이 있으면 좋아요.
  • 결제·금융처럼 가용성, 데이터 정합성, 보안과 컴플라이언스가 중요한 환경을 운영해본 경험이 있으면 좋아요.
  • 장애 복구 훈련이나 Fault Injection을 통해 시스템의 장애 전파 경로와 복구 방식을 검증해본 경험이 있으면 좋아요.
  • 인프라 비용과 리소스 효율을 가시화하고, 아키텍처나 운영 정책의 변화로 실질적인 개선을 만들어본 경험이 있으면 좋아요.

이력서는 이렇게 작성하시는 걸 추천해요

  • Kubernetes, CI/CD, IaC, 플랫폼 도구 개발, 장애 대응 또는 운영 자동화와 관련해 본인이 주도한 대표 경험 2~3가지를 중심으로 작성해 주세요.
  • 어떤 사용자 또는 비즈니스 문제가 있었고, 당시 시스템과 조직에 어떤 제약이 있었는지 알려주세요.
  • 본인이 직접 판단하고 설계·구현·조율한 범위와, 검토한 대안 및 선택 과정에서 고려한 트레이드오프를 구체적으로 작성해 주세요.
  • 여러 팀이 사용하는 플랫폼을 만든 경험은 적용 범위, 도입 과정에서 해결한 문제와 실제 업무 방식의 변화를 함께 알려주세요.
  • 개선 전후의 배포 리드타임, 변경 실패율, 장애 복구 시간, 반복 작업량, 리소스 사용량 또는 인프라 비용의 변화를 가능한 범위에서 작성해 주세요.

토스플레이스가 사용하는 기술

  • Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle
  • MySQL, MongoDB, Elasticsearch, Redis, Kafka
  • AWS, Kubernetes, Istio, Podman, Containerd
  • Git, GoCD, ArgoCD, Vault
  • Prometheus, Thanos, Grafana
  • Chaos Mesh
  • 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요.

토스플레이로의 합류 여정

  • 서류 접수 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우 협의 > 최종 합격 및 입사

자주 묻는 질문

Q. 토스플레이스 DevOps Engineer는 어떤 목표를 가지고 일하나요?

  • A. 단순히 배포와 운영을 자동화하는 게 아니라, 개발자들이 스스로 빠르고 안전하게 배포할 수 있는 환경을 만드는 것이 목표예요. CI/CD, 모니터링, 비용 최적화, 보안 컴플라이언스까지 인프라 전반에서 안정성과 속도의 균형을 찾고 있습니다.

Q. 현재 사용하는 인프라 환경은 어떤가요?

  • A. AWS 환경에서 여러개의 Kubernetes Cluster와 다양한 리소스들을 구성 및 운영하고 있어요. Service Mesh로 Istio를 사용하고 있고, Prometheus, Thanos, Grafana 등으로 다양한 리소스들을 모니터링하고 있어요.
채용팀에 문의하기