Site Reliability Engineer

Site Reliability Engineer

토스플레이스 소속
정규직
초기 멤버

합류하게 될 팀에 대해 알려드려요

  • 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요.
  • SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요.
  • Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요.
  • Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요.
  • 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요.

합류하면 함께할 업무예요

  • 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요.
  • 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요.
  • Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요.
  • 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요.
  • 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요.
  • SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요.
  • 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요.

이런 분과 함께하고 싶어요

  • 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요.
  • 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요.
  • 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요.
  • 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요.
  • AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요.
  • 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요.

이런 분이면 더 좋아요

  • SLI, SLO 또는 Error Budget을 정의하고 실제 서비스 운영과 의사결정에 활용해 본 경험이 있으면 좋아요.
  • Incident Management, Post-mortem 또는 Reliability Review 체계를 만들거나 개선해 본 경험이 있으면 좋아요.
  • 클라이언트부터 서버와 외부 시스템까지 이어지는 엔드투엔드 흐름에서 장애를 분석하고 해결해 본 경험이 있으면 좋아요.
  • 결제처럼 장애나 데이터 정합성 문제가 고객과 비즈니스에 직접적인 영향을 주는 Mission-Critical 서비스를 운영해 본 경험이 있으면 좋아요.
  • Istio 등 Service Mesh 환경에서 서비스 간 트래픽 흐름과 장애 전파 경로를 분석하고 개선해 본 경험이 있으면 좋아요.
  • Fault Injection 실험이나 장애 복구 훈련을 설계하고, 시스템의 복원력을 검증, 개선해 본 경험이 있으면 좋아요.
  • Java/Kotlin과 Spring Ecosystem을 이용해 제품 또는 플랫폼 코드를 개발해 본 경험이 있으면 좋아요.

이력서는 이렇게 작성하시는 걸 추천해요

  • 장애 대응, 신뢰성, 성능 개선 또는 운영 자동화와 관련된 대표 경험 2~3가지를 중심으로 작성해 주세요.
  • 어떤 사용자 또는 비즈니스 문제가 있었고, 당시 시스템과 조직에 어떤 제약이 있었는지 알려주세요.
  • 원인을 찾기 위해 어떤 가설을 세웠고, 어떤 데이터와 도구를 활용했는지 작성해 주세요.
  • 본인이 직접 판단하고 설계, 구현, 조율한 범위와, 해결 과정에서 고려한 트레이드오프를 구체적으로 알려주세요.
  • 개선 전후의 오류율, 지연시간, 탐지, 복구 시간, 장애 빈도 또는 반복 작업량의 변화를 가능한 범위에서 작성해 주세요.

토스플레이스에서 사용하는 기술

  • Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle
  • MySQL, MongoDB, Elasticsearch, Redis, Kafka
  • AWS, Kubernetes, Istio, Podman, Containerd
  • Git, GoCD, ArgoCD, Vault
  • Prometheus, Thanos, Grafana
  • Chaos Mesh
  • 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요.

토스플레이스로의 합류 여정

  • 서류전형 > 테크핏 인터뷰(30분) > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우협의 > 최종합격 및 입사

함께할 동료를 위한 한마디

"복잡한 오프라인의 문제를 해결하며, 전체 시스템을 직접 설계하고 주도하는 압도적인 성장을 경험하고 있어요."

  • 오프라인 결제 환경에서는 온라인보다 훨씬 다양한 변수와 예외를 마주하게 돼요.
  • 서버 플랫폼 팀은 이런 환경에서도 서비스가 안정적으로 운영될 수 있도록 공통 모듈과 플랫폼 서비스를 만들고, 장애를 더 빠르게 감지하고 회복할 수 있는 기반을 계속 개선하고 있어요.
  • 합류하시면 특정 서비스 하나가 아니라 전체 시스템을 더 나은 방향으로 설계하고 운영하는 경험을 할 수 있어요. 기술적 오너십을 가지고 깊이 기여하고 싶은 분, 좋은 동료들과 함께 답을 만들어가며 성장하고 싶은 분께 정말 좋은 팀이에요.
지원하기
토스플레이스 소속
정규직
초기 멤버

합류하게 될 팀에 대해 알려드려요

  • 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요.
  • SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요.
  • Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요.
  • Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요.
  • 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요.

합류하면 함께할 업무예요

  • 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요.
  • 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요.
  • Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요.
  • 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요.
  • 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요.
  • SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요.
  • 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요.

이런 분과 함께하고 싶어요

  • 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요.
  • 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요.
  • 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요.
  • 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요.
  • AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요.
  • 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요.

이런 분이면 더 좋아요

  • SLI, SLO 또는 Error Budget을 정의하고 실제 서비스 운영과 의사결정에 활용해 본 경험이 있으면 좋아요.
  • Incident Management, Post-mortem 또는 Reliability Review 체계를 만들거나 개선해 본 경험이 있으면 좋아요.
  • 클라이언트부터 서버와 외부 시스템까지 이어지는 엔드투엔드 흐름에서 장애를 분석하고 해결해 본 경험이 있으면 좋아요.
  • 결제처럼 장애나 데이터 정합성 문제가 고객과 비즈니스에 직접적인 영향을 주는 Mission-Critical 서비스를 운영해 본 경험이 있으면 좋아요.
  • Istio 등 Service Mesh 환경에서 서비스 간 트래픽 흐름과 장애 전파 경로를 분석하고 개선해 본 경험이 있으면 좋아요.
  • Fault Injection 실험이나 장애 복구 훈련을 설계하고, 시스템의 복원력을 검증, 개선해 본 경험이 있으면 좋아요.
  • Java/Kotlin과 Spring Ecosystem을 이용해 제품 또는 플랫폼 코드를 개발해 본 경험이 있으면 좋아요.

이력서는 이렇게 작성하시는 걸 추천해요

  • 장애 대응, 신뢰성, 성능 개선 또는 운영 자동화와 관련된 대표 경험 2~3가지를 중심으로 작성해 주세요.
  • 어떤 사용자 또는 비즈니스 문제가 있었고, 당시 시스템과 조직에 어떤 제약이 있었는지 알려주세요.
  • 원인을 찾기 위해 어떤 가설을 세웠고, 어떤 데이터와 도구를 활용했는지 작성해 주세요.
  • 본인이 직접 판단하고 설계, 구현, 조율한 범위와, 해결 과정에서 고려한 트레이드오프를 구체적으로 알려주세요.
  • 개선 전후의 오류율, 지연시간, 탐지, 복구 시간, 장애 빈도 또는 반복 작업량의 변화를 가능한 범위에서 작성해 주세요.

토스플레이스에서 사용하는 기술

  • Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle
  • MySQL, MongoDB, Elasticsearch, Redis, Kafka
  • AWS, Kubernetes, Istio, Podman, Containerd
  • Git, GoCD, ArgoCD, Vault
  • Prometheus, Thanos, Grafana
  • Chaos Mesh
  • 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요.

토스플레이스로의 합류 여정

  • 서류전형 > 테크핏 인터뷰(30분) > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우협의 > 최종합격 및 입사

함께할 동료를 위한 한마디

"복잡한 오프라인의 문제를 해결하며, 전체 시스템을 직접 설계하고 주도하는 압도적인 성장을 경험하고 있어요."

  • 오프라인 결제 환경에서는 온라인보다 훨씬 다양한 변수와 예외를 마주하게 돼요.
  • 서버 플랫폼 팀은 이런 환경에서도 서비스가 안정적으로 운영될 수 있도록 공통 모듈과 플랫폼 서비스를 만들고, 장애를 더 빠르게 감지하고 회복할 수 있는 기반을 계속 개선하고 있어요.
  • 합류하시면 특정 서비스 하나가 아니라 전체 시스템을 더 나은 방향으로 설계하고 운영하는 경험을 할 수 있어요. 기술적 오너십을 가지고 깊이 기여하고 싶은 분, 좋은 동료들과 함께 답을 만들어가며 성장하고 싶은 분께 정말 좋은 팀이에요.
채용팀에 문의하기