Server Platform Chapter의 SRE 팀은 토스의 대규모 인프라를 기반으로 서비스의 높은 신뢰성과 안정성을 책임져요.
대규모 트래픽 환경에서 이상 징후를 사전에 감지하고 빠르게 대응할 수 있도록 효과적인 모니터링 시스템을 설계하고 운영해요.
서비스가 성장하는 과정에서 발생한 문제를 해결하고, 재발 방지를 위한 설계와 해법을 마련해요.
합류하면 함께할 업무예요
토스 전사 시스템의 Stability, Scalability, Availability, Latency 지표를 고도화하고 지속적으로 개선해요.
수많은 마이크로서비스(MSA) 환경에서 발생하는 대규모 트래픽의 병목을 실시간으로 감지하고 추적할 수 있는 관측 가능성(Observability) 시스템을 고도화해요.
장애 시 비상 대응 및 Post-mortem을 주도하며, 장애 자동 복구 시스템 설계 및 아키텍처 개선을 통한 재발 방지책을 마련해요.
토스플레이스초기멤버
오프라인에서 200만 자영업자의 매장 운영을 혁신해요.
1개 포지션
합류하게 될 팀에 대해 알려드려요
토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요.
SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요.
Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요.
합류하면 함께할 업무예요
토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요.
결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요.
Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요.