합류하게 될 팀에 대해 알려드려요
- ML/AI Infra 팀은 토스의 모든 ML/AI 워크로드가 안정적으로 동작하도록, 든든한 인프라를 구축하고 운영하고 있어요.
- 우리가 운영하는 인프라는 단순한 클러스터 관리가 아니라, 대용량 데이터와 GPU 등 ML 고유의 요구사항을 반영해 온프레미스의 ML 전용 Kubernetes 클러스터와 AWS(EKS, EKS Hybrid), GCP를 유연하게 아우르는 멀티 클라우드 환경으로 설계돼요.
- 클라우드 GPU를 온프레미스에 편입하는 등 아직 정답이 정해지지 않은 복잡한 인프라 문제들을 다루는 만큼, 최적의 기술적 방향을 함께 고민하고 구조화해나가는 역할이 중요해요.
- 대형 LLM의 분산 서빙 구조 등 새롭고 도전적인 AI 시스템이 빠르고 안정적으로 돌아갈 수 있도록, 아키텍처들을 직접 검증하고 플랫폼 팀에 제공하고 있어요.
- 이 포지션은 토스의 대규모 LLM 모델들이 실서비스에 빠르고 안정적으로 제공될 수 있도록 분산 서빙 인프라를 구축하고 최적화하는 역할을 핵심으로 맡아요. 온프레미스와 멀티 클라우드를 아우르는 GPU 기반 Kubernetes 환경에서, LLM 서빙 아키텍처를 주도적으로 설계해 나갑니다.
합류하면 함께 할 업무에요
- 온프레미스와 멀티 클라우드(AWS, GCP) 를 아우르는 하이브리드 GPU Kubernetes 클러스터와 Istio, Cilium 기반의 네트워크 환경을 구축해요
- GPU Operator 스택을 활용한 딥다이브 트러블슈팅과 선제적인 용량 계획으로 최적의 리소스 효율을 달성해요.
- 대규모 LLM 서빙을 위해 vLLM, SGLang 등의 엔진을 다루고, NVIDIA Dynamo 기반의 분산 추론 아키텍처를 설계해요. 복잡한 서빙 워크로드를 K8s Custom Resource와 Operator 패턴을 활용해 배포 자동화 체계를 구축해요.
- LLM 분산 추론 시 발생하는 노드 간 통신과 I/O 병목을 해결하기 위해 RDMA(IB/RoCE) 기반의 고속 GPU 네트워크를 설계해요. 대용량 모델 로딩과 KV Cache 관리에 최적화된 VAST 등 고성능 AI 스토리지를 도입해 클러스터의 성능을 극대화해요.
이런 분과 함께하고 싶어요
- 5년 이상 또는 그에 준하는 인프라 역량으로, Kubernetes 기반의 공용 플랫폼을 직접 설계하고 운영해 본 분과 함께하고 싶어요.
- 대규모 GPU 클러스터 및 GPU Operator 스택 프로덕션 운영 경험이 있는 분과 함께하고 싶어요
- vLLM, SGLang 등 LLM 서빙 엔진을 활용한 대용량 트래픽 처리 및 분산 추론 인프라의 프로덕션 운영 을 해본 분과 함께하고 싶어요
- Python, Go 등을 활용한 인프라 자동화, 또는 K8s CRD/Controller 패턴을 직접 구현해 시스템을 구조적으로 추상화해 본 분이면 좋아요
- AI/ML 모델링에 대한 완벽한 도메인 지식이 없어도 괜찮아요. 탄탄한 K8s 역량과 인프라 최적화 경험을 바탕으로, 데이터 및 AI 조직과 협업하며 토스의 압도적인 LLM 시스템 생태계를 함께 고도화해 나갈 수 있으면 충분해요.
이런 분이면 더 좋아요
- NVIDIA Dynamo 등 분산 추론 아키텍처나 RDMA(IB/RoCE), NCCL 기반의 고속 GPU 네트워크 환경을 이해하고 계신 분이면 잘 맞아요.
- Volcano, Kueue 등을 활용해 대규모 멀티테넌트 GPU 자원을 스케줄링해 보셨으면 더욱 환영해요.
- 온프레미스와 퍼블릭 클라우드가 결합된 하이브리드 환경, 혹은 VAST 등 고성능 AI 스토리지를 다뤄본 경험이 있으시면 더욱 좋아요.
- 단순 운영을 넘어 DCGM 지표, XID, NVLink 등 GPU 하드웨어 레벨의 장애를 깊이 있게 분석하고 진단해 본 분이면 ML/AI Infra 팀의 방향과 완벽하게 잘 맞을 거예요.
이력서는 이렇게 작성하시는 걸 추천해요
- 진행했던 과제가 조직에 큰 영향력을 미쳤다면 그 내용을 자세히 작성해 주세요.
- 단순히 어떤 언어, 플랫폼, 프레임워크, 기술 등을 사용했는지보다는, 어떤 목적을 가진 과제였는지, 이를 해결하기 위해 무엇을 사용했는지, 어떻게 문제를 해결했는지에 대해 자세히 작성해 주세요.
- 플랫폼을 운영하면서 발생한 치명적인 장애를 해결해 보았거나, 성능/리소스 최적화를 해 본 경험이 있다면 작성해 주세요.
- 오픈소스 사용 중에 발생한 버그나 이슈를 해결해 보았거나, 부족한 기능을 개선하기 위해 오픈소스에 기여했던 경험이 있다면 작성해 주세요.
토스로의 합류여정
- 서류 접수 > 프리 인터뷰 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우 협의 > 최종 합격
- 프리 인터뷰에서는 지원서 기반의 주요 경험과 직무 적합도를 중심으로 면접이 진행될 예정이에요.
- 직무 인터뷰에서는 심층 기술 면접과 ML 시스템 설계를 주제로 면접이 진행될 예정이에요.
함께할 동료를 위한 한마디
"이 포지션에 합류하시면, 단순한 GPU 클러스터 관리를 넘어 대규모 프론티어 LLM 서빙 인프라 전문가로 성장하는 경험을 얻어갈 수 있습니다.”
- NVIDIA Dynamo와 같은 최신의 분산 추론 프레임워크가 완벽하게 동작하도록 GPU 고속 네트워크와 시스템 자원을 직접 제어하고, 거대한 프론티어 모델들이 한계 없이 서빙될 수 있도록 하드웨어와 K8s 인프라 레벨에서 극한의 최적화를 이끌어내는 경험을 내 것으로 만들 수 있어요.
- 금융, 추천, 검색 등 토스의 다양한 도메인에서 쏟아지는 수천만 유저의 트래픽을 든든하게 지탱하며, LLM 서비스가 멈춤 없이 안착할 수 있는 프로덕션 레벨의 대규모 GPU 인프라 생태계를 토스에서 함께 완성해 갈 수 있습니다.